LIBRARY / 文章资料库
按目录阅读
当前目录agent10 篇
当 AI 学会排版:我如何用 3 个开源 Skill 编出一个自动化排版引擎 你将学到:如何将 3 个独立的 AI Skill(md2wechat、baoyu-post-to-wechat、自研编排器)组合成一个端到端的内容发布引擎——从选题研究到博客+公众平台双端同步,中间还定制了 6 套专属视觉风格。 每次写完一篇技术文章,我都要重复三个痛苦步骤:调 Markdown 样式让它适配平台、手动上传图片到 OSS、再在后台粘贴排版。一篇文章光「搬砖」就要 40 分钟。 更糟的是,市面上的工具要么只管渲染(md2wechat),要么只管发布(baoyu-post-to-wechat),没有一个能从「选题 → 写稿 → 渲染 → 博客 → 发布」一条龙跑完。 于是我决定:不造轮子,而是把轮子编成引擎。 目录 一、三个轮子,三种哲学 二、编排架构:不重造,只缝合 三、8 步工作流:从选题到双端发布 四、6 套专属风格系统 五、三大设计原则 六、踩坑与收获 七、内容安全风控 八、开源地址与后续计划 一、三个轮子,三种哲学先介绍一下我手头的三个 Skill,它们各自擅长什么、又各自缺什么 ...
终于到动手环节了。前两篇讲了 Agent 的概念和架构,这一篇我们从头写一个能读文件、写代码、执行 Shell 的代码助手 Agent。跟着一步步来,大约 20 分钟能跑通。 环境准备先装依赖。打开终端,一行搞定: 1pip install "langchain<1.0" langchain-openai ⚠️ 版本说明: LangChain 1.0+ 移除了 create_tool_calling_agent 和 AgentExecutor(改用 LangGraph 的 create_agent())。本文基于 0.3.x 版本,langchain<1.0 确保代码可直接运行。学习完成后建议查阅 LangGraph Agent 文档 了解最新用法。 然后创建 agent_demo.py,把 API key 配好: 12import osos.environ["OPENAI_API_KEY"] = "sk-your-key-here" # 或从 .env 读取 如果你用的是其他模型(比如 DeepSee ...
Agent
未读Claude Code、Codex 明明已经停下来了,Mac 风扇却还在转,内存也迟迟不降。问题可能不在当前会话,而在一批没有正常收尾的 agent-browser daemon 与自动化 Chrome。 这次我在本机清理了 8 组遗留的 agent-browser / Chrome 后台实例及其子进程。普通 Chrome 标签页没有动,机器热量很快就降了下来。 这不是一个玄学问题,也不能简单归咎于“Chrome 太吃内存”。真正要理解的是:AI 编程工具、浏览器自动化工具、CDP、daemon 和 session 之间,到底是谁启动了谁,又该由谁负责关掉。 30 秒结论先给赶时间的人答案: agent-browser 采用 CLI + 后台 daemon + Chrome 的架构,daemon 会故意跨命令常驻,以便下一条指令不用重新启动浏览器。 每个独立 session 都可能拥有自己的浏览器实例。Claude Code、Codex 并发执行多个 agent 或工具任务时,session 数量很容易叠加。 如果任务异常中断、会话被强制停止,或者调用方忘了执行 a ...
上一篇我们讲了 Agent 的”道”——Think → Act → Observe 循环。这一篇讲”术”——LangChain 是怎么把这套机制实现出来的。如果你读完了第一篇,你已经知道 Agent 的核心思想了:LLM 是大脑,工具是手和眼睛,决策循环让 Agent 不断思考、执行、观察、调整,直到任务完成。 但概念是概念,代码是代码。LangChain 到底用了哪些类、哪些抽象、哪些设计模式,把这些概念变成了能跑的代码? 本文拆解 LangChain 的三层包结构和 Agent 核心组件。读完你能看懂 Agent 的每一行代码在做什么。 三层包结构概览先把 LangChain 的整体包结构看清楚。很多人一上来就对着几百个类头大,但其实 LangChain 的包结构有清晰的层次逻辑: 层 包 / 定位 职责 基础抽象层 langchain-core Runnable 协议、BaseTool、Messages、Callbacks 经典集成层 langchain-classic Chains、100+ 工具集成、Agent 实现、Document Loade ...
你让 ChatGPT 帮你统计项目代码行数,它说”抱歉,我做不到”这是普通 LLM 最尴尬的时刻——它很聪明,但被困在训练数据的牢笼里。 你或许有过这样的体验:问 ChatGPT 一个问题,它滔滔不绝,逻辑清晰;可一旦让它帮你查一下今天的天气、读一下你桌面上的文件、或者帮你调一下公司的 API——它立刻摊手:”抱歉,我无法访问外部信息。” 这不是它不想帮你,而是它没有手,也没有眼睛。 本文是 LangChain Agent 系列的第一篇。我们先用大白话讲清楚 Agent 到底是什么、为什么需要它,不写一行代码。读完你会理解 Agent 的核心思想,为后面的实战打好基础。 普通 LLM 的局限普通 LLM(大语言模型)本质上是一个”超级知识库 + 文本生成器”。它读过的所有东西都压缩在模型参数里,但它有三个致命短板: 1. 无法触及真实世界LLM 的知识截止于训练数据日期。它不能查文件、不能调 API、不能看天气、不能读数据库——因为它的输入只有一段文本,输出也只有一段文本。 你问它”帮我统计一下当前目录下所有 .py 文件的行数”,它只能说: “我无法读取你的文件系统。你可以用 w ...
目录 一、Comet Skill 是什么 二、从 Superpowers 到 OpenSpec:Spec Coding 的探索之路 Superpowers 的痛点 OpenSpec 的特点 经典组合的摩擦 三、Comet Skill 的核心设计 3.1 稳定的状态扭转:引入状态机思想 3.2 意图识别:跨设备断点恢复 3.3 人机确认机制:关键节点人工把控 3.4 重叠 Spec 的交接:建立单向事实链 四、Harness Engineering:Skill 侧的工程化 五、总结 一、Comet Skill 是什么在 AI 驱动开发的浪潮下,Spec Coding(规格驱动编码)成为了许多开发者探索的新范式。它的核心理念是:先写清楚”要做什么”(Spec),再让 AI Agent 按照规格执行。 Comet Skill 正是在这个背景下诞生的——它将 OpenSpec 和 Superpowers 最精华的部分串联起来,打造出更易用、更稳定的 Spec Coding 工作流。 几个关键数据: GitHub 400+ Star 120+ 分钟阅读量 4.5k+ 次下载 经过生 ...
目录 一、为什么选 Claude Code 二、快速安装 2.1 安装 Node.js 2.2 安装 Claude Code 三、模型厂商与 Coding Plan 对比 3.1 阿里百炼 3.2 腾讯云混元 3.3 百度千帆 3.4 DeepSeek 3.5 火山引擎(字节) 3.6 MiniMax 3.7 智谱 GLM 3.8 月之暗面 Kimi 四、模型厂商切换:CC Switch 五、Skill:Claude Code 的核心扩展机制 5.1 什么是 Skill 5.2 常用 Skill 安装 5.3 Skill 路径 5.4 Skill 仓库与超市 六、辅助工具推荐 6.1 Starship:终端美化 6.2 gstack:工程团队工具集 6.3 Claude HUD:可视化监控面板 6.4 跳过权限确认 七、2026 年值得关注的新工具 八、总结 引用 一、为什么选 Claude CodeClaude Code 是 Anthropic 推出的终端原生 AI 编程助手。相比 IDE 插件,它有几点核心优势: 终端原生:直接在你的 shell 里运行,能操 ...
目录 一、一句话区分 二、架构对比图 Kimi WebBridge agent-browser Playwright 三、核心维度对比表 四、逐一深挖 4.1 浏览器从哪来 4.2 登录态谁提供 4.3 AI 怎么调用 4.4 底层协议 节点数差异: 4.5 元素定位 4.6 事件可信度 (isTrusted) 五、选型指南 六、面试高频追问 Q1: Kimi WebBridge 和 agent-browser 都能抓包,有什么区别? Q2: 三者哪个能做到 isTrusted=true? Q3: 为什么不直接用 Playwright,还要造 agent-browser 和 Kimi WebBridge? Q4: Kimi WebBridge 的 Extension 会比 agent-browser 慢吗? 引用 Kimi WebBridge vs agent-browser vs Playwright 三者对比 一、一句话区分 工具 一句话 Kimi WebBridge 接管用户的真实浏览器(含登录态),不需要写代码 agent-brows ...
目录 1. 项目概述 2. PowerMem 智能记忆系统 原始记忆系统的问题 PowerMem 三层架构 三类记忆 记忆作用域 艾宾浩斯遗忘曲线 嵌入模型 3. 每轮对话的上下文构建 System Prompt 组成: 4. MCP 与 Skill 加载机制 MCP → 注册为 Tool Skill → 注入 System Prompt 5. 心跳与定时任务 Heartbeat(心跳巡查) CronService(精确调度) 6. Browser V1 vs V4 架构变化 关键改进 7. 会话管理与最大轮次 最大轮次 session_key 判断同一 chat 8. 跨会话知识保持 三层协作 压缩触发条件 每轮对话后的异步任务 ContextVars 会话隔离 引用 Nanobot 核心架构 1. 项目概述Nanobot 是企业级 AI Agent 框架,支持多渠道通信(钉钉/WhatsApp/CLI)和智能记忆管理。 技术栈:Python 3.12、FastAPI、SOFA、Pydantic、LiteLLM、Playwright ...
Claude 使用技巧目录 一、Claude Code CLI 实用技巧 二、对话与提示工程技巧 三、Claude API 高级用法 四、MCP 服务器与工具集成 五、常见误区与避坑指南 一、Claude Code CLI 实用技巧1.1 CLAUDE.md 项目指令文件在项目根目录放置 CLAUDE.md,Claude Code 每次启动都会自动加载,等效于项目级的 system prompt: 12345# CLAUDE.md- 本项目使用 pnpm,不要用 npm- 代码风格:2 空格缩进,单引号- 测试命令:pnpm test- 提交信息格式:conventional commits 技巧:可分层放置 —— ~/.claude/CLAUDE.md(全局)、项目根目录(项目级)、子目录(模块级),越深层级优先级越高。 1.2 权限与自动批准减少权限弹窗的两种方式: 命令行参数:claude --dangerously-skip-permissions(不推荐日常使用) settings.json 配置:在 .claude/settings.json 中添加允许列表 12 ...









