参考答案MCP 给 Agent 提供”工具”,Skills 给 Agent 提供”方法论”,两者解决的是完全不同层面的问题。
MCP 全称 Model Context Protocol,是一套标准化的工具调用协议,让 AI Agent 能调用外部服务。查数据库、调 API、读文件系统,都是通过 MCP 来实现的。它解决的是 Agent “能不能做”的问题。
Skills 是一套指令文档,告诉...
参考答案Skills 就是给 AI Agent 写的操作手册,本质上是一份结构化的指令文件。当 Agent 碰到某类任务,就去读对应的 Skill,按里面的步骤一步步执行,不用你每次从头教它。
比如你想让 AI 帮你创建 Cursor 的自定义规则文件,规则文件放哪个目录、格式长啥样、有哪些字段,这些东西写一个 create-rule 的 Skill 就搞定了。Agent 碰到相关任务自动加...
做了一年多的 AI Agent 系统,最大的认知升级是:「调用 LLM API」和「构建 Agent 系统」是两件完全不同的事。一句话 API 拿到结果很容易,但要做一个稳定、可观测、可降级的 Agent 系统,需要串起 7-8 个子系统,每个都有自己的坑。
这篇文章把一个 Agent 从用户敲下回车那一刻到最终答案出现在屏幕上那一刻的完整链路拆开讲。读完你应该能:
画出任意 Agen...
做了 1 年 LLM 应用,最大的认知升级是:**”调 LLM API” 和 “构建 Agent 系统” 是两个完全不同的事**。
这篇文章复盘我们怎么用 Claude Agent SDK + Skills + MCP + LangGraph 搭出可观测、可降级、可扩展的多 Agent 协同架构。
一、为什么需要 Agent SDK2024 年中,我们开始做政策智能体。第一版直接调 A...
参考答案设计 Skills 体系分三个层面来讲:单个 Skill 怎么写、多个 Skills 怎么组织、上线后怎么维护。
1)单个 Skill 至少要把四件事写清楚:什么时候触发、任务目标是什么、分步骤的操作流程要具体到每一步用什么工具传什么参数、边界情况和常见错误。最后这部分往往是从踩坑经验中提炼出来的,也是最值钱的。
2)当 Skills 数量上来之后,需要合理的目录结构。按领域分目录,...
参考答案OpenClaw 本质上是一个开源的 多渠道 AI 网关(Multi-channel AI Gateway),它自己不做推理,只做调度和执行。你可以把它理解成一个中枢网关,把大模型的推理能力翻译成对操作系统、软件 API、硬件设备的实际控制权。
跟普通聊天机器人最大的区别在于,它能真正”动手干活”,不只是回复文字。
理解 OpenClaw,只需要抓住两个核心:架构和运行时机制(Age...
自己的 javai.tech 站,最近半年没更新。偶然打开 View Source 一看,差点没晕过去——og:title 是 “Hexo”,author 是 “John Doe”,连个 description 都没有。搜索引擎大概也懵了:这是谁的站? 本文复盘整个改造过程。
一、为什么突然想修?事情是这样的:
最近一直在做 AI 相关项目,朋友圈里也开始有人搜「javai」「Sherw...
接到一个需求:处理 666 条 2 小时以上的课程视频,做成 AI 教学知识库。
看似简单——调 Qwen-VL 接口就完事了。但真做起来发现:Qwen-VL 单视频 ≤ 2h、文件 ≤ 2GB,而且不支持音频。
这篇文章复盘我们怎么用工程手段补齐模型短板,做出一条”长视频理解 Pipeline”。
一、问题的硬约束接需求时没仔细看接口文档,等真做起来才发现一堆坑:
限制项
阈值...
参考答案直接调 API 就是”一问一答”,你发一条 prompt,模型回一条 response,结束。
AI Agent 完全不同,它是一个有状态的循环决策系统,能感知环境、做规划、调用工具执行动作、观察结果,然后自己决定下一步干什么,循环往复直到任务完成。
本质区别有三点:
1)Agent 有工具调用能力,能操作外部世界,比如读写文件、执行代码、查数据库、调第三方接口。单次 API 调用只...
上个月团队 review 月账单,发现 LLM 调用占了 ¥15,000。做了 2 周优化,月成本降到 ¥8,000,节省 47%,而且可用性还提升了。
这篇文章复盘我们怎么设计多 Provider 路由、自动降级和成本监控。
一、背景:为什么需要多 Provider做 AI 应用只用一家 LLM 看似简单,实际上有 4 个隐患:
成本不可控:单 provider 价格固定,没有谈判...
参考答案OpenClaw 是一个开源的本地 AI Agent 运行平台。
它解决的问题恰好是 ChatGPT、豆包、Claude Code 这些产品各自没覆盖到的地方。
ChatGPT / 豆包这类对话产品,它们本质是”聊天机器人”,你问它答,但它不能真正”动手干活”。让它帮你改一个文件、跑一条命令、定时监控一个服务,它做不到,它只能输出文字。
Claude Code 这类 Age...
做 LLM 应用 1 年多,最痛的教训是:没有评估体系的 RAG 系统,就是一个不能 debug 的黑盒。
这篇文章复盘我们 Chatomni 政策 RAG 系统的评估体系搭建过程——从”拍脑袋觉得好”到”有数字、可对比、可回归”的演进。
一、痛点:我们怎么发现”评估”是必须的Chatomni 上线第 2 周,产品经理提了个问题:”为什么用户问’增值税对小微企业的影响’,你给的答案里引...
参考答案整条链路可以分成 入站、路由、执行、出站 四个阶段,一共 8 步。
用户在 Telegram、Discord、Slack 这些渠道发了一条消息,首先命中的是对应的渠道适配器,它负责接收原始消息,然后把平台私有格式转换成统一的 MsgContext 结构,包含发送者信息、渠道类型、群组 ID 这些字段,屏蔽掉各渠道的格式差异。
转换完成后进入 dispatchInboundMessag...
做政府/部委政策抓取 1 年,我们的爬虫架构经历了三次大的演进。这篇文章复盘三代爬虫的设计决策、成本数据和踩过的坑,希望对做类似场景(多站点、政策合规、Agent 工程化)的同学有参考价值。
一、背景:为什么”政策爬虫”是个难题去年加入贝斯平,做的第一个 AI 项目是 Chatomni 政策洞察智能体——给合规部门用的”政策 Copilot”,用户问”营改增对小微企业有什么影...
参考答案整条链路可以分成 入站、路由、执行、出站 四个阶段,一共 8 步。
用户在 Telegram、Discord、Slack 这些渠道发了一条消息,首先命中的是对应的渠道适配器,它负责接收原始消息,然后把平台私有格式转换成统一的 MsgContext 结构,包含发送者信息、渠道类型、群组 ID 这些字段,屏蔽掉各渠道的格式差异。
转换完成后进入 dispatchInboundMessag...
参考答案Agent Runner 是 OpenClaw 的核心调度器,可以理解为”指挥中心”,负责协调 LLM 调用、工具执行、错误处理等所有环节。
一次完整的 Agent 运行从用户发消息到最终输出,大致经历以下阶段:
1)排队,先进 session 级队列(保证同一会话串行),再进全局队列(控制总并发),防止资源被打满
2)准备,解析 workspace、provider/mo...
参考答案调用工具得到超大结果会带来三个直接问题:token 爆炸、挤占上下文空间、延迟飙升。
如果一条代码搜索返回 50KB 文本,按 1 token ≈ 4 字符估算,光这一条就吃掉 12000+ token。
模型的 context window 如果是 128K token,一条 tool result 就干掉了将近 10%,后面的对话历史、系统提示、用户消息全被挤压,模型理解质量直线...
参考答案裁剪是把早期消息直接丢掉,简单粗暴但会丢信息。
Compaction(压实/压缩)换了个思路:用 LLM 把一大段对话历史”压缩”成一段精炼摘要,然后用摘要替换掉原始消息。
打个比方,就像把一本 300 页的会议记录压缩成 5 页的纪要。篇幅大幅缩减,但关键决议、待办事项、重要结论都保留了。
这样 Context 窗口腾出来了,关键信息也没丢。
OpenClaw 的 Com...
参考答案做这层抽象的根本原因是 Context 管理没有万能方案。
通俗理解:Context Engine 就像手机的存储管理。有的人喜欢自动清理旧照片,有的人喜欢只删大文件,有的人喜欢全部存云端按需下载。
不同的应用场景、不同的模型上下文窗口大小、不同的任务类型,最优的 Context 策略差异巨大。
把 Context 管理抽象成接口(定义好”做什么”),让策略实现(”怎么做”)可以独立...
参考答案核心思路是适配器模式:定义一套统一的 Channel 协议,每个渠道实现一个适配器(Adapter),负责把该平台的消息格式”翻译”成系统内部统一的消息结构。上层 Gateway 只跟协议打交道,完全不关心底下接的是 Telegram 还是飞书。
这道题其实考的就是一个经典设计问题:如何隔离外部系统的差异性。
可以从三层来答:
第一层:统一消息模型
所有渠道的消息进来后,都归一化成一...
参考答案多 Agent 协作的核心判断标准是:单个 Agent 搞不定的时候(不是废话)。就像一个人干不完的活,你需要组一个团队分工协作。
具体来看,有三种典型场景:
1)任务天然可以拆成并行的独立子任务。比如你要做一次竞品分析,需要同时去搜 Google、GitHub、Twitter 三个信息源,一个 Agent 一个个串行去搜太慢了,开三个 Agent 并行抓取,效率直接翻倍。
2)不同...
参考答案Hook/中间件模式就是在 Agent 的关键生命周期节点上挂自定义逻辑,不动核心代码就能做定制。
通俗理解:Hook 就像流水线上的”检查站”,产品(消息/请求)经过每个检查站时,你可以检查、修改甚至拦截它,但流水线的主体流程不需要改动。
典型场景:
1)模型调用前换模型。比如做 A/B 测试,50% 的请求走 GPT,50% 走 Claude,Hoo...
参考答案OpenClaw 里多 Agent 之间的通信主要靠两条路。
第一条是 Announce 机制(公告机制)。子 Agent 完成任务后,自动把结果发回父 Agent 所在的 session,本质上是异步通知,就像你派助手去办事,他办完了会主动回来汇报,你不需要每隔几秒打电话问”好了没”。
第二条是斜杠命令交互。通过 /subagents send 可以主动给子 Agent 发消息,用...