图解 · AI Agent
把 AI Agent 拆开看:大脑 + 眼睛 + 手脚
普通聊天机器人是问答机器。Agent 是数字员工:你说目标,它自己拆步骤、调工具、检查结果、交付。
一直听人说 AI Agent,但「智能体」这三个字听完还是不知道它到底是什么。
最好用的理解方式:把它当成一个「数字员工」。
普通聊天机器人是「问答机器」——你问,它答,结束。Agent 是「员工」——你说目标,它自己拆步骤、调工具、检查结果、交付。一个「问答机器」变成一个「员工」。所以它的架构不是更大的模型,而是多了眼睛和手脚。
Agent = 大脑 + 眼睛 + 手脚
- LLM 大语言模型:决定「该怎么做」
- Context 上下文:决定「能看到什么」
- Tools 工具:决定「能做什么」
大脑 · LLM
就像员工的智力和经验。你交代一个目标,它负责想清楚这件事该分几步、先做哪个。
- 你说的和你想要的,往往不完全一样
- 把一个大目标拆成能执行的小动作
- 上一步结果出来了,下一步该往哪走
眼睛 · Context
Agent 当下能看到的。看不到的东西,它就当作不存在。
- 这次要它干什么
- 前面聊过什么
- 现在在哪个文件夹、有哪些文件
- 系统提示词:它的「规章制度」
「它怎么不知道我上次说的」——通常是上下文没给到,不是模型笨。
手脚 · Tools
有了工具,它就不只是「说」,而是能「做」。这是 Agent 和聊天机器人最实在的分界线。搜网页、读写文件、运行代码、调用其他软件。工具越多,能力边界越大——风险也越大。所以需要安全壳。
它不是一次答对,而是转圈逼近
ReAct 循环:想 → 做 → 看 → 再想
- 现在什么情况?下一步干什么
- 调一个工具,真的去执行
- 结果对不对?拿到什么新信息
所以它中途出错不奇怪——能自己发现并绕回来,才是关键。
一遍循环长什么样(卡片举例):任务:把这个文件夹里的发票金额汇总成表格
- 得先看看文件夹里有什么
- 列出目录 → 发现 23 个 PDF
- 都是扫描件,读不出文字
- 那要先做 OCR
- 跑 OCR → 提取金额 → 写入表格
- 有 2 张识别失败,标出来问你
注意最后一步:不确定的地方交回给你,而不是硬猜。
会不会把我电脑搞乱?
没有安全壳的 AI,像一匹脱缰的野马:力气很大,但你不知道它会往哪跑。答案是要看它有没有 Harness(安全外壳)。
完整的架构必须包三层:
- 约束 —— 哪些文件夹不能碰、哪些操作必须先问你
- 验证 —— 做完自动检查,比如代码跑起来有没有报错
- 纠正 —— 发现错了会退回安全状态,不一路错下去
「约束」具体是什么:不是一句承诺,是能列出来的规则
- 读写 ~/Documents/发票/
- 运行只读的查询命令
- 范围之外一律不碰,必须先问你
- 删除任何文件:不可逆,永远由人点确认
- 发出任何消息或付款:不可逆,永远由人点确认
判断一个 Agent 靠不靠谱,先问它的约束能不能被明确写出来。说不清的就要小心。
怎么越用越顺手
让「员工」积累经验的三层设计:
- 长期记忆:记住你的偏好和过去的解法。「他知道我习惯用 Python」
- 知识库 RAG:随时查你提供的私有资料,像给员工配了一本备查手册
- 自我进化:把成功的操作存成可复用的工具。同一件事第二次做,快很多
一句话总结
Agent 是一个有「大脑」的决策核心,通过「眼睛」看你给的上下文,指挥「手脚」操作工具,整个东西被包在「安全外壳」里。
所以下次看一个 Agent 产品,别只问模型多强,问它的眼睛能看到什么、手脚能碰什么、以及那层壳有多严。
(整理自读者笔记,概念以原书为准)