编程 agent 是五个普通部件的接线:大脑、手、笔记本缺一不可

2026-09-08 07:13:28

AI agent 解剖:把思考变成行动的五个部件

让语言模型"订周四晚上六人的桌子",它会流畅而自信地解释怎么订——然后停下来。能说会道、却一根手指都动不了。知道该做什么和真去做的差距,就是聊天机器人与 agent 的全部区别:chatbot 回答然后等待;agent 拿着目标去补上这个差距——规划、行动、跟踪进度、在关键时刻回来找你。

没有单一聪明部件能做到这点。agent 是一小队普通部件,智能在它们的接线方式里。想象 agent 是第一天上班的新人:聪明、肯干、完全不知所措——没电脑、没登录、不知道这里的规矩、不知道"完成"长什么样。下面就是你会递给那个人的五样东西。

五个部件(原文主线)

1. 大脑:LLM。 理解与判断所在:读请求、想清楚、决定下一步。它是房间里最聪明的东西,也什么都做不了——像被锁在没有电话的房间里的天才同事。这不是待修复的缺陷,而是塑造一切的事实:后面四个部件存在的唯一理由,就是给这个大脑一条出房间的路。

2. 手:技能与工具。 搜网页、跑代码、发邮件、查数据库、调服务——每一扇都是"从想到做"的门。装上几个,整个东西就醒了:模型决定做什么,技能负责怎么做。agent 的触达范围几乎完全由交给它的技能决定:只会搜索的是个阅读量很大的助手,能发邮件就能查完资料再送到你手上。

3. 笔记本:记忆。 和没有短期记忆的人共事过就知道多快崩溃——同一个问题、同一段上下文反复出现。记忆同时携带三样东西:任务中已经发生的事(别做两遍)、你惯常的偏好(团队工具、布局习惯)、对话的线索。

4. 计划(与 5. 行动循环/回报):把目标拆成步骤、跟踪进行到哪、需要时回报人类——完整五件套让"订位"从一段解说变成一次真实的预订。

实践建议

  • 设计 agent 先列五件套清单:脑(模型)、手(工具)、记忆(上下文)、计划(拆解)、回报(何时回到人)——缺任何一件都是残缺闭环;
  • agent 能力上限由工具集决定:想扩大能力先加门,不是换更大的模型;
  • 记忆分三层存:任务内状态、用户偏好、对话线索,混在一起会互相污染。

来源:The Anatomy of an AI Agent: Five Parts That Turn Thinking Into Doing - DEV Community

复制全文 生成海报 AI Agent LLM 架构

推荐文章

程序员茄子在线接单