一句话先说清楚:AI Agent(智能体)不是“更聪明的聊天机器人”,而是一个能自己定目标、拆计划、调用工具、动手执行、检查结果,直到把任务干完的 AI 程序。聊天机器人是“你说一句它答一句”,Agent 是“你扔给它一个任务,它自己跑完再向你汇报”。
1先分清:聊天机器人 vs Agent
差别不在“聪明程度”,而在“会不会自己动手”。
类比 · 聊天机器人像只回答问题的实习生——你问什么他答什么,答完就完。Agent 像能独立干活的项目负责人——你只说“把这事办妥”,他自己拆任务、跑腿、遇到问题绕路,办完才来跟你汇报。
同样都是 AI,左边“只动嘴”,右边“既动脑又动手”。这是两者最本质的区别。
Agent(智能体)
en: agent · 词源是“代理人”
能自己规划、调用工具、执行任务并检查结果的 AI 程序。关键不是“会聊天”,而是“能干活”。
2它怎么工作?核心是一个循环
所有 Agent 的工作方式都可以压缩成同一个“循环”:想一下 → 动一下 → 看一下 → 再想。
核心循环:计划 → 行动 → 观察 → 再计划,直到任务完成。第 4 步的“检查”是 Agent 和普通程序最大的不同——它会看结果、会纠错。
LLM(大语言模型)
en: Large Language Model
Agent 的“大脑”。负责理解你的话、做决策、写内容。想了解它本身怎么工作,去看另一页《大语言模型是什么》。
Agent Loop(智能体循环)
en: agent loop
“计划→行动→观察→再计划”的循环。每转一圈,Agent 就离任务完成近一点。
3Agent 的“器官”:大脑、记忆、工具、执行器
一个能独立干活的 Agent,至少要有这四样。
没有工具的 AI 只能“说”,加上工具和执行器之后,它才真正“做得到”。
Tool Use / Function Calling(工具调用)
en: tool use / function calling
Agent 调用外部能力的方式:它先“说”要调用哪个工具和参数,系统替它执行,再把结果喂回给它。2023 年起主流大模型都支持这个能力。
Memory(记忆)
en: memory
短期记忆保存“这次任务进行到哪了”;长期记忆保存“上次学到的经验”。现在的顶级模型一次能记住 100 万 token 的上下文(约 75 万个英文单词,相当于几本厚书)。
4看一个真实的例子
你只说一句话,Agent 自己跑了 5 步。注意每一步之间那个循环。
关键点:如果第 ③ 步发现“明天没下雨”,它不会傻傻继续发邮件,而是回到 ① 重新计划——这就是循环的意义。
Autonomy(自主性)
en: autonomy
Agent 的自主程度像一个滑杆:从“每走一步都问你”到“任务级自主(自己跑完再汇报)”。今天的实用系统大多在两者之间。
5它会翻车吗?会。所以要有“刹车”
Agent 不是万能的。它翻车的方式还挺有规律。
- 计划错了,就一路错下去:第一步想偏,后面每一步都在执行一个错误方案。
- 误判结果:工具返回的数据它可能看错、想当然,然后把错的东西当成“完成”。
- 停不下来:任务定义不清时,它可能在一个小问题上反复循环,消耗大量时间。
- 权限失控:如果它被允许“随便做”,一个坏决定可能造成真损失(发错邮件、删错文件、花错钱)。
所以真正的 Agent 系统几乎都有“人在环路”:花钱、发消息、删文件这类关键动作,会先停下来等你点“确认”。这是给 Agent 装的刹车,不是因为它笨,而是因为责任必须由人承担。
Human-in-the-loop(人在环路)
en: human-in-the-loop
在 Agent 的关键/危险步骤插入“真人确认”的机制。它是 Agent 系统的安全阀:Agent 提方案,人做决定。
实际上更复杂一点:真实的 Agent 系统还有更多机制——有的会“自我反思”(干完再回头检查一遍),有的会用多个 Agent 分工协作(一个做规划、一个写代码、一个负责检查),有的经过了专门的“会正确使用工具”训练。而且重要边界:今天的 Agent 是任务级自主,它只能调用你授权的工具、在你允许的范围内行动,不是科幻电影里那种完全自己拿主意的 AI。
想一想
- 如果让一个 Agent 帮你办事(整理作业、订书、管理游戏账号),你愿意给它哪些“工具权限”?哪些操作必须让它先问你?为什么?
- 如果 Agent 把“查天气”误解成了“给全组人群发广告邮件”,谁来发现?如果你是设计者,你会给它加一道什么“刹车”?