这一篇写给谁
如果你听到「AI Agent」这个词很多次,但一直没搞清它到底是什么——这篇就是为你写的。不用懂什么高级技术,我会用最直白的方式讲清楚:AI Agent 是什么、和聊天机器人有什么不同、它为什么「能干活」。
从聊天机器人说起
你大概用过 ChatGPT、Claude 这类聊天机器人。它们的工作方式很简单:
你输入一句话 → 它回答一段话。
你问「什么是 TCP」,它给你解释;你问「帮我写个冒泡排序」,它给你代码。然后呢?然后你自己把代码复制到编辑器里跑。它负责「想」,你负责「做」。
这就是聊天机器人。它没有手,只有一张嘴。
AI Agent 多了什么
AI Agent 的本质,就是给这张嘴接上了手。
它不只是「回答你」,而是能自己动手去完成一件事。为了实现这个,它多了三个东西:
1. 工具(Tools)
Agent 可以调用一些函数来「做」事情——比如:
- 运行一条命令
- 读写一个文件
- 访问一个网页
- 调用一个 API
这些工具就像是它的手和脚。你说「把项目里所有写死的密码找出来」,它就会自己去 grep 文件、分析结果、整理成报告,而不是只给你一段「你应该怎么做」的建议。
2. 循环(Loop)
这是最关键的一点。Agent 不是一次问答就结束,而是会反复地「想 → 动手 → 看结果 → 再想」,直到任务完成。
用大白话讲:
你给它一个目标 → 它决定先做一步 → 它做 → 它看看做得怎么样 → 决定下一步 → 再做……
就像你让一个实习生「帮我把这些数据整理成表格」,他不是回答你「应该用 Excel」,而是真的打开表格、开始整理、遇到问题自己处理、最后把成品给你。
3. 记忆(Memory)
Agent 能记住上下文——它做过什么、得到什么结果、离目标还差多少。这样它才能在一个多步骤任务里保持一致,不「做完第一步就忘了自己为什么做」。
一句话总结三者
Agent = 模型(会想)+ 工具(会做)+ 循环(会坚持)+ 记忆(记得住)
少一个,它都只是个聊天机器人。
一个生活化的例子
想象你开了一家小咖啡店,雇了个店员:
- 聊天机器人 = 一个只会在吧台回答你问题的店员:「这个咖啡怎么做?」他会说「先磨豆、再萃取」,但他不会动手。
- AI Agent = 一个真正能站到吧台后面干活的店员。你说「今天打烊前把所有杯子洗干净、垃圾倒了、账算好」,他会自己排好步骤、动手做完、中途遇到缺洗洁精自己去补给、最后向你汇报。
Agent 的差别不在于「更聪明」,而在于「更会干活」。
常见的 AI Agent 类型
现在你接触到的 Agent,大概能分成几类:
- 编码 Agent:帮你写代码、改代码、跑测试(比如 Claude Code、Cursor)。
- 通用任务 Agent:处理文档、整理信息、执行多步工作流。
- 浏览器 Agent:能自己操作网页、填表、抓数据。
- 多 Agent 协作:多个 Agent 分工合作,一个拆任务、一个执行、一个质检,像一个小团队。
它们的共同点是那套「循环 + 工具」,差别只是工具不同、用在不同场景。
和「自动脚本」的区别
你可能想问:那我写个脚本,不也能自动做事吗?Agent 和脚本的区别在于:
- 脚本:每一步都是人提前写死的。条件变了,脚本就不会处理了。
- Agent:每一步是它「看着情况自己决定的」。条件变了,它能自己调整。
所以 Agent 适合无法预先把每一步都写死的任务;而能写死的任务,用脚本更便宜、更稳定。
你需要理解的两个真相
- Agent 会犯错。它基于「判断」做决定,判断就可能出错。它不是魔法,是「会自主行动的程序」。
- Agent 越强,越需要约束。它有了手,就要防止它「乱动手」——权限、护栏、二次确认,这些是让 Agent 安全可靠的关键(这个我会在别篇展开)。
下一站
如果你想进一步了解「是什么在背后驱动这个循环」——也就是那个让 Agent 能一遍遍「想 → 动手」的引擎,可以看我的另一篇:《Harness 是什么:Agent 背后的引擎》。