AI Agent 是什么:从聊天机器人到会干活的程序

零基础看懂 AI Agent:模型会想、工具会做、循环会坚持、记忆记得住。用生活化的例子讲清 Agent 与聊天机器人、自动脚本的区别。

这一篇写给谁

如果你听到「AI Agent」这个词很多次,但一直没搞清它到底是什么——这篇就是为你写的。不用懂什么高级技术,我会用最直白的方式讲清楚:AI Agent 是什么、和聊天机器人有什么不同、它为什么「能干活」。

从聊天机器人说起

你大概用过 ChatGPT、Claude 这类聊天机器人。它们的工作方式很简单:

你输入一句话 → 它回答一段话。

你问「什么是 TCP」,它给你解释;你问「帮我写个冒泡排序」,它给你代码。然后呢?然后你自己把代码复制到编辑器里跑。它负责「想」,你负责「做」。

这就是聊天机器人。它没有手,只有一张嘴。

AI Agent 多了什么

AI Agent 的本质,就是给这张嘴接上了手

它不只是「回答你」,而是能自己动手去完成一件事。为了实现这个,它多了三个东西:

1. 工具(Tools)

Agent 可以调用一些函数来「做」事情——比如:

  • 运行一条命令
  • 读写一个文件
  • 访问一个网页
  • 调用一个 API

这些工具就像是它的手和脚。你说「把项目里所有写死的密码找出来」,它就会自己去 grep 文件、分析结果、整理成报告,而不是只给你一段「你应该怎么做」的建议。

2. 循环(Loop)

这是最关键的一点。Agent 不是一次问答就结束,而是会反复地「想 → 动手 → 看结果 → 再想」,直到任务完成。

用大白话讲:

你给它一个目标 → 它决定先做一步 → 它做 → 它看看做得怎么样 → 决定下一步 → 再做……

就像你让一个实习生「帮我把这些数据整理成表格」,他不是回答你「应该用 Excel」,而是真的打开表格、开始整理、遇到问题自己处理、最后把成品给你。

3. 记忆(Memory)

Agent 能记住上下文——它做过什么、得到什么结果、离目标还差多少。这样它才能在一个多步骤任务里保持一致,不「做完第一步就忘了自己为什么做」。

一句话总结三者

Agent = 模型(会想)+ 工具(会做)+ 循环(会坚持)+ 记忆(记得住)

少一个,它都只是个聊天机器人。

一个生活化的例子

想象你开了一家小咖啡店,雇了个店员:

  • 聊天机器人 = 一个只会在吧台回答你问题的店员:「这个咖啡怎么做?」他会说「先磨豆、再萃取」,但他不会动手。
  • AI Agent = 一个真正能站到吧台后面干活的店员。你说「今天打烊前把所有杯子洗干净、垃圾倒了、账算好」,他会自己排好步骤、动手做完、中途遇到缺洗洁精自己去补给、最后向你汇报。

Agent 的差别不在于「更聪明」,而在于「更会干活」。

常见的 AI Agent 类型

现在你接触到的 Agent,大概能分成几类:

  • 编码 Agent:帮你写代码、改代码、跑测试(比如 Claude Code、Cursor)。
  • 通用任务 Agent:处理文档、整理信息、执行多步工作流。
  • 浏览器 Agent:能自己操作网页、填表、抓数据。
  • 多 Agent 协作:多个 Agent 分工合作,一个拆任务、一个执行、一个质检,像一个小团队。

它们的共同点是那套「循环 + 工具」,差别只是工具不同、用在不同场景。

和「自动脚本」的区别

你可能想问:那我写个脚本,不也能自动做事吗?Agent 和脚本的区别在于:

  • 脚本:每一步都是人提前写死的。条件变了,脚本就不会处理了。
  • Agent:每一步是它「看着情况自己决定的」。条件变了,它能自己调整。

所以 Agent 适合无法预先把每一步都写死的任务;而能写死的任务,用脚本更便宜、更稳定。

你需要理解的两个真相

  1. Agent 会犯错。它基于「判断」做决定,判断就可能出错。它不是魔法,是「会自主行动的程序」。
  2. Agent 越强,越需要约束。它有了手,就要防止它「乱动手」——权限、护栏、二次确认,这些是让 Agent 安全可靠的关键(这个我会在别篇展开)。

下一站

如果你想进一步了解「是什么在背后驱动这个循环」——也就是那个让 Agent 能一遍遍「想 → 动手」的引擎,可以看我的另一篇:《Harness 是什么:Agent 背后的引擎》。