Agent 核心组件

AI Agent(智能体),是一个能够自主思考、并执行任务的自动化程序。它把大模型从一个被动的 “聊天框”,升级成了一个能主动干活的 “数字员工”。

那么,这个数字员工的内部到底是由什么构成的呢?这一节,我们就来把 Agent 拆开看看。实际上,一个 AI Agent 主要由以下 4 个核心组件构成:

  • 大脑(LLM)
  • 记忆(Memory)
  • 思考规划(Planning)
  • 工具调用(Tools)

我们可以把一个 Agent 想象成一个能干活的人:大脑(LLM)负责思考、拿主意,记忆(Memory)是他的记性,规划(Planning)是他做事的条理,而工具(Tools)就是他的一双手——这四样凑齐了,才算一个真正能独立干活的 “数字员工”。

AI Agent 四大核心组件图解:通俗展示了让“数字员工”真正独立干活的四个必备部分——负责思考的大脑、留存经验的记忆、安排条理的规划以及作为双手的工具调用。

大脑(LLM)

对于 AI Agent 来说,大模型(LLM)是它最核心的部分,相当于它的 “中央处理器(大脑)”。

在传统的方式中,大模型的主要工作是生成文本(比如帮你写一篇文章)。但到了 Agent 架构中,它的工作重心就变了:它要负责读懂外部输入的信息,理解你的最终目标,再像人一样做逻辑推理,然后决定下一步该干什么。

AI Agent 聪不聪明,完全取决于作为大脑的大模型能力强不强。比如你为公司做了一个财务 AI Agent,虽然用的是同一个 Agent 的 “壳”,但选择的大模型不同(比如 Gemini Pro 和 DeepSeek),最后干出来的质量也会差不少。

小伙伴们在选择大模型要注意,如果底座模型的逻辑推理能力太弱,Agent 在干活时就很容易陷入死循环,或者做出错误的决策。这也是为什么目前工业界真正好用的 Agent,几乎清一色都用行业最顶尖的大模型来当大脑。

AI Agent 大脑核心组件:大模型 LLM 负责逻辑推理与决定下一步动作

记忆(Memory)

如果 Agent 要去执行一个周期长、又复杂的业务任务,它就不能像金鱼一样转头就忘。记忆组件,负责的就是把 Agent 过去的执行经验和你的偏好信息存下来。

其中,Agent 的记忆主要分为以下 2 种:

1. 短期记忆(Short-term Memory)

对于 Agent 来说,短期记忆依赖于 “上下文窗口”。

它负责记住当前这一次任务的对话历史,以及正在处理的临时数据。一旦当前任务完成,或者超出了窗口的容量上限,这段记忆就会被清理掉。

2. 长期记忆(Long-term Memory)

对于 Agent 来说,长期记忆主要依赖于 “外挂知识库(RAG)” 和 “向量数据库”。

举个例子,你今天告诉私人 Agent:“我对花生过敏”。Agent 就会把这句话提取出来,永久保存在后端的向量数据库中。

一个月后,当你让它帮忙点外卖时,它会自动从数据库里翻出这条长期记忆,并在点餐时主动避开含有花生的菜品。

AI Agent 记忆组件图解:短期上下文记忆与基于 RAG 向量数据库的长期记忆

思考与规划(Planning)

当人类面对一个复杂的问题时,我们通常不会盲目动手,而是先在脑子里做一个计划。Agent 同样也具备这种能力,这就是思考与规划组件。

当我们给 Agent 下达一个比较大的目标(比如:“帮我写一份两万字的行业调研报告”)时,它不会直接提笔就写,而是先思考和规范。

通过思考与规划组件,它主要会做以下 2 件事。

1. 任务拆解

Agent 会把一个庞大的目标,拆解成若干个按顺序执行的小步骤。比如:第 1 步先去全网搜索行业数据,第 2 步拟定报告大纲,第 3 步分章节撰写,第 4 步进行错别字审查……

2. 反思与纠错

执行过程中难免出岔子。比如 Agent 在跑 “第 1 步搜数据” 时,发现搜索接口报错了。这时它不会当场崩溃、停摆,而是触发反思机制,意识到 “这条路走不通”,然后重新规划路线(比如换一个搜索引擎,或者改去某个特定的数据库查),直到把问题解决为止。

大模型之所以能像这样一步步拆解、一步步往下想,靠的是一种叫 “思维链(CoT)” 的能力——这正是我们在下一节要介绍的内容。

AI Agent 思考与规划组件:通过思维链,进行任务拆解与反思纠错的工作流

工具调用(Tools)

工具调用,是给 Agent 装上 “手脚” 的组件。大模型本身只是一串跑在服务器里的代码,它是没法直接去碰真实的物理世界或者互联网。

有了工具调用组件,开发工程师可以给 Agent 配备各种各样的 API 接口。比如:

  • 给它配备一个 “搜索工具”,它就能实时浏览当天的新闻。
  • 给它配备一个 “代码执行器”,它就能在后台自己写 Python 脚本并运行出结果。
  • 给它配备一个 “邮件 API”,它就能自动编辑邮件并发送给你的客户。
  • ……

AI Agent 工具调用组件:为大模型装上手脚执行搜索、代码与邮件 API 调用

在整个干活的过程中,Agent 的大脑会根据当前这一步的计划,自主决定应该用哪一个工具、什么时候用、以及给这个工具传入什么参数。

在底层的代码实现里,让大模型自己决定该调用哪个工具、并把对应的调用参数也一起生成出来——这种能力,业界给它起了个专有名词,叫 “Function Calling(函数调用)”。

“Function Calling” 这个术语非常重要,它是目前各大顶级开源和闭源模型(如 OpenAI、DeepSeek)最核心的高级功能之一。掌握了它,我们才能真正在代码层面为 AI 装上 “手脚”。

Agent 工作流程

最后,我们把这四个组件串联起来,就是 Agent 工作的完整逻辑:

  1. Agent 接收到任务后,以大模型为大脑进行推理,利用思考规划组件将任务拆解为具体的步骤
  2. 在执行步骤时,它会结合记忆组件提取历史经验,并自主触发工具调用组件去真实世界中获取数据或产生操作
  3. 最后再根据工具返回的结果,决定下一步的动作。

AI Agent 完整工作流程架构图:四大核心组件串联执行任务的底层逻辑

举个完整的例子:当你对私人 Agent 说 “帮我订一份不辣的午饭”,它会先用大脑(LLM)听懂目标,然后用规划(Planning)把任务拆成 “查附近餐厅 → 筛掉辣的 → 下单” 三步,中途会调用记忆(Memory)想起你 “不吃香菜” 的习惯,最后调用 “外卖下单工具”(Tools)真正把订单提交出去。四个组件配合一轮,活儿就干完了。

AI Agent 订午饭场景案例:大脑规划、记忆偏好与外卖工具调用的实战图解

在这四大组件中,“思考规划(Planning)” 和 “工具调用(Tools)”是 Agent 区别于传统大模型最关键的两个杀手锏。因此在接下来两节中,我们会深入了解这两大组件。

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号