一文搞懂 AI Agent:从原理到三大架构模式

一文读懂 AI Agent 核心原理、Function Call 机制与三大主流架构模式

一、什么是 AI Agent?

AI Agent(人工智能代理) 是一个具备自主性、反应性、目标导向性的软件实体,能通过"感知 → 决策 → 行动 → 反馈"闭环,在动态环境中持续完成复杂任务。

Agent vs RPA vs ChatBot

维度 传统 RPA ChatBot AI Agent
自动化方式 固定 UI 脚本 关键词匹配 动态任务规划
决策能力 强(语义推理)
工具使用 预设接口 少量 API 动态选择组合
适应性 极低 中等

一句话区分三者:

  • ChatBot = 会说话的界面
  • RPA = 数字流水线工人
  • AI Agent = 具备思考能力的任务经理

二、PDCA 循环:Agent 的运行骨架

所有智能体的核心运行框架都是 感知-决策-行动-反馈(PDCA)循环

感知(Perception) → 决策(Decision) → 行动(Action) → 反馈(Feedback)
       ↑                                              ↓
       └────────── 更新上下文 & 记忆 ←─────────────────┘
模块 职责 关键点
感知 接收解析输入(文本/图像/语音) 输入归一化、多模态融合
决策 LLM 充当"大脑"判断任务、选工具 由 Function Call 实现
行动 实际调用工具执行 异常处理、结果标准化
反馈 评估结果,决定下一步 成功/失败/追问,自我反思

正是"反馈"这一环,让 Agent 具备了持续优化的能力,形成真正的智能闭环。

三、Function Call:连接"想"与"做"的桥梁

模型按需自动生成函数调用指令,动态使用外部工具的能力。
如果 LLM 是大脑,Function Call 就是神经信号——把 LLM 的意图标准化地传递给程序去执行。

为什么需要它?

早期做法是让 LLM 在 prompt 里"猜"参数输出 JSON,问题很多:格式不可控、参数易遗漏、安全性差。

Function Call 协议把这一切标准化:

  • LLM 输出结构化的"工具调用请求"(函数名 + 参数)
  • 程序代码负责执行并返回结果
  • LLM 基于结果做下一步决策

三步调用流程

  1. 注册:向 LLM 声明可用函数(name + description + parameters
  2. 响应:LLM 返回 function_call 字段,包含函数名和 JSON 参数
  3. 执行:开发者调用真实函数,结果以 role: function 回传给 LLM

Schema 设计三原则

  • 描述清晰:让 LLM 明白工具"在什么场景下用、解决什么问题"
  • 类型精确:善用 enum 限制枚举值,降低错误率
  • 必填合理:关键参数进 required,可选参数给默认值

Schema 既是接口契约,更是 LLM 的决策指南。

四、三大主流架构模式

Function Call 是"手脚",架构模式是"大脑的思考方式"。不同任务复杂度需要不同策略。

4.1 ReAct 模式:边想边做

核心:推理(Reasoning)与行动(Action)交替进行,逐步逼近答案。

Thought: 我需要查公式
Action: search_knowledge
Observation: sin²α + cos²α = 1
Thought: 现在可以计算了...
  • Function Call 节奏:高频、短平快
  • 适用场景:信息检索、多跳问答、工具链式调用
  • 优缺点:灵活适应性强,但易陷入循环,需设最大轮次

4.2 Plan-and-Execute 模式:谋定后动

核心:先规划完整计划,再分步执行。

  1. Planning:LLM 输出结构化步骤列表(此阶段不调用任何工具)
  2. Execution:程序按计划依次执行子任务
  3. Summary:整合所有结果生成最终回复
  • Function Call 节奏:规划阶段零调用 + 执行阶段集中调用
  • 适用场景:复杂项目管理、学习计划制定、批量任务
  • 优缺点:结构清晰可预测,但计划可能僵化

4.3 Reflection 模式:三思而行

核心:执行后主动反思,评估结果质量并修正。

执行 → 反思("答案对吗?有遗漏吗?")→ 通过则输出 / 不通过则修正
  • Function Call 节奏:不定频、事件驱动
  • 适用场景:数学物理题求解、代码调试、医疗法律等高风险场景
  • 优缺点:可靠性高,但效率低,需防反思死循环

三种模式速查表

模式 核心思想 Function Call 节奏 最适合的任务
ReAct 边推理边行动 高频、交替 探索性、实时性任务
Plan-and-Execute 先计划后执行 低频、集中 复杂流程、长任务
Reflection 执行后反思 事件驱动 高精度、高可靠任务

真实业务中常采用混合模式:顶层用 P&E 做规划,底层用 ReAct 做执行,关键节点用 Reflection 做质量检查。

五、一图总结

AI Agent = LLM(大脑) + Function Call(神经) + 工具(手脚) + 架构模式(思考方式)
概念 一句话要点
AI Agent 自主、目标导向的智能实体,具备 PDCA 闭环
PDCA 循环 感知→决策→行动→反馈,构成智能闭环
Function Call 连接 LLM"想"与程序"做"的标准化协议
ReAct 边想边做,适合探索性任务
Plan-and-Execute 谋定后动,适合复杂长流程
Reflection 三思而行,适合高精度任务

掌握这四个核心概念,你就握住了 AI Agent 的精髓,可以开始设计自己的智能体了。