一、什么是 AI Agent?
AI Agent(人工智能代理) 是一个具备自主性、反应性、目标导向性的软件实体,能通过"感知 → 决策 → 行动 → 反馈"闭环,在动态环境中持续完成复杂任务。
Agent vs RPA vs ChatBot
| 维度 | 传统 RPA | ChatBot | AI Agent |
|---|---|---|---|
| 自动化方式 | 固定 UI 脚本 | 关键词匹配 | 动态任务规划 |
| 决策能力 | 无 | 弱 | 强(语义推理) |
| 工具使用 | 预设接口 | 少量 API | 动态选择组合 |
| 适应性 | 极低 | 中等 | 高 |
一句话区分三者:
- ChatBot = 会说话的界面
- RPA = 数字流水线工人
- AI Agent = 具备思考能力的任务经理
二、PDCA 循环:Agent 的运行骨架
所有智能体的核心运行框架都是 感知-决策-行动-反馈(PDCA)循环:
感知(Perception) → 决策(Decision) → 行动(Action) → 反馈(Feedback)
↑ ↓
└────────── 更新上下文 & 记忆 ←─────────────────┘
| 模块 | 职责 | 关键点 |
|---|---|---|
| 感知 | 接收解析输入(文本/图像/语音) | 输入归一化、多模态融合 |
| 决策 | LLM 充当"大脑"判断任务、选工具 | 由 Function Call 实现 |
| 行动 | 实际调用工具执行 | 异常处理、结果标准化 |
| 反馈 | 评估结果,决定下一步 | 成功/失败/追问,自我反思 |
正是"反馈"这一环,让 Agent 具备了持续优化的能力,形成真正的智能闭环。
三、Function Call:连接"想"与"做"的桥梁
模型按需自动生成函数调用指令,动态使用外部工具的能力。
如果 LLM 是大脑,Function Call 就是神经信号——把 LLM 的意图标准化地传递给程序去执行。
为什么需要它?
早期做法是让 LLM 在 prompt 里"猜"参数输出 JSON,问题很多:格式不可控、参数易遗漏、安全性差。
Function Call 协议把这一切标准化:
- LLM 输出结构化的"工具调用请求"(函数名 + 参数)
- 程序代码负责执行并返回结果
- LLM 基于结果做下一步决策
三步调用流程
- 注册:向 LLM 声明可用函数(
name+description+parameters) - 响应:LLM 返回
function_call字段,包含函数名和 JSON 参数 - 执行:开发者调用真实函数,结果以
role: function回传给 LLM
Schema 设计三原则
- 描述清晰:让 LLM 明白工具"在什么场景下用、解决什么问题"
- 类型精确:善用
enum限制枚举值,降低错误率 - 必填合理:关键参数进
required,可选参数给默认值
Schema 既是接口契约,更是 LLM 的决策指南。
四、三大主流架构模式
Function Call 是"手脚",架构模式是"大脑的思考方式"。不同任务复杂度需要不同策略。
4.1 ReAct 模式:边想边做
核心:推理(Reasoning)与行动(Action)交替进行,逐步逼近答案。
Thought: 我需要查公式
Action: search_knowledge
Observation: sin²α + cos²α = 1
Thought: 现在可以计算了...
- Function Call 节奏:高频、短平快
- 适用场景:信息检索、多跳问答、工具链式调用
- 优缺点:灵活适应性强,但易陷入循环,需设最大轮次
4.2 Plan-and-Execute 模式:谋定后动
核心:先规划完整计划,再分步执行。
- Planning:LLM 输出结构化步骤列表(此阶段不调用任何工具)
- Execution:程序按计划依次执行子任务
- Summary:整合所有结果生成最终回复
- Function Call 节奏:规划阶段零调用 + 执行阶段集中调用
- 适用场景:复杂项目管理、学习计划制定、批量任务
- 优缺点:结构清晰可预测,但计划可能僵化
4.3 Reflection 模式:三思而行
核心:执行后主动反思,评估结果质量并修正。
执行 → 反思("答案对吗?有遗漏吗?")→ 通过则输出 / 不通过则修正
- Function Call 节奏:不定频、事件驱动
- 适用场景:数学物理题求解、代码调试、医疗法律等高风险场景
- 优缺点:可靠性高,但效率低,需防反思死循环
三种模式速查表
| 模式 | 核心思想 | Function Call 节奏 | 最适合的任务 |
|---|---|---|---|
| ReAct | 边推理边行动 | 高频、交替 | 探索性、实时性任务 |
| Plan-and-Execute | 先计划后执行 | 低频、集中 | 复杂流程、长任务 |
| Reflection | 执行后反思 | 事件驱动 | 高精度、高可靠任务 |
真实业务中常采用混合模式:顶层用 P&E 做规划,底层用 ReAct 做执行,关键节点用 Reflection 做质量检查。
五、一图总结
AI Agent = LLM(大脑) + Function Call(神经) + 工具(手脚) + 架构模式(思考方式)
| 概念 | 一句话要点 |
|---|---|
| AI Agent | 自主、目标导向的智能实体,具备 PDCA 闭环 |
| PDCA 循环 | 感知→决策→行动→反馈,构成智能闭环 |
| Function Call | 连接 LLM"想"与程序"做"的标准化协议 |
| ReAct | 边想边做,适合探索性任务 |
| Plan-and-Execute | 谋定后动,适合复杂长流程 |
| Reflection | 三思而行,适合高精度任务 |
掌握这四个核心概念,你就握住了 AI Agent 的精髓,可以开始设计自己的智能体了。