学习目标
完成本节学习后,学员将能够:
- 准确理解 AI Agent 的定义、核心特征与演化路径
- 清晰区分 Agent、传统 RPA 和 ChatBot 的本质差异
- 深入掌握 感知-决策-行动-反馈(PDCA)循环机制的运行逻辑
- 理解主流 Agent 架构模式的设计思想及其适用场景
一、什么是 AI Agent?
1.1 定义:智能体 ≠ 聊天机器人
AI Agent(人工智能代理) 是一个具备自主性、反应性、目标导向性和环境交互能力的软件实体。它能通过"感知 → 决策 → 行动 → 反馈"闭环,在动态环境中持续执行复杂任务,以达成预设目标。
关键词解析:
| 特征 | 含义 |
|---|---|
| 自主性 (Autonomy) | 不依赖人工干预即可独立运行 |
| 反应性 (Reactivity) | 能感知并响应外部环境变化 |
| 目标导向性 (Goal-directedness) | 所有行为服务于特定任务目标 |
| 持续性 (Persistence) | 长时间运行并维护状态记忆 |
| 工具调用能力 (Tool Use) | 主动调用外部函数或服务扩展能力 |
类比说明:你可以把 AI Agent 想象成一位"数字员工",不仅能听懂你的指令,还能自己查资料、写报告、发邮件、做数据分析——而不仅仅是一个会说话的客服机器人。
1.2 发展历程:从规则系统到大模型驱动
| 时期 | 技术代表 | 特点 | 局限 |
|---|---|---|---|
| 1980s–1990s | 专家系统、符号 AI | 基于手工编码规则 | 缺乏泛化能力 |
| 2000s–2010s | RPA、工作流引擎 | 自动化固定流程 | 无法处理非结构化输入 |
| 2017–2020 | Task-Oriented Dialogue Systems | 多轮对话+API 调用 | 依赖严格意图识别 |
| 2022–至今 | LLM-Based Agents(如 AutoGPT、LangChain Agents) | 大模型驱动决策+Function Calling | 对幻觉敏感,需工程控制 |
二、Agent vs RPA vs ChatBot:三者的本质区别
我们从五个维度进行对比分析:
| 维度 | 传统 RPA | ChatBot | AI Agent |
|---|---|---|---|
| 自动化方式 | 固定 UI 操作脚本 | 固定问答匹配 | 动态任务规划 |
| 输入类型 | 结构化数据为主 | 文本指令 | 多模态输入(文本/图像/语音) |
| 决策能力 | 无,仅流程执行 | 弱,关键词匹配 | 强,基于语义推理 |
| 工具使用 | 预设接口调用 | 少量 API 集成 | 动态选择和组合工具 |
| 适应性 | 极低(页面变即失效) | 中等(需重新训练) | 高(可通过 prompt 调整) |
| 典型应用 | 财务报销自动录入 | 客服问答机器人 | 教育助教、科研助手、编程帮手 |
场景举例:学生问"帮我批改这张作业"
| 角色 | 如何应对? |
|---|---|
| ChatBot | “抱歉,我不能看图片。” 或 “请打字告诉我题目内容。” |
| RPA | 无法理解问题,除非预先设定好"上传→OCR→比对答案"的完整流程脚本 |
| AI Agent | 自动调用 OCR 识别图像 → 解析题目与作答 → 查询标准答案 → 判断正误 → 生成反馈建议 → 推送结果给用户 |
结论:
- ChatBot = 会说话的界面
- RPA = 数字流水线工人
- AI Agent = 具备思考能力的任务经理
三、感知-决策-行动-反馈(PDCA)循环机制深度剖析
这是所有智能体的核心运行框架,也是构建可靠 Agent 系统的理论基石。
+------------------+
| |
| 感知 | ←--- 用户输入 / 环境信号
| (Perception) |
+--------+---------+
|
v
+--------v---------+
| |
| 决策 | ←--- LLM推理 + 工具选择
| (Decision) |
+--------+---------+
|
v
+--------v---------+
| |
| 行动 | ←--- 调用工具(如OCR、数据库查询)
| (Action) |
+--------+---------+
|
v
+--------v---------+
| |
| 反馈 | ←--- 获取执行结果 + 用户评价
| (Feedback) |
+--------+---------+
|
+----------→ 更新上下文 & 记忆 → 下一轮循环
3.1 感知模块(Perception)
负责接收并解析用户的原始输入,可能包括:
- 文本指令(“帮我分析这道错题”)
- 图像文件(手写作业照片)
- 语音录音(口述问题)
- 上下文历史(之前的对话记录)
处理要点:
- 输入归一化:统一转为文本描述
- 上下文注入:结合会话历史增强理解
- 多模态融合:图文联合编码(后续章节详述)
示例:当学生上传一张数学题截图时,Agent 需先将其转换为如下提示词上下文:
用户上传了一张包含以下内容的手写图片:
"已知 sin(α) = 3/5,且 α ∈ (π/2, π),求 cos(α) 的值。"
请判断是否为错题,并提供讲解。
3.2 决策模块(Decision)
这是 Agent 的"大脑",由 LLM 驱动,负责回答两个关键问题:
- 当前任务是什么?
- 应该调用哪个工具来解决它?
决策过程示例:
用户请求:"帮我看看这道题做对了吗?"
→ 感知到这是一个"作业批改"任务
→ 决策:需要先识别图像中的文字 → 应调用 OCR 工具
→ 输出:{"tool": "ocr_service", "args": {"image_path": "/uploads/xxx.jpg"}}
核心技术支撑:Function Calling(将在下一节深入讲解)。LLM 不再直接输出答案,而是输出一个结构化的"工具调用请求"。
3.3 行动模块(Action)
根据决策结果,实际执行工具调用,例如:
- 调用
ocr_service提取图像文本 - 查询
knowledge_db获取知识点解释 - 发送消息 via
push_service
注意事项:
- 工具调用必须封装为可复用的服务接口
- 需要处理超时、失败、降级等异常情况
- 返回结果应标准化(JSON 格式)
3.4 反馈模块(Feedback)
收集行动结果,并评估是否达成目标:
- 成功:继续下一步或结束任务
- 失败:尝试重试、切换工具或向用户求助
- 不确定:主动追问澄清需求
高级形态还包括:
- 自我反思(Self-Reflection):检查上一步是否有误
- 用户反馈整合:如"这个解释我不太懂" → 触发更详细的讲解
正是这一环的存在,使得 Agent 具备了"持续优化"的能力,形成了真正的智能闭环。
四、当前主流 Agent 架构模式对比
不同的任务复杂度需要不同的架构设计。以下是四种典型模式:
| 模式 | 英文名 | 适用场景 | 特点 | 在 EduMentor 中的应用 |
|---|---|---|---|---|
| ReAct | Reasoning + Acting | 单任务、多步骤 | 推理与行动交替进行,适合探索性强的任务 | 智能答疑中逐步检索知识 |
| Plan-and-Execute | 规划后执行 | 多子任务、长流程 | 先制定完整计划,再分步执行 | 错题分析 → 推送练习全流程调度 |
| Reflection | 自我反思 | 高质量输出要求 | 执行后自我评估,迭代改进 | 主观题批改后的评分修正 |
| Graph-based | 基于图的状态机 | 复杂流程、条件分支 | 使用节点和边建模状态流转 | 多 Agent 协作主控流程 |
4.1 ReAct 模式:推理 → 行动 → 观察 → 再推理
格式化提示词模板(Prompt Pattern):
Thought: 我需要查找三角函数公式
Action: search_knowledge_base
Observation: sin²α + cos²α = 1
Thought: 现在我可以用这个公式计算...
优点:
- 实时性强,边想边做
- 适合开放域问答、信息检索类任务
缺点:
- 易陷入无限循环
- 难以处理长流程任务
在 EduMentor 中的应用:用于智能答疑 Agent,当学生提问较难问题时,Agent 可多次调用知识库检索服务,逐步逼近正确答案。
4.2 Plan-and-Execute 模式:先规划,再执行
分两阶段:
- Planning Phase:LLM 输出一个任务列表(To-Do List)
- Execution Phase:依次执行每个子任务
示例:生成个性化复习计划
{
"plan": [
{"step": 1, "task": "获取学生最近一周错题"},
{"step": 2, "task": "统计薄弱知识点"},
{"step": 3, "task": "生成专项练习题"},
{"step": 4, "task": "安排推送时间"}
]
}
优点:
- 流程清晰,易于调试
- 支持中断恢复
- 更容易保证最终目标达成
缺点:
- 规划可能不准确
- 若中间步骤失败,需重新规划
在 EduMentor 中的应用:适用于练习生成 Agent 或错题分析 Agent,确保整个辅导流程有序可控。
4.3 Reflection 模式:执行 → 反思 → 修正
Agent 在每次行动后都会停下来"自省":
- “我的回答够清楚吗?”
- “有没有遗漏关键点?”
- “用户可能会误解哪里?”
典型实现方式:
- Critic Model:引入第二个模型专门做评审
- Self-Evaluation Prompt:让同一个模型评估自己的输出质量
例如:
第一次反馈:"你算错了。"
反思后改进:"你在第三步应用诱导公式时符号出错,因为α在第二象限,cos应为负值。"
在 EduMentor 中的应用:用于主观题批改和个性化反馈生成,提升教育内容的专业性和可接受度。
4.4 Graph-Based 模式:基于状态图的流程控制
使用**有向图(Directed Graph)**来显式定义 Agent 的状态转移逻辑,每个节点是一个操作或决策点,边表示跳转条件。
技术实现:LangGraph(LangChain 子项目)
优势:
- 可视化流程,便于团队协作
- 支持并发、循环、条件分支
- 易于添加异常处理路径
在 EduMentor 中的应用:作为主控 Agent(Orchestrator)的底层架构,协调多个专业 Agent 协同工作。
收到上传图片
│
▼
是作业吗? ─── 否 ──→ 调用答疑Agent
│
是
▼
调用OCR
│
▼
批改Agent评分
│
▼
错题分析Agent诊断
│
▼
生成专项练习
│
▼
推送服务发送
五、本节小结
| 概念 | 核心要点 |
|---|---|
| AI Agent | 自主、反应、目标导向的智能实体,具备 PDCA 闭环能力 |
| 与 RPA 区别 | RPA 是"自动化脚本",Agent 是"任务管理者" |
| 与 ChatBot 区别 | ChatBot 只能回答,Agent 能主动做事 |
| PDCA 循环 | 感知→决策→行动→反馈,构成智能闭环 |
| Function Call | 是实现"行动"的关键技术基础(下节详解) |
| ReAct 模式 | 边推理边执行,适合探索性任务 |
| Plan 模式 | 先规划再执行,适合长流程任务 |
| Reflection 模式 | 自我反思提升输出质量 |
| Graph 模式 | 显式控制流程,适合复杂协同系统 |