AI Agent核心原理

AI Agent 定义、核心特征、PDCA 循环机制与主流架构模式

学习目标

完成本节学习后,学员将能够:

  • 准确理解 AI Agent 的定义、核心特征与演化路径
  • 清晰区分 Agent、传统 RPA 和 ChatBot 的本质差异
  • 深入掌握 感知-决策-行动-反馈(PDCA)循环机制的运行逻辑
  • 理解主流 Agent 架构模式的设计思想及其适用场景

一、什么是 AI Agent?

1.1 定义:智能体 ≠ 聊天机器人

AI Agent(人工智能代理) 是一个具备自主性、反应性、目标导向性和环境交互能力的软件实体。它能通过"感知 → 决策 → 行动 → 反馈"闭环,在动态环境中持续执行复杂任务,以达成预设目标。

关键词解析:

特征 含义
自主性 (Autonomy) 不依赖人工干预即可独立运行
反应性 (Reactivity) 能感知并响应外部环境变化
目标导向性 (Goal-directedness) 所有行为服务于特定任务目标
持续性 (Persistence) 长时间运行并维护状态记忆
工具调用能力 (Tool Use) 主动调用外部函数或服务扩展能力

类比说明:你可以把 AI Agent 想象成一位"数字员工",不仅能听懂你的指令,还能自己查资料、写报告、发邮件、做数据分析——而不仅仅是一个会说话的客服机器人。

1.2 发展历程:从规则系统到大模型驱动

时期 技术代表 特点 局限
1980s–1990s 专家系统、符号 AI 基于手工编码规则 缺乏泛化能力
2000s–2010s RPA、工作流引擎 自动化固定流程 无法处理非结构化输入
2017–2020 Task-Oriented Dialogue Systems 多轮对话+API 调用 依赖严格意图识别
2022–至今 LLM-Based Agents(如 AutoGPT、LangChain Agents) 大模型驱动决策+Function Calling 对幻觉敏感,需工程控制

二、Agent vs RPA vs ChatBot:三者的本质区别

我们从五个维度进行对比分析:

维度 传统 RPA ChatBot AI Agent
自动化方式 固定 UI 操作脚本 固定问答匹配 动态任务规划
输入类型 结构化数据为主 文本指令 多模态输入(文本/图像/语音)
决策能力 无,仅流程执行 弱,关键词匹配 强,基于语义推理
工具使用 预设接口调用 少量 API 集成 动态选择和组合工具
适应性 极低(页面变即失效) 中等(需重新训练) 高(可通过 prompt 调整)
典型应用 财务报销自动录入 客服问答机器人 教育助教、科研助手、编程帮手

场景举例:学生问"帮我批改这张作业"

角色 如何应对?
ChatBot “抱歉,我不能看图片。” 或 “请打字告诉我题目内容。”
RPA 无法理解问题,除非预先设定好"上传→OCR→比对答案"的完整流程脚本
AI Agent 自动调用 OCR 识别图像 → 解析题目与作答 → 查询标准答案 → 判断正误 → 生成反馈建议 → 推送结果给用户

结论

  • ChatBot = 会说话的界面
  • RPA = 数字流水线工人
  • AI Agent = 具备思考能力的任务经理

三、感知-决策-行动-反馈(PDCA)循环机制深度剖析

这是所有智能体的核心运行框架,也是构建可靠 Agent 系统的理论基石。

    +------------------+
    |                  |
    |     感知         | ←--- 用户输入 / 环境信号
    |  (Perception)    |
    +--------+---------+
             |
             v
    +--------v---------+
    |                  |
    |     决策         | ←--- LLM推理 + 工具选择
    |   (Decision)     |
    +--------+---------+
             |
             v
    +--------v---------+
    |                  |
    |     行动         | ←--- 调用工具(如OCR、数据库查询)
    |   (Action)       |
    +--------+---------+
             |
             v
    +--------v---------+
    |                  |
    |     反馈         | ←--- 获取执行结果 + 用户评价
    |   (Feedback)     |
    +--------+---------+
             |
             +----------→ 更新上下文 & 记忆 → 下一轮循环

3.1 感知模块(Perception)

负责接收并解析用户的原始输入,可能包括:

  • 文本指令(“帮我分析这道错题”)
  • 图像文件(手写作业照片)
  • 语音录音(口述问题)
  • 上下文历史(之前的对话记录)

处理要点:

  • 输入归一化:统一转为文本描述
  • 上下文注入:结合会话历史增强理解
  • 多模态融合:图文联合编码(后续章节详述)

示例:当学生上传一张数学题截图时,Agent 需先将其转换为如下提示词上下文:

用户上传了一张包含以下内容的手写图片:
"已知 sin(α) = 3/5,且 α ∈ (π/2, π),求 cos(α) 的值。"
请判断是否为错题,并提供讲解。

3.2 决策模块(Decision)

这是 Agent 的"大脑",由 LLM 驱动,负责回答两个关键问题:

  1. 当前任务是什么?
  2. 应该调用哪个工具来解决它?

决策过程示例:

用户请求:"帮我看看这道题做对了吗?"
 感知到这是一个"作业批改"任务
 决策:需要先识别图像中的文字  应调用 OCR 工具
 输出:{"tool": "ocr_service", "args": {"image_path": "/uploads/xxx.jpg"}}

核心技术支撑:Function Calling(将在下一节深入讲解)。LLM 不再直接输出答案,而是输出一个结构化的"工具调用请求"。

3.3 行动模块(Action)

根据决策结果,实际执行工具调用,例如:

  • 调用 ocr_service 提取图像文本
  • 查询 knowledge_db 获取知识点解释
  • 发送消息 via push_service

注意事项:

  • 工具调用必须封装为可复用的服务接口
  • 需要处理超时、失败、降级等异常情况
  • 返回结果应标准化(JSON 格式)

3.4 反馈模块(Feedback)

收集行动结果,并评估是否达成目标:

  • 成功:继续下一步或结束任务
  • 失败:尝试重试、切换工具或向用户求助
  • 不确定:主动追问澄清需求

高级形态还包括:

  • 自我反思(Self-Reflection):检查上一步是否有误
  • 用户反馈整合:如"这个解释我不太懂" → 触发更详细的讲解

正是这一环的存在,使得 Agent 具备了"持续优化"的能力,形成了真正的智能闭环。

四、当前主流 Agent 架构模式对比

不同的任务复杂度需要不同的架构设计。以下是四种典型模式:

模式 英文名 适用场景 特点 在 EduMentor 中的应用
ReAct Reasoning + Acting 单任务、多步骤 推理与行动交替进行,适合探索性强的任务 智能答疑中逐步检索知识
Plan-and-Execute 规划后执行 多子任务、长流程 先制定完整计划,再分步执行 错题分析 → 推送练习全流程调度
Reflection 自我反思 高质量输出要求 执行后自我评估,迭代改进 主观题批改后的评分修正
Graph-based 基于图的状态机 复杂流程、条件分支 使用节点和边建模状态流转 多 Agent 协作主控流程

4.1 ReAct 模式:推理 → 行动 → 观察 → 再推理

格式化提示词模板(Prompt Pattern):

Thought: 我需要查找三角函数公式
Action: search_knowledge_base
Observation: sin²α + cos²α = 1
Thought: 现在我可以用这个公式计算...

优点

  • 实时性强,边想边做
  • 适合开放域问答、信息检索类任务

缺点

  • 易陷入无限循环
  • 难以处理长流程任务

在 EduMentor 中的应用:用于智能答疑 Agent,当学生提问较难问题时,Agent 可多次调用知识库检索服务,逐步逼近正确答案。

4.2 Plan-and-Execute 模式:先规划,再执行

分两阶段:

  1. Planning Phase:LLM 输出一个任务列表(To-Do List)
  2. Execution Phase:依次执行每个子任务

示例:生成个性化复习计划

{
  "plan": [
    {"step": 1, "task": "获取学生最近一周错题"},
    {"step": 2, "task": "统计薄弱知识点"},
    {"step": 3, "task": "生成专项练习题"},
    {"step": 4, "task": "安排推送时间"}
  ]
}

优点

  • 流程清晰,易于调试
  • 支持中断恢复
  • 更容易保证最终目标达成

缺点

  • 规划可能不准确
  • 若中间步骤失败,需重新规划

在 EduMentor 中的应用:适用于练习生成 Agent 或错题分析 Agent,确保整个辅导流程有序可控。

4.3 Reflection 模式:执行 → 反思 → 修正

Agent 在每次行动后都会停下来"自省":

  • “我的回答够清楚吗?”
  • “有没有遗漏关键点?”
  • “用户可能会误解哪里?”

典型实现方式:

  • Critic Model:引入第二个模型专门做评审
  • Self-Evaluation Prompt:让同一个模型评估自己的输出质量

例如:

第一次反馈:"你算错了。"
反思后改进:"你在第三步应用诱导公式时符号出错,因为α在第二象限,cos应为负值。"

在 EduMentor 中的应用:用于主观题批改和个性化反馈生成,提升教育内容的专业性和可接受度。

4.4 Graph-Based 模式:基于状态图的流程控制

使用**有向图(Directed Graph)**来显式定义 Agent 的状态转移逻辑,每个节点是一个操作或决策点,边表示跳转条件。

技术实现:LangGraph(LangChain 子项目)

优势:

  • 可视化流程,便于团队协作
  • 支持并发、循环、条件分支
  • 易于添加异常处理路径

在 EduMentor 中的应用:作为主控 Agent(Orchestrator)的底层架构,协调多个专业 Agent 协同工作。

收到上传图片
是作业吗? ─── 否 ──→ 调用答疑Agent
调用OCR
批改Agent评分
错题分析Agent诊断
生成专项练习
推送服务发送

五、本节小结

概念 核心要点
AI Agent 自主、反应、目标导向的智能实体,具备 PDCA 闭环能力
与 RPA 区别 RPA 是"自动化脚本",Agent 是"任务管理者"
与 ChatBot 区别 ChatBot 只能回答,Agent 能主动做事
PDCA 循环 感知→决策→行动→反馈,构成智能闭环
Function Call 是实现"行动"的关键技术基础(下节详解)
ReAct 模式 边推理边执行,适合探索性任务
Plan 模式 先规划再执行,适合长流程任务
Reflection 模式 自我反思提升输出质量
Graph 模式 显式控制流程,适合复杂协同系统