跳转至

Agent 原理

CONFIDENCE — HIGH

Agent 核心组成、执行循环、与其他概念的区别、适用场景和风险。


什么是 Agent

Agent(智能体)解决的核心问题:当任务步骤不是提前写死的,而是需要模型根据目标和中间结果动态判断下一步动作时,普通固定流程不够用了。

解决的问题:

  • 固定 Chain / Workflow 难覆盖开放任务
  • 是否调用工具、调用哪个工具、调用几次无法预先完全写死
  • 任务需要边观察、边决策、边执行

核心组成

Agent(智能体)
├── Goal(目标)
├── Planner / Reasoner(规划/推理)
├── Tool(工具)
├── Memory / State(状态)
└── Executor(执行循环)

标准公式(LLM 时代):Agent = LLM(大脑) + Planning(规划) + Tool Use(执行) + Memory(记忆)

AI Agent vs Agentic AI

维度 AI Agent Agentic AI
词性 名词:具体执行实体 形容词/名词:系统能力属性或架构范式
比喻 单兵/工具人 项目经理/生态系统
系统构成 单体架构(一个 LLM + 一组工具) 多智能体架构(编排层 + 共享记忆池 + 多角色 Agent)
任务复杂度 单一、短链路、结构化 复杂、长链路、非结构化
协作能力 有限或无 深度协作,通过 A2A、MCP 等协议通信
自主性 受限,需用户触发 强自主性,端到端执行,具备自我纠错

Agentic AI 由吴恩达(Andrew Ng)提出,核心公式:Agent = Model + Harness。AI Agent 是实现 Agentic AI 的基础,但只有具备高度自主性、能通过多 Agent 协作解决复杂问题的系统才属于 Agentic AI。

标准执行循环

  1. 接收任务
  2. 理解目标
  3. 判断是否调用工具
  4. 执行工具
  5. 读取结果
  6. 决定下一步
  7. 输出最终答案

与其他概念的区别

概念 特点
Chain 固定流程,步骤预定义
Workflow 有向图,分支可预定义
Tool Calling 单次工具调用
Agent 动态决策,边执行边判断
RAG 检索增强生成,Agent 的一种应用

能力来源

  • LLM:理解与推理能力
  • Tool:外部能力扩展
  • Memory:状态延续
  • Prompt:行为约束

适用场景

  • 开放式任务
  • 多工具协同
  • 步骤不固定的任务
  • 需要边执行边判断的任务

核心风险

风险 说明
幻觉决策 LLM 编造不存在的工具或结果
工具乱调 调用错误工具或传错参数
死循环 无法终止的推理循环
成本失控 多轮调用导致 token 消耗过大

最小实践路径

  1. 准备一个明确目标的单任务场景
  2. 只接 1 个工具(搜索或查询)
  3. 验证“判断 → 调用 → 读取 → 输出”循环

如果最小循环没跑稳,不要急着扩展多工具、长期记忆或复杂自治能力。

常见误学路径

  • 不要把 Agent 当成“更高级的聊天”
  • 不要一上来就多工具堆满
  • 不要忽略终止条件和边界
  • 不要把灵活性误当成稳定性

AI 工程四层栈(L1→L4)

层级 范式 核心动作
L1 Prompt Engineering 优化单次交互输入(角色扮演、Few-shot、CoT)
L2 Context Engineering 通过 RAG、向量数据库将项目文档和代码库喂给模型
L3 Harness Engineering 引入沙箱、工具调用和权限控制,赋予 Agent 执行能力
L4 Loop Engineering 设计反馈回路、状态持久化和自动化触发,让 Agent 自主迭代

四层递进,每层包含前层。当前 Agent 工程的核心竞争力在 L3(约束控制)和 L4(循环自动化)。

相关笔记