Agent 原理¶
CONFIDENCE — HIGH
Agent 核心组成、执行循环、与其他概念的区别、适用场景和风险。
什么是 Agent¶
Agent(智能体)解决的核心问题:当任务步骤不是提前写死的,而是需要模型根据目标和中间结果动态判断下一步动作时,普通固定流程不够用了。
解决的问题:
- 固定 Chain / Workflow 难覆盖开放任务
- 是否调用工具、调用哪个工具、调用几次无法预先完全写死
- 任务需要边观察、边决策、边执行
核心组成¶
Agent(智能体)
├── Goal(目标)
├── Planner / Reasoner(规划/推理)
├── Tool(工具)
├── Memory / State(状态)
└── Executor(执行循环)
标准公式(LLM 时代):Agent = LLM(大脑) + Planning(规划) + Tool Use(执行) + Memory(记忆)
AI Agent vs Agentic AI¶
| 维度 | AI Agent | Agentic AI |
|---|---|---|
| 词性 | 名词:具体执行实体 | 形容词/名词:系统能力属性或架构范式 |
| 比喻 | 单兵/工具人 | 项目经理/生态系统 |
| 系统构成 | 单体架构(一个 LLM + 一组工具) | 多智能体架构(编排层 + 共享记忆池 + 多角色 Agent) |
| 任务复杂度 | 单一、短链路、结构化 | 复杂、长链路、非结构化 |
| 协作能力 | 有限或无 | 深度协作,通过 A2A、MCP 等协议通信 |
| 自主性 | 受限,需用户触发 | 强自主性,端到端执行,具备自我纠错 |
Agentic AI 由吴恩达(Andrew Ng)提出,核心公式:Agent = Model + Harness。AI Agent 是实现 Agentic AI 的基础,但只有具备高度自主性、能通过多 Agent 协作解决复杂问题的系统才属于 Agentic AI。
标准执行循环¶
- 接收任务
- 理解目标
- 判断是否调用工具
- 执行工具
- 读取结果
- 决定下一步
- 输出最终答案
与其他概念的区别¶
| 概念 | 特点 |
|---|---|
| Chain | 固定流程,步骤预定义 |
| Workflow | 有向图,分支可预定义 |
| Tool Calling | 单次工具调用 |
| Agent | 动态决策,边执行边判断 |
| RAG | 检索增强生成,Agent 的一种应用 |
能力来源¶
- LLM:理解与推理能力
- Tool:外部能力扩展
- Memory:状态延续
- Prompt:行为约束
适用场景¶
- 开放式任务
- 多工具协同
- 步骤不固定的任务
- 需要边执行边判断的任务
核心风险¶
| 风险 | 说明 |
|---|---|
| 幻觉决策 | LLM 编造不存在的工具或结果 |
| 工具乱调 | 调用错误工具或传错参数 |
| 死循环 | 无法终止的推理循环 |
| 成本失控 | 多轮调用导致 token 消耗过大 |
最小实践路径¶
- 准备一个明确目标的单任务场景
- 只接 1 个工具(搜索或查询)
- 验证“判断 → 调用 → 读取 → 输出”循环
如果最小循环没跑稳,不要急着扩展多工具、长期记忆或复杂自治能力。
常见误学路径¶
- 不要把 Agent 当成“更高级的聊天”
- 不要一上来就多工具堆满
- 不要忽略终止条件和边界
- 不要把灵活性误当成稳定性
AI 工程四层栈(L1→L4)¶
| 层级 | 范式 | 核心动作 |
|---|---|---|
| L1 | Prompt Engineering | 优化单次交互输入(角色扮演、Few-shot、CoT) |
| L2 | Context Engineering | 通过 RAG、向量数据库将项目文档和代码库喂给模型 |
| L3 | Harness Engineering | 引入沙箱、工具调用和权限控制,赋予 Agent 执行能力 |
| L4 | Loop Engineering | 设计反馈回路、状态持久化和自动化触发,让 Agent 自主迭代 |
四层递进,每层包含前层。当前 Agent 工程的核心竞争力在 L3(约束控制)和 L4(循环自动化)。
相关笔记¶
- RAG 原理 — 检索增强生成