跳转至

RAG 原理

CONFIDENCE — HIGH

RAG 离线/在线链路、核心组件、常见误区和优化点。


什么是 RAG

RAG(检索增强生成)解决的核心问题:模型本身不知道你的私有知识、最新知识和长文档细节,但业务又要求它基于这些知识回答。

解决的问题:

  • 模型不知道企业内部/个人私有资料
  • 模型知识可能过时
  • 长文档无法直接完整塞进上下文
  • 纯靠模型参数回答,幻觉风险过高

核心链路

RAG = 先找资料,再组织回答

离线准备链路

文档采集 → 文档清洗 → Chunk 切片 → Embedding 向量化 → 建立向量索引

在线问答链路

用户提问 → Query 向量化 → Retriever 召回 → Rerank 重排 → Context Packing → LLM 生成

核心组件

组件 作用
Document Source 知识来源
Chunk 文档切片
Embedding 向量化表示
Vector Store 向量存储
Retriever 检索器
Prompt Augmentation 上下文拼装
Generation LLM 生成

关键优化点

  • 文档清洗质量
  • Chunk 粒度设计
  • 检索策略(向量 / BM25 / Hybrid)
  • Rerank 重排
  • 上下文长度控制
  • 回答护栏

常见误区

误区 真相
接了 RAG 就没有幻觉 只能降低风险,不能消灭
模型越强 RAG 越简单 检索质量同样重要
RAG = 向量库 + 大模型 真正难点在整条链路
召回越多越好 召回质量比数量重要

RAG vs 其他方案

方案 适用场景
RAG 私有知识问答,知识更新频繁
Fine-tuning 特定领域风格,知识相对稳定
Search 传统关键词匹配
Agent 需要动态决策和工具调用

最小实践路径

  1. 准备 3~5 篇小文档
  2. 完成切片 + embedding + 检索
  3. 把检索结果拼进 Prompt,让模型基于证据回答

如果最小闭环没跑通,不要过度讨论高级检索策略、Rerank 或 Graph RAG。

工程关注点

  • 召回率
  • 精确率
  • 延迟
  • Token 成本
  • 文档更新机制
  • 可评估性

实战案例

SecRAG 是把这些原理落地到证券行业投研场景的实践:混合检索(ChromaDB 向量 + BGE Reranker 语义重排)解决召回质量问题,角色权限过滤解决“同一问题不同角色看到不同结果”的问题,验证节点解决数字/引用准确性问题。

相关笔记