RAG 原理¶
CONFIDENCE — HIGH
RAG 离线/在线链路、核心组件、常见误区和优化点。
什么是 RAG¶
RAG(检索增强生成)解决的核心问题:模型本身不知道你的私有知识、最新知识和长文档细节,但业务又要求它基于这些知识回答。
解决的问题:
- 模型不知道企业内部/个人私有资料
- 模型知识可能过时
- 长文档无法直接完整塞进上下文
- 纯靠模型参数回答,幻觉风险过高
核心链路¶
RAG = 先找资料,再组织回答
离线准备链路
在线问答链路
核心组件¶
| 组件 | 作用 |
|---|---|
| Document Source | 知识来源 |
| Chunk | 文档切片 |
| Embedding | 向量化表示 |
| Vector Store | 向量存储 |
| Retriever | 检索器 |
| Prompt Augmentation | 上下文拼装 |
| Generation | LLM 生成 |
关键优化点¶
- 文档清洗质量
- Chunk 粒度设计
- 检索策略(向量 / BM25 / Hybrid)
- Rerank 重排
- 上下文长度控制
- 回答护栏
常见误区¶
| 误区 | 真相 |
|---|---|
| 接了 RAG 就没有幻觉 | 只能降低风险,不能消灭 |
| 模型越强 RAG 越简单 | 检索质量同样重要 |
| RAG = 向量库 + 大模型 | 真正难点在整条链路 |
| 召回越多越好 | 召回质量比数量重要 |
RAG vs 其他方案¶
| 方案 | 适用场景 |
|---|---|
| RAG | 私有知识问答,知识更新频繁 |
| Fine-tuning | 特定领域风格,知识相对稳定 |
| Search | 传统关键词匹配 |
| Agent | 需要动态决策和工具调用 |
最小实践路径¶
- 准备 3~5 篇小文档
- 完成切片 + embedding + 检索
- 把检索结果拼进 Prompt,让模型基于证据回答
如果最小闭环没跑通,不要过度讨论高级检索策略、Rerank 或 Graph RAG。
工程关注点¶
- 召回率
- 精确率
- 延迟
- Token 成本
- 文档更新机制
- 可评估性
实战案例¶
SecRAG 是把这些原理落地到证券行业投研场景的实践:混合检索(ChromaDB 向量 + BGE Reranker 语义重排)解决召回质量问题,角色权限过滤解决“同一问题不同角色看到不同结果”的问题,验证节点解决数字/引用准确性问题。