CHAO AI LEARNING PATH

AI 知识库

从基础认知到真实项目,把零散知识整理成可以持续学习的路径。 继续学习 RAG 的成本和优化
22学习模块 119已上线课程 67%当前章节
LEARNING MODULES

选择学习方向

幻觉与可靠回答RAG 的成本和优化

06 幻觉与可靠回答

RAG 的成本和优化

RAG 看起来只是先查资料,但它不是免费午餐。真正花钱的地方通常在资料处理、Embedding、存储检索和大模型调用。要把账算清,才能知道该先优化哪一步。

一句话回答

RAG 不是免费午餐,省的是训练成本,花的还是运行成本。 真正持续出账的通常是资料处理、Embedding、存储检索和大模型调用;要优化,不是把资料塞满,而是让模型只看到更少、更准、更有用的内容。

一眼看懂 先看账单,再看怎么省

成本账本

当前示例:场景 A · 高频 FAQ(换左侧场景,这里的成本压力会一起变)
01 钱主要花在哪里 cost map
资料处理前期成本

PDF 解析、清洗、切块、去重,资料越乱,第一次接入越费工。

Embedding一次性

把片段转成向量方便检索,资料越多、更新越频繁,这一步越容易变重。

数据库存储和检索持续成本

向量库、索引和搜索服务都要维护,问得越多,检索成本就越容易累积。

大模型调用长期成本

输入越长、输出越长、调用越频繁,这一项最容易成为长期账单。

02 为什么不能资料越多越好 more is not better

低效:把更多资料直接塞给模型

  • 一口气塞很多片段,Token 成本会涨。
  • 重复、过期、无关内容会把答案搅乱。
  • 最贵模型被拿去回答简单问题。
  • 重复问答没有缓存,每次都重跑一遍。

高效:只让模型看到更准的内容

  • 资料先清理,再切块,减少噪声。
  • 检索只拿 Top 3 / Top 5,少而准。
  • 简单问题用便宜模型,复杂问题再升级。
  • 高频问题直接缓存,别每次都重新生成。

本节练习

拿一个真实的知识库问答场景,先算清资料处理、检索和模型调用三笔账,再决定先优化哪一步。

别急着换大模型。先把一条 RAG 链路拆开,看清哪一步最贵、哪一步最该先优化。

资料有没有重复、过期或无关内容? 切块是不是按语义切,而不是整份硬塞? 检索是不是拿了太多段,Top 3 就够吗? 模型简单问题是不是也在用最贵模型? 缓存高频问题能不能直接复用答案?

可以直接复制

一条最实用的优化规则

先清资料,再切块,再限 Top-K,再按难度选模型,最后把高频问题缓存起来。这样省下来的不是一点点 Token,而是整条链路的浪费。
最后总结 final rule
RAG 的优化,不是让 AI 看更多,而是让 AI 看得更准。

真正专业的做法,是把资料处理、Embedding、检索、模型调用和缓存分开看。这样你才知道,哪些钱该花,哪些 Token 完全可以省下来。

本节小结

  • RAG 不是免费午餐,真正持续烧钱的是运行链路。
  • 优化不是把资料塞满,而是让模型只看更准的内容。
  • 资料、切块、检索、模型,任何一步错了都会影响成本和答案。
  • 重复问题要缓存,简单问题用便宜模型,复杂问题再上强模型。