资料处理前期成本
PDF 解析、清洗、切块、去重,资料越乱,第一次接入越费工。
06 幻觉与可靠回答
RAG 看起来只是先查资料,但它不是免费午餐。真正花钱的地方通常在资料处理、Embedding、存储检索和大模型调用。要把账算清,才能知道该先优化哪一步。
RAG 不是免费午餐,省的是训练成本,花的还是运行成本。 真正持续出账的通常是资料处理、Embedding、存储检索和大模型调用;要优化,不是把资料塞满,而是让模型只看到更少、更准、更有用的内容。
先选一个常见场景
这套 RAG 要不要做、该怎么做、值不值得继续优化,先看资料是否干净、检索是否精准、问题是否重复。不是每个问答都值得把最贵模型跑一遍。
PDF 解析、清洗、切块、去重,资料越乱,第一次接入越费工。
把片段转成向量方便检索,资料越多、更新越频繁,这一步越容易变重。
向量库、索引和搜索服务都要维护,问得越多,检索成本就越容易累积。
输入越长、输出越长、调用越频繁,这一项最容易成为长期账单。
本节练习
别急着换大模型。先把一条 RAG 链路拆开,看清哪一步最贵、哪一步最该先优化。
可以直接复制
先清资料,再切块,再限 Top-K,再按难度选模型,最后把高频问题缓存起来。这样省下来的不是一点点 Token,而是整条链路的浪费。
真正专业的做法,是把资料处理、Embedding、检索、模型调用和缓存分开看。这样你才知道,哪些钱该花,哪些 Token 完全可以省下来。