先别急着调用模型。
成本、速度与模型选择
缓存:能复用的内容不要反复付费
AI 的很多成本来自 Token、模型调用、RAG 检索和外部工具。如果同样的问题、资料和结果每次都重新计算,就会把钱花在重复劳动上。缓存就是为了避免这种浪费。
一句话回答
缓存就是:已经得到过、短时间内仍然有效的结果,不要每次都重新计算。它能让 AI 系统更快、更省钱,但前提是别把过期数据当成新答案。
用 Key 看以前有没有处理过。
直接返回,几十毫秒完成。
再调用模型、RAG 或工具。
保存可复用结果和有效期。
先看看以前有没有能用的,有就别重新算。
100 个类似问题,每次都查资料、调模型、生成答案。
第一个请求认真处理,后面的请求先复用可用结果。
能复用的结果,不要每次从头计算。
一天内通常不会变化。
不需要每分钟更新。
大量用户反复问相同问题。
输入短时间不变时可复用。
股票、加密货币、汇率变化快。
旧缓存可能导致超卖或误导。
支付、发货、退款随时变化。
准确性比省一次调用更重要。
实时性越强的数据,缓存越要谨慎。缓存最大的敌人是旧数据。
变化慢,可以较长缓存。
高频重复,定期刷新。
普通业务数据短时间缓存。
变化快,缓存要非常谨慎。
时间到了 -> 缓存过期 -> 重新获取最新数据 -> 更新缓存
标准问答、固定解释、重复摘要。
高频查询可复用相关文档列表。
天气、汇率等短时间复用。
系统规则、品牌说明、固定规范。
company:introduction:zhproduct:A100:manualfaq:refund:zhweather:shanghai:now 这个结果刚刚算过,还能不能直接用?
哪些信息以后还值得让 AI 知道?
业务数据应该在哪里长期、准确地保存?
Cache = 临时复用,Memory = 长期记住,Database = 正式保存。
命中就直接返回。
没命中也别全塞进去。
只拿当前相关资料。
用合适模型完成任务。
结果可复用时保存。
本节练习
给企业 AI 客服设计一张缓存策略表
把公司介绍、FAQ、产品列表、订单状态、库存、天气 API、RAG 检索结果分别标出来:能不能缓存、TTL 多久、什么时候主动清缓存。
本节小结
缓存不是少调用 AI 的粗暴技巧,而是让系统判断:该复用的时候复用,该实时查询的时候绝不使用旧数据。
- 缓存解决的是:这个结果刚刚算过,还能不能直接复用。
- 缓存通常同时带来两个收益:更快,也更省钱。
- 缓存不是永久保存,必须设置 TTL,并在源数据变化时让旧缓存失效。
- Cache 是临时复用,Memory 是长期记住,Database 是正式保存,不要混淆。