直接返回。
成本、速度与模型选择
简单问题,不要调用最贵模型
很多 AI 任务其实不需要“顶级大脑”。如果只是分类、提取、格式转换、简单摘要或固定问答,却每次都调用最强模型,就像请高级专家专门负责复制粘贴。
一句话回答
简单问题,不要调用最贵模型。能缓存就缓存,能用规则就用规则,简单任务用快模型,普通任务用主力模型,复杂任务再使用强模型。
程序处理。
快模型。
主力模型。
强模型。
人工确认。
任务够简单,就用够用的模型。
姓名、电话、公司名称、订单号。
正面/负面、个人/企业、工单类别。
把文本整理成 JSON、表格或固定结构。
把短文本压缩成几句话。
营业时间、联系方式、常见流程。
给客户、邮件、内容打基础标签。
简单问题不是字数少,而是规则清楚、答案范围有限、不需要深度推理。
规则清楚,答案范围有限。
强推理、长上下文能力没有真正用上。
为了简单结果买了过高规格的计算能力。
用户只是要马上完成。
为了一个简单结果,买了远超需求的计算能力。
整理资料、分类、录入。
写方案、做普通分析。
战略判断、复杂项目。
不是越强越好,而是匹配最重要。
营业时间、客服电话、退款入口。
结合数据库和知识库回答。
多项政策、高风险判断。
0.01 元 / 次。
0.10 元 / 次。
每天差 9,000 元。
模型选择就是商业成本问题。
AI 产品一旦规模化,模型选择不是技术细节,而是商业成本问题。
用户期待马上完成。
重点是稳定、快、低延迟。
不需要最大推理能力。
处理常规问题。
够好就直接返回。
复杂、低置信度时转强模型。
权限、资金、法律等需要确认。
分类、提取、格式转换。
写作、总结、普通客服、一般分析。
深度推理、复杂代码、战略分析。
资金、法律、重要权限。
看起来很短,但答错可能造成资金损失。
高风险任务不是单纯换更强模型,还要增加权限和人工确认。
任务难度 + 错误成本 + 速度要求 + 预算。
快模型。
快模型。
强模型。
主力模型。
按需选择。
本节练习
给 20 个高频客服问题做成本分流
标记哪些可以缓存,哪些可以规则处理,哪些适合快模型,哪些需要主力模型、强模型或人工确认。
本节小结
成熟的 AI 产品不会问“哪个模型最强”,而会问“这次任务,用哪个模型最划算、最快、又足够好?”
- 简单问题不是字数少,而是判断不复杂、规则清楚、答案范围有限。
- 能缓存或规则解决的任务,甚至不一定需要调用模型。
- 简单任务通常更看重速度、稳定和低成本。
- 这次任务用哪个模型最划算、最快、又足够好,比“哪个模型最强”更重要。