问题短,上下文少,模型处理内容少。
成本、速度与模型选择
成本、速度与模型选择:为什么对话越长越贵?
同样一句问题,在新对话里可能很快;聊了很久以后,可能变慢,也可能更贵。关键不在“第几轮”,而在这一轮到底给模型送进去了多少上下文。
一句话回答
对话越长,通常是因为本轮送进模型的上下文更多。真正决定成本的不是“聊到第几轮”,而是这一轮模型实际处理了多少输入 Token,又生成了多少输出 Token。
历史、资料、工具结果一起进入本轮上下文。
对话越长 -> 上下文可能越大 -> 输入 Token 越多 -> 成本通常越高
模型要遵守的规则和边界。
前面已经确定过的信息。
用户这一次真正想做什么。
检索到的相关知识片段。
CRM、数据库、搜索等返回内容。
模型最终生成的回答。
你这一轮只输入几个字,不代表模型这一轮只处理几个字。
你只发了一句话,不代表模型只处理这一句话。
回答越长,输出消耗也越多。
实际价格取决于模型计费,但账单结构基本可以这样理解。
模型先读更多内容,首字等待变长。
搜索、数据库、外部 API 都需要等待。
Agent 可能理解、判断、生成、再检查。
AI 速度慢,不一定只是模型慢,也可能是上下文太大、工具太多、推理步骤太多。
1000 份资料都给模型,让它自己找重点。
先检索,只取最相关的几段交给模型。
20,000 Token 的聊天记录、修改过程和重复确认。
项目目标、已确定规则、关键资料来源和当前待办。
分类、提取字段、格式检查。
内容生成、摘要、普通客服回答。
复杂分析、重要判断、深度推理。
模型不是越强越好,而是任务和模型匹配最好。
判断用户到底要完成什么。
读取客户、订单、沟通记录。
给出客户价值和优先级。
写跟进建议或邮件草稿。
汇总给用户,并记录成本。
重要信息留下,无关对话移除或摘要。
RAG 只拿当前任务相关资料。
简单任务不用最贵模型。
设置最大工具次数、重试次数和时长。
记录每个任务平均 Token 和花费。
用户只要结论时,不生成长篇。
用刚刚好的上下文 + 刚刚好的模型,完成当前任务。
本节练习
给客户分析 Agent 设计一张成本控制表
写清哪些历史要摘要,哪些资料用 RAG 查,哪些步骤用小模型,哪些步骤用强模型,以及最大工具次数、最大模型调用次数和最大输出长度。
本节小结
真正成熟的 AI 工作台,不是“全部用最强模型 + 全部资料塞进去”,而是会判断这次任务需要多少上下文、哪些资料、哪个模型和多少成本。
- AI 每次回答,不一定只看最新一句话,还会处理本轮提供的上下文。
- 上下文越大,输入 Token 通常越多,因此成本可能更高、速度也可能更慢。
- 资料不是越多越好,应该只把当前任务真正需要的信息交给 AI。
- 模型不是越强越好,要在能力、速度和成本之间匹配任务。