CHAO AI LEARNING PATH

AI 知识库

从基础认知到真实项目,把零散知识整理成可以持续学习的路径。 继续学习 成本、速度与模型选择:为什么对话越长越贵?
22学习模块 119已上线课程 10%当前章节
LEARNING MODULES

选择学习方向

成本、速度与模型选择成本、速度与模型选择:为什么对话越长越贵?

成本、速度与模型选择

成本、速度与模型选择:为什么对话越长越贵?

同样一句问题,在新对话里可能很快;聊了很久以后,可能变慢,也可能更贵。关键不在“第几轮”,而在这一轮到底给模型送进去了多少上下文。

一句话回答

对话越长,通常是因为本轮送进模型的上下文更多。真正决定成本的不是“聊到第几轮”,而是这一轮模型实际处理了多少输入 Token,又生成了多少输出 Token。

01 先看一张图:为什么越聊越贵? context grows, cost grows
快 / 省 新对话

问题短,上下文少,模型处理内容少。

慢 / 贵 长对话

历史、资料、工具结果一起进入本轮上下文。

对话越长 -> 上下文可能越大 -> 输入 Token 越多 -> 成本通常越高

02 AI 不是只看你最后一句话 one question, many inputs
系统指令

模型要遵守的规则和边界。

历史对话

前面已经确定过的信息。

当前问题

用户这一次真正想做什么。

RAG 资料

检索到的相关知识片段。

工具结果

CRM、数据库、搜索等返回内容。

模型输出

模型最终生成的回答。

你这一轮只输入几个字,不代表模型这一轮只处理几个字。

03 画成账单就更容易理解 input + output
输入 Token 系统指令 + 历史 + 资料 + 工具结果 + 当前问题

你只发了一句话,不代表模型只处理这一句话。

输出 Token AI 生成的答案

回答越长,输出消耗也越多。

本轮消耗 = 输入 Token + 输出 Token

实际价格取决于模型计费,但账单结构基本可以这样理解。

04 为什么还可能变慢? not only model speed
上下文太大

模型先读更多内容,首字等待变长。

工具太多

搜索、数据库、外部 API 都需要等待。

推理步骤多

Agent 可能理解、判断、生成、再检查。

AI 速度慢,不一定只是模型慢,也可能是上下文太大、工具太多、推理步骤太多。

05 正确思路:不是全塞进去 retrieve only what matters
全部塞进去

1000 份资料都给模型,让它自己找重点。

需要什么拿什么

先检索,只取最相关的几段交给模型。

原始长历史

20,000 Token 的聊天记录、修改过程和重复确认。

压缩后状态

项目目标、已确定规则、关键资料来源和当前待办。

06 不是所有任务都要用最强模型 model routing
便宜 / 快 小模型

分类、提取字段、格式检查。

均衡 主力模型

内容生成、摘要、普通客服回答。

能力强 / 更贵 强模型

复杂分析、重要判断、深度推理。

模型不是越强越好,而是任务和模型匹配最好。

07 一个 Agent 为什么可能调用很多次模型? one task, many calls
01 理解任务

判断用户到底要完成什么。

02 分析资料

读取客户、订单、沟通记录。

03 判断意向

给出客户价值和优先级。

04 生成方案

写跟进建议或邮件草稿。

05 整理结果

汇总给用户,并记录成本。

08 真正要优化的是三角关系 ability / speed / cost
压缩历史

重要信息留下,无关对话移除或摘要。

精准检索

RAG 只拿当前任务相关资料。

模型路由

简单任务不用最贵模型。

限制循环

设置最大工具次数、重试次数和时长。

监控成本

记录每个任务平均 Token 和花费。

控制输出

用户只要结论时,不生成长篇。

用刚刚好的上下文 + 刚刚好的模型,完成当前任务。

本节练习

给客户分析 Agent 设计一张成本控制表

写清哪些历史要摘要,哪些资料用 RAG 查,哪些步骤用小模型,哪些步骤用强模型,以及最大工具次数、最大模型调用次数和最大输出长度。

压缩历史重要信息留下,无关对话移除或摘要。 精准检索RAG 只拿当前任务相关资料。 模型路由简单任务不用最贵模型。 限制循环设置最大工具次数、重试次数和时长。 监控成本记录每个任务平均 Token 和花费。 控制输出用户只要结论时,不生成长篇。

本节小结

真正成熟的 AI 工作台,不是“全部用最强模型 + 全部资料塞进去”,而是会判断这次任务需要多少上下文、哪些资料、哪个模型和多少成本。

  • AI 每次回答,不一定只看最新一句话,还会处理本轮提供的上下文。
  • 上下文越大,输入 Token 通常越多,因此成本可能更高、速度也可能更慢。
  • 资料不是越多越好,应该只把当前任务真正需要的信息交给 AI。
  • 模型不是越强越好,要在能力、速度和成本之间匹配任务。