CHAO AI LEARNING PATH

AI 知识库

从基础认知到真实项目,把零散知识整理成可以持续学习的路径。 继续学习 速度、质量、价格怎么取舍?
22学习模块 119已上线课程 90%当前章节
LEARNING MODULES

选择学习方向

成本、速度与模型选择速度、质量、价格怎么取舍?

成本、速度与模型选择

速度、质量、价格怎么取舍?

真正做 AI 产品时,很快会遇到一个现实问题:到底应该优先速度、质量,还是价格?因为又快、又强、又便宜,很难同时做到最好。

一句话回答

速度、质量、价格没有固定最优解,要看当前任务是什么。真正成熟的 AI 产品追求的不是最强、最快、最便宜,而是在用户可以接受的速度和成本下,达到任务需要的质量。

01 先看一张图:AI 的不可能三角 speed quality price
回答更准、更强 质量

复杂理解、推理和风险判断通常需要更强能力。

响应更快 速度

减少等待、减少链路步骤,让用户更快拿到结果。

成本更低 价格

单次便宜还不够,要看完成任务总成本。

这不是说三者永远只能选两个,而是提醒你:产品设计通常需要在三者之间做取舍。

02 三种追求都会带来代价 each priority has cost
追求更高质量

可能需要更强模型,成本可能更高,时间可能更长。

追求极低价格

可能选择轻量模型,复杂任务质量可能下降。

追求极快速度

可能减少推理和处理过程,复杂问题质量可能下降。

03 速度是整条链路的速度 end to end latency
01 用户提问

等待从这里开始。

02 知识库检索

检索慢也会拖慢体验。

03 调用模型

模型速度只是其中一环。

04 调用工具

外部 API、数据库、搜索都会耗时。

05 生成答案

输出越长,完成越慢。

用户感觉到的速度,其实是整条链路的速度。

04 用户能接受多慢,取决于任务有多难 wait tolerance
要快 AI 客服

用户问怎么退款,等几十秒体验很差。

可等待 100 页商业计划书

用户知道任务复杂,通常愿意多等。

看预期 判断标准

用户能接受多慢,取决于他认为任务有多难。

05 质量不是字数,而是任务完成得好不好 quality is task success
理解问题

有没有抓住用户真正要解决什么。

答案准确

事实、计算和业务规则是否可靠。

重点完整

有没有遗漏影响结果的关键信息。

推理合理

过程是否站得住,结论是否有依据。

减少幻觉

不知道时不要编,风险高时要确认。

解决问题

最终能不能帮用户把事情办成。

质量 ≠ 字数,质量应该理解成任务完成得好不好。

06 价格要看单任务成本 cost per task
输入 Token

系统规则、用户问题、上下文。

输出 Token

答案越长,输出成本越高。

Embedding / RAG

建索引、检索和召回资料。

搜索服务

外部搜索也可能计费。

第三方 API

天气、物流、CRM、支付等工具。

文件和图片处理

解析、OCR、视觉理解、切块。

Agent 多轮调用

一步任务可能变成多次模型调用。

单任务成本

真正要看的,是完成一次任务总共花多少钱。

不要只看“模型一次多少钱”,而应该看“完成一次任务总共花多少钱”。

07 举一个最简单的模型选择例子 fit task to model
很快 / 够用 / ¥0.01 模型 A

适合提取姓名、手机号、简单分类。

较快 / 较好 / ¥0.08 模型 B

适合普通客服、写作、总结和日常分析。

较慢 / 很强 / ¥0.50 模型 C

适合多资料分析、复杂推理和高要求任务。

没有最好的模型,只有最适合当前任务的模型:提取姓名和手机号,大概率选 A;分析 10 份竞争对手资料,可能要选 B 或 C。

08 选择模型前先问四个问题 decision questions
任务难吗?

简单走快模型,普通走主力模型,复杂走强模型。

用户着急吗?

实时客服、搜索、操作反馈优先速度。

答错代价大吗?

资金、权限、法律、医疗不能只看便宜。

调用量大吗?

高频任务单次多花一点,规模化后就是大成本。

09 可以把任务分成四类 four task routes
速度 + 成本 高频简单任务

标签分类、意图识别、信息提取、格式转换。

三者平衡 普通日常任务

写邮件、会议总结、普通客服、数据解释。

质量优先 复杂分析任务

深度研究、复杂代码、多文档理解、多步骤推理。

安全 + 质量 高风险任务

资金、权限、法律、医疗、删除关键数据。

10 一张图看懂任务分配 route by priority
高频简单

快模型,控制成本。

普通任务

主力模型,综合平衡。

复杂任务

强模型,允许更长处理。

高风险

强模型 + 数据验证 + 人工确认。

成熟 AI 系统需要多个模型,是因为不同任务的优先级完全不同。

11 不要为了省钱,最后反而更贵 cheap can become expensive
01 第一次

便宜模型答错。

02 第二次

用户要求重试。

03 第三次

继续补 Prompt。

04 第四次

人工修改或工具补救。

05 最后

还是调用强模型。

便宜模型 ≠ 最低任务成本。

12 一次成功率也要算进成本 success rate matters
0.05 元 × 3 次 模型 A

单次便宜,但平均要多次才能完成。

0.20 元 × 1 次 模型 B

单次更贵,但一次成功率更高。

价格 × 平均调用次数 真正比较

还要考虑等待时间和失败成本。

不要只看 API 价目表,要看模型价格 × 平均调用次数。

13 速度和质量都不只靠换模型 optimize the whole system
系统 A

模型很快,但查 5 次数据库、检索 10 份资料、调用 3 个工具、调用模型 4 次。

系统 B

模型稍慢,但一次检索 + 一次模型调用,最终可能更快。

模型能力理解、推理、表达。 Prompt任务边界和输出要求。 上下文是否给了必要信息。 RAG 资料检索出来的是不是相关资料。 工具数据数据库、API 返回是否准确。 业务规则权限、安全和事实边界。
14 成熟系统可以先便宜,后升级 dynamic model routing
用户请求

先进入任务判断。

普通模型处理

先用合适的默认路径。

结果可靠?

可靠就直接返回。

不可靠

升级强模型或转人工。

动态模型路由既控制成本,又不会把复杂任务硬塞给小模型。

15 用户也可以自己选择模式 make tradeoff visible
快速模式

快、便宜,适合普通任务。

标准模式

速度和质量平衡。

深度模式

更慢、更贵,适合复杂任务。

16 给每种任务设置最低合格线 business thresholds
分类任务

准确率不低于 95%,响应小于 1 秒,成本尽量低。

客服任务

正确率不低于 98%,响应小于 3 秒,成本中等。

深度分析

质量优先,30 秒甚至更长也可以接受。

这样以后选择模型就不是靠感觉,而是根据业务指标选。

17 最终决策逻辑 from task to route
任务有多复杂?

决定是否需要强模型。

用户能等多久?

决定响应速度要求。

答错代价多大?

决定安全和确认机制。

调用量有多大?

决定成本控制力度。

简单高频:快 + 便宜;普通任务:三者平衡;复杂任务:质量优先;高风险任务:安全 + 质量优先。

18 把前面几节知识串起来 resource scheduling
能不能缓存?

能复用就先复用。

减少无效上下文

只读取必要文件和资料。

判断任务难度

选择合适模型。

控制输出长度

减少不必要输出。

必要时升级

复杂任务不硬撑。

缓存结果

为下一次节省。

真正成熟的 AI 系统不是每次调用一个大模型,而是在不断做资源调度。

本节练习

给四类任务做模型选择表

把标签分类、普通客服、100 页商业计划书分析、资金操作审核分别标注优先指标、可接受响应时间、最低质量线和推荐模型策略。

高频简单任务 速度 + 成本:标签分类、意图识别、信息提取、格式转换。 普通日常任务 三者平衡:写邮件、会议总结、普通客服、数据解释。 复杂分析任务 质量优先:深度研究、复杂代码、多文档理解、多步骤推理。 高风险任务 安全 + 质量:资金、权限、法律、医疗、删除关键数据。

本节小结

不要找一个固定答案,而要先看当前任务是什么。该省的地方省,该快的地方快,该用强模型的时候别舍不得。

这才是 AI 产品真正的成本、体验和质量平衡。

  • 高频简单任务:速度和成本优先。
  • 普通日常任务:速度、质量、价格平衡。
  • 复杂任务:质量优先。
  • 高风险任务:安全和准确优先。
  • 在用户可以接受的速度和成本下,达到任务需要的质量。