CHAO AI LEARNING PATH

AI 知识库

从基础认知到真实项目,把零散知识整理成可以持续学习的路径。 继续学习 成本优化的第一性原则
22学习模块 119已上线课程 100%当前章节
LEARNING MODULES

选择学习方向

成本、速度与模型选择成本优化的第一性原则

成本、速度与模型选择

成本优化的第一性原则

缓存、减少无效上下文、控制输出长度、动态模型路由、文件按需处理都很重要。但真正理解 AI 成本,不能只记技巧,而要回到任务本身。

一句话回答

不要优化“价格”,要优化“完成任务的总成本”。AI 成本优化的第一性原则,是用最少的必要计算,把任务稳定完成。

01 先看一张图:AI 成本到底花在哪? cost starts before the model
01 用户提出任务

先别急着调用模型。

02 必须用 AI 吗?

规则、程序、缓存能解决就不用模型。

03 准备必要上下文

资料不是越多越好。

04 选择合适模型

刚刚够用即可。

05 控制输出长度

答案够解决问题就行。

06 能否缓存结果?

能复用就复用。

最便宜的一次模型调用,是根本不用调用模型。

02 第一性原则到底是什么意思? back to the root
有没有必要让模型做?

不需要理解语义,就别交给大模型。

需要多少信息?

只取会影响当前任务的上下文。

用多强的模型才够?

别为了简单任务买过量能力。

需要输出多长?

简单查询就短回答。

能不能复用结果?

重复率越高,越应该缓存。

不要从现成做法出发,而要回到任务本身重新拆解。

03 最先问:这件事真的需要大模型吗? rules before models
库存低于 10 件

库存 < 10,就提醒采购。

金额超过 5 万元

金额 > 50000,就标记为高金额订单。

规则明确

优先交给程序,更快、更便宜、更稳定。

规则明确的问题,优先交给程序。

04 大模型应该做程序不擅长的部分 right work, right layer
规则明确

程序。

语义复杂

AI。

精确数据

数据库。

实时信息

工具 / API。

高风险判断

强模型 + 人工确认。

05 模型真的需要看这么多吗? necessary context only
全部资料

企业介绍、100 页手册、客户案例、培训资料、售后政策。

先检索

围绕 A100 保修问题找相关内容。

只给必要信息

A100 售后政策相关两段内容。

资料有多少就传多少,是成本浪费的常见来源。

06 真的需要最强模型吗? minimum capable model
简单分类 / 提取

快模型。

普通写作 / 总结

主力模型。

复杂推理 / 研究

强模型。

真正目标

用达到要求的最低成本模型。

核心不是用最便宜模型,而是用达到要求的最低成本模型。

07 这件事以前是不是已经做过? reuse repeated work
1 万人都问什么是 RAG

每次重新生成就是重复付费。

第一次调用 AI

得到标准答案。

保存缓存

短时间内有效就复用。

后续直接返回

更快,也更省。

重复率越高的任务,越应该考虑缓存。

08 输出真的需要这么长吗? answer enough, not endless
订单有没有发货?

用户只想知道结果。

500 字长文

输出过度,用户还要找答案。

已发货,预计明天送达

短,但已经解决问题。

09 单任务真实成本比模型单价更重要 total task cost
模型调用成本

输入、输出和模型单价。

重试成本

答不好就反复调用。

工具成本

搜索、RAG、第三方 API。

人工接管成本

复杂问题转人工也有成本。

失败业务成本

错误、等待、投诉和风险损失。

单任务真实成本

真正应该被优化的对象。

哪个方案能用最低总成本把任务稳定完成,才是真问题。

10 AI 成本优化的四层漏斗 less waste, same outcome
少调用

能不用 AI,就不用 AI。

少输入

必须用 AI,就只给必要信息。

用对模型

模型能力刚刚够用即可。

少输出

答案够解决问题,就别过度生成。

能复用就复用

已经处理过的内容,尽量复用。

11 不要为了省 Token,把质量省没了 optimize within quality
文章分类错一次

影响通常有限,可以更重视成本。

10 万元退款判断

错误成本远高于模型费。

真正成本

AI 成本 + 错误成本 + 业务风险。

目标不是 Token 最少,而是在满足质量要求的前提下,资源最少。

12 一个客服系统的成本优化案例 redesign the workflow
30% 固定 FAQ

缓存直接回答。

简单知识问题

RAG + 快模型。

订单相关问题

数据库 + 主力模型。

复杂纠纷

强模型。

高风险

转人工。

这不是简单换便宜模型,而是整条工作流都被重新设计了。

13 真正烧钱的往往是系统设计浪费 architecture before price
全部历史对话

每次都带上。

所有资料

全部塞给模型。

简单规则

也让模型判断。

重复答案

反复生成。

Agent 死循环

工具和模型一直调用。

无用字段

工具结果返回太多。

简单任务强模型

能力浪费。

输出永远几千字

用户和系统都在付费。

成本优化首先是架构问题,其次才是模型价格问题。

14 一个非常实用的五问法 five questions
有没有必要让模型做?

不需要理解语义,就别交给大模型。

需要多少信息?

只取会影响当前任务的上下文。

用多强的模型才够?

别为了简单任务买过量能力。

需要输出多长?

简单查询就短回答。

能不能复用结果?

重复率越高,越应该缓存。

15 把前面几节知识全部串起来 cost chapter recap
对话越长越贵

减少上下文。

缓存

减少重复计算。

动态变量

提高可复用性。

文件长文本

按需处理。

任务匹配模型

降低模型成本。

速度质量价格

控制总任务成本。

最后全部汇总成一个原则:不让系统做无意义的 AI 计算。

16 一张图看懂完整优化思路 from task to outcome
必须用 AI?

否:程序 / 规则。是:继续。

需要哪些信息?

只取必要上下文。

任务有多复杂?

选择合适模型。

结果要多详细?

控制输出长度。

以前做过吗?

是:缓存。否:生成。

完成任务

用最少必要计算稳定完成。

本节练习

把一个客服系统重新拆成低成本工作流

固定 FAQ 走缓存,明确规则走程序,简单知识走 RAG + 快模型,订单问题走数据库 + 主力模型,复杂纠纷走强模型,高风险转人工。

30% 固定 FAQ 缓存直接回答。 简单知识问题 RAG + 快模型。 订单相关问题 数据库 + 主力模型。 复杂纠纷 强模型。 高风险 转人工。

本节小结

最好的成本优化,不是让 AI“便宜地多干活”,而是让 AI“只干真正值得它干的活”。

当你从这个角度设计 AI 工作台,成本优化就不再是换模型、算 Token,而是对整个任务链路重新设计。

  • 能不用 AI,就不用 AI。
  • 必须用 AI,就只给必要信息。
  • 模型能力刚刚够用即可。
  • 答案够解决问题,就别过度生成。
  • 已经处理过的内容,尽量复用。