CHAO AI LEARNING PATH

AI 知识库

从基础认知到真实项目,把零散知识整理成可以持续学习的路径。 继续学习 图片、文件、长文本的隐藏成本
22学习模块 119已上线课程 40%当前章节
LEARNING MODULES

选择学习方向

成本、速度与模型选择图片、文件、长文本的隐藏成本

成本、速度与模型选择

图片、文件、长文本的隐藏成本

用户可能只说“帮我分析一下这个文件”,但后台可能已经经历文件解析、图片处理、文本提取、上下文输入、模型分析和结果生成。看起来是一个附件,实际可能是一整条处理链路。

一句话回答

用户看到的是一个附件,AI 系统处理的可能是一大堆数据。图片、文件和长文本真正贵的地方,往往藏在解析、提取、检索、视觉理解、输入 Token 和输出 Token 里。

01 一个文件进入 AI 后发生了什么? upload is only the start
01 用户上传

看起来只是一个 PDF、一张图或一个 Excel。

02 解析文件

识别格式,提取文字,判断图片、表格和扫描页。

03 切块筛选

长文本拆成 Chunk,只保留相关内容。

04 检索内容

根据问题找到最可能有用的片段。

05 模型分析

把必要上下文送进模型理解和推理。

06 生成答案

输出摘要、解释、对比或结论。

上传文件本身不一定最贵,真正产生成本的是后面的解析、读取、检索和模型处理。

02 用户的问题很短,后台上下文可能很长 short request, long context
用户问题

可能只有“总结一下”几个字。

文件内容

背后可能是 50,000 Token 的正文。

系统规则

还要叠加 Prompt、工具说明和回答规范。

历史上下文

如果对话很长,历史也会继续增加成本。

真正影响成本的,是为了回答这几个字,系统给模型准备了多少上下文。

03 哪些内容最容易藏成本? files are not equal
长文本

页数越多,进入模型的输入 Token 越可能变大。

图片

视觉模型要理解文字、图表、布局、商品和场景。

扫描 PDF

每页更像图片,可能需要 OCR 或视觉理解。

大表格

行数很多时,应先用程序或数据库计算。

多张图片

一张图和十张图不是同一个成本级别。

长输出

完整分析、逐章总结会继续增加输出 Token。

文件页数相同,不代表处理成本相同;一张图片也不等于固定成本。

04 错误方式和正确方式差在哪里? filter before model
暴力方式 300 页 PDF不筛选,直接全塞给模型。 20 张图片不判断任务,全部交给视觉模型。 5 万行表格让模型自己读原始数据找 Top 5。
更好的方式 搜索相关章节先缩小范围,再让模型阅读。 提取相关图片只处理这次问题需要看的页面或截图。 程序处理表格先算出关键结果,再让模型解释。

不要把“所有资料”都等于“有效上下文”。

05 长文件更适合先切块,再检索 chunk and retrieve
长文件

一本手册或一份长合同。

切块 Chunk

按章节、主题或语义拆开。

建立索引

让系统可以快速找到相关片段。

按问题检索

用户问什么,就取相关部分。

Chunk 不是越小越好,也不是越大越好,关键是保持语义完整,同时避免带入太多无关内容。

06 AI 不应该承担所有计算工作 program first, model later
50 万行销售数据

不要全部塞给模型,让它自己找最高的 5 个产品。

程序 / SQL 先计算

先算出 Top 5、平均值、趋势和异常值。

AI 负责解释

模型更适合把结果讲清楚、写成摘要或建议。

擅长计算的交给程序,擅长理解和表达的交给模型。

07 重复文件要复用,更新文件要失效 cache with versions
文件上传

计算文件标识或版本号。

是否处理过

同一文件没变化时复用中间结果。

复用缓存

解析、切块、索引结果可以避免重复做。

版本失效

文件更新后,旧缓存必须失效。

08 文件任务最好先分级 choose the right route
直接处理 轻量任务

1 张图片、几页文档、短文本。

先筛选 中等任务

几十页 PDF、多张图片,先解析、切块、筛选。

建流程 大型任务

几百页资料、大表格、大量文件,用索引、RAG、分批、缓存。

09 成本可以拆成一条链路 cost chain
解析成本

识别格式、抽取文字、处理扫描页。

索引成本

切块、清洗、建立可检索结构。

检索成本

从长资料里找到相关内容。

输入 Token

最终送给模型的上下文。

输出 Token

摘要、分析、对比越长,输出越多。

工具调用

Agent 还可能多轮调用和重试。

文件大小不是最关键的,真正关键的是最终有多少内容进入 AI 的处理链路。

10 真正的优化:只处理必要内容 screen before spend
长文档

先检索相关章节。

大表格

程序先计算结果。

扫描文件

只处理需要的页面。

多张图片

根据任务选择相关图片。

重复文件

复用已解析和已索引结果。

历史内容

压缩无关上下文。

本节练习

设计一个 PDF 分析流程

识别类型、检查是否处理过、解析文本/图片/表格、切块建索引、按问题检索相关内容,只把必要内容交给模型。

长文档先检索相关章节。 大表格程序先计算结果。 扫描文件只处理需要的页面。 多张图片根据任务选择相关图片。 重复文件复用已解析和已索引结果。 历史内容压缩无关上下文。

本节小结

成熟的 AI 系统不会“有什么就全部塞给模型”,而是先判断任务需要什么,再把真正有用的内容交给模型。

  • 用户看到的是附件,后台处理的是解析、提取、检索、视觉理解和模型推理。
  • 文件大小不等于 AI 成本,关键是最终进入模型处理链路的有效内容。
  • 长文本先切块和检索,大表格先由程序计算,图片按需交给视觉模型。
  • 先筛选,再处理,只给必要内容,能复用就复用。