看起来只是一个 PDF、一张图或一个 Excel。
成本、速度与模型选择
图片、文件、长文本的隐藏成本
用户可能只说“帮我分析一下这个文件”,但后台可能已经经历文件解析、图片处理、文本提取、上下文输入、模型分析和结果生成。看起来是一个附件,实际可能是一整条处理链路。
一句话回答
用户看到的是一个附件,AI 系统处理的可能是一大堆数据。图片、文件和长文本真正贵的地方,往往藏在解析、提取、检索、视觉理解、输入 Token 和输出 Token 里。
识别格式,提取文字,判断图片、表格和扫描页。
长文本拆成 Chunk,只保留相关内容。
根据问题找到最可能有用的片段。
把必要上下文送进模型理解和推理。
输出摘要、解释、对比或结论。
上传文件本身不一定最贵,真正产生成本的是后面的解析、读取、检索和模型处理。
可能只有“总结一下”几个字。
背后可能是 50,000 Token 的正文。
还要叠加 Prompt、工具说明和回答规范。
如果对话很长,历史也会继续增加成本。
真正影响成本的,是为了回答这几个字,系统给模型准备了多少上下文。
页数越多,进入模型的输入 Token 越可能变大。
视觉模型要理解文字、图表、布局、商品和场景。
每页更像图片,可能需要 OCR 或视觉理解。
行数很多时,应先用程序或数据库计算。
一张图和十张图不是同一个成本级别。
完整分析、逐章总结会继续增加输出 Token。
文件页数相同,不代表处理成本相同;一张图片也不等于固定成本。
不要把“所有资料”都等于“有效上下文”。
一本手册或一份长合同。
按章节、主题或语义拆开。
让系统可以快速找到相关片段。
用户问什么,就取相关部分。
Chunk 不是越小越好,也不是越大越好,关键是保持语义完整,同时避免带入太多无关内容。
不要全部塞给模型,让它自己找最高的 5 个产品。
先算出 Top 5、平均值、趋势和异常值。
模型更适合把结果讲清楚、写成摘要或建议。
擅长计算的交给程序,擅长理解和表达的交给模型。
计算文件标识或版本号。
同一文件没变化时复用中间结果。
解析、切块、索引结果可以避免重复做。
文件更新后,旧缓存必须失效。
1 张图片、几页文档、短文本。
几十页 PDF、多张图片,先解析、切块、筛选。
几百页资料、大表格、大量文件,用索引、RAG、分批、缓存。
识别格式、抽取文字、处理扫描页。
切块、清洗、建立可检索结构。
从长资料里找到相关内容。
最终送给模型的上下文。
摘要、分析、对比越长,输出越多。
Agent 还可能多轮调用和重试。
文件大小不是最关键的,真正关键的是最终有多少内容进入 AI 的处理链路。
先检索相关章节。
程序先计算结果。
只处理需要的页面。
根据任务选择相关图片。
复用已解析和已索引结果。
压缩无关上下文。
本节练习
设计一个 PDF 分析流程
识别类型、检查是否处理过、解析文本/图片/表格、切块建索引、按问题检索相关内容,只把必要内容交给模型。
本节小结
成熟的 AI 系统不会“有什么就全部塞给模型”,而是先判断任务需要什么,再把真正有用的内容交给模型。
- 用户看到的是附件,后台处理的是解析、提取、检索、视觉理解和模型推理。
- 文件大小不等于 AI 成本,关键是最终进入模型处理链路的有效内容。
- 长文本先切块和检索,大表格先由程序计算,图片按需交给视觉模型。
- 先筛选,再处理,只给必要内容,能复用就复用。