CHAO AI LEARNING PATH

AI 知识库

从基础认知到真实项目,把零散知识整理成可以持续学习的路径。 继续学习 为什么有些模型看不懂图
22学习模块 119已上线课程 50%当前章节
LEARNING MODULES

选择学习方向

新手概念篇为什么有些模型看不懂图

03 第零篇章 · 第一次系统认识 AI

为什么有些模型看不懂图

AI 不是天生就会“看”。有些模型只能处理文字,有些模型经过多模态训练,才能理解图片、截图、表格、公式和视觉信息。

一句话回答

会聊天不等于会看图。普通语言模型主要处理文字;多模态模型多了一套视觉理解能力,会先把图片转成模型能处理的信息,再结合你的问题生成回答。所以有的 AI 能分析产品图、UI 截图和公式笔记,有的只能让你用文字描述。

01 同一张图,文字模型和多模态模型差在哪 same image
示例图片

一张产品图片

Product Photo

用户上传一张智能水杯产品图,希望 AI 帮他总结卖点和优化电商详情页。

模型 A · 纯文本模型

只看得懂你打出来的字

我无法直接查看图片。你可以用文字描述产品外观、功能和卖点,我再帮你整理文案。

模型 B · 多模态模型

能先读图,再回答问题

这是一款偏简洁科技风的智能水杯,主体为白色圆柱形,顶部有深色杯盖,适合突出“健康提醒、温度显示、办公随行”这类卖点。

02 AI 为什么需要额外学习“看图” why learn vision
人类

眼睛看到世界,大脑逐渐学习

人从小会接触颜色、形状、距离、物体关系和真实环境,所以看到苹果时,不只是认识“苹果”两个字。

文字模型

最开始主要学习文字之间的关系

它知道“苹果”这个词经常和水果、红色、甜味一起出现,但如果没学过图像,就不知道图片里的苹果长什么样。

多模态模型

把图片和文字一起学习

它通过大量图文配对数据,学习图片内容、物体关系和文字描述之间的对应关系。

03 AI 是怎么“看懂”图片的 vision pipeline
图片输入产品图、截图、照片、表格图。 视觉分析识别颜色、形状、文字、布局和物体。 信息转换把视觉内容转成模型能理解的数据表示。 图文结合结合你的问题,生成分析、解释或建议。

所以 AI 不是像人眼一样“直接看见图片”,而是先把图片转成可计算的视觉信息,再交给语言模型组织答案。

04 为什么有些模型没有视觉能力 why missing
训练目标不同有些模型专注聊天、写作、代码,只训练文字能力,并没有学习图片。 模型架构不同看图需要视觉理解模块,相当于给 AI 增加一套“眼睛”和翻译系统。 训练成本更高图片包含大量像素和视觉关系,需要更多图文数据、算力和调校。 应用场景不需要很多后台分类、文本客服、代码生成任务,用纯文本模型更快也更便宜。
05 看图、画图、修图不是一回事 ability map
看图

理解图片里有什么

例如识别产品特点、读截图、解释图表、分析海报结构。

分析

结合目标给建议

例如分析网页设计、指出电商主图问题、整理 UI 优化建议。

生成

从文字生成新图片

这属于生图能力,背后可能是另一类图像生成模型。

修改

对原图做局部编辑

例如换背景、改颜色、删除物体、扩展画面,需要图像编辑能力。

06 哪些任务需要视觉能力 use cases
设计工作UI 截图、网页设计、海报结构、视觉风格分析。 电商运营产品图、竞品图、主图卖点、详情页视觉检查。 办公资料PDF 截图、表格图片、会议白板、流程图理解。 学习辅导公式、教材、手写笔记、课堂板书和图表解释。
07 常见支持看图的 AI 怎么理解 model map

现在很多主流 AI 产品已经具备多模态能力,例如 GPT 系列、Gemini 系列、Claude 视觉模型、通义千问视觉模型、豆包视觉模型等。普通用户不需要先背型号,先看它是否支持“上传图片并分析”。

图片理解能描述图片内容、识别物体、分析场景。 图文问答能结合你的问题回答,而不是只做图片说明。 视觉分析能看布局、设计、图表、流程和截图问题。

重要提醒

AI 能看图,也会看错图

看图模型可能识别错误、漏掉小字、误读数字、混淆按钮关系,也可能把看不清的细节说得很确定。尤其是合同、财务凭证、医学图片、身份信息和重要设计交付,都要人工复核。

先描述让 AI 先说看到了什么。 再分析再让它给判断和建议。 标不确定要求它指出看不清和不确定处。 人工复核关键数字、风险和结论别直接发布。
08 普通用户怎么问,图片 AI 才更好用 prompt lab
分析截图

根据这张页面截图,帮我优化设计

请先描述这张截图的页面结构,再分析视觉层级、留白、按钮位置、文字可读性和移动端风险,最后给出 5 条按优先级排序的优化建议。

本节练习

拿一张真实截图,练习“先事实,后判断”

上传一张网页截图或产品图,让 AI 按四段输出:看到了什么、可能有什么问题、建议怎么改、哪些地方需要人工确认。这个练习能让你马上感受到多模态模型和普通文本模型的差别。

可见事实只写图片里真实能看到的内容。 结构分析看布局、层级、颜色和信息密度。 优化建议给具体动作,不要泛泛而谈。 风险标注把看不清和可能误判的地方列出来。 人工复核关键结论由人最终确认。

本节小结

  • AI 不是天生会看图,看图能力来自多模态训练和视觉理解模块。
  • 普通模型主要理解文字,多模态模型才能处理图片、截图、表格和视觉问题。
  • 看图、画图、修图是三种不同能力,一个产品可能在后台调用多个模型。
  • 图片任务要先让 AI 描述事实,再做分析,并对重要细节人工复核。