一张产品图片
用户上传一张智能水杯产品图,希望 AI 帮他总结卖点和优化电商详情页。
只看得懂你打出来的字
我无法直接查看图片。你可以用文字描述产品外观、功能和卖点,我再帮你整理文案。
能先读图,再回答问题
这是一款偏简洁科技风的智能水杯,主体为白色圆柱形,顶部有深色杯盖,适合突出“健康提醒、温度显示、办公随行”这类卖点。
03 第零篇章 · 第一次系统认识 AI
AI 不是天生就会“看”。有些模型只能处理文字,有些模型经过多模态训练,才能理解图片、截图、表格、公式和视觉信息。
会聊天不等于会看图。普通语言模型主要处理文字;多模态模型多了一套视觉理解能力,会先把图片转成模型能处理的信息,再结合你的问题生成回答。所以有的 AI 能分析产品图、UI 截图和公式笔记,有的只能让你用文字描述。
用户上传一张智能水杯产品图,希望 AI 帮他总结卖点和优化电商详情页。
我无法直接查看图片。你可以用文字描述产品外观、功能和卖点,我再帮你整理文案。
这是一款偏简洁科技风的智能水杯,主体为白色圆柱形,顶部有深色杯盖,适合突出“健康提醒、温度显示、办公随行”这类卖点。
人从小会接触颜色、形状、距离、物体关系和真实环境,所以看到苹果时,不只是认识“苹果”两个字。
它知道“苹果”这个词经常和水果、红色、甜味一起出现,但如果没学过图像,就不知道图片里的苹果长什么样。
它通过大量图文配对数据,学习图片内容、物体关系和文字描述之间的对应关系。
所以 AI 不是像人眼一样“直接看见图片”,而是先把图片转成可计算的视觉信息,再交给语言模型组织答案。
例如识别产品特点、读截图、解释图表、分析海报结构。
例如分析网页设计、指出电商主图问题、整理 UI 优化建议。
这属于生图能力,背后可能是另一类图像生成模型。
例如换背景、改颜色、删除物体、扩展画面,需要图像编辑能力。
现在很多主流 AI 产品已经具备多模态能力,例如 GPT 系列、Gemini 系列、Claude 视觉模型、通义千问视觉模型、豆包视觉模型等。普通用户不需要先背型号,先看它是否支持“上传图片并分析”。
重要提醒
看图模型可能识别错误、漏掉小字、误读数字、混淆按钮关系,也可能把看不清的细节说得很确定。尤其是合同、财务凭证、医学图片、身份信息和重要设计交付,都要人工复核。
请先描述这张截图的页面结构,再分析视觉层级、留白、按钮位置、文字可读性和移动端风险,最后给出 5 条按优先级排序的优化建议。
本节练习
上传一张网页截图或产品图,让 AI 按四段输出:看到了什么、可能有什么问题、建议怎么改、哪些地方需要人工确认。这个练习能让你马上感受到多模态模型和普通文本模型的差别。