04 第一篇章 · 大模型从哪来
GPT 的跃进:PreTraining 为什么改变了一切
GPT 的真正突破,不只是聊天更自然,而是 AI 的学习方式变了。过去很多 AI 靠人写规则、做专用任务;PreTraining 出现后,模型先从海量数据里学习语言、知识和规律,再迁移到写作、代码、翻译、总结、分析和对话等任务。
一句话回答
PreTraining 最大的改变,是让 AI 从“被人写规则”变成“自己从海量数据里学规律”。GPT 先通过预训练形成通用理解和生成能力,再经过微调、人类反馈和产品化,才变成今天能写作、写代码、分析、对话和执行任务的 AI 助手。
先理解旧时代,才看得懂跃进
过去很多 AI 更像专用工具:人写规则,机器执行
比如垃圾邮件分类、机器翻译、图片识别,早期常见思路是:专家先设计规则或特征,再让模型完成一个固定任务。问题是,规则写到哪里,AI 能力就到哪里;换一个任务,往往要重新设计。
旧 AI 更像做一道固定题,GPT 更像先学会语言规律
人工写规则:出现“免费中奖”“点击领取”等词,就提高垃圾邮件概率。
先从大量文本中学习邮件语气、上下文、意图和常见表达,再迁移到分类、解释和生成。
AI 不再只依赖人类手写规则
模型从海量样本里学习规律,人不需要把每一种情况都提前写死。
一个基础模型可以迁移到很多任务
写文章、写代码、翻译、总结、分析、对话,不再每个任务都从零做一个模型。
数据、参数和算力放大了模型能力
模型越能表达复杂规律,就越可能出现写作、推理、代码等综合能力。
Transformer 让模型更会看上下文
它能同时关注一句话里的不同部分,理解“苹果公司”和“苹果水果”的区别。
一个大脑底座,支撑多种能力
GPT 不只是某个小工具,而是可以连接写作、代码、翻译、分析等任务的通用底座。
预训练不是把资料原文装进去
模型改变的是参数和关联能力,不是保存一本可以随时精确查询的互联网副本。
复杂任务需要通用理解能力做底座
Agent 要理解目标、拆步骤、调用工具、判断结果,这些都离不开预训练带来的基础能力。
PreTraining 最大的意义,是让 AI 从专用软件走向通用大脑。以前 AI 更像一个个功能按钮;现在 AI 开始接近数字员工,可以理解任务、生成内容、连接工具,并参与完整工作流程。
本节小结
- PreTraining 让 AI 从“规则驱动”变成“数据学习”。
- GPT 先通过预测下一个 Token 学会语言、知识和规律。
- 模型规模、数据规模和 Transformer 架构共同放大了能力。
- Foundation Model 是 AI Agent 的大脑底座,真正落地还要连接工具和流程。