CHAO AI LEARNING PATH

AI 知识库

从基础认知到真实项目,把零散知识整理成可以持续学习的路径。 继续学习 复盘(上):大模型是什么,幻觉是怎么来的?
22学习模块 119已上线课程 50%当前章节
LEARNING MODULES

选择学习方向

篇章复盘复盘(上):大模型是什么,幻觉是怎么来的?

07 篇章复盘

复盘(上):大模型是什么,幻觉是怎么来的?

学到这里,先不继续增加新概念。我们把前面最重要的知识串起来:大模型到底是什么,为什么它会产生幻觉,以及怎样让回答更可靠。

本篇只复盘两个问题

大模型不是传统数据库,而是一个通过大量数据学会生成语言的模型。它根据上下文预测接下来应该出现的 Token,所以“说得合理”不等于“事实一定正确”。

两个核心问题 two questions
01 大模型到底是什么?

不是一个把互联网原样存进去的数据库,而是通过大量数据训练,学到语言、知识和模式的生成模型。

02 幻觉是怎么来的?

模型擅长生成“看起来合理”的语言,但合理不等于真实;缺资料、错前提和高风险事实都会让它说错。

大模型如何生成回答 from data to answer
01 大量数据

文章、网页、代码、对话等

02 预训练

学习语言和知识规律

03 模型参数

形成可生成内容的能力

04 Token 预测

根据上下文预测下一步

05 完整回答

一个 Token 一个 Token 生成

为什么“补全机器”能变成聊天助手 chat assistant stack
第 1 层 预训练

让模型会说话,拥有基础语言和知识能力。

第 2 层 指令微调

让模型学会听人类要求,翻译、总结、写代码、解释概念。

第 3 层 Chat Template

把 System / User / Assistant 按聊天格式整理给模型。

第 4 层 System Prompt

告诉模型现在是什么角色,应该遵守哪些规则。

幻觉为什么会出现 reasonable is not true
用户问题 某家公司 2025 年营收多少?

问题要求非常具体,但模型未必拥有可靠、实时、可验证的数据。

语言结构很熟悉 公司 + 年份 + 营收 + 增长率
可能输出 “营收达到 38.7 亿元,同比增长 26.4%。”

听起来专业、数字具体,但如果没有来源,就可能只是“像真的”。

最可能出现的内容,不等于事实一定正确。

模型默认更擅长生成合理语言,不等于每一句话都经过事实验证。真正危险的是:不知道,但特别会说。

最容易产生幻觉的场景 risk scenes
冷门信息

模型见过的可靠资料少,容易按语言结构补空白。

最新信息

模型内部知识不一定实时,新闻、价格、职位要查来源。

精确数字

日期、金额、比例、排名越具体,越要核验出处。

错误前提

问题本身如果是假设错了,模型可能顺着继续编。

内部资料

公司制度、产品政策、合同条款不是通用常识。

把前面几篇串起来 reliable answer stack
应对 1 Prompt

约束回答:不知道就说不知道,不要为了完整而猜。

应对 2 RAG

先查知识库,再基于真实资料回答。

应对 3 参数控制

事实任务更稳,创意任务再适度放开。

应对 4 搜索 / 工具

最新事实、数据和状态交给可验证工具。

应对 5 评测 + 人工审核

发现系统问题,高风险内容由人把关。

最后记住三句话 final memory
01

大模型不是传统数据库,而是从大量数据中学习规律形成的模型。

02

大模型生成答案的重要基础,是根据上下文不断预测接下来应该出现的 Token。

03

“最可能出现的内容”不等于“事实一定正确”,这就是幻觉的重要来源。

本节小结

  • 大模型不是数据库,而是从大量数据中学习规律形成的模型。
  • 大模型生成答案的重要基础,是不断预测接下来应该出现的 Token。
  • 语言上最合理的内容,不一定是事实正确的内容。
  • 可靠 AI 应用要靠 Prompt、RAG、搜索/工具、评测和人工审核一起配合。