不是一个把互联网原样存进去的数据库,而是通过大量数据训练,学到语言、知识和模式的生成模型。
07 篇章复盘
复盘(上):大模型是什么,幻觉是怎么来的?
学到这里,先不继续增加新概念。我们把前面最重要的知识串起来:大模型到底是什么,为什么它会产生幻觉,以及怎样让回答更可靠。
本篇只复盘两个问题
大模型不是传统数据库,而是一个通过大量数据学会生成语言的模型。它根据上下文预测接下来应该出现的 Token,所以“说得合理”不等于“事实一定正确”。
模型擅长生成“看起来合理”的语言,但合理不等于真实;缺资料、错前提和高风险事实都会让它说错。
文章、网页、代码、对话等
学习语言和知识规律
形成可生成内容的能力
根据上下文预测下一步
一个 Token 一个 Token 生成
让模型会说话,拥有基础语言和知识能力。
让模型学会听人类要求,翻译、总结、写代码、解释概念。
把 System / User / Assistant 按聊天格式整理给模型。
告诉模型现在是什么角色,应该遵守哪些规则。
问题要求非常具体,但模型未必拥有可靠、实时、可验证的数据。
听起来专业、数字具体,但如果没有来源,就可能只是“像真的”。
模型默认更擅长生成合理语言,不等于每一句话都经过事实验证。真正危险的是:不知道,但特别会说。
模型见过的可靠资料少,容易按语言结构补空白。
模型内部知识不一定实时,新闻、价格、职位要查来源。
日期、金额、比例、排名越具体,越要核验出处。
问题本身如果是假设错了,模型可能顺着继续编。
公司制度、产品政策、合同条款不是通用常识。
约束回答:不知道就说不知道,不要为了完整而猜。
先查知识库,再基于真实资料回答。
事实任务更稳,创意任务再适度放开。
最新事实、数据和状态交给可验证工具。
发现系统问题,高风险内容由人把关。
大模型不是传统数据库,而是从大量数据中学习规律形成的模型。
大模型生成答案的重要基础,是根据上下文不断预测接下来应该出现的 Token。
“最可能出现的内容”不等于“事实一定正确”,这就是幻觉的重要来源。
本节小结
- 大模型不是数据库,而是从大量数据中学习规律形成的模型。
- 大模型生成答案的重要基础,是不断预测接下来应该出现的 Token。
- 语言上最合理的内容,不一定是事实正确的内容。
- 可靠 AI 应用要靠 Prompt、RAG、搜索/工具、评测和人工审核一起配合。