CHAO AI LEARNING PATH

AI 知识库

从基础认知到真实项目,把零散知识整理成可以持续学习的路径。 继续学习 Token 和词表:AI 怎么切字
22学习模块 119已上线课程 60%当前章节
LEARNING MODULES

选择学习方向

第一篇章 · 大模型从哪来Token 和词表:AI 怎么切字

04 第一篇章 · 大模型从哪来

Token 和词表:AI 怎么切字

上一节我们知道,训练和推理是两个阶段。这一节继续往里看一层:文字进入模型之前,AI 不是直接按整句话理解,而是先把文字切成 Token,再通过词表变成数字进行计算。

一句话回答

AI 不是直接读整句话,而是先把文字切成 Token。Token 会进入词表变成编号,模型再根据这些编号进行计算、预测和生成。训练时,它会反复练习“下一个 Token 应该是什么”,猜错就调整参数。

01 一句话进来,AI 先做了什么 text to tokens
1原始文字你输入一句中文、英文、代码或带符号的内容。 2切成 Token分词器把文字切成模型能处理的小颗粒。 3查词表编号每个 Token 都会对应一个编号,方便模型计算。 4预测下一个模型根据前文判断后面最可能接什么。
02 试着输入一句话,看它怎么被切开 tokenizer lab

这是教学模拟,不是某个模型的官方 tokenizer

把一句人话拆成 AI 能计算的小颗粒

你可以换一句话试试。重点不是记住具体切法,而是理解:模型处理前,会先把文字、数字、符号和代码拆成 Token。

切分结果
词表编号
0教学估算 Token --字符 / Token

不同模型的词表不同,真实 Token 数也会不同。

03 Token 切完后,模型为什么像在接话 next token

模型不是一次写完整篇,而是一颗一颗往后生成

它会根据前面的 Token,猜后面最可能出现什么

如果你输入“今天的天气很”,模型会在很多可能结果里计算概率,比如“好”“热”“不好”。推理时它选择一个方向继续写;训练时如果猜错,就用正确答案来调整参数。

当前前文 我想用 AI 写一份营销方案
目标客户84% 核心卖点58% 执行步骤32%
04 再看一个训练小模拟:猜错以后发生什么 training demo

训练不是背答案,而是调整内部连接

模型猜错一次,就把参数往正确方向推一点

下面是一个极简模拟:前文是“今天的天气很”,真实答案是“不好”。训练前模型更偏向猜“晴朗”,纠错后,“不好”的概率会升高。

输入样本 今天的天气很 ____ 真实答案:不好
晴朗62% 不好18% 开心7%
错误信号 偏高:模型更想猜“晴朗”
05 小白最容易混淆的三个点 clear boundary
Token 不等于字数

一个中文词可能是一颗,也可能被拆开

不同模型的分词器不同,同一句话切出来的 Token 数可能不一样。

词表不等于知识库

词表只是编号表,不负责保存公司资料

公司价格、政策、产品文档,通常应该放进知识库,而不是误以为词表能解决。

预测不等于理解人心

模型是在计算最可能的续写方向

它可以表现得像理解你,但底层仍然是根据输入和参数生成结果。

06 最后用一条线记住 simple line
文字人类输入 Token切成颗粒 词表编号变成数字 模型计算预测生成

本节小结

  • AI 处理文字前,会先把内容切成 Token。
  • 词表把 Token 映射成编号,模型再进行计算。
  • 训练常见形式是预测下一个 Token,猜错就调整参数。
  • 这个页面是帮助理解原理的模拟,不代表某个模型的真实切分结果。