在大语言模型(Large Language Model, LLM)中,Token(令牌、词元、子词单元)是模型处理文本的最小单元。可是怎么翻译呢?今天群里一位老师就这样提问,从而引发此文。


  1. 什么是 Token?

与传统的“词”或“字符”不同,Token 是一种 子词级别的抽象,它既能保留单词的语义,又能兼顾模型的记忆和计算效率。

核心要点

  • Token ≠ 词(Word)
  • Token ≠ 字符(Character)
  • Token 是模型内部使用的“原子”单位,用来构造词向量、做注意力计算、控制上下文长度等。

  1. Token 是怎么来的?

2.1 传统分词(Word‑level)

最早的 NLP 系统往往直接把句子按空格、标点拆成“词”。但这会遇到:

  • 词表爆炸:不同语言、不同领域出现的词汇量巨大,导致模型需要存储海量词向量。
  • 稀疏性:罕见词会导致训练样本不足,模型难以学习其语义。
  • 多义词与形态变化:如“跑跑” vs “跑步”,单词级别难以捕捉细微差别。

2.2 子词分词(Sub‑word Tokenization)

为了解决上述问题,研究者提出 子词分词,把词拆成更小但语义更丰富的片段。常见算法:

算法代表模型关键思路典型 Token 例子
Byte Pair Encoding (BPE)GPT‑2、GPT‑3迭代合并最频繁的字符对un , ##aff, ##able
WordPieceBERT、RoBERTa以最大似然估计合并子词##ing , ##ly
SentencePieceT5、GPT‑4无监督的子词切分,支持多语言▁the , ▁cat

为什么要有子词?

  • 减小词表:将数十万单词压缩到几千个子词。
  • 处理生词 OOV(Out‑of‑Vocabulary):任何新词都能拆解为已知子词。
  • 捕捉形态变化:如 runningrun + ##ning

2.3 Token 的具体生成流程

  1. 文本预处理
  • 统一编码(如 UTF‑8)
  • 标点、大小写处理(有时会保留原始大小写)
  1. 分词器(Tokenizer)
  • 读取词表
  • 按 BPE/WordPiece/SentencePiece 规则逐字/逐字符扫描
  • 输出 Token ID(整数索引)和 Token 字符串
  1. Token Embedding
  • 每个 Token ID 对应一个可训练的向量(embedding)
  • 这些向量在模型训练过程中不断更新

  1. Token 的主要特点

特点说明
可变长度Token 的字符长度不固定(如 ▁the 1 字节 vs ##ing 3 字节)。
子词级别能同时兼顾单词级语义与字符级细节。
上下文敏感在 Transformer 的自注意力中,Token 之间的关系决定最终表示。
可扩展通过增大词表或使用动态词表,可适应新领域词汇。
多语言兼容SentencePiece 等方法可一次性处理多种语言,无需语言特定规则。

3.1 Token 与句子长度的关系

  • 大多数 LLM(如 GPT‑4)对 最大上下文长度 有硬性限制(例如 8,192 或 32,768 Token)。
  • 这意味着 一句话的 Token 数量 直接决定了模型能否一次性看到整句。
  • 对长文本,常用 滑动窗口分块 技术,或通过 分块 Attention 方案来突破。

3.2 Token 与模型性能的关联

  • 词表大小:过小的词表导致 OOV,过大的词表则增加参数量。
  • 子词粒度:更细的粒度(如字符级)能捕捉更多细节,但会拉长序列。
  • 分词器质量:优良的分词器能让模型更好地利用上下文,提升生成质量。

  1. “Token” 在中文中的翻译

在中文 NLP 社区,Token 这一术语常见的译法有:

译法适用场景说明
词元 (Token)学术论文、技术文档直接对应“token”概念,强调“单元”属性。
令牌计算机安全、密码学但在 NLP 中使用较少,易与安全术语混淆。
子词解释分词算法侧重“子词”这一粒度。
词片形象化表达适合面向大众的说明。

推荐用法

  • 技术文档 / 论文词元Token(加括号)
  • 例:我们使用 GPT‑3 的词元(token)表进行分词。
  • 面向读者的博客 / 讲座子词词片
  • 例:在 GPT‑4 中,一个“词片”(token)可以是“▁the”或“##ing”。

实际上,在当前的讨论中,大家基本都是保持“Token”原文不翻译,后面加上中文注释,以避免歧义。


  1. 简单总结

  • Token 是 LLM 处理文本的最小单元,通常采用子词分词算法生成。

  • 它兼具 语义丰富性计算可控性,是模型训练与推理的核心。

  • 通过 BPE/WordPiece/SentencePiece 等技术,Token 能够覆盖海量词汇,支持多语言。

  • 在中文文献中,词元 是最常见且准确的翻译;根据受众可选用 子词词片 等表述。
    掌握 Token 的概念与实现细节,是深入理解大语言模型内部机制的第一步。希望这篇文章能帮助读者在阅读 LLM 文献、搭建自己的模型时更得心应手。希望大家在 NLP 和 LLM 的世界里探索愉快!

    假如你从2026年开始学大模型,按这个步骤走准能稳步进阶。

接下来告诉你一条最快的邪修路线,

3个月即可成为模型大师,薪资直接起飞。
img

阶段1:大模型基础

img

阶段2:RAG应用开发工程

img

阶段3:大模型Agent应用架构

img

阶段4:大模型微调与私有化部署

img

配套文档资源+全套AI 大模型 学习资料,朋友们如果需要可以微信扫描下方二维码免费领取【保证100%免费】👇👇
在这里插入图片描述
img

img

img

img
img

配套文档资源+全套AI 大模型 学习资料,朋友们如果需要可以微信扫描下方二维码免费领取【保证100%免费】👇👇

在这里插入图片描述

更多推荐