词元

模型处理文本时切分出的基本单位。

把它讲透

词元到底是什么?

模型读取和生成文本时使用的基本小块,不等于固定的一个字或一个词。

人看到一句话,会按语义理解整句;语言模型先把它切成 Token,再把每个 Token 转成数字进行计算。模型最终也是一个 Token 一个 Token 地预测并输出文本。

把它想成“机器读文字的积木”

Token 像给机器准备的文字积木。英文里一个常用词可能是一个积木,较长或生僻的词可能被拆成几个;中文也不一定是“一字一个 Token”。切分方式由模型自己的分词器决定,所以同一句话在不同模型里可能占用不同数量的 Token。

一段文字怎样变成回答?

  1. 切分文本

    先把提示词、文档和历史对话切成 Token。此时模型看到的不是完整句子,而是一串可处理的单位。

  2. 转成数字并计算

    每个 Token 会被映射成数字表示,模型据此结合上下文计算下一个位置最可能出现什么。

  3. 逐个生成

    模型选择下一个 Token,加入已有文本后继续预测,于是一个字、一个词或一段符号慢慢组成完整回答。

它会直接影响什么?

Token 不是抽象术语;它直接决定一次请求能装多少内容,以及调用的成本和响应时间。

  • 01 — 上下文窗口

    提示词、附件、历史消息和模型回答都会占用 Token。总量超过模型窗口时,内容不能被同时放入这次请求。

  • 02 — 费用

    许多 API 按输入和输出 Token 计费。长文、长对话或反复输出会让用量上升。

  • 03 — 生成速度

    模型需要逐个生成 Token;输出越长,通常等待越久。

它在真实产品中怎样出现?

例如让 AI 总结一份很长的报告:报告本身、你的指令、先前对话和模型的总结都要一起放进上下文窗口。若 Token 不够,就要分段、先摘要,或用 RAG 只取相关片段。

容易误解

一个中文字符就是一个 Token 吗?

不一定。Token 由模型的分词器决定,可能对应一个字、几个字、一个词的一部分,或连同前后的空格和标点。

Token 越少,回答就越好吗?

不是。减少无关内容能节省成本并留出窗口,但过度压缩会丢失必要背景。关键是保留完成当前任务真正需要的信息。

词元是模型处理语言的积木:它决定模型一次能看多少、生成多快,以及调用大致要花多少。

它解决什么问题?

模型不是按整句阅读,而是把文本转成 Token;它会影响上下文长度、速度和费用。

它通常出现在哪?

API 的用量和模型的上下文窗口,常常都以 Token 计量。