词元
模型处理文本时切分出的基本单位。
把它讲透
词元到底是什么?
模型读取和生成文本时使用的基本小块,不等于固定的一个字或一个词。
人看到一句话,会按语义理解整句;语言模型先把它切成 Token,再把每个 Token 转成数字进行计算。模型最终也是一个 Token 一个 Token 地预测并输出文本。
把它想成“机器读文字的积木”
Token 像给机器准备的文字积木。英文里一个常用词可能是一个积木,较长或生僻的词可能被拆成几个;中文也不一定是“一字一个 Token”。切分方式由模型自己的分词器决定,所以同一句话在不同模型里可能占用不同数量的 Token。
一段文字怎样变成回答?
- 切分文本
先把提示词、文档和历史对话切成 Token。此时模型看到的不是完整句子,而是一串可处理的单位。
- 转成数字并计算
每个 Token 会被映射成数字表示,模型据此结合上下文计算下一个位置最可能出现什么。
- 逐个生成
模型选择下一个 Token,加入已有文本后继续预测,于是一个字、一个词或一段符号慢慢组成完整回答。
它会直接影响什么?
Token 不是抽象术语;它直接决定一次请求能装多少内容,以及调用的成本和响应时间。
- 01 — 上下文窗口
提示词、附件、历史消息和模型回答都会占用 Token。总量超过模型窗口时,内容不能被同时放入这次请求。
- 02 — 费用
许多 API 按输入和输出 Token 计费。长文、长对话或反复输出会让用量上升。
- 03 — 生成速度
模型需要逐个生成 Token;输出越长,通常等待越久。
它在真实产品中怎样出现?
例如让 AI 总结一份很长的报告:报告本身、你的指令、先前对话和模型的总结都要一起放进上下文窗口。若 Token 不够,就要分段、先摘要,或用 RAG 只取相关片段。
容易误解
一个中文字符就是一个 Token 吗?
不一定。Token 由模型的分词器决定,可能对应一个字、几个字、一个词的一部分,或连同前后的空格和标点。
Token 越少,回答就越好吗?
不是。减少无关内容能节省成本并留出窗口,但过度压缩会丢失必要背景。关键是保留完成当前任务真正需要的信息。
词元是模型处理语言的积木:它决定模型一次能看多少、生成多快,以及调用大致要花多少。
它解决什么问题?
模型不是按整句阅读,而是把文本转成 Token;它会影响上下文长度、速度和费用。
它通常出现在哪?
API 的用量和模型的上下文窗口,常常都以 Token 计量。