Token与分词

合集文章导航
本合集共 5 篇文章,涵盖 Token 与分词核心知识:
- Token 到底是什么? - 理解 Token 的本质
- Tokenizer 是怎么工作的? - BPE、WordPiece 和 SentencePiece
- 中文分词为什么特殊? - 中英文 Token 数量差异
- 上下文长度、Token 预算和接口费用到底怎么算? - 费用计算实战
- Tokenization 对 Prompt、RAG 和长文本处理有什么影响? - 工程实践指南
当大模型"吃"文字时,它到底在吃什么?
你有没有想过一个问题?
你跟ChatGPT说一段话,它是怎么"看"的?按字数?按词语?
都不是。
它按一种叫 Token 的单位来理解和计价。
这就奇怪了。我们从小到大,读书写字都是按"字"或"词"来的,怎么AI偏偏要用这个奇怪的单位?
更气人的是——
同样一段话,别人发的Token比你少一大截,费用直接砍半。
凭什么?
好,先把框架搭起来,搞清楚Token和大模型到底是什么关系。
大模型吃"字"还是吃"词"?都不是
先纠正一个直觉错误。
你以为大模型在读"字"?错。
你以为大模型在读"词"?也不对。
它吃的是 Token。
Token是什么?简单说,就是大模型处理文本时的"一口食物"。
这一口可大可小。
可能是一半个字——比如"未"和"来"。
可能是一个完整词——比如"人工智能"。
也可能是多个词——比如英文里的"un+happy+ness"。
你没看错,同一句话,切法不同,Token数量就不同。
这就跟吃饭一样。有人用勺子,有人用筷子——同样一顿饭,吃的"口数"完全不一样。大模型按"口"算钱,按"口"消化。

为什么不能统一按"字"或"词"切?
你可能想问:搞这么复杂干嘛?统一按字切不行吗?
还真不行。
按字切太碎了。"人工智能"切成4个Token,每个单字意思残缺,大模型光拼凑理解就累死。
按词切呢?问题更大。
中文没有空格,词边界本身就模糊。"南京市长江大桥"——是"南京+市长+江大桥",还是"南京市+长江+大桥"?
人类都纠结,机器更懵。
所以Token这个设计,本质上是找了一个"刚刚好"的粒度。太大了理解费劲,太小了效率太低。
那大模型怎么知道该怎么切?
这就要说到Tokenizer(分词器)了。
你可以把它理解成一个"切菜工"——专门负责把原材料切成大小均匀的块。
主流的切法有三种:BPE、WordPiece、SentencePiece。最常用的是BPE。
BPE的思路很有意思:它从字符开始,不断合并最常出现的"邻居"。
举个例子,"e"和"r"经常挨着出现,就合并成"er"。"er"和"ing"又经常一起出现,就再合并成"ering"。
这个过程就像小孩学说话——先把单字记住,然后发现"爸爸"总是一起出现,就把它当成一个词来记。
需要注意的是,不同模型的"切菜工"手艺不同。GPT-4用的和Claude用的就不是同一个。所以同样一句话,Token数可能差出20%。

为什么中文的Token总比英文多?
这是个扎心的事实。
同样表达一个意思,中文消耗的Token通常是英文的1.5到2倍。为什么?
第一,中文没有空格。 英文天然用空格把词分开了,中文机器得先猜哪儿是词的边界,这本身就费Token。
第二,中文单字信息密度低。 一个"的"字能表达的意思很有限。英文呢?"un+happy+ness"拆成三块,每块都有信息。
说白了,中文像一幅没有留白的山水画——密密麻麻,大模型得自己找重点。英文像一张画好了格子的表格——哪儿是词,一目了然。
结果就是:用中文跟大模型说话,天然就比英文贵。
我之前用Claude写产品文档,同样的内容,英文版本比中文版本便宜了近一半。

Token数是怎么影响你钱包的?
说到钱,就比较现实了。
大模型API是按Token数收费的。GPT-4o输入每100万Token约2.5美元,Claude 3.5 Sonnet差不多也是这个价。
你写一个Prompt,1000字中文,大概消耗600-800个Token。看起来不多?
但企业级应用一天调用几十万次,费用就可怕了。
更关键的不只是钱。还有 上下文窗口限制。
模型一顿饭能吃的Token是有限的。GPT-4o支持12.8万Token,Claude 3.5支持20万Token。听起来很多?
但你喂给它一篇10万字的小说,加Prompt,加历史对话——分分钟爆掉。爆掉之后怎么办?要么截断,要么加钱扩容。
这就像流量套餐——用超了,要么限速,要么掏钱。

搞懂Token能让你少花冤枉钱
到这里你可能明白了:Token管理是个技术活。
搞懂了,你能干几件事:
精简Prompt。 废话少说,指令清晰。我之前有个客户,Prompt从200字压缩到50字,效果反而更好,月费直接降了60%。
预估成本。 你知道一段文字大概多少Token,就能估算API费用。这对做产品定价、预算控制特别重要。
优化长文本处理。 RAG(检索增强生成)、长文本摘要、文档问答——这些场景的核心都是Token管理。你知道哪儿能压缩、哪儿不能压缩,才能做出真正高效的AI应用。
怎么练?下次写Prompt的时候,顺手估算一下Token数。养成习惯,你对大模型的理解会更深一步。

这个合集能给你什么?
读到这里,你已经对Token有了整体感知。
但这只是开胃菜。
真正的硬菜还在后面——Token到底是什么?它和大模型的"思维"有什么关系?为什么大模型要按Token来理解,而不是按语义?
下一篇文章,我们会把Token拆开来看,看看它在大模型眼里到底是什么样子。
准备好了吗?
