Token 是什么?大模型计费与上下文的计量单位详解

AI百科 2026-09-08
0

什么是 Token?

在人工智能领域,Token(词元)是大模型处理文本的最小单位。你可以把它理解为 AI 眼中的"文字积木":当我们输入一句话时,大模型并不会直接读懂汉字或单词,而是先把文本切分成一个个 Token,再把它们转换成数字进行处理。

一个 Token 不完全等于一个字或一个词。以英文为例,一个单词可能是 1 个 Token(如 "hello"),也可能被拆成多个(如 "unbelievable" 可能拆成 "un" + "believ" + "able")。中文的情况类似,常见的做法是一个汉字约等于 1 到 2 个 Token,具体取决于模型使用的分词器(Tokenizer)。

Token 之所以重要,主要有两个原因:一是计费,绝大多数大模型 API 按 Token 数量收费;二是上下文限制,模型一次能"记住"的内容长度由 Token 数决定,这就是常说的上下文窗口(Context Window)。

Token 是怎么运作的?

大模型在处理文本前,会先经过一个叫分词器的组件。它基于在海量语料上统计出的词表,把文本切成高频出现的片段。英文按词根、词缀切分,中文通常按字或常用词组切分。切分完成后,每个 Token 会映射为一个数字编号,再通过嵌入层转换成向量,供模型计算。

理解 Token 的一个关键点是:大模型本质上是逐个 Token 生成内容的。它每一步预测下一个最可能出现的 Token,不断循环,直到生成完整回答。这就是为什么你在 ChatGPT、Kimi 等产品中能看到文字"一个字一个字往外蹦"的打字机效果。

下面这个表格对比了不同语言的 Token 换算规律(以常见通用分词器为参考,具体数值因模型而异):

文本类型典型换算关系示例
英文约 1 Token ≈ 0.75 个单词(或 4 个字符)"artificial" 可能拆为 2-3 个 Token
中文约 1 个汉字 ≈ 1-2 个 Token"人工智能" 约 4-6 个 Token
代码/符号切分更碎,Token 消耗更多一段 Python 代码 Token 数远超同长度文字
经验法则:1 个 Token 大约对应 1.5~1.8 个汉字。粗略估算时,1000 个 Token 约等于 600~700 个汉字。

Token 与计费的关系

使用大模型 API 时,费用 = 输入 Token 单价 × 输入量 + 输出 Token 单价 × 输出量。需要注意:输出 Token 的单价通常高于输入 Token,因为生成文本的计算成本更高。此外,多轮对话中,历史消息会作为上下文重复计入输入,这也是长对话费用增长较快的原因。

Token 与上下文窗口的关系

上下文窗口决定了模型一次能处理的文本总量,输入和输出共享这个额度。例如一个 128K Token 窗口的模型,理论上可以一次性读完一本十几万字的小说。窗口越大,能喂给模型的资料越多,但输入成本也相应增加。

主流产品与工具

国内主流大模型产品都已开放 API 服务,且计费透明,普遍以每百万 Token 为报价单位:

  • DeepSeek(深度求索):以极高性价比著称,V3、R1 系列模型按百万 Token 计费,输入输出价格差异明显,适合开发者和企业大规模调用。
  • Kimi(月之暗面):以长上下文见长,网页版和 App 免费使用,开放平台按 Token 计费,适合处理长文档场景。
  • 通义千问(阿里):Qwen 系列模型提供从轻量到旗舰的多个规格,开源版本丰富,API 价格梯度清晰。
  • 豆包(字节跳动):面向 C 端免费使用,火山引擎开放平台提供按 Token 计费的 API 服务。
  • 智谱清言 / GLM 系列(智谱 AI):提供网页版对话和 API 服务,GLM 系列模型在国产化部署方面应用广泛。
  • 文心一言(百度):千帆平台上提供按 Token 计费的多种模型版本,覆盖企业级应用。

对于普通用户,网页端和 App 通常按会员制或免费额度使用,感知不到 Token;而开发者通过 API 调用时,Token 就是实实在在的账单单位。各家官网一般都提供 Token 用量统计和费用估算工具,建议调用前先测算。

应用场景

理解 Token 对以下场景尤其有用:

  1. API 成本控制:开发者通过精简提示词、控制输出长度、使用量级更小的模型,可以显著降低调用成本。
  2. 长文档处理:知道上下文窗口大小后,可以判断一份合同、一本书能否一次性输入模型,还是需要分段处理或使用 RAG 检索方案。
  3. 产品选型:对比各家模型时,除了看价格,还要结合 Token 单价、上下文长度、实际效果综合评估性价比。
  4. 提示词优化:写提示词时避免冗余表达,把宝贵的上下文额度留给真正重要的信息。

常见问题

1 个 Token 到底等于多少个汉字?

没有统一标准,取决于具体模型的分词器。主流国产模型(如 DeepSeek、Qwen)针对中文做了优化,通常 1 个汉字约对应 1 个 Token 或略多;而部分以英文为主的模型,1 个汉字可能消耗 2 个以上 Token。准确数值可查阅各官方文档中的分词说明,或使用其在线 Token 计算器。

为什么我的对话费用越来越高?

多轮对话中,每一轮请求都会把全部历史消息作为输入发送给模型,输入 Token 随对话轮次累积增长。如果历史消息很长,即使本轮只问一句简短的话,输入费用也会不低。解决办法包括:定期开启新对话、精简历史记录,或使用支持上下文缓存、按缓存价格计费的服务。

上下文窗口越大越好吗?

不一定。窗口大意味着能处理更长的资料,但也可能带来更高的输入费用、更慢的响应速度,甚至"中间信息遗忘"的问题——模型对长文本中间部分的注意力可能弱于首尾。实际使用中,应根据任务需要选择合适长度,短任务不必堆满上下文。

小结:Token 是理解大模型运作、成本和能力的钥匙。记住三个要点——计费按 Token 算、上下文按 Token 限、生成按 Token 逐个输出,你就能对 AI 产品的定价和能力边界做出清晰判断。
©️版权声明:若无特殊声明,本站所有文章版权均归AI智库原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

相关文章

发表评论