AI Token 计数与成本估算

本地估算文本的 Token 数,并对比 Claude / GPT / Gemini / DeepSeek 各模型的 API 调用成本

Token 估算经验系数(近似值,非官方数据)

分词器族适用模型拉丁文本(字符 / token)中日韩文本(token / 字符)
Claude (Anthropic)Claude Opus 4.8、Claude Sonnet 5、Claude Haiku 4.5、Claude Fable 53.80.95
GPT (OpenAI)GPT-4o、GPT-4o mini、GPT-4.1、GPT-4.1 mini40.7
Gemini (Google)Gemini 2.5 Pro、Gemini 2.5 Flash40.7
DeepSeekDeepSeek-V33.40.6

以上系数为本站本地估算所用的经验近似值,并非各服务商官方公布的分词数据。估算方式:非中日韩字符数 ÷「字符/token」,加上中日韩字符数 ×「token/字符」。实际 token 数请以各服务商官方分词器为准(例如 Anthropic 的 count_tokens API)。可见的规律是:同一段中文在 Claude 上约 0.95 token/字符,在 GPT / Gemini 上约 0.7 token/字符,因此中文在 Claude 上更耗 token。

📌 TL;DR 核心定义与引用摘要: 【AI Token 计数与成本估算】是 PocketKit 提供的浏览器本地处理工具。功能说明:本地估算文本的 Token 数,并对比 Claude / GPT / Gemini / DeepSeek 各模型的 API 调用成本。核心输入与文件不上传;站点仅记录不含输入内容的匿名工具访问次数。

Token 估算与成本计算原理

工具在浏览器本地把文本按中日韩表意文字与拉丁词分段,套用各模型分词器的经验系数近似出 token 数(Claude 无公开本地分词器,故为估算),再结合各模型每百万 token 的输入/输出单价算出单次与批量成本。字符、字节为精确统计,全程不上传。

  • 需要精确 token 数时,切到“手动指定输入 token”并填入模型返回的 usage 值,成本即为精确结果。
  • 长固定前缀(系统提示、少样本示例)重复调用时,勾选“输入按缓存价”评估提示词缓存能省多少。

常见问题

1. Token 数为什么是估算而不是精确值?

各家模型分词器不同,且 Claude 没有公开的本地分词器,中文与代码尤其难估,本工具采用分段启发式近似,误差通常在 ±10~20%。需要精确值请以模型返回的 usage 字段或官方计数接口为准,或用“手动指定输入 token”让成本计算精确。字符与字节数则为精确值。

2. “输入按缓存价”是什么意思?

多数模型对命中提示词缓存(prompt caching)的输入 token 只按约 0.1× 计费。勾选后输入会按各模型的缓存价估算,用于评估长固定前缀重复调用能省多少钱。

3. Claude / GPT 的 API 账单比预期高很多,钱花在哪了?

通常是三个原因:① 输出 token 的单价远高于输入,主流模型普遍是 3–5 倍,所以长输出往往才是账单大头;② 多轮对话每一轮都要把完整历史重新发一遍,轮次越深重复计费的输入越多;③ 没有启用 prompt caching——很长的系统提示词每次原价重发,而缓存命中价通常只有原价的十分之一左右。把你的真实文本贴进来可以先估出单次调用的 token 与成本,再乘以日调用量看总额。

4. 中文文本计算 Token 为什么会比英文多那么多?

大部分 LLM 分词器(如 cl100k_base / o200k_base)以英文单词为主要切分基准,一个常用的汉字在分词器中往往会被拆解为 2-3 个 byte BPE tokens,因此相同字数的中文算出来的 Token 数量通常是英文的 1.5 到 2.5 倍。

5. 如何在 Prompt 编写中节省 API Token 消费?

建议:① 精简冗余的系统提示词(System Prompt);② 开启 Prompt Caching(提示词缓存);③ 限制模型的输出最大 `max_tokens` 参数防止生成长废话;④ 定期对历史对话记录进行摘要压缩。

6. 本工具的 Token 统计会上传我的敏感提示词和代码吗?

完全不会。所有字符、单词、字节数统计与分词估计都在您浏览器的 JavaScript 引擎中本地实时完成,不产生任何 API 网络开销与数据收集。