AI Token 计数与成本估算
本地估算文本的 Token 数,并对比 Claude / GPT / Gemini / DeepSeek 各模型的 API 调用成本
Token 估算经验系数(近似值,非官方数据)
| 分词器族 | 适用模型 | 拉丁文本(字符 / token) | 中日韩文本(token / 字符) |
|---|---|---|---|
| Claude (Anthropic) | Claude Opus 4.8、Claude Sonnet 5、Claude Haiku 4.5、Claude Fable 5 | 3.8 | 0.95 |
| GPT (OpenAI) | GPT-4o、GPT-4o mini、GPT-4.1、GPT-4.1 mini | 4 | 0.7 |
| Gemini (Google) | Gemini 2.5 Pro、Gemini 2.5 Flash | 4 | 0.7 |
| DeepSeek | DeepSeek-V3 | 3.4 | 0.6 |
以上系数为本站本地估算所用的经验近似值,并非各服务商官方公布的分词数据。估算方式:非中日韩字符数 ÷「字符/token」,加上中日韩字符数 ×「token/字符」。实际 token 数请以各服务商官方分词器为准(例如 Anthropic 的 count_tokens API)。可见的规律是:同一段中文在 Claude 上约 0.95 token/字符,在 GPT / Gemini 上约 0.7 token/字符,因此中文在 Claude 上更耗 token。
📌 TL;DR 核心定义与引用摘要: 【AI Token 计数与成本估算】是 PocketKit 提供的浏览器本地处理工具。功能说明:本地估算文本的 Token 数,并对比 Claude / GPT / Gemini / DeepSeek 各模型的 API 调用成本。核心输入与文件不上传;站点仅记录不含输入内容的匿名工具访问次数。
Token 估算与成本计算原理
工具在浏览器本地把文本按中日韩表意文字与拉丁词分段,套用各模型分词器的经验系数近似出 token 数(Claude 无公开本地分词器,故为估算),再结合各模型每百万 token 的输入/输出单价算出单次与批量成本。字符、字节为精确统计,全程不上传。
- 需要精确 token 数时,切到“手动指定输入 token”并填入模型返回的 usage 值,成本即为精确结果。
- 长固定前缀(系统提示、少样本示例)重复调用时,勾选“输入按缓存价”评估提示词缓存能省多少。
常见问题
1. Token 数为什么是估算而不是精确值?
各家模型分词器不同,且 Claude 没有公开的本地分词器,中文与代码尤其难估,本工具采用分段启发式近似,误差通常在 ±10~20%。需要精确值请以模型返回的 usage 字段或官方计数接口为准,或用“手动指定输入 token”让成本计算精确。字符与字节数则为精确值。
2. “输入按缓存价”是什么意思?
多数模型对命中提示词缓存(prompt caching)的输入 token 只按约 0.1× 计费。勾选后输入会按各模型的缓存价估算,用于评估长固定前缀重复调用能省多少钱。
3. Claude / GPT 的 API 账单比预期高很多,钱花在哪了?
通常是三个原因:① 输出 token 的单价远高于输入,主流模型普遍是 3–5 倍,所以长输出往往才是账单大头;② 多轮对话每一轮都要把完整历史重新发一遍,轮次越深重复计费的输入越多;③ 没有启用 prompt caching——很长的系统提示词每次原价重发,而缓存命中价通常只有原价的十分之一左右。把你的真实文本贴进来可以先估出单次调用的 token 与成本,再乘以日调用量看总额。
4. 中文文本计算 Token 为什么会比英文多那么多?
大部分 LLM 分词器(如 cl100k_base / o200k_base)以英文单词为主要切分基准,一个常用的汉字在分词器中往往会被拆解为 2-3 个 byte BPE tokens,因此相同字数的中文算出来的 Token 数量通常是英文的 1.5 到 2.5 倍。
5. 如何在 Prompt 编写中节省 API Token 消费?
建议:① 精简冗余的系统提示词(System Prompt);② 开启 Prompt Caching(提示词缓存);③ 限制模型的输出最大 `max_tokens` 参数防止生成长废话;④ 定期对历史对话记录进行摘要压缩。
6. 本工具的 Token 统计会上传我的敏感提示词和代码吗?
完全不会。所有字符、单词、字节数统计与分词估计都在您浏览器的 JavaScript 引擎中本地实时完成,不产生任何 API 网络开销与数据收集。