大模型 API 价格对比
横向对比 Claude / GPT / Gemini / DeepSeek 各模型的输入输出价、缓存价、上下文窗口与混合价
TL;DR 核心定义与引用摘要: 【大模型 API 价格对比】用于横向对比 Claude / GPT / Gemini / DeepSeek 各模型的输入输出价、缓存价、上下文窗口与混合价。核心输入和文件在当前浏览器中处理,不发送到 PocketKit API;页面仅记录不包含输入内容的匿名工具访问次数。
大模型价格对比与混合价原理
工具把 Claude / GPT / Gemini / DeepSeek 各模型的输入价、输出价、缓存价与上下文窗口集中成一张表,按你设定的输入:输出比例把两档价加权成“混合价”以便一维排序。价格数据本地内置、可编辑,不联网取价。
使用建议与操作提示
- 先按真实业务估个输入:输出比例(对话/RAG≈3:1,纯生成≈1:1)再看混合价,排序才贴近实际花费。
- 标“参考”的非 Claude 价格可能变动,投产前到对应官网核对一遍。
常见问题
1. 表格里的“混合价”是怎么算的?
按你选的“输入:输出”比例,把输入价与输出价做加权平均,折成一个可比的每百万 tokens 单价,用于横向排序。对话/RAG 常见约 3:1,纯生成偏 1:1;真实成本取决于你的实际输入输出配比。
2. 这里的价格准确吗?
Anthropic(Claude)为官方参考价;OpenAI、Google、DeepSeek 标注为“参考价”,可能随官方调整而变化,请以各服务商官网为准。价格集中维护,便于更新。
3. 同样一件事,用哪个模型最省钱?
先判断你的任务是输入重还是输出重。分类、信息抽取、格式转换这类输出很短的任务由输入价主导,应当优先看输入单价和缓存价;写长文、生成代码这类由输出价主导,输出单价便宜的模型优势更明显。表格里可以直接横向对比各模型的输入 / 输出 / 缓存价与上下文窗口。实践中最省钱的做法通常不是选一个模型,而是分级路由:简单任务交给便宜模型,只把复杂推理留给最强的那个。
4. 什么是 Prompt Caching(提示词缓存),如何降低 90% 成本?
Anthropic、OpenAI 和 DeepSeek 均提供了提示词缓存机制。当向模型发送长上下文(如大篇幅文档、固定系统规则或代码库),只要前缀内容与前次请求严格一致且超过最低 Token 阈值(Claude 为 1024 tokens,DeepSeek 为 64 tokens),命中缓存的输入 Token 仅按正常价格的 10% 计费,且首字响应延迟(TTFT)大幅缩短。
5. 如何利用 Batch API(离线批处理模式)获得五折优惠?
对于非实时性任务(如数据清洗、大批量文档离线总结、情感打标),可以使用 OpenAI 或 Anthropic 的 Batch API。提交批量作业并在 24 小时内异步获取结果,官方通常提供立减 50% 的半价折扣,并拥有独立的速率限制配额。