最后更新:2026 年 3 月 · 价格核实于 2026 年 3 月
2026 年,最便宜与最昂贵的 AI 模型之间价差超过 100 倍。取决于你选择哪个模型、提示词写得多高效,单次 agent 会话的成本可以在 0.02 美元到 45 美元之间浮动。本指南拆解每个主流模型的定价,对比真实的按任务成本,并展示 token 优化如何把经济账扭转到对你有利的一边。
在对比具体模型之前,值得先弄清 AI token 定价的实际运作方式。所有商用 LLM 都按 token 计费——token 是文本的小单位,大约对应四分之三个英文单词。单词 "understanding" 是两个 token,短语 "Please help me write a function that" 是九个 token。一段典型的自然语言段落大约是 60 到 100 个 token。
价格按每百万 token(MTok)报价,每个模型有三个需要区分的价格点:
输入 token 是你发送给模型的内容:指令、上下文、对话历史、系统提示词,以及你附上的任何文档或代码。这是模型读取你提示词的费用。输入价格几乎总是低于输出价格,因为读取的计算成本低于生成。对大多数工作流来说,输入 token 的数量远超输出——一条典型提示词可能是 2,000 个 token,回复只有 500 个。在 Claude Code 或 Cursor 这类带工具的 agent 会话中,这个比例还会进一步倾斜:模型为了生成每一次简短的工具调用,都要读取数千行代码上下文。
输出 token 是模型针对你的提示词生成的内容,包括实际的回答、写出的代码、推理过程,以及工具调用参数。输出 token 更贵——通常是输入价格的 3 到 5 倍——因为生成需要串行计算:每个输出 token 都依赖之前的所有 token,天然比输入侧的并行处理更昂贵。对编程任务来说,输出成本常常主导账单,因为模型会生成冗长的代码块、解释说明和多步工具调用序列。
缓存价格是最新、影响也最大的维度。当你在多次请求中发送相同的前缀(系统提示词、对话历史或文档上下文)时,提供商可以缓存首次请求的 KV(键值)表示并在后续请求中复用。缓存的输入 token 便宜得多——通常比标准输入价低 90%。Anthropic、OpenAI 和 Google 现在都提供某种形式的提示词缓存,只是实现方式各异。对每一轮都要重发相同上下文的 agent 会话而言,真正决定成本的是缓存价格。一次 200K token 的 agent 会话,如果每轮输入的 90% 命中缓存,实际花费只是牌面输入价的一小部分。
下表列出了通过商用 API 可用的各主流模型当前的每百万 token 定价。价格单位为美元。
| 模型 | 输入 / MTok | 输出 / MTok | 缓存读取 / MTok | 上下文窗口 |
|---|---|---|---|---|
| Anthropic (Claude) | ||||
| Claude Opus 4 | $15.00 | $75.00 | $1.50 | 200K |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 | 200K |
| Claude Haiku 3.5 | $0.80 | $4.00 | $0.08 | 200K |
| OpenAI | ||||
| GPT-4o | $2.50 | $10.00 | $1.25 | 128K |
| GPT-4o-mini | $0.15 | $0.60 | $0.075 | 128K |
| o1 | $15.00 | $60.00 | $7.50 | 200K |
| Google (Gemini) | ||||
| Gemini 2.0 Flash | $0.10 | $0.40 | $0.025 | 1M |
| Gemini 1.5 Pro | $1.25 | $5.00 | $0.3125 | 2M |
价差惊人。发送 100 万个输入 token,在 Gemini 2.0 Flash 上花 0.10 美元,在 Claude Opus 4 或 o1 上要 15.00 美元——相差 150 倍。输出价格的跨度类似:Gemini Flash 每 MTok 0.40 美元,Claude Opus 4 则是 75.00 美元,相差 187 倍。这不是可以忽略的边际差异。给任务选错模型,或把不必要的冗长提示词发给昂贵的模型,能把一个 0.50 美元的工作流变成 50 美元。
缓存价格缩小了多轮工作流的差距,但没有消除它。Claude Opus 4 的缓存输入价 $1.50/MTok,仍是 Gemini Flash 缓存价 $0.025/MTok 的 60 倍。模型选择的经济账会在 agent 会话的每一轮上复利放大。
裸的每百万 token 价格很难有直观感受。真正重要的是一个真实任务到底要花多少钱。以下是三个常见场景在各模型上的具体成本,按典型的输入输出比例估算。
约 500 输入 / 约 200 输出 token
约 5K 输入 / 约 1K 输出 token
约 200K 输入 / 约 50K 输出(40 轮)
Agent 会话这一列才是数字变得真实的地方。一位每天跑 10 次 Claude Opus 4 agent 会话的开发者,每天在 API token 上就要花 67.50 美元,一个月约 1,350 美元。同样的会话换成 Sonnet 4,每月 270 美元;换成 Gemini 2.0 Flash,月账单降到 8 美元。这些不是假想的推演——它们反映的是 2025 年至 2026 年间开发者使用 Claude Code、Cursor 等 agent 工具的真实用量模式。
简单问答与 agent 会话之间的成本鸿沟,说明了为什么上下文窗口越大,单 token 效率就越呈指数级重要。提示词很短时,模型选择几乎无所谓——就算是 Opus 4,回答一个小问题也只要 0.02 美元。但当你在一次 40 轮编程会话的每一轮里都塞进 200,000 个 token 的上下文时,提示词里每一个浪费的 token 都被放大了 40 倍,模型之间的价差也就成了一杯咖啡与一期车贷的区别。
定价表告诉你每个 token 多少钱,却不会告诉你浪费了多少 token。实际上,大多数开发者在 token 上的花费比必要水平高出 30-50%,而浪费的来源往往并不显眼。
Agent 框架每一轮都会重发完整的对话历史。到第 20 轮,模型在重读它早已处理过的 19 轮上下文。如果你早期的提示词写得啰嗦,这份啰嗦现在正在每一次后续请求中被反复计费。第 1 轮里一条本可以 60 词却写了 100 词的提示词,那多出的 40 词要乘以会话剩余的每一轮。在一次 40 轮的 Opus 4 会话中,第 1 轮里一段不必要的冗长文字就能给总账单添上好几美元。
Agent 会话经常发出冗余的 API 调用:模型把同一个文件读两遍、同一条搜索再跑一次,或因为忘了自己已经取过数据而用相同参数再次调用工具。每次重复调用都会把完整的上下文窗口连同工具结果再过一遍模型。Terse 的 agent 监控器常规检测到会话中 5-15% 的工具调用属于重复,每一次都要为重读完整上下文付输入 token、为重复的响应付输出 token。
人写的提示词充满了花 token 却不加信息的模式。"I would really appreciate it if you could please" 与 "Please" 传达的指令完全相同——而 "Please" 本身与什么都不写也一样,因为 LLM 不需要客套就能给出好结果。LLMLingua(EMNLP 2023)的研究量化了这一点:典型提示词包含 40-70% 的冗余 token。含糊措辞("I think maybe")、赘词("basically"、"actually"、"just")、元语言("what I'm trying to do is")和过度限定,都在消耗模型处理时直接忽略的 token。
一个拼错的变量名、一个不正确的函数签名,或一条含混的指令,都可能让模型产出错误结果,进而引发一轮追加纠正——把整个上下文窗口再发送一遍。在 Opus 4 上,一次由错别字引发的、上下文为 100K token 的重试,光输入 token 就要 1.50 美元。错别字本身也许只有两个字符——但重试的代价是整个上下文窗口被重新处理一遍。在提示词发送之前、在入口处做拼写纠正,可以把这一整类浪费彻底消除。
许多提示词里塞满了 Markdown 标题、项目符号、加粗标记等格式字符——它们对阅读提示词的人有意义,对处理提示词的模型却无关紧要。一条充斥着 **bold**、### headers 和 - bullet points 的提示词,可能把 5-10% 的 token 预算花在格式字符上。去掉它们,模型的输出同样出色。
上面描述的隐性成本并非不可撼动。通过 token 优化——在提示词发送给模型之前进行压缩,去除冗余、保留模型真正需要的指令——它们可以被系统性地削减。
Terse 应用一条在本机运行、耗时不到 5 毫秒的 7 级优化管线。它对成本的影响相当可观,并会在 agent 会话中复利放大。以下是各类任务在使用 Terse Normal 模式(削减 25-40%)前后的数字对比:
| 场景 | 模型 | 使用 Terse 前 | 使用 Terse 后(削减 30%) | 节省 |
|---|---|---|---|---|
| 简单问答(500 token) | Opus 4 | $0.0225 | $0.0158 | $0.007 |
| 简单问答(500 token) | GPT-4o | $0.0033 | $0.0023 | $0.001 |
| 代码评审(5K token) | Opus 4 | $0.150 | $0.105 | $0.045 |
| 代码评审(5K token) | Sonnet 4 | $0.030 | $0.021 | $0.009 |
| Agent 会话(200K token) | Opus 4 | $6.75 | $4.73 | $2.02 |
| Agent 会话(200K token) | Sonnet 4 | $1.35 | $0.95 | $0.40 |
| Agent 会话(200K token) | GPT-4o | $1.00 | $0.70 | $0.30 |
| Agent 会话(200K token) | o1 | $6.00 | $4.20 | $1.80 |
就单次请求而言,一个简单问题上的节省看起来微不足道。但 agent 会话中的复利效应让数字变得可观。一位每天跑 10 次 Opus 4 agent 会话的开发者,每天省 20.20 美元,每月省 404 美元。一支五人开发团队,每月就是 2,020 美元——足以覆盖额外的工具、基础设施,或直接把 AI 预算砍掉四分之一。
节省还会进一步复利,因为 token 优化抑制了上下文窗口的增长。当第 1 到第 10 轮的提示词缩短 30% 时,第 11 到第 40 轮重发的累计上下文也随之缩短。一次 40 轮会话的实际节省通常比线性的 30% 再高 5-10 个百分点,因为压缩会沿着对话历史层层传导。
在 Aggressive 模式(削减 40-60%)下,节省大致翻倍。习惯了电报式提示词——更短、更直接、剥离所有赘料——的开发者,可以把 Opus 4 agent 会话的成本从 6.75 美元压到 3.00 美元以下。到那时,Opus 4 与 Sonnet 4 之间的成本差距已经小到:对于确实能体现质量差异的任务,直接选更强的模型也变得合理。
模型选择取决于两个因素:你在做什么,以及你愿意花多少钱。以下是一个基于任务类型和预算敏感度的决策框架。
简单查询、头脑风暴、解释说明和对话类任务。token 量低,几乎不需要上下文。
最划算:GPT-4o-mini($0.0002/次)或 Gemini 2.0 Flash($0.0001/次)
按规格编写函数、类和模块。上下文中等、输出量大,正确性对质量要求高。
最均衡:Claude Sonnet 4($0.030/次)或 GPT-4o($0.023/次)
多步逻辑、数学证明、架构决策、研究分析。准确性压倒一切。
最高质量:Claude Opus 4($0.15/任务)或 o1($0.135/任务)
带工具调用的长多轮会话:Claude Code、Cursor、Aider。token 量大,上下文逐轮增长。
最均衡:Claude Sonnet 4($1.35/会话)。省钱:Haiku 3.5($0.36/会话)
文档分类、数据提取、大规模摘要。请求数以千计,单位成本最重要。
最划算:Gemini 2.0 Flash($0.10/MTok)或 GPT-4o-mini($0.15/MTok)
处理大型 PDF、代码库或研究论文。需要大上下文窗口和强理解力。
最合适:Gemini 1.5 Pro(2M 上下文,$1.25/MTok)或 Claude Sonnet 4(200K,$3/MTok)
基本原则很简单:用能为你的任务产出可接受结果的最便宜模型。对大多数编程工作流,Claude Sonnet 4 或 GPT-4o 在能力与成本之间的平衡最好。Opus 4 和 o1 留给它们更强的推理确实能带来可度量提升的任务——复杂的架构决策、隐蔽的 bug 分析,或换成便宜模型就得多次重试(重试本身也要花 token)的多文件重构。
对于数据处理、分类和提取这类高吞吐工作,Gemini 2.0 Flash 和 GPT-4o-mini 独一档。分别以每百万输入 token 0.10 和 0.15 美元的价格,它们让那些在前沿模型上贵得离谱的任务变得经济可行。质量差距是真实存在的——这些模型在复杂推理上比不了 Opus 4——但对于结构清晰、定义明确的任务,它们能以极小的成本达到相近的表现。
还有一个重要的考量:最便宜的模型未必是最便宜的选择。如果一个廉价模型要两次尝试才能得到正确答案,而更贵的模型一次就对,那廉价模型实际反而更贵。每次重试都要重发完整的上下文窗口。在一次 100K token 的 agent 会话中,Sonnet 4 上的一次重试要 0.30 美元的输入 token。如果更贵的 Opus 4 避免了那次重试,你为 Opus 4 输入价多付的 0.15 美元就被抵消了。真正的成本指标不是每 token 的价格,而是每个成功结果的价格。
Token 优化与模型无关。不管你把提示词发给 Opus 4、GPT-4o-mini 还是 Gemini Flash,里面的冗余都同样存在。Terse 之所以对所有模型都有效,是因为它工作在提示词层面——在文本到达任何 API 之前。
Terse 的优化管线处理的是纯文本。它不依赖任何模型的分词器、API 格式或定价结构。无论提示词发往 Anthropic、OpenAI 还是 Google,压缩的应用方式完全一致。赘词就是赘词,不管终点是哪个模型;含糊措辞在每家提供商那里都要花 token。Terse 在 Normal 模式下实现的 30-40% 削减,会在任何模型、任何价位上直接转化为 30-40% 更少的计费 token。
优化的美元价值与模型价格成正比。在 Gemini Flash 上削减 30%,每百万 token 省 0.03 美元;同样的 30% 在 Opus 4 上,每百万 token 省 4.50 美元——同一次优化,美元收益放大 150 倍。这意味着 Terse 在最贵的模型上回本最快,而这些模型恰恰是开发者最不愿在质量上妥协的。与其从 Opus 4 降级到便宜模型,不如继续用最好的模型,通过压缩提示词来降低它的实际成本。
在提示词压缩之外,Terse 的 agent 监控能力让你实时看清 token 都去了哪里。监控面板跟踪每个 agent 会话的输入 token、输出 token、缓存命中、工具调用和累计成本;标记重复工具调用,检测冗余文件读取,并在上下文占用超过 85% 时发出警报。这些洞察帮你优化的不只是提示词,而是整个工作流——找出 agent 浪费 token 的模式,进而调整做法,或更新你的 CLAUDE.md 规则,让浪费不再重演。
大多数开发者每天跑的不是一次 agent 会话,而是五次、十次、二十次。Token 优化的节省在会话之间线性累积,在单次会话内部(由于上下文窗口重发)则指数放大。一位用 Terse 优化提示词、每天跑 10 次 Sonnet 4 agent 会话的开发者,大约每天省 4.00 美元、每月省 80 美元、每年省 960 美元。换成 Opus 4,同样的用量模式每天省 20 美元、每月 400 美元、每年 4,800 美元。团队的话,按人数相乘即可。
算术很简单,含义却很重大:对在意成本的开发者来说,token 优化不是可有可无的点缀。按 2026 年当前的价格水平,它是直接作用于你 AI 预算的一项输入,并随你运行的每一次会话复利增长。
Terse 在提示词到达任何 API 之前将其压缩 30-60%。本机运行、耗时不到 5 毫秒,兼容 Claude、GPT、Gemini 及所有其他模型。在 agent 监控面板中实时查看你的节省。
下载 Terse探索更多降低 AI 成本的指南与技术: