什么是 Token 优化?降低 AI 成本完全指南
你发送给 LLM 的每一个 token 都在花钱。而大多数提示词中,有 40-70% 的 token 是模型并不需要的冗余。Token 优化在它们到达 API 之前将其移除——降成本,不降质量。
目录
什么是 Token 优化?
其原理并不复杂:人类书写的文本天然存在冗余。当我们给 ChatGPT、Claude 或任何 LLM 写提示词时,总会夹带赘词、含糊措辞、客套话、多余的限定语和啰嗦的句式——它们对模型几乎不携带任何信息。微软的研究(LLMLingua 论文,EMNLP 2023)表明,典型提示词中 40-70% 的 token 可以移除,而模型的输出质量没有任何可测量的变化。
Token 优化把这一发现变成了实用工具。与其手动把每条提示词改写得更精炼,token 优化工具会自动检测并移除冗余——实时进行、覆盖每条提示词、贯穿每次会话。结果是:你从 LLM 得到同等质量的回答,却只需为明显更少的 token 付费。
这并不是把提示词写得敷衍,也不是删除重要上下文。Token 优化专门针对人类自然而然添加、但 LLM 并不需要的语言脚手架。"I was wondering if you could perhaps" 变成 "can you";"What I would really like you to do is" 变成一条直接的请求。意思完全相同,token 成本却不同。
什么是 AI Token?
在深入优化之前,先理解 token 到底是什么、它为什么与成本相关,会很有帮助。
Token 是大语言模型处理文本的基本单位。Token 既不是单词、字符,也不是句子——它们是由分词器(通常是 BPE,字节对编码)生成的子词单元。在实践中,一个 token 大约对应 3-4 个英文字符,或约 0.75 个英文单词。单词 "optimization" 是两个 token,"the" 是一个 token。像 "Please help me write a function" 这样的短句约为 7 个 token。
所有主流 LLM 提供商都按 token 对 API 计费:
- 输入 token — 你的提示词中的 token,包括系统指令、对话历史和当前消息。这是你发送给模型的部分。
- 输出 token — 模型在回复中生成的 token。通常比输入 token 贵 3-5 倍。
- 缓存 token — 部分提供商(尤其是 Anthropic 的 Claude)对与此前发送内容相匹配的 token 提供折扣价,鼓励保持一致的提示词结构。
以下是 2026 年主流模型的定价:
模型 输入(每 100 万 token) 输出(每 100 万 token) Claude Opus 4 $15.00 $75.00 Claude Sonnet 4 $3.00 $15.00 GPT-4o $2.50 $10.00 GPT-4.5 $75.00 $150.00 Gemini 2.5 Pro $1.25 $10.00
按这个价格,token 用量的账很快就会累积起来。一位用 Claude Opus 4 进行 40 轮编程会话的开发者,可能消耗 210,000 个输入 token 和 45,000 个输出 token——单个任务就要 6.53 美元。如果 token 优化把输入 token 减少 50%,会话成本就降到 4.96 美元。每天跑 10 次会话、每周 5 天,一个月复利下来能省 300 多美元。
上下文窗口是另一个维度。每个模型都有最大上下文长度——单次请求所能处理的 token 总数上限。Claude 的 200K 上下文窗口和 Gemini 的 1M 窗口固然慷慨,但 agent 会话很快就能填满它们。上下文窗口一满,模型要么截断较早的对话历史(丢失信息),要么会话必须重启。Token 优化通过在同样的 token 预算里装进更多有效内容,延展了上下文窗口的实际容量。
为什么 Token 优化在 2026 年至关重要
对任何在规模化使用或构建 LLM 应用的人来说,token 优化已经从"锦上添花"变成了必需品。三个趋势的汇合让它在 2026 年变得至关重要。
1. Agent 会话让 Token 用量爆炸式增长
AI 编程 agent 的兴起——Claude Code、Cursor、Windsurf、Aider、OpenClaw——从根本上改变了 token 的消耗方式。2024 年,大部分 LLM 使用是单发式的:一条提示词,一条回复。2026 年,主导模式变成了多轮 agent 会话:为完成一个任务,模型被调用 20 次、40 次甚至 100 多次。
Agent 会话的每一轮都会把完整的对话历史塞进提示词。第 3 轮写下的一句赘语,会作为上下文在第 4 到第 40 轮被反复重发。这形成了一种复利效应:早期的冗余会在此后每次 API 调用中成倍放大。一句 15 个 token 的多余句子,在剩余 37 轮中反复出现,就要花掉 555 个 token——而这只是一次会话里的一句话。
Terse 的 agent 监控器曾跟踪到单个编程任务累计输入 token 超过 500,000 的会话。按 Claude Opus 4 的价格,仅输入 token 就是 7.50 美元。哪怕只优化 30%,每个任务也能省 2.25 美元——在大多数开发团队的运行规模下,这是一笔实实在在的节省。
2. 企业 AI 预算正被严格审视
随着组织从 AI 试验走向生产部署,财务团队开始对 API 成本刨根问底。一支 10 人的开发团队,每人每天跑 5-8 次 agent 会话,每月的 LLM API 开销轻松达到 5,000-15,000 美元。Token 优化能直接、可度量地削减这笔支出,而不需要开发者改变工作流,也不必换用能力更弱的模型。
ROI 的计算很简单:如果一个 token 优化工具每个席位每月 8 美元,却能省下 200-500 美元的 API 成本,它的回报是自身成本的 25-60 倍。这就是为什么 token 优化已与模型访问、向量数据库和可观测性工具并列,成为 AI 基础设施预算中的一个固定项目。
3. 上下文窗口效率决定 Agent 质量
更大的上下文窗口本应解决长对话中的信息丢失问题。但它没有。研究一再表明,模型对埋在长上下文中间的信息表现更差(Liu 等人 2023 年记录的"lost in the middle"问题)。上下文窗口里的 token 更多并不意味着表现更好——往往适得其反,模型会在噪音中难以聚焦到相关信息。
Token 优化直接解决这一点。移除冗余 token 后,上下文窗口中的信噪比提高了。模型看到的文本更少,但看到的每一句都信息密度更高。结果是注意力分配更佳、回答更准确,模型忽略或违背先前上下文的情况也更少。Token 优化不只是省钱的手段——它同时是提质的手段。
Token 优化如何运作
Token 优化涵盖了从简单的空白清理到复杂的语言学分析等一系列技术。最有效的方案会把多种技术组合成一条分阶段处理文本的管线。下面以 Terse 的 7 级管线为参考实现,说明现代 token 优化的工作方式。
第 1 级:代码块保护
在任何优化开始之前,系统会识别并抽出绝不能被修改的内容:代码块(围栏式和缩进式)、行内代码、URL、文件路径和命令行参数。这些内容被占位符替换,并在优化完成后还原。这一点至关重要——token 优化必须对技术内容是安全的。代码块内一处错误的优化就可能引入 bug 或改变程序行为。
第 2 级:拼写纠正
错别字以两种方式浪费 token。其一,拼错的单词往往会被切分成比正确形式更多的子词单元(错拼 "optmization" 变成 3 个 token 而不是 2 个)。其二,错别字可能让模型困惑,产生更长或更不准确的回复,消耗额外的输出 token。拼写纠正在这些错误到达模型之前将其修复,既使用针对常见技术错拼的内置词典,也借助系统级拼写检查器扩大覆盖面。
第 3 级:空白规整
连续多个空格、过多的空行、行尾空白,以及代码块之外不一致的缩进,都在消耗 token 却不增加任何含义。空白规整把它们压缩到最简形式。仅这一项通常就能在真实提示词中省下 2-5% 的 token,尤其是从编辑器或格式混乱的文档中粘贴的文本。
第 4 级:模式优化
模式优化应用 20 多条确定性的文本转换规则,把啰嗦的短语替换为简洁的等价表达。这些规则源自对数千条真实提示词的分析,总结出最常见的冗长模式。例如:
- "in order to" 变成 "to"(每次出现省 2 个 token)
- "a large number of" 变成 "many"(省 4 个 token)
- "at this point in time" 变成 "now"(省 5 个 token)
- "due to the fact that" 变成 "because"(省 4 个 token)
- "in the event that" 变成 "if"(省 4 个 token)
- "is able to" 变成 "can"(省 2 个 token)
- "take into consideration" 变成 "consider"(省 2 个 token)
单条替换看似微小,但在整条提示词中会不断累积。一条 500 词的提示词通常包含 8-15 处这类模式,仅模式优化一项就能累计省下 30-60 个 token。
第 5 级:NLP 分析
这一级针对四类人类下意识添加、但对 LLM 没有益处的语言冗余:
- 赘词:"just"、"actually"、"basically"、"really"、"very"、"quite"、"simply"、"literally"。这些词在人类对话中起强调作用,但对解析指令的 LLM 来说信息量为零。
- 含糊措辞:"I think"、"maybe"、"perhaps"、"it seems like"、"I believe"、"it might be"。LLM 不需要你表达不确定——无论你是否含糊其辞,它都会给出同样的回答。
- 客套话:"please"、"could you kindly"、"would you mind"、"I would appreciate if"、"thank you in advance"。模型不会因为被礼貌地请求就更卖力。这些短语花掉 token,却不影响输出质量。
- 元语言:"I want you to"、"what I need is"、"the thing is"、"here is what I am looking for"。这些自我指涉的铺垫先告诉模型你要问什么,然后你才真正问出来。铺垫本身就是冗余。
第 6 级:电报式压缩
为了实现最大压缩(在 Aggressive 模式下可用),电报式压缩借鉴了电报时代的通信技巧:去掉冠词("the"、"a"、"an")、在语义不受影响时省略助动词、将常见短语缩写化,并把被动句改为主动语态。得到的文本读起来更像速记,但传达给模型的指令一模一样。
第 7 级:代码块还原
第 1 级保护起来的所有内容被原封不动地还原。最终输出是一条压缩后的提示词:代码分毫未动、自然语言更精炼、拼写全部正确——随时可以发送给模型。
Token 优化 vs 提示词工程
Token 优化与提示词工程互为补充,但本质上是两门不同的学科。理解这一区别很重要,因为它们解决不同的问题、作用于不同的层面。
| 维度 | Token 优化 | 提示词工程 |
|---|---|---|
| 目标 | 在不改变含义的前提下减少 token 数 | 通过更好的指令提升输出质量 |
| 运行时机 | 自动,作用于每条提示词 | 手动,发生在提示词设计阶段 |
| 作用范围 | 所有文本——提示词、上下文、历史 | 系统提示词与模板 |
| 所需技能 | 无(全自动) | 较高(需要领域专业知识) |
| 主要收益 | 降低成本、提升上下文效率 | 改善输出质量 |
| 可组合性 | 是——可优化任何提示词 | 因提示词而异——每个模板需单独打磨 |
| 能否处理用户输入 | 能——适用于动态的自由文本 | 不能——只作用于预先设计的模板 |
提示词工程关注你说什么:选择正确的指令、组织 few-shot 示例、指定输出格式,以及设计能引出高质量回答的系统提示词。它是设计期的活动——你精心打造一个提示词模板,然后反复使用。
Token 优化关注你说得有多高效:剥离任何待发送文本中的语言开销,无论那是精心设计的系统提示词,还是随手敲下的用户消息。它是运行期的活动——自动作用于每一条提示词。
最有效的做法是两者兼用。一条既经过精心设计、又做过 token 优化的提示词,能以最低的 token 成本换来高质量的输出。你为质量设计提示词,让优化负责效率。两种实践相互加强:提示词工程确保正确的信息到达模型,token 优化确保只有正确的信息到达模型——不带稀释信号的赘料。
更关键的是,token 优化覆盖了提示词工程鞭长莫及的文本:用户生成的输入。当开发者在 Claude Code 里敲下一个随想的问题、或往 ChatGPT 里粘贴一份 bug 报告时,这些文本没有经过任何提示词工程,带着自然人类写作的全部冗余。Token 优化会自动压缩它们,在 API 成本中最大、最不可控的那部分上创造节省。
真实世界的节省
Token 优化的理论节省已有充分依据:自然语言内容可削减 40-70%,这既来自 LLMLingua 的研究,也来自 Terse 部署的实测数据。但这些百分比在实践中意味着什么?
案例研究:Claude Code Agent 会话
Terse 的 agent 监控器跟踪了一次真实的 Claude Code 会话——一个跑了 42 轮的重构任务,数据如下:
指标 优化前 优化后 输入 token 总量 210,847 90,064 输出 token 总量 45,231 45,231(不变) 会话成本 $6.54 $3.74 节省 — $2.80 (43%) 处理耗时 — 合计 <12ms
输出 token 保持不变,因为 token 优化只压缩输入——即你发送的提示词和上下文。模型回复的长度取决于任务本身,而不是你的提示词有多啰嗦。这正是核心洞察:输出一模一样,输入成本显著更低。
随时间累积的影响
对一位每天跑 6 次 agent 会话、每周 5 天的职业开发者来说,数字很快就会滚起来:
- 每日节省:6 次会话 x $2.80 = $16.80/天
- 每月节省:每位开发者约 $370/月
- 10 人团队:每月约省 $3,700 的 API 成本
- 团队年度:约 $44,400 的节省
以上采用保守估计(43% 压缩率、Claude Opus 4 定价)。使用 GPT-4.5(输入 $75/M token)等更昂贵模型的团队,节省会成比例放大。一次 210K 输入 token 的 GPT-4.5 agent 会话,优化前 15.81 美元、优化后 6.76 美元——单次会话就省 9.05 美元。
上下文窗口效率增益
除了直接省钱,token 优化还延展了上下文窗口的有效容量。在上面那次 210K token 的会话中,优化后只用了 90K token 的上下文——在 Claude 的 200K 窗口内还剩 110K 的富余。这意味着会话可以跑得更久才触发上下文截断、被迫重启的次数更少,而且后期各轮的表现更好——因为上下文里装的是密实的信息,而不是填充的赘料。
把选择性上下文技术与 token 优化结合使用的团队反馈,会话在触及上下文上限前能多跑 60-80%,直接转化为更少的任务中断和更少的重复劳动。
Token 优化工具
2026 年的 token 优化生态包含几种路线,各有取舍。以下是主要选项的对比。
Terse
Terse 是一款 macOS 上的本机 token 优化器兼 agent 监控器。它对提示词实时应用 7 级压缩管线,以亚毫秒级的处理延迟实现 40-70% 的 token 削减。Terse 通过 macOS 辅助功能 API 直接对接 Claude Code、ChatGPT、Cursor、Aider 等 LLM 界面——不需要浏览器扩展、API 代理或改动代码。所有处理都在你的机器本地运行,提示词永远不会离开你的设备。
Terse 的独特之处在于把提示词优化与 agent 会话监控合二为一。除了压缩 token,它还跟踪每轮成本、检测重复工具调用、监控上下文窗口用量,并生成 CLAUDE.md 规则来预防 agent 的浪费行为。它不只是在减少 token——它让你看清 AI 预算究竟花在了哪里。
LLMLingua / LLMLingua-2
LLMLingua 是微软研究院开创基于模型的提示词压缩的学术框架。它用一个较小的 LLM 来识别并移除低信息量 token。压缩质量出色,但需要 GPU(或调用托管模型的 API),每次压缩增加 200-500ms 延迟,且面向批处理/离线场景设计,而非实时交互工作流。LLMLingua-2 通过训练的分类器提升了速度,但仍需神经网络推理。
手动改写提示词
最朴素的办法:把提示词亲手改得更精炼。对于一次设计、反复使用的系统提示词和模板,这很有效。但它无法扩展到动态的用户输入、对话历史,或随每轮增长的 agent 会话上下文。它需要自律、领域知识和时间——而且只能作用于你可控的文本,管不了用户产生的文本。
API 层面的提示词缓存
Anthropic 等提供商提供提示词缓存:重复出现的提示词前缀按折扣价计费(通常是标准输入价的 10%)。这能降低提示词中静态部分(系统消息、few-shot 示例)的成本,但帮不了动态部分(用户输入、对话历史)——而冗余恰恰最集中在那里。Token 优化与提示词缓存是互补的:优化动态内容、缓存静态内容,组合起来的节省最大。
用 Terse 快速上手
用 Terse 搭好 token 优化只需不到两分钟。以下是快速上手流程。
第 1 步:下载
从 GitHub Releases 页面下载最新的 Terse DMG。打开 DMG,把 Terse 拖进"应用程序"文件夹。首次启动时,右键点按应用并选择"打开"以绕过 macOS Gatekeeper(Terse 尚未经过 Apple 签名)。
第 2 步:授予辅助功能权限
Terse 使用 macOS 辅助功能 API 读写已连接应用中的文本。前往系统设置 → 隐私与安全性 → 辅助功能,点击 + 按钮,添加 Terse。没有这个权限,你仍然可以在手动复制粘贴模式下使用 Terse,但自动捕获与替换会被禁用。
第 3 步:连接你的应用
用 Cmd+Shift+T 打开 Terse 主窗口。Terse 会自动检测受支持的应用——ChatGPT(Chrome/Safari)、Claude Code、Cursor、Aider 和 OpenClaw。当你聚焦到一个已连接的应用时,Terse 弹出条会出现在屏幕顶部,显示实时优化统计。
第 4 步:选择模式
在弹出条中切换三种优化级别:
- Soft:只做拼写纠正和空白处理。节省 2-5%,语义零改动。适合只想要干净文本、不想改动任何内容的场景。
- Normal:移除赘词、含糊措辞、客套话和元语言。节省 15-25%。日常使用的推荐默认值。
- Aggressive:最大压缩,包含电报式精简。节省 25-40%。适合每个 token 都要计较的高强度 agent 会话。
第 5 步:开始优化
在手动模式(默认)下,点击捕获从活跃应用读取文本,在弹出条中检查优化结果,然后点击替换把优化后的文本写回,或点击复制自行粘贴。开启自动模式可获得随输入持续运行的免手动优化。
关于详细配置选项、键盘快捷键,以及 agent 监控和 CLAUDE.md 规则生成等高级功能,请参阅完整的 Terse 文档。
延伸阅读
探索 Terse token 优化管线背后的研究与技术: