指南

什么是 Token 优化?降低 AI 成本完全指南

最后更新:2026 年 3 月

你发送给 LLM 的每一个 token 都在花钱。而大多数提示词中,有 40-70% 的 token 是模型并不需要的冗余。Token 优化在它们到达 API 之前将其移除——降成本,不降质量。

目录

  1. 什么是 Token 优化?
  2. 什么是 AI Token?
  3. 为什么 Token 优化在 2026 年至关重要
  4. Token 优化如何运作
  5. Token 优化 vs 提示词工程
  6. 真实世界的节省
  7. Token 优化工具
  8. 用 Terse 快速上手

什么是 Token 优化?

Token 优化是指在不降低输出质量的前提下,系统性减少发送给大语言模型(LLM)以及从其接收的 token 数量的过程。它在提示词和上下文窗口到达模型之前应用各种压缩技术——包括赘词去除、去重、拼写纠正和短语精简——从而带来更低的成本、更快的响应,以及对有限上下文窗口更高效的利用。

其原理并不复杂:人类书写的文本天然存在冗余。当我们给 ChatGPT、Claude 或任何 LLM 写提示词时,总会夹带赘词、含糊措辞、客套话、多余的限定语和啰嗦的句式——它们对模型几乎不携带任何信息。微软的研究(LLMLingua 论文,EMNLP 2023)表明,典型提示词中 40-70% 的 token 可以移除,而模型的输出质量没有任何可测量的变化。

Token 优化把这一发现变成了实用工具。与其手动把每条提示词改写得更精炼,token 优化工具会自动检测并移除冗余——实时进行、覆盖每条提示词、贯穿每次会话。结果是:你从 LLM 得到同等质量的回答,却只需为明显更少的 token 付费。

这并不是把提示词写得敷衍,也不是删除重要上下文。Token 优化专门针对人类自然而然添加、但 LLM 并不需要的语言脚手架。"I was wondering if you could perhaps" 变成 "can you";"What I would really like you to do is" 变成一条直接的请求。意思完全相同,token 成本却不同。

什么是 AI Token?

在深入优化之前,先理解 token 到底是什么、它为什么与成本相关,会很有帮助。

Token 是大语言模型处理文本的基本单位。Token 既不是单词、字符,也不是句子——它们是由分词器(通常是 BPE,字节对编码)生成的子词单元。在实践中,一个 token 大约对应 3-4 个英文字符,或约 0.75 个英文单词。单词 "optimization" 是两个 token,"the" 是一个 token。像 "Please help me write a function" 这样的短句约为 7 个 token。

所有主流 LLM 提供商都按 token 对 API 计费:

以下是 2026 年主流模型的定价:

模型                输入(每 100 万 token)  输出(每 100 万 token)
Claude Opus 4       $15.00                  $75.00
Claude Sonnet 4     $3.00                   $15.00
GPT-4o              $2.50                   $10.00
GPT-4.5             $75.00                  $150.00
Gemini 2.5 Pro      $1.25                   $10.00

按这个价格,token 用量的账很快就会累积起来。一位用 Claude Opus 4 进行 40 轮编程会话的开发者,可能消耗 210,000 个输入 token 和 45,000 个输出 token——单个任务就要 6.53 美元。如果 token 优化把输入 token 减少 50%,会话成本就降到 4.96 美元。每天跑 10 次会话、每周 5 天,一个月复利下来能省 300 多美元。

上下文窗口是另一个维度。每个模型都有最大上下文长度——单次请求所能处理的 token 总数上限。Claude 的 200K 上下文窗口和 Gemini 的 1M 窗口固然慷慨,但 agent 会话很快就能填满它们。上下文窗口一满,模型要么截断较早的对话历史(丢失信息),要么会话必须重启。Token 优化通过在同样的 token 预算里装进更多有效内容,延展了上下文窗口的实际容量。

为什么 Token 优化在 2026 年至关重要

对任何在规模化使用或构建 LLM 应用的人来说,token 优化已经从"锦上添花"变成了必需品。三个趋势的汇合让它在 2026 年变得至关重要。

1. Agent 会话让 Token 用量爆炸式增长

AI 编程 agent 的兴起——Claude Code、Cursor、Windsurf、Aider、OpenClaw——从根本上改变了 token 的消耗方式。2024 年,大部分 LLM 使用是单发式的:一条提示词,一条回复。2026 年,主导模式变成了多轮 agent 会话:为完成一个任务,模型被调用 20 次、40 次甚至 100 多次。

Agent 会话的每一轮都会把完整的对话历史塞进提示词。第 3 轮写下的一句赘语,会作为上下文在第 4 到第 40 轮被反复重发。这形成了一种复利效应:早期的冗余会在此后每次 API 调用中成倍放大。一句 15 个 token 的多余句子,在剩余 37 轮中反复出现,就要花掉 555 个 token——而这只是一次会话里的一句话。

Terse 的 agent 监控器曾跟踪到单个编程任务累计输入 token 超过 500,000 的会话。按 Claude Opus 4 的价格,仅输入 token 就是 7.50 美元。哪怕只优化 30%,每个任务也能省 2.25 美元——在大多数开发团队的运行规模下,这是一笔实实在在的节省。

2. 企业 AI 预算正被严格审视

随着组织从 AI 试验走向生产部署,财务团队开始对 API 成本刨根问底。一支 10 人的开发团队,每人每天跑 5-8 次 agent 会话,每月的 LLM API 开销轻松达到 5,000-15,000 美元。Token 优化能直接、可度量地削减这笔支出,而不需要开发者改变工作流,也不必换用能力更弱的模型。

ROI 的计算很简单:如果一个 token 优化工具每个席位每月 8 美元,却能省下 200-500 美元的 API 成本,它的回报是自身成本的 25-60 倍。这就是为什么 token 优化已与模型访问、向量数据库和可观测性工具并列,成为 AI 基础设施预算中的一个固定项目。

3. 上下文窗口效率决定 Agent 质量

更大的上下文窗口本应解决长对话中的信息丢失问题。但它没有。研究一再表明,模型对埋在长上下文中间的信息表现更差(Liu 等人 2023 年记录的"lost in the middle"问题)。上下文窗口里的 token 更多并不意味着表现更好——往往适得其反,模型会在噪音中难以聚焦到相关信息。

Token 优化直接解决这一点。移除冗余 token 后,上下文窗口中的信噪比提高了。模型看到的文本更少,但看到的每一句都信息密度更高。结果是注意力分配更佳、回答更准确,模型忽略或违背先前上下文的情况也更少。Token 优化不只是省钱的手段——它同时是提质的手段。

Token 优化如何运作

Token 优化涵盖了从简单的空白清理到复杂的语言学分析等一系列技术。最有效的方案会把多种技术组合成一条分阶段处理文本的管线。下面以 Terse 的 7 级管线为参考实现,说明现代 token 优化的工作方式。

第 1 级:代码块保护

在任何优化开始之前,系统会识别并抽出绝不能被修改的内容:代码块(围栏式和缩进式)、行内代码、URL、文件路径和命令行参数。这些内容被占位符替换,并在优化完成后还原。这一点至关重要——token 优化必须对技术内容是安全的。代码块内一处错误的优化就可能引入 bug 或改变程序行为。

第 2 级:拼写纠正

错别字以两种方式浪费 token。其一,拼错的单词往往会被切分成比正确形式更多的子词单元(错拼 "optmization" 变成 3 个 token 而不是 2 个)。其二,错别字可能让模型困惑,产生更长或更不准确的回复,消耗额外的输出 token。拼写纠正在这些错误到达模型之前将其修复,既使用针对常见技术错拼的内置词典,也借助系统级拼写检查器扩大覆盖面。

第 3 级:空白规整

连续多个空格、过多的空行、行尾空白,以及代码块之外不一致的缩进,都在消耗 token 却不增加任何含义。空白规整把它们压缩到最简形式。仅这一项通常就能在真实提示词中省下 2-5% 的 token,尤其是从编辑器或格式混乱的文档中粘贴的文本。

第 4 级:模式优化

模式优化应用 20 多条确定性的文本转换规则,把啰嗦的短语替换为简洁的等价表达。这些规则源自对数千条真实提示词的分析,总结出最常见的冗长模式。例如:

单条替换看似微小,但在整条提示词中会不断累积。一条 500 词的提示词通常包含 8-15 处这类模式,仅模式优化一项就能累计省下 30-60 个 token。

第 5 级:NLP 分析

这一级针对四类人类下意识添加、但对 LLM 没有益处的语言冗余:

第 6 级:电报式压缩

为了实现最大压缩(在 Aggressive 模式下可用),电报式压缩借鉴了电报时代的通信技巧:去掉冠词("the"、"a"、"an")、在语义不受影响时省略助动词、将常见短语缩写化,并把被动句改为主动语态。得到的文本读起来更像速记,但传达给模型的指令一模一样。

第 7 级:代码块还原

第 1 级保护起来的所有内容被原封不动地还原。最终输出是一条压缩后的提示词:代码分毫未动、自然语言更精炼、拼写全部正确——随时可以发送给模型。

Token 优化 vs 提示词工程

Token 优化与提示词工程互为补充,但本质上是两门不同的学科。理解这一区别很重要,因为它们解决不同的问题、作用于不同的层面。

维度Token 优化提示词工程
目标在不改变含义的前提下减少 token 数通过更好的指令提升输出质量
运行时机自动,作用于每条提示词手动,发生在提示词设计阶段
作用范围所有文本——提示词、上下文、历史系统提示词与模板
所需技能无(全自动)较高(需要领域专业知识)
主要收益降低成本、提升上下文效率改善输出质量
可组合性是——可优化任何提示词因提示词而异——每个模板需单独打磨
能否处理用户输入能——适用于动态的自由文本不能——只作用于预先设计的模板

提示词工程关注你说什么:选择正确的指令、组织 few-shot 示例、指定输出格式,以及设计能引出高质量回答的系统提示词。它是设计期的活动——你精心打造一个提示词模板,然后反复使用。

Token 优化关注你说得有多高效:剥离任何待发送文本中的语言开销,无论那是精心设计的系统提示词,还是随手敲下的用户消息。它是运行期的活动——自动作用于每一条提示词。

最有效的做法是两者兼用。一条既经过精心设计、又做过 token 优化的提示词,能以最低的 token 成本换来高质量的输出。你为质量设计提示词,让优化负责效率。两种实践相互加强:提示词工程确保正确的信息到达模型,token 优化确保只有正确的信息到达模型——不带稀释信号的赘料。

更关键的是,token 优化覆盖了提示词工程鞭长莫及的文本:用户生成的输入。当开发者在 Claude Code 里敲下一个随想的问题、或往 ChatGPT 里粘贴一份 bug 报告时,这些文本没有经过任何提示词工程,带着自然人类写作的全部冗余。Token 优化会自动压缩它们,在 API 成本中最大、最不可控的那部分上创造节省。

真实世界的节省

Token 优化的理论节省已有充分依据:自然语言内容可削减 40-70%,这既来自 LLMLingua 的研究,也来自 Terse 部署的实测数据。但这些百分比在实践中意味着什么?

40-70%
自然语言的 token 削减率
210K
典型 agent 会话 token(优化前)
~90K
优化后(节省 57%)

案例研究:Claude Code Agent 会话

Terse 的 agent 监控器跟踪了一次真实的 Claude Code 会话——一个跑了 42 轮的重构任务,数据如下:

指标                  优化前                 优化后
输入 token 总量       210,847                90,064
输出 token 总量       45,231                 45,231(不变)
会话成本              $6.54                  $3.74
节省                  —                      $2.80 (43%)
处理耗时              —                      合计 <12ms

输出 token 保持不变,因为 token 优化只压缩输入——即你发送的提示词和上下文。模型回复的长度取决于任务本身,而不是你的提示词有多啰嗦。这正是核心洞察:输出一模一样,输入成本显著更低。

随时间累积的影响

对一位每天跑 6 次 agent 会话、每周 5 天的职业开发者来说,数字很快就会滚起来:

以上采用保守估计(43% 压缩率、Claude Opus 4 定价)。使用 GPT-4.5(输入 $75/M token)等更昂贵模型的团队,节省会成比例放大。一次 210K 输入 token 的 GPT-4.5 agent 会话,优化前 15.81 美元、优化后 6.76 美元——单次会话就省 9.05 美元。

上下文窗口效率增益

除了直接省钱,token 优化还延展了上下文窗口的有效容量。在上面那次 210K token 的会话中,优化后只用了 90K token 的上下文——在 Claude 的 200K 窗口内还剩 110K 的富余。这意味着会话可以跑得更久才触发上下文截断、被迫重启的次数更少,而且后期各轮的表现更好——因为上下文里装的是密实的信息,而不是填充的赘料。

选择性上下文技术与 token 优化结合使用的团队反馈,会话在触及上下文上限前能多跑 60-80%,直接转化为更少的任务中断和更少的重复劳动。

Token 优化工具

2026 年的 token 优化生态包含几种路线,各有取舍。以下是主要选项的对比。

Terse

Terse 是一款 macOS 上的本机 token 优化器兼 agent 监控器。它对提示词实时应用 7 级压缩管线,以亚毫秒级的处理延迟实现 40-70% 的 token 削减。Terse 通过 macOS 辅助功能 API 直接对接 Claude Code、ChatGPT、Cursor、Aider 等 LLM 界面——不需要浏览器扩展、API 代理或改动代码。所有处理都在你的机器本地运行,提示词永远不会离开你的设备。

Terse 的独特之处在于把提示词优化与 agent 会话监控合二为一。除了压缩 token,它还跟踪每轮成本、检测重复工具调用、监控上下文窗口用量,并生成 CLAUDE.md 规则来预防 agent 的浪费行为。它不只是在减少 token——它让你看清 AI 预算究竟花在了哪里。

LLMLingua / LLMLingua-2

LLMLingua 是微软研究院开创基于模型的提示词压缩的学术框架。它用一个较小的 LLM 来识别并移除低信息量 token。压缩质量出色,但需要 GPU(或调用托管模型的 API),每次压缩增加 200-500ms 延迟,且面向批处理/离线场景设计,而非实时交互工作流。LLMLingua-2 通过训练的分类器提升了速度,但仍需神经网络推理。

手动改写提示词

最朴素的办法:把提示词亲手改得更精炼。对于一次设计、反复使用的系统提示词和模板,这很有效。但它无法扩展到动态的用户输入、对话历史,或随每轮增长的 agent 会话上下文。它需要自律、领域知识和时间——而且只能作用于你可控的文本,管不了用户产生的文本。

API 层面的提示词缓存

Anthropic 等提供商提供提示词缓存:重复出现的提示词前缀按折扣价计费(通常是标准输入价的 10%)。这能降低提示词中静态部分(系统消息、few-shot 示例)的成本,但帮不了动态部分(用户输入、对话历史)——而冗余恰恰最集中在那里。Token 优化与提示词缓存是互补的:优化动态内容、缓存静态内容,组合起来的节省最大。

用 Terse 快速上手

用 Terse 搭好 token 优化只需不到两分钟。以下是快速上手流程。

第 1 步:下载

GitHub Releases 页面下载最新的 Terse DMG。打开 DMG,把 Terse 拖进"应用程序"文件夹。首次启动时,右键点按应用并选择"打开"以绕过 macOS Gatekeeper(Terse 尚未经过 Apple 签名)。

第 2 步:授予辅助功能权限

Terse 使用 macOS 辅助功能 API 读写已连接应用中的文本。前往系统设置 → 隐私与安全性 → 辅助功能,点击 + 按钮,添加 Terse。没有这个权限,你仍然可以在手动复制粘贴模式下使用 Terse,但自动捕获与替换会被禁用。

第 3 步:连接你的应用

Cmd+Shift+T 打开 Terse 主窗口。Terse 会自动检测受支持的应用——ChatGPT(Chrome/Safari)、Claude Code、Cursor、Aider 和 OpenClaw。当你聚焦到一个已连接的应用时,Terse 弹出条会出现在屏幕顶部,显示实时优化统计。

第 4 步:选择模式

在弹出条中切换三种优化级别:

第 5 步:开始优化

在手动模式(默认)下,点击捕获从活跃应用读取文本,在弹出条中检查优化结果,然后点击替换把优化后的文本写回,或点击复制自行粘贴。开启自动模式可获得随输入持续运行的免手动优化。

关于详细配置选项、键盘快捷键,以及 agent 监控和 CLAUDE.md 规则生成等高级功能,请参阅完整的 Terse 文档

今天就开始节省 Token

Terse 以零延迟把 AI token 成本降低 40-70%。本机运行、隐私安全,兼容所有主流 LLM。提供免费档。

下载 Terse

延伸阅读

探索 Terse token 优化管线背后的研究与技术: