用OmniRoute节省95%Token成本
如果你整天运行Claude Code、Cursor或任何编码代理,Token才是真正的账单。OmniRoute承诺你可以通过一个开源网关,免费将这笔费用削减15%到95%。
这个范围是第一个值得停下来思考的地方。一个工具在一种情况下节省95%,在另一种情况下节省15%,它报告的不是一个数字。它报告的是几个不同的机制,叠加在一起,每个都有自己的声明隐藏在平均值中。
OmniRoute就是做出这个承诺的网关:一个端点,200多个提供商,内置压缩层。
这里有四个名字很重要:OmniRoute本身,以及它捆绑的三个工具——RTK、Caveman和LLMLingua-2,每个都是由不同的人为不同的原因构建的。
这篇文章将介绍所有四个,而不是孤立地介绍一个工具,因为真正的问题是它们中哪一个值得在你的工作流程中占有一席之地。
1、这些节省的市场,不仅仅是一个网关
我用Claude Code进行了所有测试,这是我每天使用的代理。但这四个工具都不是Claude专属的。RTK、Caveman和LLMLingua-2也适用于Codex、Cursor或任何开源模型。
然后我逐块分析了这个领域。
目前有四种选项可以解决同一个问题,但机制不同。
OmniRoute是一个免费的开源AI网关,由500多名贡献者在MIT许可证下构建。 它不发明压缩。它将别人的工作打包成一个堆叠的管道,并给结果打上一个数字:15%到95%。
RTK是一个独立的开源项目,它针对你的终端输出。它监视命令输出:git status、测试运行器、构建日志。49个过滤器决定什么保留。删除ANSI代码,删除进度条,保留失败和更改的文件名。
自己运行一下,区别立刻显现。
cargo install --git https://github.com/rtk-ai/rtk
rtk git status
在一个混乱的仓库上运行原始的git status会产生几千个Token的噪音。通过RTK管道处理后,相同的命令返回实际状态:哪些文件更改了,没有其他内容。
RTK是一个独立的Rust二进制文件。它可以在Claude Code、Cursor或Copilot前面工作,无需安装任何OmniRoute。它不依赖于网关。你今天就可以指向你的终端并自己检查输出。
Caveman对散文进行同样的处理,它本身就是一个独立的开源项目。它不是过滤命令输出,而是重写你自己的句子:删除填充词、犹豫和重复的上下文,同时保持代码块、数字和技术术语不变。
LLMLingua-2背后是一个真正的研究实验室,而不是独立的维护者。微软通过提炼GPT-4对提示中哪些Token承载意义、哪些不承载的判断来训练它,然后将该判断打包成一个可以在本地运行的小型分类器。
pip install llmlingua
from llmlingua import PromptCompressor
compressor = PromptCompressor()
result = compressor.compress_prompt(long_prompt, rate=0.3)
print(result["compressed_prompt"])
这三个工具背后是OmniRoute自己构建的四五个较小的引擎:删除跨轮次重复的文本,将JSON数组压缩成列,对巨大的日志块进行采样而不是发送全部。真实、有用,但范围比主要功能更窄。
2、数字背后的数学
OmniRoute不是通过运行一百个会话并平均结果来测量89%。它是计算出来的。
公式在文档中:
combined = 1 - (1 - RTK savings) × (1 - Caveman input savings)
代入OmniRoute为每个部分使用的数字,RTK为80%,Caveman为46%,你得到1 - (1-0.80) × (1-0.46),结果是89.2%。在RTK完整的声称范围(60%到90%)上运行相同的公式,组合数字在78.4%到94.6%之间移动。这是营销中15%到95%范围的大部分,在LLMLingua-2对任何存活的散文运行自己的处理之前。
公式是公开发布的,任何人都可以验证:两个真实的百分比,相乘。
但一个复合数字的可靠性取决于构建它的两个输入。
在围绕它构建成本预测之前,值得检查一下。
3、在数字之前:谁掌握着钥匙
在检查OmniRoute的数学是否成立之前,还有第二个值得问的问题:你信任持有你API密钥的东西吗?
默认情况下,OmniRoute以纯文本形式存储API密钥和OAuth令牌。加密是存在的,但只有在你自己设置STORAGE_ENCRYPTION_KEY的情况下。跳过这个步骤,每个凭据都在磁盘上可读。
护栏默认为失败开放。如果安全检查在请求中途抛出错误,注册表会记录它并继续。提示注入扫描默认为警告你,而不阻止请求。
2026年5月,Socket.dev标记了npm包的混淆代码和安装脚本。没有发现确认的恶意软件,但维护者修补了两个真正的漏洞。一位审查员的结论很直白:不要在受监管的环境中运行这个。
这些都不涉及RTK或Caveman的压缩数字是否真实。这是一个独立的风险,叠加在数学说的任何内容之上,值得在下一节回答另一个问题之前了解。
4、数字成立的地方,以及不成立的地方
这里有两个问题很重要。RTK的压缩数字是否经得起测试,Caveman的呢?
RTK大多成立。 OmniRoute自己的声称是60%到90%的命令输出。JetBrains对83个真实Claude Code会话的重放,以及对2,900多个实际开发命令的单独测量,达到了89%的噪音减少,不同命令类型之间存在真正的差异:cargo test减少了91.8%,git status减少了80.8%,grep只有49.5%。
我针对一个真实的260次提交的仓库运行了自己的版本:git log --stat -20,原始与通过RTK管道处理的对比。RTK自己的计数器报告了结果:1.6K输入Token,1.2K输出,节省了357个Token,23%。
低于主要数字,也低于2,900个命令的平均值,这可以追踪到:日志输出在任何过滤之前就很紧凑。测试失败和构建噪音是RTK获得更大数字的地方,而不是git日志。
一个真正的限制,没有营销提到:Claude Code内置的Read和Grep工具绕过了RTK的钩子。RTK只处理通过Bash运行的命令,大约是代理在典型会话中执行的三分之一。
Caveman没有那么好。 供应商声称平均节省65%。三个独立的测试人员,包括Kuba Guzik,在真实的编码任务上运行了自己的基准测试,测量结果为14%到21%,会话范围的影响接近4%到5%。Guzik发现一个简单的"简洁"指令,根本没有工具,以34%击败了Caveman的实际数字。
我自己测量了Caveman自己发布的五个示例对:简历、系统提示、代理推理、API文档、支持知识库。所有五个的总体节省:41.7%,从简历的22.4%到系统提示的57.9%。这是供应商自己精心挑选的最佳案例,用来展示工具的最强表现,它仍然远低于65%的主要数字。
在检查质量的基准测试中,质量没有受到影响。在一个独立测试的72次运行中,压缩和未压缩版本都返回了100%的正确事实。Caveman在这些测试中没有破坏任何东西。只是无论谁运行,数字都无法重现。
LLMLingua-2还没有受到这种审查。在真实的编码代理工作流中没有针对它的独立现场测试,这就是为什么它被标记而不是被声称。
5、你应该运行网关,还是只运行组件?
两条路径,取决于你在优化什么。
在受监管的商店中,跳过OmniRoute。 相反,独立安装RTK和Caveman。两个机制,每个都有自己的维护者或研究实验室来审查,没有共享网关将每个提供商的API密钥放在一个地方。在依靠LLMLingua-2之前确认它正在运行。它在没有错误的情况下失败开放,静默的无操作看起来与工作的安装相同,直到你检查。
为便利性优化,OmniRoute没问题,但有一个条件。 在你安装它的那一天设置STORAGE_ENCRYPTION_KEY。不要等事件提醒你。
无论哪种方式,根据你自己的数字预算节省,而不是供应商的。
RTK的真实数字在充满测试失败和构建噪音的会话中会高于23%。这就是在你自己的工作负载上运行数学的意义,而不是借用别人的平均值。
标签上的数字从来不是一个测量值。它是一个模型,通过将另外两个工具的声称相乘并发布结果,就好像秒表产生的一样。这不是OmniRoute独有的。在这里或任何其他地方,在信任输出之前检查输入。
原文链接: I Compared the AI Token-Cost Tools Behind OmniRoute's 95% Savings Claim
汇智网翻译整理,转载请标明出处