本周 GitHub 周榜出了个断层冠军:OmniRoute,七天生了一万一千颗星,把第二名甩开近四千。29.9k 总星、MIT 协议、500 多贡献者、当前 v3.8.49。它干的事一句话能说明白,在你电脑上起一个本地端口,把 290 个 AI 模型供应商(其中 90 多个有免费额度)接成同一个 endpoint,让 Claude Code、Cursor、Cline 这些 coding agent 直接用上免费的 Claude、GPT、Gemini。维护者 Diego 是巴西人,这也是 Kimi 官方支持的第一个巴西开源项目。
解决什么痛点
用 coding agent 的人多半被这几件事折磨过:某个 API key 突然限额,代码写到一半被打断;订阅的 Claude Code 额度月底没用完就清零;工具输出(git log、build 日志)动辄上万 token,烧得心疼;每接一个工具就得配一遍 key,十几个 dashboard 切来切去;prompt 全走别人云上,敏感代码不踏实;团队几个人共享一个订阅,谁抢到谁用。OmniRoute 把这些打包解决:限了就自动切下一个 provider,订阅额度优先榨干,工具输出过一遍压缩管道,所有 key 本地 AES-256-GCM 加密、数据不出域,团队共享还能按 key 池公平分额、闲时把空闲额度借出去。官方列了十个日常痛点对十个修复,核心就一句话,别再手搓十几个 dashboard 和死 key 了。
一个 endpoint 通吃 33 个工具
装好后只给客户端一个地址:http://localhost:20128/v1。它是 OpenAI 兼容协议,所以凡吃 OpenAI 接口的工具都能接,官方列了 33 个,Claude Code、Codex、Cursor、Cline、Copilot CLI、Aider、Continue、Goose、Open Interpreter 全在内。路由分四级兜底:先走你的订阅(Claude Code/Codex/Copilot),额度满了切自建 API key(DeepSeek/Groq/xAI),预算到顶再切便宜档(GLM 0.5 美元、MiniMax 0.2 美元),最后兜到永久免费层(Kiro、Qoder、Pollinations)。毫秒级切换,客户端无感。这套兜底有三层自愈:provider 级熔断器(5xx 才跳闸,60 秒后半开探测)、key 级冷却退避(429 认 Retry-After,一个 key 冷却不影响同源其他 key)、model 级锁定(单个模型挂不影响整条连接)。
19 种路由策略加 auto 模式
不想配策略就填 auto,它按 12 个因子(健康、额度、成本、延迟、成功率)实时打分挑当下最该用的。auto 还分几档:auto/coding 质量优先写代码,auto/fast 抢延迟,auto/cheap 抢便宜,auto/offline 抢额度余量,auto/smart 留 10% 探索更好模型。要自己控,19 种策略随便拼:priority 按序耗尽、fill-first 把每个额度榨干、cost-optimized 按美元最小、context-relay 让长对话跨模型接力、fusion 扇出多个模型再让裁判合成一个答案、pipeline 把多个目标串成流水线、lkgp 黏在最后一个成功的 provider 上不乱跳、cache-optimized 把相同 prompt 前缀钉死在同一账号最大化命中缓存。一个 combo 就是跨多个模型的链,配额跑光或 provider 挂了,静默滑到下一个,这是它自称「打不坏」的底气。
压缩省 89% token 怎么做到
最反直觉的是它的压缩。默认跑 RTK 加 Caveman 两个引擎叠加,工具和上下文负载同时过两遍,省 78 到 95%,工具密集场景平均 89.2%。官方给了个例子:一段 69 token 的 React 解释压成 19 token,答案一样,省 72%。压缩后长这样:「New object ref each render. Inline object prop = new ref = re-render. Wrap in useMemo.」。关键是代码块、URL、JSON 这些结构化数据永远字节级原样保留,不参与压缩。一共 12 个引擎可拼:Session-Dedup 跨轮去掉重复内容、CCR 把大块归档成按需取的标记、RTK 专门过滤工具结果里的命令输出、Relevance 按最近一次提问做句子级抽取打分、Caveman 规则压缩散文、LLMLingua-2 用 MobileBERT 做 ML 语义剪枝(代码安全、异步跑)、OmniGlyph 实验性地把上下文编码成图丢给 Claude Fable 5(最激进、可选)。预设分档:Lite 只去空白省 15% 当保底,Standard 省 30% 日常用,Aggressive 省 50% 应付长工具会话,Ultra 省 75% 顶到极限。还有个自适应拨盘,不靠一个开关阈值,而是只把最便宜、无损的引擎开到刚好塞满模型上下文窗口为止。激进档有 eval harness(npm run eval:compression),可以先在固定语料上跑保真度再上。客户端零改动,压缩在管道里透明完成。
免费层到底有多少
官方敢挂一个数字:每月约 15.3 亿免费 token。来源是它聚合了 43 个 provider 池、516 个模型的免费层,去重后算的实数,不是把每个 rate limit 全天候拉满的注水值。永久免费、不要 token 上限的有 OpenCode Zen(DeepSeek V4)、Kilo Code(腾讯 Hy3)、SiliconFlow(DeepSeek V3.2/R1)、Z.AI GLM、百度 ERNIE、Qoder(Qwen3-Max、Kimi-K2)、Pollinations、Cloudflare AI、NVIDIA NIM、Cerebras 等。这数字每两周按线上目录重审一次,provider 砍免费层就掉、新的来了就涨,这点比那些「永久免费」宣传实在。首月还有一批注册赠送额度(vertex 300M、agentrouter 200M、together 25M 等),OpenRouter 充 10 美元能解锁每月多 2400 万 token、更高 RPM。dashboard 有个 /dashboard/free-tiers 页实时显示用了多少、剩多少,每家 provider 的额度网格一目了然。所以它不是「无限免费用 Claude」的魔法,是把零散的免费额度拼成一张看得见的预算表,该上付费就上付费。
三分钟上手
# 1. 装并启动
npm install -g omniroute
omniroute
# dashboard 在 http://localhost:20128,API 在 /v1
# 2. dashboard -> Providers 连一个免费的
# OpenCode Free 免登录,或 Kiro AI 每月约 50 次免费 Claude
# 3. coding tool 里填:
# Base URL: http://localhost:20128/v1
# API Key: 从 dashboard -> Endpoints 拷
# Model: auto
# 4. 验证
curl http://localhost:20128/v1/models -H "Authorization: Bearer YOUR_KEY"装完零 key 零配置,auto 已经能回话(OpenCode Free 和 Felo 预置进默认 combo)。也有 Docker 镜像、桌面端,甚至能 Termux 装手机上跑。客户端发不了自定义 header 的话,它还提供带 token 的兼容别名(/vscode/YOUR_KEY/...),专门伺候那些死活不肯带 Authorization 头的工具。一条命令 setup-* 还能自动配 12 个以上的 coding 工具,omniroute launch 是零配置直接开跑。
背后的人和工程量
项目是 Diego Souza 一个人起头、在 GitHub 公开维护的,500 多人贡献,43 种语言 UI 界面,测试套件超过 2.5 万条。Trendshift 榜上有名,Discord、Telegram、WhatsApp 都有社区。值得注意的工程取舍:它把压缩、路由、熔断、MCP(104 个工具)、A2A、持久记忆、prompt 注入护栏全塞进一个进程,自托管 100% MIT,不靠云托管收费。这也是它对比表里敢说自己「唯一全功能集」的来源,代价是配置项多、上手有学习曲线。它还内置了透明 MITM 解密(TPROXY),能抓那些不认代理环境变量的 CLI;key 的记忆默认关闭,开了用 int8 向量量化还带衰减。
适合谁加注意点
适合:天天用 coding agent、想压成本或抗 rate limit 的开发者;团队共享几个订阅、要公平分额的;隐私敏感、不想 prompt 过云的。
注意四点。一是合规,目录里 15 个 provider 被标了 ToS 风险旗(用别人免费层做商业项目,得自己掂量),dashboard 会显示让你决定。二是激进压缩在长会话里偶尔会让模型漏细节,重要任务别一上来就 Ultra。三是 README 里部分链接带 aff=omniroute,是赞助链,对你无额外成本,但知道一下。四是免费层是各家免费层拼起来的,有 rate limit、不是无限,重负载还是得上付费 key。五是工程层面,它装成全局 npm 包,Node 版本太老会报 ERESOLVE 警告(官方说无害),Windows 下偶有路径坑,想省心直接用 Docker 镜像跑。还有个 remote 模式能把 OmniRoute 放 VPS 上、本地 CLI 连过去,适合要 7x24 在线、几个人共用的团队。
和竞品、和 Kimi K3 的关系
和 OpenRouter、LiteLLM 比,OmniRoute 官方对比表(13 项能力)显示它是唯一把「290 provider 加 19 路由策略加 12 引擎压缩加 MCP 104 工具加 A2A 加持久记忆加 TLS 指纹隐身加全平台加 100% MIT 自托管」凑齐的。OpenRouter 偏云端聚合、LiteLLM 偏 proxy 库,定位不同。
还有个呼应。OmniRoute 的创始开源之友(Founding Open Source Friend)正是 Kimi(月之暗面),它的 PR 合并验证是用 Kimi K3 跑的,Kimi API 和 Kimi Code 订阅都是一等公民接入。刚在 7 月 27 日开源权重的 K3,在这套网关里开箱即用。一个造最大开源模型,一个把开源模型接到每个 coding 工具,上下游咬上了。
OmniRoute 本身不复杂,复杂的是它背后聚合的那 290 个 provider 的运维。装一个、填 auto,省的是你切 key、查额度、算成本的时间。要白嫖得明白,就别只填 auto 就完事,看一眼 dashboard 的 free-tiers 页,知道自己在用谁家的额度。本周它还在周榜第一,迭代很快,上线前建议锁版本号。
参考来源
- OmniRoute GitHub 仓库(本周周榜冠军,29.9k star,MIT):https://github.com/diegosouzapw/OmniRoute
- 官网与 dashboard 介绍:https://omniroute.online
- npm 包(
npm install -g omniroute):https://www.npmjs.com/package/omniroute - 免费层计算方法(43 池 / 516 模型,每两周重审):https://github.com/diegosouzapw/OmniRoute/blob/main/docs/reference/FREE_TIERS.md
- 对竞品 OpenRouter/LiteLLM/9router/CLIProxyAPI 的 13 项能力对比:https://github.com/diegosouzapw/OmniRoute/blob/main/docs/comparison/OMNIROUTE_VS_ALTERNATIVES.md
- 12 引擎压缩管道文档(RTK + Caveman,省 15-95%):https://github.com/diegosouzapw/OmniRoute/blob/main/docs/compression/COMPRESSION_ENGINES.md