惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Forbes - Security
Forbes - Security
The Register - Security
The Register - Security
G
Google Developers Blog
罗磊的独立博客
WordPress大学
WordPress大学
L
LangChain Blog
博客园 - 三生石上(FineUI控件)
Recorded Future
Recorded Future
Microsoft Azure Blog
Microsoft Azure Blog
Google DeepMind News
Google DeepMind News
大猫的无限游戏
大猫的无限游戏
MongoDB | Blog
MongoDB | Blog
小众软件
小众软件
Recent Announcements
Recent Announcements
T
Tailwind CSS Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
云风的 BLOG
云风的 BLOG
Apple Machine Learning Research
Apple Machine Learning Research
酷 壳 – CoolShell
酷 壳 – CoolShell
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
F
Full Disclosure
The Cloudflare Blog
B
Blog RSS Feed
S
Schneier on Security
T
Tenable Blog
人人都是产品经理
人人都是产品经理
Engineering at Meta
Engineering at Meta
T
Tor Project blog
N
Netflix TechBlog - Medium
T
Threatpost
NISL@THU
NISL@THU
Stack Overflow Blog
Stack Overflow Blog
N
News | PayPal Newsroom
N
News and Events Feed by Topic
aimingoo的专栏
aimingoo的专栏
博客园 - 叶小钗
P
Privacy & Cybersecurity Law Blog
C
CERT Recently Published Vulnerability Notes
Last Week in AI
Last Week in AI
M
MIT News - Artificial intelligence
C
CXSECURITY Database RSS Feed - CXSecurity.com
P
Privacy International News Feed
博客园 - 【当耐特】
Help Net Security
Help Net Security
The Hacker News
The Hacker News
Hugging Face - Blog
Hugging Face - Blog
TaoSecurity Blog
TaoSecurity Blog
S
Secure Thoughts
C
Cisco Blogs
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events

博客园 - iTech

7万星的AI交易框架:让大模型模拟投行多空辩论,自动做交易决策 71000颗星的AI交易团队:让大模型模拟投行分工,自动做交易决策 13400颗星的开源项目:输入一句话,AI全自动帮你做短视频 102颗星的沙盒:当AI学会自己写代码、跑测试、做部署 AI 技术日报 - 2026-05-08 29k 星的 PageIndex:不用向量数据库,靠推理就能做 RAG 每天花两小时刷信息?这个开源项目帮你全自动搞定 读源码像读小说?试了 DeepWiki 和 Zread,我再也不想裸读 GitHub 了 Matt Pocock 开源的这套 .claude 技能,为什么让工程师集体上头? Cursor Team Kit:Cursor 官方团队在用的 17 个 AI 工作流 AI 技术日报 - 2026-05-07 AI 技术日报 - 2026-05-06 AI 技术日报 - 2026-05-05 Anthropic CEO 说 12 个月内程序员要失业,我扒完他的底牌,发现事情没那么简单 把工程师的肌肉记忆装进 Claude Code,这个 4300 Star 的项目我后悔没早用 AI 技术日报 - 2026-05-04 AI 技术日报 - 2026-05-03 AI 技术日报 - 2026-05-02 六大 Agent 框架横评:谁支持 Skills?谁能自动创建 Agent?MCP 呢? Wechatsync:一个 Chrome 插件,一键把文章同步到 31 个平台 LangChain 开源了 Open SWE:Stripe、Ramp、Coinbase 内部都在造的编程 Agent Cockpit:把 Claude Code 从终端里搬出来,装进浏览器 Cursor 把自家的 AI Agent 开放了:写几行 TypeScript 就能调 Cursor 干活 AI 技术日报 - 2026-05-01 AI 写代码每次结果都不一样?Archon 用 YAML 工作流把 AI 编程变成流水线 AI 写代码比你快了,但你还是得学编程——只不过学法得换 腾讯的龙虾特工队:4 个 AI Agent 同日更新,全家桶正式成型 Agno 不做更聪明的 Agent,它要把所有 Agent 框架包进同一个操作系统 Hermes Agent 终于有了像样的 Web 界面,而且还支持远程访问 Datawhale 出了一套 29 学科知识地图,把 AI 的底牌全掀了 Hermes Agent 在聊天框里就能用的 20 种高级功能 一份 AGENTS.md 能顶一次模型升级?Augment Code 用数据说了算 NVIDIA 开源了一个「AI 沙箱」,20K Star,让 Agent 跑代码不再裸奔 60ms 冷启动、5MB 内存:腾讯开源的这个沙箱让 Docker 安全隔离像笑话 AI 技术日报 - 2026-04-30 AI 技术日报 - 2026-04-29 AI 技术日报 - 2026-04-28 Goose:Linux 基金会亲儿子,能撼动 Claude Code 和 OpenCode 吗? AI 技术日报 - 2026-04-27 AI 技术日报 - 2026-04-26 Google 把价值20美元/月的东西免费了,102K人已经抢到了 OpenClaw 和 Claude Code 网络搜索配置指南 AI 技术日报 - 2026-04-25 Anthropic 为什么遥遥领先:从 Cat Wu 专访看AI霸主的底层逻辑 Mac 本地跑大模型完全指南:你的苹果电脑就是 AI 工作站 同样 70B 参数,为什么 MoE 只激活 13B 就能打平 Dense? DeepSeek-V4 技术报告里藏着一条线:华为昇腾 NPU 已完成推理验证 DeepSeek-V4 深夜炸场:1M 上下文、384K 输出、双模型,API 定价直接卷到底 MacBook Air 跑大模型实测:Ollama、llama.cpp、LM Studio 谁才是本地推理之王? AI 技术日报 - 2026-04-24 OpenCode:Claude Code 的最佳平替 2026 开源大模型五国杀:Qwen 3.6 vs Gemma 4 vs Llama 4 vs GLM-5.1 vs DeepSeek V4 MCP 与 Skills 的你死我活:Anthropic 的 Agent 生态野心与开发者的站队困境 给 AI Agent 配搜索,国内能用的搜索 API 实测对比 AI 技术日报 - 2026-04-23 CC Switch:49K Star 的 Claude Code 登录绕过神器,还能管 Codex 和 Gemini CLI NVIDIA 开出 32 万美元年薪招 AI Agent 工程师,JD 里藏着这些信号 fast-mirror-skill 技术拆解:一个小而完整的 Claude Skill 是怎么设计的 Cursor 值 600 亿美元?马斯克这次赌的不是技术,是入口 AI 技术日报 - 2026-04-22 别再问 AI 能不能赚钱了:3 个上班族亲测有效的副业方法(2026 最新版) 10 分钟从零搞定 Hermes Agent:飞书微信双通道丝滑上线 AI 技术日报 - 2026-04-21 Anthropic 实战总结:AI Agent 的 3 种工作流模式,选错代价很大 安装 openclaw,hermes 慢的想发疯,fast-mirror-skill 来救了 Claude Routines:你下班睡觉了,Agent 还在为你干活 微信飞书里敲一个斜杠就能干活:Hermes Quick Command 到底多省事 AI 正在疯狂吃电:算力尽头是电力,谁能解这道题? AI 技术日报 - 2026-04-20 3K 行代码造一个越用越聪明的 AI Agent:GenericAgent 登顶 GitHub Trending 高德途途封神机器人半马,背后的 ABot-Claw 到底是什么 人们希望 AI 能干啥?Anthropic 调查:第一名不是赚钱,是变强 AI 时代人们在担心什么?Anthropic 的 13 条焦虑排行榜 OpenAI 官方 Agent SDK 来了:22k Star,支持 100+ 模型,Python 10 行代码上手 AI 技术日报 - 2026-04-19 OpenAgents Workspace:让 Claude Code 和 Codex 在同一个群里干活 Claude 是要干掉整个软件行业吗? Claude 官方推荐多 Agents 设计模式 多 Agent 系统的 5 种协调模式:选错了模式,再强的 Agent 也白搭 AI 技术日报 - 2026-04-18 AI 技术日报 - 2026-04-17 Better-Harness:让AI Agent自己优化自己的革命性框架 OpenClaw Workspace 完全指南:我的AI编程工作流 DeepSeek内蒙草原高薪招聘:AI时代的数字牧民梦,还是营销噱头? 2 核 2G 的阿里云 ECS 能跑 OpenClaw 吗?能,但有点折腾 AI 技术日报 - 2026-04-16 OpenCLI:一个命令行搞定 16+ 内容平台的神器 从零到精通:OpenClaw CLI 命令完全指南 AI 技术日报 - 2026-04-15 AI Agent 如何自我进化?Hermes Agent Self-Evolution 深度解析 AI 技术日报 - 2026-04-14 为什么你的飞书 Bot 总是连不上?OpenClaw Gateway 架构深度解析 OpenClaw 连接飞书的原理:Gateway、Channel 与消息流转 国内安装 Hermes Agent 踩坑全记录:从 GitHub 超时到正常跑起来的每一步 35 万 Star 的 OpenClaw:5 分钟部署你的私人 AI 助手,直连飞书 AI 技术日报 - 2026-04-13 公司用 AI 筛简历,这个开源项目让候选人用 AI 反选公司 为什么 Google ADK 可能是你下一个 Agent 框架——7 个改变游戏规则的特性 Microsoft Agent Framework 深度解析:架构设计与实战落地 AI 技术日报 - 2026-04-11
Weave Router:让 Claude Code 自动切模型,省 40% token
iTech · 2026-06-27 · via 博客园 - iTech

Weave Router:一个 endpoint 让 Claude Code 自动切换 Opus 和 DeepSeek,省 40% token

用 Claude Code 写代码的,先收藏,这篇能帮你省钱。

一个很现实的问题:Opus 4.7 发布后,tokenizer 一改,账单直接起飞。但你心里清楚,不是每个请求都需要 Opus 的智商——子 agent 探索代码库用 DeepSeek V4 Flash 就够了,只有规划复杂改动那种才真正需要 Opus 4.8。

问题是你没法手动在每次请求前判断「这个该用哪个模型」。Weave Router 解决的就是这个。它是 Weave 公司开源的一个模型路由代理(workweave/router,Go 写的,262 stars),插在 Claude Code / Codex / Cursor 和模型提供商之间,每个请求自动选最优模型。官方数据:省 40-70% token,质量无感知差异。

关键不是「能切模型」(手动谁都会),而是它怎么决定切哪个。这点后面细说,跟市面上那些 prompt 决策的路由器不是一回事。

本文提纲

  1. 它到底怎么工作的
  2. 路由决策:embedder,不是 prompt
  3. 一行安装接入三大工具
  4. 一个真实的路由长什么样
  5. 跟手动切模型比,省在哪
  6. 自托管还是托管,怎么选
  7. 几个要注意的点

它到底怎么工作的

Weave Router 本质是个代理服务器。你把 Claude Code、Codex 或 Cursor 的 API endpoint 指向它(比如 localhost:8080),它就夹在中间干活:

MERMAID_BLOCK_0

它对外假装自己是 Anthropic、OpenAI、Gemini 三家的 API(各自的原生协议都支持:Anthropic Messages、OpenAI Chat Completions、Gemini native)。你发来的请求,它先看一眼,决定路由到哪个模型,然后把请求翻译成那个模型的协议格式转发出去,响应再翻译回来。streaming、tool use、vision 这些都透传,对客户端完全透明。

对你来说,Claude Code 还是那个 Claude Code,配置里只是把 base URL 换了一下。但背后每一次推理,可能在不同的模型之间跳。

路由决策:embedder,不是 prompt

这是 Weave Router 最值得说的地方,也是它和那些「写个 prompt 让大模型决定路由」的玩具项目本质区别。

市面上很多 router 的决策方式是:拿一个 LLM 看一眼请求,prompt 它「这个该用哪个模型」。问题是这个决策本身就要消耗 token 和延迟,而且 LLM 决策不稳定。

Weave Router 不这么干。它用的是一个本地运行的轻量 embedder(on-box,跑在你自己机器上),决策逻辑基于一篇论文叫 Avengers-Pro。工作方式大致是:

  1. 把进来的请求 embed 成向量
  2. 跟一个预先训练好的「cluster scorer」比对——这个 scorer 是 Weave 在数万条真实 agent traces 上用 RL 训练出来的
  3. 匹配到最合适的模型集群

整个决策在 50ms 以内完成,不经过任何 LLM,不产生额外 token 消耗。RL 训练时的奖励信号是:选中的模型成功完成了任务就给正反馈。所以 scorer 学到的是「哪类请求在哪个模型上实际成功率高、成本低」,不是「哪类请求看起来该用哪个模型」。

这个设计有几个好处。第一快,50ms 你感知不到。第二省,决策本身零 token。第三可解释,向量匹配是确定性过程,比 LLM 的「我觉得」可靠。

一行安装接入三大工具

接入方式简单到离谱。不需要 clone、不需要 Docker、不需要 Postgres:

这行命令会问你用哪个工具(Claude Code / Codex / opencode),选好后自动帮你改对应的配置文件——Claude Code 改 settings、Codex 改 ~/.codex/config.toml、opencode 改 opencode.json。你只需要提供 provider key,其他全自动。

如果不想用交互式选择,直接带参数:

npx @workweave/router --claude              # 直接配置 Claude Code
npx @workweave/router --codex               # 直接配置 Codex
npx @workweave/router --scope project       # 只对当前 repo 生效,配置 commit 进项目

Cursor 是 early beta(README 自己标注性能可能不是最佳),需要在 Settings → Models 里 Override OpenAI Base URL 指向 http://localhost:8080/v1,手动填 rk_... 路由 key。

这里有个设计细节值得注意:Codex 的配置改动是非破坏性的。它只增删自己管理的 [model_providers.weave] 块,你 Codex 里其他配置原封不动。--uninstall 也只移除这个块。这点对开发者很友好——不用担心装了个工具把自己的配置搞乱。

而且装完之后可以随时开关切换,不用反复改配置:

npx @workweave/router off --claude    # 路由关闭,直连原 provider
npx @workweave/router on --claude     # 路由开启
npx @workweave/router status          # 看当前状态

Claude Code 甚至有 /router-off/router-on 斜杠命令,在对话里直接切。

一个真实的路由长什么样

Weave 在 HN launch 帖里给了一个具体例子,能直观看出路由逻辑:

请求类型 路由到的模型 为什么
规划复杂改动 Opus 4.8 需要强推理,规划错了后面全白干
子 agent 探索代码库 DeepSeek V4 Flash 只是收集上下文,不需要强推理,快且便宜
执行已定好的方案 GLM 5.2 方案明确,执行靠速度和成本
简单查询 Kimi K2.6 杀鸡不用牛刀

这个分层很关键:不是所有任务都用最强模型才好。规划阶段用 Opus 保证方向对,执行阶段用便宜模型保证快和省。如果你全程 Opus,既贵又未必快;全程 DeepSeek,省钱但复杂规划可能翻车。Weave Router 的价值就是让你每个环节都用对模型,而不是全局二选一。

跟手动切模型比,省在哪

有人会说:我自己在 Claude Code 里 /model 切不就行了?

能切,但切不动几个问题。第一,你得知道什么时候切。写代码写到一半,你判断不了当前这个请求是「需要 Opus 的规划」还是「DeepSeek 就够」——这是路由器擅长而你手动判断成本高的事。第二,一个 agent loop 里请求是混合的。Claude Code 一次任务可能发几十个请求,规划、探索、执行交织在一起,你不可能逐个手动切。第三,手动切容易忘切回去,要么一直贵,要么该用强模型时还在用便宜的导致质量下降。

Weave Router 是 per-request 粒度的,每个请求独立决策。同一个任务里,规划那个请求走 Opus,紧接着探索代码库的子请求就走 DeepSeek,你全程不用管。40% 的节省就是这么来的——把那些「用了 Opus 但其实不需要」的请求路由到了便宜模型。

成本数据可以感受一下量级:Opus 4.8 的输入价格是 DeepSeek V4 Flash 的几十倍。如果一个 agent loop 有 20 个请求,其中只有 3 个真需要 Opus,其余 17 个路由到 DeepSeek,省下的就是实打实的钱。

自托管还是托管,怎么选

Weave Router 提供两种用法:

托管版(推荐先试):npx @workweave/router 默认连 Weave 的 hosted router,你的 provider key 加密存在本地,请求经 Weave 的路由服务分发。零运维,适合个人开发者快速验证。

自托管版:自己跑整个 stack(router + dashboard + Postgres),适合不想把请求经过第三方、或者要在内网用的团队:

echo "OPENROUTER_API_KEY=sk-or-v1-..." >> .env.local
make full-setup   # 起 Postgres + router:8080 + dashboard,自动生成 rk_ key

自托管有个亮点:dashboard 在 localhost:8080/ui/,能看到每次路由决策去了哪个模型、为什么。对调试和优化路由策略很有用。

两种模式都支持 BYOK(Bring Your Own Key)——provider key 始终在你自己手里,加密存储。这点对安全敏感的团队很重要,你的 OpenAI / Anthropic / DeepSeek key 不会上传到 Weave。

可观测性也做得完整,原生 OTLP trace 输出,能接 Honeycomb、Datadog、Grafana。路由决策过程不是黑盒,每次都能追到。

几个要注意的点

许可证是 ELv2(Elastic License 2),不是 MIT/Apache。ELv2 允许你自由使用、修改、自托管,但禁止把它作为托管服务提供给第三方。个人用和公司内部用没问题,但你想拿它做个 SaaS 卖给别人,不行。商业集成前看清楚这条。

Cursor 是 early beta。README 自己写了「performance may not be the best」。Cursor 的集成方式是手动改 Base URL,不如 Claude Code / Codex 那种自动配置顺滑。Cursor 用户建议先在 Claude Code 上体验,等 Cursor 集成稳定。

托管版请求经过 Weave。虽然 key 加密存储、协议透明,但你的请求内容确实会过 Weave 的路由服务。如果这点介意,用自托管版,全程不出你的机器。Weave 本身是做工程智能平台的公司(客户有 Robinhood、PostHog),可信度还行,但安全合规严格的团队建议自托管。

路由质量取决于你启用的模型池。router 只能在你配置的 provider 里选。如果你只配了 OpenAI 一个,它没得选。要发挥效果,至少配 2-3 个价差大的模型(比如 Opus + DeepSeek + GLM),让它有路由空间。OpenRouter 是推荐的 baseline provider,一个 key 接一堆 OSS 模型。

Weave Router 抓住的是一个真实且越来越普遍的痛点:AI 编程成本在涨,但没人想为了省钱牺牲关键任务的质量。它的解法不是让你在「贵但强」和「便宜但弱」之间二选一,而是让每一类请求各得其所。如果你日常用 Claude Code 或 Codex 且对账单敏感,值得花十分钟装上试试——hosted 版零成本验证,数据说话。

参考文档与链接

用 Claude Code 的,账单超多少了?装上这个试试能省多少,评论区报个数。觉得有用点个赞让更多人看到。


作者: itech001
来源: 公众号:AI人工智能时代
网站: https://www.theaiera.cn/
每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。