惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
MongoDB | Blog
MongoDB | Blog
博客园_首页
博客园 - 三生石上(FineUI控件)
博客园 - 聂微东
B
Blog RSS Feed
D
Docker
IT之家
IT之家
大猫的无限游戏
大猫的无限游戏
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
阮一峰的网络日志
阮一峰的网络日志
罗磊的独立博客
Recent Announcements
Recent Announcements
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
A
About on SuperTechFans
The GitHub Blog
The GitHub Blog
G
Google Developers Blog
V
V2EX
量子位
雷峰网
雷峰网
月光博客
月光博客
云风的 BLOG
云风的 BLOG
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
Tailwind CSS Blog

IT之家

消息称大疆 Pocket 4 目标超千万,可能是一英寸 CMOS 出货量最大的单品 OpenAI 回应马斯克要求罢免奥尔特曼:搞法律突袭,扰乱诉讼 - IT之家 鸿蒙智行问界 M6 预订量突破 10 万台,预售 26.98 万元起 今年一季度全国铁路完成固定资产投资 1379 亿元,西十高铁、雄商高铁山东段联调联试 - IT之家 首届北京市中学生人形机器人足球赛今日启动,近 50 支队伍参赛 - IT之家 涉及“赵一鸣是日本品牌”等,抖音处置 1500 余条谣言内容 - IT之家 广汽集团与海尔集团签约,探索“人车家”互联生态 - IT之家 亚马逊调整云游戏平台 Luna 业务模式,取消 Ubisoft+、GOG 等第三方商店 消息称华擎将推出 X870E Taichi White,补全 AMD 800 系白色旗舰主板缺失 长城汽车归元平台首款方盒子全球征名,十二佳提名公布 - IT之家 消息称雷克萨斯新车即将支持苹果数字车钥匙 - IT之家 普京要求俄罗斯加速自研有竞争力的 AI 模型,彻底转向国产技术 - IT之家 影石刘靖康:已开源保真全景无人机仿真平台 AirSim360、DAP 全景度量深度模型等核心成果 - IT之家 长安汽车总经理赵非:当前车企仅靠卖车已难以盈利 - IT之家 地平线创始人余凯:4 月 22 日推出中国第一款舱驾融合智能体芯片“星空” - IT之家 冯兴亚:广汽集团具身智能机器人即将量产,飞行汽车预计今年完成适航认证并量产交付 - IT之家 模块化笔电制造商 Framework CEO 痛批业界追逐“AI 优先”,称个人计算设备可能就此消亡 16 年来首次:小米首届员工运动会今天启幕,雷军压轴致辞 - IT之家 比亚迪廉玉波:新能源汽车产业正进入确定性与不确定性并存的阶段 - IT之家 阿耳忒弥斯 2 号宇航员安全返回地球,有哪些技术和科研收获 - IT之家 曝索尼 Alpha 7R VI 全画幅无反相机将随 100-400mm f/4.0 GM 镜头一同登场,发布会预计在 5 月 小米产教融合最新成绩披露:合作院校超 400 家、成都基地启用 - IT之家 亚马逊 CEO 贾西:自研芯片年化收入预估 500 亿美元,规模超 AMD 与英特尔 马来西亚推动“AI 城市”转型,目标 2030 年成为“AI 国家” Galaxy S24 Ultra 手机用户反馈三星人为设限,无法使用 Galaxy Buds4 Pro 耳机高清语音 广汽集团董事长冯兴亚:当前县级市场新能源汽车渗透率不到 20% - IT之家 消息称《地铁:离去》新作下周公布,有望 State of Play 发布会亮相 广汽新一代智能座舱架构与电子电气架构明日发布,将宣布芯片生态建设的重大突破 - IT之家 苹果预订台积电 6 万片晶圆产能,2027 年全力冲刺 AI 服务器芯片 日本经济产业省向 Rapidus 追加 6315 亿日元支持,加速下一代半导体研发
AI 账单飙升?Netflix 工程师开源项目 Headroom 爆火,号称可...
作者:问舟 · 2026-06-20 · via IT之家

IT之家 6 月 20 日消息,Netflix 高级工程师 Tejas Chopra 开发了一款名为 Headroom 的开源工具,旨在解决 AI 应用日益高昂的词元(Token)成本问题。

该项目于 2026 年 1 月开源,目前已更新至 v0.26.0 版本,但直到近日突然在海外以及国内 AI 圈内爆火,几乎能在各大平台看到推荐它的帖子。截至IT之家发稿,该项目在 GitHub 上已获得超过 3.96 万颗星标。

根据 Tejas Chopra 在开源峰会上的分享,Headroom 累计已帮助用户节省约 70 万美元(IT之家注:现汇率约合 474.9 万元人民币)的成本,并释放了超过 2000 亿个 Token。

据其本人介绍,Headroom 的诞生源于 Tejas Chopra 在一次个人项目开发中收到的一张 287 美元的 API 账单。他分析后发现,大量成本并非来自其编写的提示词,而是由自动生成的大量冗余数据造成,包括嵌套的 JSON 结构、重复的 API 响应和数据库字段等。有研究指出,AI 应用中约 76% 的 Token 消耗仅用于读取用户输入。

Headroom 的工作原理是在 AI 应用与 LLM 之间建立一个本地运行的透明压缩层。它在工具输出、日志、文件、RAG 检索片段和对话历史等内容到达大模型之前进行压缩,从而显著减少 Token 消耗,同时声称能保持回答质量不变。

当然,其压缩是可逆的,原始内容会被缓存在本地(如 Redis 或 SQLite),当模型需要详细信息时,可通过 CCR(Compress, Cache and Retrieve)机制调取。

在技术实现上,Headroom 包含多个组件:CacheAligner 用于稳定前缀以利用提供商的 KV 缓存;ContentRouter 负责检测内容类型并选择最优压缩算法,包括针对 JSON 的 SmartCrusher、针对代码的 AST 压缩以及基于模型的 Kompress-base 文本压缩。

实测数据显示,在代码搜索场景中,Token 从 17,765 个降至 1,408 个,节省 92%;在 SRE 事故调试场景中,从 65,694 个降至 5,118 个,同样节省 92%。

Headroom 提供多种集成方式以适应不同场景。用户可通过 Python 或 TypeScript 库直接调用 compress (messages) 函数;也可使用智能体模式,执行 headroom proxy --port 8787 实现零代码改动接入;还支持 headroom wrap claude|codex|cursor|aider|copilot 命令直接包装现有 AI 编程智能体。

此外,它还提供 MCP 服务器模式,通过 headroom_compress、headroom_retrieve 和 headroom_stats 三个工具供任何 MCP 客户端调用。

该项目同时提供输出 Token 缩减功能,通过精简 AI 回复中仅能提供情绪价值的客套话和重复代码来进一步降低成本。

参考资料:

  • 官网文档:https://headroom-docs.vercel.app/docs

  • GitHub:https://github.com/chopratejas/headroom

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。