惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - Franky
Apple Machine Learning Research
Apple Machine Learning Research
月光博客
月光博客
Vercel News
Vercel News
Recent Announcements
Recent Announcements
B
Blog RSS Feed
Y
Y Combinator Blog
M
MIT News - Artificial intelligence
MongoDB | Blog
MongoDB | Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
雷峰网
雷峰网
D
Docker
Jina AI
Jina AI
IT之家
IT之家
人人都是产品经理
人人都是产品经理
L
LangChain Blog
G
Google Developers Blog
Google DeepMind News
Google DeepMind News
MyScale Blog
MyScale Blog
博客园 - 叶小钗
The GitHub Blog
The GitHub Blog
The Cloudflare Blog
A
About on SuperTechFans
Hugging Face - Blog
Hugging Face - Blog

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
谷歌LiteRT-LM通过Gemma 4多Token预测将本地推理速度提升了最...
作者:Sergio De Simone张卫滨 · 2026-06-23 · via InfoQ - 促进软件开发领域知识与创新的传播

LiteRT-LM原生支持Gemma 4的多Token预测(Multi-Token Prediction,MTP)草稿器(drafter),可将推理速度提升最高 2.2 倍。该框架已经从 Kotlin 与 C++进行了扩展,新增了对 Swift 和 JavaScript API 的支持。

LiteRT-LM 在 LiteRT(前身为 TensorFlow Lite)之上包含了一层专门的编排逻辑,专为处理大规模语言模型(LLM)而设计。谷歌表示,它是在 Android、iOS 与 Web 等平台上运行 Gemma 4 的运行时,经过了生产环境的验证和高度优化。

其基于 LiteRT 的底层使其能有效应对内存、计算与硬件碎片化等约束,结合了先进的量化模式以及加速的 XNNPACK 和 MLDrift 内核。在编排层面,它采用优化流水线以最小化昂贵的 CPU-GPU 数据传输,支持多 Token 预测并具备先进的会话管理功能。谷歌称这种组合使其成为“针对 Gemma 模型性能最高的运行时环境”。

LiteRT-LM 在 MTP 上采用了推测性解码(speculative decoding),并通过“优化主模型与 MTP 草稿器之间的数据交互”来避免简单实现的常见瓶颈。

为了实现这一点,LiteRT-LM 通过在相同硬件 IP(例如,GPU)上同时执行轻量级的 MTP 草稿器与主模型来实现内存的局部化。在本地内存中管理共享的 KV 缓存和激活态,完全消除了跨 IP 同步与数据传输带来的延迟惩罚。一旦草稿器预测出未来的 token,主模型便使用优化内核对其进行评估,从而在验证阶段最大化并行处理。

基于自身的基准测试,谷歌表示 MTP 解码在 Gemma 4 E2B 上快了 1.6 倍,在 Gemma 4 E4B 上快了 2.2 倍。公司还报告称,无论是预填充(prefill)还是解码(decode)性能,相比 llama.cpp、MLX、Cactus 与 ONNX 等竞争框架提升了 1.8 到 3.7 倍。

LiteRT-LM 将会话管理视为一等特性。它可以保存并恢复 KV 缓存状态,从而在避免昂贵重算的同时无缝续接长时交互,这既能改善用户体验也能提高效率。

另一个重要支柱是内存效率,通过将按层分布的嵌入向量(per-layer embeddings)保持在外部并按需动态加载图像与音频编码器,运行时可以尽可能地保持精简。例如,约 2.58 GB 的 Gemma 4 E2B 模型在 Apple 移动 CPU 上只占用了约 607MB。

系统还强调了 agentic 的能力,原生支持 Gemma 4 的“思考模式(Thinking Mode)”、用于结构化输出的约束解码,以及函数调用(function-calling)。这些功能允许运行时暂停执行、返回结构化的工具调用请求并在随后恢复执行。

随 Gemma 4 一同推出的多 Token 预测草稿器使用推测性解码并行生成多个 token,然后在单次通过的过程中一起进行验证。该方法减少了 VRAM 与计算单元之间的持续数据移动,同时利用了许多预测“显而易见”这一事实,这类预测通常不需要像其他情况那么多的计算。

LiteRT-LM已经在GitHub 开源,并包括用于桌面试验的CLI,以及用于在设备上运行的移动示例应用

查看英文原文:Google LiteRT-LM Speeds Up Local Inference Up to 2.2x With Gemma 4 Multi-Token Prediction