惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

酷 壳 – CoolShell
酷 壳 – CoolShell
雷峰网
雷峰网
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Spread Privacy
Spread Privacy
H
Hacker News: Front Page
PCI Perspectives
PCI Perspectives
Webroot Blog
Webroot Blog
罗磊的独立博客
H
Heimdal Security Blog
TaoSecurity Blog
TaoSecurity Blog
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
大猫的无限游戏
大猫的无限游戏
月光博客
月光博客
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
Google Online Security Blog
Google Online Security Blog
Last Week in AI
Last Week in AI
美团技术团队
Help Net Security
Help Net Security
The Hacker News
The Hacker News
C
Cisco Blogs
T
The Blog of Author Tim Ferriss
J
Java Code Geeks
The Register - Security
The Register - Security
IT之家
IT之家
WordPress大学
WordPress大学
Jina AI
Jina AI
Recent Commits to openclaw:main
Recent Commits to openclaw:main
H
Help Net Security
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
T
Threat Research - Cisco Blogs
P
Proofpoint News Feed
NISL@THU
NISL@THU
爱范儿
爱范儿
The GitHub Blog
The GitHub Blog
Scott Helme
Scott Helme
V
Vulnerabilities – Threatpost
B
Blog
T
Tenable Blog
博客园 - 三生石上(FineUI控件)
T
The Exploit Database - CXSecurity.com
S
Security Affairs
小众软件
小众软件
Hacker News: Ask HN
Hacker News: Ask HN
Security Latest
Security Latest
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
W
WeLiveSecurity
A
Arctic Wolf
L
LINUX DO - 热门话题
Google DeepMind News
Google DeepMind News
M
MIT News - Artificial intelligence

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 谷歌开源“Agent Skill 超级工具箱”,云、库、引擎、AI全线打通,开发者狂喜 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek
褚杏娟 · 2026-04-29 · via InfoQ - 促进软件开发领域知识与创新的传播

4 月 28 日,小米开源了 MiMo-V2.5 和 MiMo-V2.5-Pro 两款模型:MiMo-V2.5 基础模型提供原生多模态能力,而 MiMo-V2.5-Pro 则是专门为“长周期一致性”和复杂软件工程设计的。

小米采用了宽松、对企业友好的 MIT License,这意味着模型适合被用于商业应用的生产环境。用户可以按需修改模型,并根据自身需要,在本地或虚拟私有云上运行。

在 GDPVal-AA(Elo)基准测试中,Pro 模型取得了 1581 分,超过了 Kimi K2.6 和 GLM 5.1 等竞争对手。

小米还进一步公布了 V2.5-Pro 自动完成若干高复杂度任务的数据:

  • 用 Rust 实现 SysY 编译器:模型从零开始实现了一个完整编译器,包括 lexer、parser 和 RISC-V 汇编后端,用时 4.3 小时。整个过程横跨 672 次工具调用,在隐藏测试集中取得了 233/233 的满分。这个任务通常需要计算机科学专业学生花费数周时间完成。

  • 全功能视频编辑器:模型用时 11.5 小时,进行了 1868 次工具调用,最终生成了一个 8192 行的桌面应用,具备多轨时间线和导出流水线。

  • 模拟 EDA 优化:在一项研究生级别的工程任务中,模型优化了 TSMC 180nm 工艺下的 Flipped-Voltage-Follower(FVF-LDO)稳压器。通过不断迭代 ngspice 仿真循环,模型将线性调整率等指标相较初始尝试提升了 22 倍。

小米用这些实验来凸显 V2.5-Pro 的一种 “harness awareness”,也就是“脚手架意识”。模型会主动管理自己的记忆,并塑造自身上下文,以便在数千次连续工具调用中维持一致性。

拼 token 效率,但 DeepSeek 价格依然最能打

根据小米公布的基准测试,这些模型被认为是目前适合 agentic “claw” 任务的高效模型之一。

所谓 “claw” 任务,指的是为 OpenClaw、NanoClaw、Hermes Agent 这类系统提供支持。用户可以通过第三方消息应用直接与这些智能体沟通,让它们代替人类用户去完成任务,比如制作和发布营销内容、运营账号、整理邮件、安排日程等等。

随着 OpenClaw 等被广泛应用,token 消耗量也迅速爆发,越来越多服务开始转向按使用量计费。这时,“为用户省钱”这一点变得非常关键。

微软的 GitHub Copilot 今天宣布正在转向基于用量的计费方式,也就是按照人类用户实际消耗的每个 token 收费,而不是像 Anthropic 那样施加速率限制,或者像 OpenAI 那样提供“自助餐式”的无限量订阅。这让更多人意识到,AI 推理补贴时代结束了。

过去大家一个月用 20 美元、100 美元、200 美元就能跑大量 Claude、OpenAI 高端模型完成工作,本就不可能长期持续。有用户直言,这很像 ZIRP 时代互联网公司的增长策略:先烧钱补贴、快速获客,等用户习惯和粘性形成后,再开始正式变现。

而对于用户来说,现在编程成本从固定订阅变成不确定的 token 消耗,这个账可能越来越难算。 Agent 编程不是普通聊天,真实成本来自长上下文、反复工具调用、缓存命中率和模型倍率等。

这个背景下,小米为这些模型提供了相当有竞争力的价格,覆盖国内和国际市场。

对海外开发者来说,高性能的 MiMo-V2.5-Pro 在最高 256K 上下文窗口内,缓存未命中时每百万输入 token 价格为 1.00 美元,输出价格为 3.00 美元。对于 256K 到 1M token 之间的超长上下文任务,价格会翻倍:输入为 2.00 美元,输出为 6.00 美元。

单纯模型定价角度看,国内模型横向比较时,MiMo 价格并不便宜。

部分模型海内外价格不完全统计,来源:AI 前线

不过,实际的整体使用价格还是要结合 token 效率来看。Artificial Analysis 之前的测评显示,在同一套 Intelligence Index 评测中,不同模型的 token 消耗差异巨大。DeepSeek V4 Flash、GPT-5.4 mini、Claude Sonnet 4.6 等模型动辄消耗 2 亿级输出 token,且大部分是推理 token;而 MiMo-V2.5-Pro 约为 9200 万,GPT-5.5 xhigh 约为 7500 万,Gemini 3.1 Pro Preview 甚至只有 5700 万。

而从小米发布的 ClawEval 基准测试图也可以看到,MiMo-V2.5 和尤其是 Pro 版本,在完成基准测试中的 claw 任务时表现很强,同时消耗的 token 又最少。

根据测试,在 ClawEval 上,V2.5-Pro 以每条轨迹约 7 万 token 的消耗,取得了 64% 的 Pass^3 成绩。而在能力水平相近的情况下,这比 Claude Opus 4.6、Gemini 3.1 Pro 和 GPT-5.4 少用了大约 40% 到 60% 的 token。

“MiMo V2.5 Pro 有一点很不错:它似乎是目前 token 效率最高的开源模型。它会思考,但不会总是陷入那种很长的‘等等,好像不对’的循环。很喜欢这一点。”有网友评价道。

“更高的智能,并不只是拿到更高的分数。它还意味着,用更少的 token 达到同样的能力水平。”官方表示。值得注意的是,小米大模型负责人罗福莉就曾直言大模型公司“价格战是陷阱”。

她认为,如果用户把精力浪费在低质量的 Agent 框架、极不稳定且缓慢的推理服务、以及为降本而被迫降级的模型上,最终发现自己仍然什么都做不成,这对用户体验和留存率来说,就是一个恶性循环。而真正的出路不是更便宜的 token,而是协同进化,即“更高 token 效率的 Agent 框架”叠加“更强大高效的模型”。

不过,小米当前模型定价依然处于较低位置。小米所有模型现在还限时免收缓存写入费用,同时整个 MiMo-V2.5-TTS 套件也完全免除费用,其中包括专门的语音克隆和语音设计功能。这种定价逻辑显然是为了加速从简单聊天应用,转向持久、长周期智能体的过程,后者可以以传统前沿模型小部分的成本运行。

此外,小米还推出了重新设计后的 “Token Plan”,目前分为四档:

  • Lite “Starter Pack” 提供 7.2 亿 credits,年费 63.36 美元。

  • Standard 档提供 24 亿 credits,年费 168.96 美元。

  • Pro 档提供 84 亿 credits,年费 528.00 美元,面向企业使用场景。

  • Max 档面向高强度编码爱好者,提供 192 亿 credits,年费 1056.00 美元。

除了 credit 配额外,所有套餐还包括更优惠的 API 价格、离峰调用 20% 折扣,以及对 Cursor、Zed、Claude Code 等热门编码工具的 “Day-0” 支持。

此外,开源的同时,罗福莉宣布提供 100 万亿免费 token,目前已经有用户晒出入选邮件。

网友评价

当前看,小米模型获得了一些不错的评价。

“这个模型太棒了,是我目前最喜欢的,比我使用的 Kimi 2.6 和 GLM 都好。”网友“Someone1Somewhere1”表示。

该开发者介绍,自己在工作和个人爱好上都会用到它们。“工作方面主要是做数据分析、整理用于演示文稿的数据,包括字体排版,以及在大量给定数据中查找一些小众信息。我个人爱好游戏开发。这方面包括用 Python 写代码、处理一些复杂数学问题、进行创意写作,分析我自己写下的大量概念、技能设定和主题,然后帮我根据特定素材进一步组织和打磨,比如宗教礼仪、古代神话、民间传说、creepypasta 这类内容。”

不过,有用户指出评价是“绝对不算出色”,MiMo-V2.5 Pro 思考时间太长了。

还有开发者表示,“DeepSeek 也有它的用途,但它并不能满足我的需求。我用 Mimo 进行构思、研究、假设检验,以及梳理要开发的内容和整体思路。然后,在实现阶段,我使用 GLM 和 Kimi。Mimo 非常擅长实施前的沟通,集思广益并对想法进行压力测试。”

都是 MoE 架构,但训练路线不同

MiMo-V2.5 的核心稀疏专家混合架构,总参数规模达到 310B,激活参数 15B。

V2.5 被训练来做跨模态推理,通过平衡局部注意力和全局注意力来维持多模态感知能力。

根据小米博客文章,MiMo-V2.5 遵循了严格的五阶段演进路线:

  • 文本预训练,基于 48 万亿 token 构建庞大的语言主干;

  • Projector Warmup,将自研音频和视觉编码器与语言核心对齐;

  • 多模态预训练,在高质量跨模态数据上进行规模化训练;

  • Agentic 后训练,逐步将上下文窗口从 32K 扩展到 1M token;

  • RL 和 MOPD:使用强化学习和多模态偏好优化来提升真实世界推理和感知能力。

V2.5-Pro 则是一个总参数规模为 1.02 T 的 MoE 模型,活跃参数为 42B。它采用了 MiMo-V2-Flash 中引入的混合注意力架构和 3 层多 Token 预测(MTP)设计,支持最高 100 万 token 的上下文长度。

V2.5-Pro 采用混合注意力架构,局部滑动窗口注意力和全局注意力以 6:1 的比例交错排列,窗口大小为 128 个 token。

这种设计可以在通过可学习的 attention sink bias 维持长上下文性能的同时,将 KV-cache 存储量减少近 7 倍。V2.5-Pro 可以“快速扫过”绝大部分上下文,同时对当前目标最相关的 15% 数据施加高密度注意力。对于调试大型代码仓库等任务来说,这是一个关键特性。

不过,与同样使用混合注意力机制的 DeepSeek-V4 比,V2.5-Pro 更接近主流推理框架可部署方案,架构创新相对更工程化,attention 压缩不如 DeepSeek 激进。DeepSeek-V4 更偏自研系统栈和底层 kernel 优化,系统复杂度高、部署门槛可能更高。

MTP 方面,V2.5-Pro 还配备三个使用 dense FFN 的轻量级 MTP 模块。这使得推理阶段的输出速度提升至约 3 倍,同时也有利于加速强化学习训练中的 rollout。

MiMo-V2.5-Pro 使用 27T tokens 进行训练,采用 FP8 混合精度和原生 32K 序列长度,上下文窗口最高支持 100 万 tokens。其训练重点不再是感官对齐,而是转向扩展后训练计算量。这一过程旨在注入 “harness awareness”,即“脚手架意识”。模型会被专门训练,以便在 Claude Code 或 OpenCode 这类自主智能体脚手架中,管理自己的记忆和上下文。

最后,虽然两款模型都会经历强化学习(RL)和多模态偏好优化(MOPD),但这些阶段的目标不同:

  • 对于 MiMo-V2.5,RL 阶段用于加强感知能力和多模态推理能力。

  • 对于 MiMo-V2.5-Pro,RL 更聚焦于 agentic 场景中的指令遵循,确保模型能够遵守深藏在超长上下文中的细微要求,并在自主执行过程中从错误中优雅恢复。这带来了 Pro 模型的“自我纠错”纪律性。

在实际体验中,有用户指出,同样是一份数据处理脚本的审查,有一处不会报错的隐秘 bug,两个模型都查不出来,但是 GPT 和 Claude 都能够稳定地发现它。不过 DeepSeek v4 Pro 告诉它检查哪个部分后,它能够发现问题,MIMO V2.5 Pro 做不到,需要明确的错误反馈。

“我感觉 MIMO 的这个模型推理预算被限制很厉害,又或者可能没有做过太多长链推理的训练。没有明确的错误反馈,靠它自己凭空思考表现不太好。”该用户指出。

此外还有用户提到,在免费期过后,小米模型使用占比一直在下降,加上近期罗福莉露出频繁,“现在小米公司做的一切,感觉就是为了营销它的产品,它的 Token。”

参考链接:

https://mimo.xiaomi.com/mimo-v2-5-pro

https://huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro

https://venturebeat.com/ai/open-source-xiaomi-mimo-v2-5-and-v2-5-pro-are-among-the-most-efficient-and-affordable-at-agentic-claw-tasks