惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

U
Unit 42
博客园 - Franky
T
Tailwind CSS Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
月光博客
月光博客
人人都是产品经理
人人都是产品经理
雷峰网
雷峰网
Hugging Face - Blog
Hugging Face - Blog
有赞技术团队
有赞技术团队
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
阮一峰的网络日志
阮一峰的网络日志
C
Check Point Blog
爱范儿
爱范儿
T
The Blog of Author Tim Ferriss
aimingoo的专栏
aimingoo的专栏
Stack Overflow Blog
Stack Overflow Blog
博客园 - 聂微东
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
L
LangChain Blog
云风的 BLOG
云风的 BLOG
MyScale Blog
MyScale Blog
Microsoft Security Blog
Microsoft Security Blog
The Cloudflare Blog
博客园 - 三生石上(FineUI控件)

博客园 - PetterLiu

OpenReel开源项目 OpenConnector 技术白皮书 汽车行业高效办公AI实践案例集 微软开源Flint语义驱动的图表项目 工业互联网零信任安全应用进展与挑战 开发思维导论:从大白话创意到AI全自动执行 从微服务到 Agent:我们到底在焦虑什么? Drain3与LogParser-LLM技术优劣势及适用场景对比 人机协作的工程化进化路线与落地案例 长视频如何实现信息压缩与细节 AI 站点可靠性工程 (SRE) Agent 苹果公司"中国+1"布局的逻辑重塑与风险对冲 训练 Agent 最怕什么?不是模型笨,是环境烂。 大语言模型自我验证机制与环境鲁棒性前沿技术研究报告 全球软件产业智能化范式转移与商业价值重构研究报告 基于AJ-Bench智能体自我验证场景案 物业行业 AI 落地避坑指南 AI 驱动的视频内容自动化创作框架ShortGPT 2026年6月份个人回顾 Skill不是长Prompt:如何写出工业级 Skill AI 驱动下的上下文治理与管理范式革命 为什么 FDE 正在成为商业落地的唯一解药 《不懂人性,就别做管理》:软件研发管理的核心洞察解读 四周实现非母语教学APP Agent Mail 产品介绍与 Trae Solo Agent 实测 AI时代团队效能的非线性陷阱与组织重构升级 AI落地三大误区与组织提效路径 AI工程化人才的角色演变与组织冲击 揭秘AI搜索时代的"GEO全链路技能库" AI领域值得关注的人与机构
小米MiMo-V2.5系列模型开源
PetterLiu · 2026-04-29 · via 博客园 - PetterLiu

XiaomiMOv2.5

MiMo-V2.5系列模型

在Agent领域实现三大突破:

一、技术性能登顶​

基准测试全面领先​

GDPVal-AA(Elo)1581分,ClawEval 63.8分,τ³-Bench 72.9分

超越DeepSeek V4-Pro/Kimi K2.6等开源模型

Token效率较Kimi提升42%,

成本优势显著

双模型

架构​ V2.5-Pro:1T参数专攻复杂Agent任务

V2.5:310B全模态模型

均支持1M上下文窗口,MIT协议完全开源

二、生态激励创新​

百万亿Token激励计划​

提供100T

免费Token助力开发者

支持商业部署与二次开发

极速部署适配​

当天实现vLLM/SGLang支持

架构

image

一、整体架构总览

MiMo 是一个统一的多模态大语言模型,核心设计思路是:

  1. 文本、图像 / 视频、音频 三种不同模态的输入,全部转换成统一的 Token 序列。
  2. 喂给同一个共享的主干网络 MiMo Hybrid-SWA Backbone 进行处理。
  3. 最后通过 LM Head(语言模型头)和 MTP Block(多 Token 预测模块)输出文本结果。

简单说:“多模态输入 → 统一编码 → 单一大模型理解 → 文本输出”

二、分模块深度解读

1. 输入层:三种模态的处理流水线

这一层的核心目标是:把不同格式的原始数据,转换成模型能理解的 Token。

(1)文本输入(最右侧)
  • 输入:用户的文字指令(比如图中的 User: What's in this video?)。
  • 处理:直接用文本 Tokenizer 转换为 Text Tokens(黄色方块)
  • 特点:最直接,无需额外投影,直接加入统一序列。
(2)图像 / 视频输入(中间)

这是多模态模型的视觉处理核心:

  • 输入:图片或视频帧序列(图里的汽车视频帧)。
  • 步骤 1:MiMo ViT(视觉 Transformer)

    对图像 / 视频帧进行特征提取,把像素数据转换成高维视觉特征。

  • 步骤 2:Visual Projector(视觉投影器)

    把 ViT 输出的视觉特征,投影成和文本 Token 维度一致的 Visual Tokens(绿色方块)

  • 特点:支持图片和视频,统一处理为视觉 Token。
(3)音频输入(最左侧)
  • 输入:原始音频波形(图里的声波图)。
  • 步骤 1:Audio Tokenizer(音频分词器)

    把连续的音频信号切成小段,提取基础特征。

  • 步骤 2:Local Transformer(局部 Transformer)

    对音频特征进行初步建模,捕捉音频的时序信息(比如语调、节奏)。

  • 步骤 3:Audio Projector(音频投影器)

    把音频特征投影成统一维度的 Audio Tokens(蓝色方块)

  • 特点:专门的音频处理流水线,适配语音、环境音等多类音频输入。
2. 统一序列层:多模态 Token 的融合

三种模态处理完后,会拼接成一个完整的序列:

Audio Tokens + Visual Tokens + Text Tokens

这个序列会一起送入主干网络,实现真正的多模态融合,而不是文本和视觉分开处理再简单拼接。

3. 核心:MiMo Hybrid-SWA Backbone

这是整个模型的 “大脑”,所有 Token 的理解、关联、推理都在这里完成。

  • Hybrid(混合):说明它是一个混合架构,同时处理不同模态的 Token。
  • SWA(推测为 Sliding Window Attention / 滑动窗口注意力)

    这类技术常见于超长上下文模型,比如支持 1M Token 上下文窗口,既能高效处理长序列,又能降低计算成本。

  • 特点:所有模态的 Token 共享同一个主干网络,实现跨模态的深度理解。
4. 输出层:文本生成

主干网络处理完后,通过两个部分生成最终的文本输出:

  1. LM Head(语言模型头)

    这是标准大模型的输出层,把主干网络的隐藏状态映射成词汇表概率,生成下一个 Token。

  2. MTP Block(Multi-Token Prediction / 多 Token 预测模块)

    这是一个效率优化模块,支持一次预测多个未来的 Token,能显著提升生成速度和 Token 效率(对应你之前海报里 “Token 效率较 Kimi 提升 42%” 的技术支撑)。

Run MiMo-V2.5-Pro with ATOM on AMD Instinct GPUs

docker run -d -it \
     --ipc=host \
     --network=host \
     --privileged \
     --cap-add=CAP_SYS_ADMIN \
     --device=/dev/kfd \
     --device=/dev/dri \
     --device=/dev/mem \
     --group-add video \
     --cap-add=SYS_PTRACE \
     --security-opt seccomp=unconfined \
     --shm-size 32G \
     --entrypoint "/bin/bash" \
     --name mimov25pro \
     aigmkt/mimo-v2.5-pro-atom:latest

Refer:

https://mimo.xiaomi.com/mimo-v2-5

https://github.com/XiaomiMiMo/MiMo-V2.5-ASR

https://huggingface.co/XiaomiMiMo