惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
T
Threatpost
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
T
Tenable Blog
AWS News Blog
AWS News Blog
Know Your Adversary
Know Your Adversary
TaoSecurity Blog
TaoSecurity Blog
P
Palo Alto Networks Blog
Spread Privacy
Spread Privacy
I
Intezer
Security Latest
Security Latest
The Last Watchdog
The Last Watchdog
Google DeepMind News
Google DeepMind News
Help Net Security
Help Net Security
Cyberwarzone
Cyberwarzone
N
News and Events Feed by Topic
O
OpenAI News
A
Arctic Wolf
S
Secure Thoughts
Attack and Defense Labs
Attack and Defense Labs
N
News and Events Feed by Topic
M
MIT News - Artificial intelligence
F
Full Disclosure
P
Privacy International News Feed
The GitHub Blog
The GitHub Blog
T
Troy Hunt's Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
H
Hacker News: Front Page
aimingoo的专栏
aimingoo的专栏
S
Security @ Cisco Blogs
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Apple Machine Learning Research
Apple Machine Learning Research
Engineering at Meta
Engineering at Meta
Cloudbric
Cloudbric
大猫的无限游戏
大猫的无限游戏
Google Online Security Blog
Google Online Security Blog
Recent Announcements
Recent Announcements
H
Help Net Security
量子位
V
V2EX
美团技术团队
G
Google Developers Blog
www.infosecurity-magazine.com
www.infosecurity-magazine.com
S
Schneier on Security
V2EX - 技术
V2EX - 技术
D
Docker
博客园 - 【当耐特】
Project Zero
Project Zero
博客园 - 司徒正美

博客园 - marsggbo

LLM agent 为什么不稳?问题可能不在模型,在 harness Meta-Harness:让 LLM 自己搜索最优 harness,模型不动,性能白涨 从零理解 ASR:音频基础、Qwen3-ASR 架构,以及离线 vs 流式推理原理 arXiv'26 | LLM Agents 让群体信念变得可编程:当 AI 开始系统性操控舆论 巴西「主权大模型」翻车:当模型可以随便融合,怎么证明它偷了你的权重? 进阶篇 | 不靠人工设计,让遗传算法自己进化出 SOTA 的 LLM 剪枝指标 说人话:一文搞懂现在火热的 LLM agent 自进化原理 ICML'26 | Transformer 真的需要三个投影矩阵吗?Q-K=V 让 KV Cache 直接砍半 UPenn & Meta | NF-CoT:当 LLM 的思维链不再是文字,而是连续概率流 arXiv'26 | 为什么你的多智能体系统越加 agent 越慢?DeLM 用去中心化解了这个矛盾 arXiv'26 | Self-Harness:让 Agent 自己改自己的 harness,pass rate 最高翻倍 Anthropic | 当 AI 开始造自己:递归自我改进离我们有多远? arXiv'26 | Mirage:把世界模型的 3D 记忆搬进 Latent Space,快 10 倍还省 55 倍显存 arXiv'26 | FlashMemory-DeepSeek-V4:用 13.5% 的显存干 100% 的活,超长上下文推理的 less is more MoE 压缩新思路:别删专家、别合并专家,把它们"重映射"就够了 MoE 变 Dense:剪枝+蒸馏能救内存瓶颈吗? ReMoE:只动 Router 就让 MoE 推理快 2 倍?这才是端侧 MoE 部署该有的姿势 LLM 时代,还有人搞 AutoML 吗?有,而且变得更难了 arXiv'26 | Frontier:LLM 推理仿真器,端到端误差从 51.7% 降到 2.6% arXiv'26 | ELF:Flow Matching 生成文字,用 10 倍少的数据全面超越主流 Diffusion LM LLMRouterBench:当所有 routing 方法被拉到同一起跑线,结果有些尴尬 LLM Agent Memory 全景拆解:从 RAG 到 KV Cache 到参数写入,100+ 篇工作的方法演进与真实取舍 EuroSys'26 | TokenFlow:让 LLM 流式输出真正「流」起来 AAAI'23 | NAS-LID:用「局部内在维度」给超网做体检,省 86% 显存 ICLR'26 Workshop Spotlight | Lang-PINN:让 LLM 多智能体帮你从自然语言一键搭建物理信息神经网络 KDD'25 | BurstGPT:我们收集了 1031 万条 Azure OpenAI 真实 trace,LLM 推理系统没你想的那么稳 KBS'21 | 我写的 AutoML 综述被引 2700+ 次,今天来聊聊这篇文章的来龙去脉 EuroSys'26 | PARD 提前丢掉注定超时的请求,goodput 最高提升 176% EuroSys'26 | MFS 把整个 model family 融进一套嵌套模型,KVCache 跨 tier 直接共享 EuroSys'26 | LLMFolder 用常量折叠把 FFN 参数砍 80%,精度反超剪枝方法 65% EuroSys'26 | KUNSERVE 把冗余参数副本临时让给 KVCache,P99 TTFT 最快降 72× EuroSys'26 | IBP 用无损 bit 压缩缓解 PCIe 瓶颈,GNN/DLRM/LLM 推理都能用 FAST'26 | SolidAttention 把 SSD 搬进 LLM 推理,笔记本也能跑 128k 上下文 LLM 推理启动慢?华为用一个「可编程 Page Cache」把模型加载砍了 79% 延迟降47%!FineMoE如何用「细粒度」打破MoE推理的显存-延迟死局 训练一个「会管技能库」的 AI——SkillOS 让 agent 真正越用越强 MoE 训练通信瓶颈有救了?DySHARP 直接在交换机里做计算,干掉 50% 冗余流量 2026-05-12-2508_06526 把 Dense LLM 变成 MoE 还能推理提速?NeurIPS 2024 Read-ME 做到了 说人话理解 EPIC:KV Cache 复用的「编译-链接」范式(附可运行代码复现) KV Cache 也能「语义共享」?SemShareKV 用 LSH 做到了 写完 Markdown 还要手动排版?我写了个 VS Code 插件一键搞定微信公众号、知乎、小红书 让不同 LLM 之间共享 KV Cache?DroidSpeak 是怎么做到的 RouteMark: 基于路由行为指纹的模型合并知识产权归属 | A Fingerprint for IP Attribution in Routing-based Model Merging Lang-PINN: 从自然语言到物理信息神经网络的多智能体框架 | From Language to PINNs via a Multi-Agent Framework Ghost in the Cloud: 地理分布式大模型训练的安全隐患 | Your Geo-distributed LLM Training is Easily Manipulated GM-Skip: 基于度量引导的 Transformer 块跳过策略加速视觉语言模型 | Metric-Guided Transformer Block Skipping for Efficient VLMs ExpertFlow: 基于预测性专家缓存与令牌调度的高效MoE推理 | Efficient MoE Inference via Predictive Expert Caching and Token Scheduling AutoHete: 面向大语言模型的自动化高效异构训练系统 | An Automatic and Efficient Heterogeneous Training System for LLMs DAC'26 | ExpertFlow:让 MoE 大模型在单卡上跑起来,内存省 93%、速度快 10 倍 Eurosys26 | FineMoE如何用「细粒度」打破MoE推理的显存-延迟死局 LoRA fine-tune吞吐量提升1.96倍!LoRAFusion如何把内存带宽浪费和pipeline bubble一起干掉 Fast26 | LLM 推理启动慢?华为用一个「可编程 Page Cache」把模型加载砍了 79% KV Cache 的两层存储到底卡在哪?FAST'26 这篇论文给出了答案 NeurIPS24 | 把Dense LLM变身MoE还提速 ICML25 | EPIC:KV Cache 复用的「编译-链接」范式(附可运行代码复现) KV Cache 复用的第三条路:FAST 2026 CacheSlide 是怎么解决 Agent 推理的位置漂移问题的 MoE 推理的内存墙,被一块多芯粒芯片打穿了? KVCOMM:让多 Agent 系统的 KV Cache 真正“通起来”,TTFT 直接砍掉 7.8 倍 NSDI26 | DroidSpeak让不同 LLM 之间共享 KV Cache TokenDance 解决多 Agent LLM 推理的 KV Cache 冗余问题 当 AI 开始学会"记住":LLM Agent 记忆系统的统一视角 【转载】ACM MM 投稿论文模板修改成投稿模式 尝试从源头理解 SVD 原理和计算 LLM 场景下的强化学习技术扫盲 解决 Overleaf 中插入 PDF 图片失败的问题:排查与修复 Tmux ctrl+B快捷键失效处理办法 对抗训练综述学习笔记 【转知乎回答】一文看懂 LLaMA 中的旋转式位置编码(Rotary Position Embedding) 二进制中为什么负数是正数取反再加一 leetcode 常见题型代码总结 Prompt-Tuning、P-Tuning和Prefix-Tuning区别和代码实现【转】 Deepspeed ZeRO系列算法原理+通信开销详解 NSCC集群使用笔记 Huggingface Transformers实现张量并行的小坑 set/get_output_embeddings Pytorch 如何使用 storage 实现参数 offload? TACC 集群使用笔记 图解 vLLM 的推理调度策略 大模型推理框架 vLLM 源码解析(二):Block 模块分配和管理 OpenAI 的视频生成大模型Sora的核心技术详解(一):Diffusion模型原理和代码详解 大模型推理框架 vLLM 源码解析(一)
多 Agent 协作不需要说「人话」?LatentMAS 让 LLM 在隐空间里直接协作
marsggbo · 2026-07-23 · via 博客园 - marsggbo

插播:之前写的《动手学 AutoML》终于出版了,从 NAS 到超参优化都有覆盖,适合想系统入门 AutoML 的同学。好了广告结束,现在进入正题。

动手学AutoML书籍封面

多 Agent 协作不需要说「人话」?LatentMAS 让 LLM 在隐空间里直接协作

原文:Latent Collaboration in Multi-Agent Systems


1. 前言

你有没有想过,当我们让多个 LLM agent 协作解题的时候,它们之间到底在交流什么?

答案是:文本。一个 agent 花了几千个 token 把推理过程写成自然语言,传给下一个 agent,下一个 agent 再花几千个 token 来理解和继续推理。整个过程就像两个程序员用微信聊天来 pair programming——能用,但效率低得离谱。

这个问题在当前的多 Agent 系统(MAS)里是普遍存在的。无论是 AutoGen、CAMEL 这类经典框架,还是 Chain-of-Agents 这种流水线设计,agent 之间的通信全部依赖自然语言。每个 agent 都要先把"想法"编码成离散 token,传给下一个 agent,再从 token 解码出"想法"——这个过程本身就在丢信息、加延迟

但仔细想想,LLM 内部推理的时候,用的根本不是 token,而是 hidden states——一个高维连续向量空间里的表示。token 只是最后被 LM head 解码出来给人看的"翻译"。那一个自然的问题就来了:agent 之间能不能直接传 hidden states,跳过文本这个"中间商"?

来自 Princeton、UIUC 和 Stanford 的一个团队最近提出了 LatentMAS,一个完全在隐空间(latent space)里实现多 Agent 协作的框架——不训练、不微调、不生成中间文本,agent 之间直接通过 KV cache 传递"思维"。在 9 个 benchmark 上,准确率最高提升 14.6%,推理速度快 4-4.3×,token 消耗减少 70.8%-83.7%。

今天想和大家聊聊这个工作背后的设计思路,以及它为什么可能是多 Agent 系统的一个新范式。


2. 为什么文本通信是瓶颈?

先交代下背景。现在的 LLM-based MAS 主要有两种架构:

Sequential 和 Hierarchical 两种 MAS 架构

  • Sequential(链式):planner → critic → refiner → solver,前一个 agent 的输出喂给后一个
  • Hierarchical(层级式):多个领域专家 agent 各自推理,最后由一个 summarizer 汇总

不管哪种架构,agent 之间的通信介质都是文本。这带来三个问题:

第一,信息瓶颈。LLM 内部 hidden state 的维度通常是 2048-5120,一个向量就能编码丰富的语义信息。但编码成 token 之后,每个 token 只是一个离散符号,从 \(|V| \approx 150000\) 的词表里选一个——信息密度断崖式下降。论文里有个很直观的定理:要用 token 无损表达 \(m\) 步 latent thoughts,需要的文本长度至少是 \(\Omega(d_h \cdot m / \log|V|)\),其中 \(d_h\) 是 hidden dimension。对于 Qwen3-8B(\(d_h = 3584\)),这意味着 latent thoughts 可以比文本高效 377 倍

第二,延迟爆炸。每个 agent 都要做一轮完整的 auto-regressive 解码(一个 token 一个 token 地吐),然后下一个 agent 再把这堆 token 全部 prefill 进去。4 个 agent 的 sequential MAS,光文本生成和重新 prefill 就要跑 8 轮前向传播。

第三,错误放大。文本是有歧义的。planner 写的方案可能措辞不精确,critic 理解偏了,refiner 基于偏了的理解做修改……表面文字传递中每一环都可能引入误解,而 hidden states 是精确的数学向量,不存在"理解偏差"


3. LatentMAS 的核心设计

LatentMAS 的完整流程如下图:

LatentMAS 系统架构总览

整个设计分两块:agent 内部的 latent thoughts 生成agent 之间的 latent working memory 传递

3.1 Latent Thoughts:让 Agent 在隐空间里"思考"

标准 LLM 推理的流程是:hidden state \(h_t\) → LM head 解码成 token \(x_{t+1}\) → token embedding \(e_{t+1}\) → 进入下一轮前向传播。

LatentMAS 把中间的"解码-重编码"去掉了:直接把最后一层的 hidden state \(h_t\) 当作下一步的输入 embedding,跳过 token 这个中介

但这里有个工程上的坑:\(h_t\) 是最后一层输出,分布和输入 embedding \(e\) 差异很大。直接把 \(h_t\) 塞回浅层会出现 out-of-distribution 的问题。怎么解?

论文提出了一个很巧妙的 Input-Output Alignment:构造一个对齐矩阵 \(W_a\),把 \(h_t\) 映射回输入 embedding 空间:

\[e = h \cdot W_a, \quad \text{其中} \quad W_a \approx W_{out}^{-1} \cdot W_{in} \]

这里 \(W_{out}\) 是 LM head,\(W_{in}\) 是 token embedding 层。\(W_a\) 只需要算一次,后面所有 latent step 复用。实际实现用的是 ridge regression 的闭式解来保证数值稳定性。

这个设计完全不需要训练——只用了模型自带的 \(W_{in}\)\(W_{out}\),是一个纯推理时的操作。

3.2 Latent Working Memory:用 KV Cache 做跨 Agent 通信

这是全文最有意思的部分。

agent \(A_1\) 完成 \(m\) 步 latent thoughts 生成后,它的所有 transformer 层都积累了一整套 KV cache。这些 KV cache 不仅包含了原始输入的信息,还包含了 \(m\) 步 latent reasoning 产生的新信息。论文把这整套 KV cache 定义为 agent \(A_1\)latent working memory

\[\mathcal{M}_{A_1} = \{(K^{(l)}_{A_1,cache}, V^{(l)}_{A_1,cache}) \mid l = 1, 2, \ldots, L\} \]

下一个 agent \(A_2\) 接手时,做一步简单操作:\(A_1\) 的 KV cache 拼接到自己对应层的 KV cache 前面。就这样,\(A_2\) 就"看到"了 \(A_1\) 所有的思考过程——包括它对原始 prompt 的处理和 \(m\) 步 latent reasoning 的结果。

论文还证明了一个关键定理:通过 KV cache 传递 working memory 和直接把前序 agent 的完整输出重新 prefill 一遍,产生的结果是完全等价的(信息无损)

实现上,KV cache 的传递直接通过 HuggingFace Transformers 的 past_key_values 接口完成——不需要改任何模型代码

3.3 只有最后一个 Agent 需要"说人话"

整个流水线里,前面所有 agent 都在隐空间里思考和传递,只有最后一个 agent 负责解码出文本答案。这大幅减少了 token 生成量和相应的解码开销。


4. 实验结果

4.1 全面压制文本 MAS

如下图,在 9 个 benchmark 上(包括数学推理、常识推理、代码生成),分别用 Qwen3-4B / 8B / 14B 三种规模测试:

LatentMAS 在 9 个 benchmark 上的表现

几个关键数字:

  • 准确率:比单模型平均提升 13.3-14.6%,比 TextMAS 平均提升 2.8-4.6%
  • 推理速度:比 TextMAS 快 4×-4.3×(即使 TextMAS 已经用了 vLLM 加速)
  • Token 用量:减少 70.8%-83.7%

下面这张效率对比图更直观:

LatentMAS 的效率增益

左图是推理速度对比,右图是 token 用量对比。注意 TextMAS 的 baseline 已经用了 vLLM 做加速了,LatentMAS 还能在这个基础上快 2.6×-7×。

在推理密集型任务(AIME24/25、GPQA-Diamond)上,TextMAS 动辄需要 20K+ token 来完成完整的 text-based CoT,而 LatentMAS 只用不到 50 步 latent step 就能达到同等甚至更好的效果。

4.2 Latent Thoughts 是否真的在"思考"?

一个合理的怀疑是:latent step 生成的 hidden states 到底有没有语义?会不会只是无意义的噪声恰好歪打正着?

论文做了一个很有说服力的分析。如下图,把 LatentMAS 生成的 hidden embeddings(红色)和 TextMAS 生成的 token embeddings(蓝色)做 t-SNE 可视化:

Latent thoughts 的语义表达

两个关键观察:

  1. LatentMAS 的 hidden embeddings 和 TextMAS 的 token embeddings 覆盖了几乎相同的 embedding 区域——说明 latent thoughts 编码了和正确文本回答相同的语义
  2. LatentMAS 的分布更广——说明 latent thoughts 比离散 token 具有更高的多样性和表达能力

4.3 对齐矩阵 \(W_a\) 的作用

如下图,不做对齐的 hidden state \(h_t\)(橙色)和原始 input embedding \(e_t\)(蓝色)分布差异很大。做完 \(W_a\) 对齐后的 \(e_{t+1}\)(绿色)重新和 \(e_t\) 对齐了:

Input-Output 对齐效果

去掉 \(W_a\) 后,下游任务准确率下降 2.3%-5.3%。

4.4 最佳 Latent Step 深度

Latent step 并不是越多越好。论文在三个任务上做了 ablation,发现 40-80 步是最佳范围。超过这个范围,性能会平台期甚至下降——过多的 latent step 可能引入冗余信息。


5. 几点个人 Take

这篇工作最让我兴奋的地方不是具体的数字提升,而是它开辟了一个新的思路:多 Agent 之间的通信介质不必是人类可读的文本,可以是模型内部的连续表示

几个值得关注的点:

1. 完全 training-free 这件事很 impressive\(W_a\) 的构造只用了现有的 \(W_{in}\)\(W_{out}\),KV cache 传递用的是 HuggingFace 原生接口。没有额外参数、没有训练数据,直接即插即用。这大大降低了实际落地的门槛。

2. 但同构 agent 的假设是个限制。LatentMAS 要求所有 agent 使用相同架构的模型(same transformer layer shape),因为 KV cache 的 dimension 要对齐才能拼接。现实中,强大的 MAS 往往需要不同规模甚至不同架构的模型分工协作。论文也提到了可以用 adapter 做异构对齐,但这就引入了训练,breaking 了 training-free 的优势。

3. 和 KV cache 通信的结合值得深挖。这篇工作的 KV cache 传递策略非常朴素——全量拼接。随着 agent 数量增加和 latent step 加深,KV cache 会持续膨胀。能不能结合 KV cache 压缩(比如上一篇聊的 SemShareKV 的思路)做选择性传递?这可能是一个有意思的后续方向。

4. 对 latent reasoning 本身的理解还有空间。论文证明了 latent thoughts 的理论表达上界,但对于"模型到底在 latent step 里做了什么"这个问题,目前主要靠 t-SNE 可视化来间接验证。更深入的 mechanistic interpretability 分析会让这个 story 更完整。

总体来说,LatentMAS 把"在隐空间里做多 agent 协作"这个想法走通了,而且效果很好。从文本通信到 latent 通信,本质上是信息传递的效率升级。这个方向和我们做 MoE 推理优化的思路有异曲同工之处——核心都是减少不必要的计算和数据搬运,把算力花在真正重要的地方

欢迎评论区交流,特别是做多 Agent 系统或 LLM 推理优化的同学,欢迎讨论哈哈。