惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Martin Fowler
Martin Fowler
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
A
About on SuperTechFans
Apple Machine Learning Research
Apple Machine Learning Research
The Register - Security
The Register - Security
Vercel News
Vercel News
H
Hackread – Cybersecurity News, Data Breaches, AI and More
人人都是产品经理
人人都是产品经理
MyScale Blog
MyScale Blog
云风的 BLOG
云风的 BLOG
博客园_首页
U
Unit 42
T
Tailwind CSS Blog
G
GRAHAM CLULEY
F
Full Disclosure
V
Vulnerabilities – Threatpost
T
Tenable Blog
月光博客
月光博客
P
Privacy & Cybersecurity Law Blog
P
Privacy International News Feed
K
Kaspersky official blog
Scott Helme
Scott Helme
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
N
News and Events Feed by Topic
T
The Exploit Database - CXSecurity.com
N
News and Events Feed by Topic
有赞技术团队
有赞技术团队
Recent Commits to openclaw:main
Recent Commits to openclaw:main
L
LINUX DO - 最新话题
Recorded Future
Recorded Future
Application and Cybersecurity Blog
Application and Cybersecurity Blog
Help Net Security
Help Net Security
The GitHub Blog
The GitHub Blog
Cisco Talos Blog
Cisco Talos Blog
SecWiki News
SecWiki News
P
Proofpoint News Feed
Security Latest
Security Latest
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
罗磊的独立博客
S
Security Affairs
M
MIT News - Artificial intelligence
L
LINUX DO - 热门话题
美团技术团队
Simon Willison's Weblog
Simon Willison's Weblog
T
Threat Research - Cisco Blogs
Stack Overflow Blog
Stack Overflow Blog
Forbes - Security
Forbes - Security
Hugging Face - Blog
Hugging Face - Blog
博客园 - Franky
V
Visual Studio Blog

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
ChatGPT那一套要过时了?翁荔实测创业首个模型,回合制AI被“原生实时交互”秒了
华卫 · 2026-05-13 · via InfoQ - 促进软件开发领域知识与创新的传播

整理 | 华卫

AI 是否正在结束“回合制”聊天的时代?

所有在工作或日常生活中经常使用 AI 模型的人都知道,在文本、图像、音频和视频等各种模态下,现在基本的交互模式仍然是一样的:人类用户先提供输入,然后等待从几毫秒到几分钟不等(在某些特别复杂的问题中,甚至需要数小时或数天),随后 AI 模型再给出输出。用 Thinking Machines 的话说,目前大多数 AI 模型都是通过“外挂式”的方式来实现交互,将不同组件拼接在一起以模拟打断、多模态或并发等能力。然而,这类手工构建的系统终将被通用能力的进步所超越。

“如果 AI 真正要承担那些需要自然交互的工作,它就必须超越这种「回合制」的交互方式。最终,它需要能够更流畅、更自然地响应人类输入,甚至在处理下一次人类输入(无论是文本还是其他形式)的同时就做出回应。”这是 Thinking Machines 的观点。去年,前 OpenAI 首席技术官 Mira Murati、前 OpenAI 研究员兼联合创始人 John Schulman 等人创立了这家资金充足的 AI 初创公司,致力于让先进 AI 系统“更易理解、更可定制,并具备更通用的能力”。

今天,Thinking Machines 宣布推出“交互模型”TML-Interaction-Small,将其称为“首个同时具备强大智能/指令遵循能力与交互性的模型”。据介绍,这是一个拥有 2760 亿参数的混合专家(MoE)模型,其中活跃参数为 120 亿,可以持续接收音频、视频和文本输入,并在实时中进行思考、响应和行动,不依赖外部“脚手架”来实现交互能力。根据第三方基准测试结果,这种方法在性能上取得了显著提升,同时也降低了延迟。

不过,该模型目前尚未向公众或企业开放,该公司在公告博客中表示:“在接下来的几个月里,我们将开放一个有限的研究预览以收集反馈,并计划在今年晚些时候更广泛发布。”

137 页训练日志的交互模型,实力碾压其他前沿模型

在研究预览中,Thinking Machines 展示了 TML-Interaction-Small 模型在交互能力上的质变,以及在智能与响应速度之间达到的当前最先进的综合表现。

“整体体验更像是在协作,而不是在‘下提示词’。”演示视频中,OpenAI 前应用研究副总裁、Thinking Machines 联合创始人翁荔出镜展示了 TML-Interaction-Small 模型的无缝对话管理能力。该模型能够隐式判断说话者是在思考、让出话语权、自我修正,还是在邀请回应,无需单独的对话管理模块。

视频

在 X 上,翁荔表示,“过去几个月,我们玩得很开心,也有很多压力,最终产出了 12 个版本(外加大量子版本)和 137 页的训练日志。事实证明,人与人之间的协作对于提升人机协作非常重要。”

不仅如此,TML-Interaction-Small 模型还解锁了一系列原本需要通过“外部脚手架”实现的能力,包括:

  • 语言与视觉的即时插话:模型可以根据上下文在需要时主动插入,而不仅仅是在用户说完之后才回应。

  • 同时语音(Simultaneous speech):用户与模型可以同时说话(例如实时翻译)。

  • 时间感知(Time-awareness):模型对时间流逝具有直接的感知能力。

  • 同时进行工具调用、搜索与生成式 UI:在与用户对话(说与听)的同时,模型可以并行执行搜索、浏览网页或生成界面,并将结果自然地融入对话之中。

为衡量交互质量,该实验室使用了 FD-bench,这是目前少数专门用于衡量交互性的基准之一。为量化智能水平,他们使用 Audio MultiChallenge,这是一个常用的基准,用于评估智能和指令遵循能力。结果显示,TML-Interaction-Small 显著优于现有的实时系统,包括 Gemini-3.1-flash-live 和 GPT-realtime-2.0 minimal。

  • 响应速度:其轮次响应延迟为 0.40 秒,而 Gemini-3.1-flash-live 为 0.57 秒,GPT-realtime-2.0 minimal 为 1.18 秒。

  • 交互质量:在 FD-bench V1.5 上,其得分为 77.8,几乎是主要竞争对手的两倍(GPT-realtime-2.0 minimal 为 46.8)。在 FD-bench v1.5 中,模型会接收预录音频,并需要在特定时刻作出响应。该基准从多个场景评估模型行为,包括用户打断、用户回应性反馈(backchannel)、与他人对话以及背景语音。

同时,该实验室改造了 RepCount-A、ProactiveVideoQA 和 Charades 三个基准来评估模型的视觉主动性。结果显示,在 RepCount-A(视频中物理动作计数)和 ProactiveVideoQA 等专项测试中,Thinking Machines 的模型能够主动参与视觉环境,而其他前沿模型则保持沉默或给出错误答案,包括高推理模型。

Thinking Machines 认为,通过将“交互性”内化为模型的一部分,模型规模的扩展将不仅让其更聪明,也会让它成为更高效的协作伙伴。此外,他们表示,虽然预计随着模型规模的扩大,交互能力也会进一步提升,但目前更大规模的预训练模型在这一实时交互场景下仍然过于缓慢,无法投入使用。“今年晚些时候,我们计划发布更大规模的模型。”

从零开始训练,200 毫秒为单位实时响应

这次发布的核心,是 AI 在“时间感知”和“存在感”上的一次根本性转变。当前的前沿模型通常以单线程方式体验现实。它们会等待用户完成输入后才开始处理,并且在生成回应时,其“感知”是冻结的。在博客中,Thinking Machines 的研究人员将这种现状描述为一种限制,它迫使人类不得不去“迁就”AI 接口,比如把问题写得像邮件一样,并将思考打包成一整块再输入。

为解决这种“协作瓶颈”,Thinking Machines 从零开始训练了这一交互模型,并放弃了标准的交替式 token 序列。取而代之的是,他们采用了一种多流(multi-stream)、微回合(micro-turn)的设计,可以以 200 毫秒为单位同时处理输入和输出,确保实时响应能力。这种“全双工”(full-duplex)架构使模型能够实时地“听、说、看”,从而在用户说话时进行回应性反馈(backchannel),或在捕捉到视觉线索时主动插话。例如,当用户在代码片段中写出 bug,或者有朋友进入视频画面时。

技术上,该模型采用了无编码器的早期融合(encoder-free early fusion)。系统不再依赖像 Whisper 这样庞大的独立编码器来处理音频,而是通过一个轻量级嵌入层,直接接收原始音频信号(以 dMel 表示)和图像块(40×40),并在 Transformer 架构中从零开始联合训练所有组件。

由于实时交互需要近乎即时的响应速度,而这往往与深度推理能力存在冲突,该实验室因还此设计了一种由两部分组成的系统:

  • 交互模型(Interaction Model):始终与用户保持持续交互,负责对话管理、存在感维持以及即时响应。

  • 后台模型(Background Model):作为一个异步代理,负责处理持续性推理、网页浏览或复杂工具调用,并将结果流式传回交互模型,由后者自然地融入对话中。

在整个过程中,交互模型始终保持在线,回答后续问题、接收新的输入、维持对话上下文,并在后台结果返回时将其整合进对话中。当某个任务需要比即时响应更深层的推理时,交互模型会将其委托给异步运行的后台模型。这种分工让用户既能获得高响应速度,又能享受到完整的智能能力,包括推理模型的规划能力、工具使用能力以及代理式工作流,同时又具备非“思考型”模型的低延迟响应。

并且,这种架构使 AI 能够在执行任务(如实时翻译或生成 UI 图表)的同时,继续监听用户反馈。这一功能在发布视频中也得到了展示,模型在生成条形图的同时,给出了类似人类反应时间的多种提示反馈。需要注意的是,后台模型和交互模型本身都具备智能能力。即使单独使用,交互模型在交互性能和智能基准测试上也具有很强的竞争力。

一旦开放,将为企业带来巨大价值

如果 Thinking Machines 的交互模型向企业开放,很可能将从根本上改变企业将 AI 融入运营流程的方式。像 TML-Interaction-Small 这样的原生交互模型,可以实现当前标准多模态模型无法做到或极其脆弱的多种企业能力。

当前的企业 AI 必须完成一个“回合”后才能分析数据。而在制造业或实验室环境中,原生交互模型可以持续监控视频流,一旦检测到安全违规或流程偏差,就能主动插入提醒,无需等待工作人员提出问题。该模型在 RepCount-A(精确计数重复动作)和 ProactiveVideoQA(随着视觉证据出现即时回答问题)等视觉基准中的表现,表明它可以作为高风险物理任务的实时审计员。

在语音客服中,主要的摩擦来自于 2026 年标准 API 常见的 1–2 秒“处理延迟”。Thinking Machines 的模型将轮次延迟降低至 0.40 秒,大致相当于自然人类对话的速度。由于其原生支持同时语音处理,企业客服机器人可以在不打断用户的情况下,一边倾听客户情绪,一边提供“回应性反馈”(例如“我明白”“嗯嗯”),并提供实时翻译,使对话更像自然交流,而不是一段段割裂的录音。

标准大模型缺乏“内在时钟”,只有在文本提示中提供时间信息时才“知道时间”。而交互模型天生具备时间感知能力,可以管理时间敏感流程,例如“每 4 分钟提醒我检查一次温度”或“如果这个流程比上一次耗时更长就提醒我”。这对于工业维护和制药研究尤为关键,因为时间是核心变量。

此前,Thinking Machines 表示,将在其发布中坚持“重要的开源组件”,以赋能研究社区。但目前,尚不清楚这些新的交互模型是否会遵循同样的开源策略。

另值得一提的是,此次模型发布前,Meta 已从 Thinking Machines 挖走 7 名创始成员。据外媒报道,挖人前,Meta CEO 马克·扎克伯格曾接触 Mira Murati,试图收购 Thinking Machines Lab,但被拒绝了。

不过,Thinking Machines 并非单向流失人才,公司也聘请了 PyTorch 创始人 Soumith Chintala 担任 CTO,并引入 Neal Wu 等知名技术人才。有外媒报道称,曾在 Meta 工作 8 年、负责多模态感知系统的 Weiyao Wang 也已加入该公司。目前,该公司的规模增长至约 130 人。

参考链接:

https://thinkingmachines.ai/blog/interaction-models/