惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
Security @ Cisco Blogs
Y
Y Combinator Blog
N
Netflix TechBlog - Medium
aimingoo的专栏
aimingoo的专栏
Martin Fowler
Martin Fowler
大猫的无限游戏
大猫的无限游戏
IT之家
IT之家
C
Check Point Blog
爱范儿
爱范儿
A
About on SuperTechFans
博客园 - 聂微东
V
Visual Studio Blog
博客园_首页
WordPress大学
WordPress大学
Help Net Security
Help Net Security
博客园 - Franky
Forbes - Security
Forbes - Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Webroot Blog
Webroot Blog
博客园 - 司徒正美
人人都是产品经理
人人都是产品经理
量子位
Vercel News
Vercel News
Google DeepMind News
Google DeepMind News
W
WeLiveSecurity
V
V2EX
SecWiki News
SecWiki News
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Hugging Face - Blog
Hugging Face - Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
S
Securelist
L
LangChain Blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
Schneier on Security
Schneier on Security
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
The Register - Security
The Register - Security
L
Lohrmann on Cybersecurity
www.infosecurity-magazine.com
www.infosecurity-magazine.com
P
Privacy International News Feed
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
C
Cyber Attacks, Cyber Crime and Cyber Security
Simon Willison's Weblog
Simon Willison's Weblog
Apple Machine Learning Research
Apple Machine Learning Research
Security Archives - TechRepublic
Security Archives - TechRepublic
Latest news
Latest news
Spread Privacy
Spread Privacy
F
Full Disclosure
美团技术团队
I
Intezer

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
撸猫撸出SOTA!3个00后2个月,造出史上最快流式音视频社交模型
听雨 · 2026-06-20 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-06-20 18:42:35 来源:量子位

速度快7倍,成本只有Veo 3的1/2000

鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI

一觉醒来,AI的新潮流变成了养猫???

火速围观一下,刚刚全球流式音视频模型赛道闯进了一匹黑马,能力SOTA级,模型名字就叫缅因猫(MaineCoon)。

养过缅因猫的朋友都知道,这个品种有个外号叫「猫狗」,意思是几乎你走到哪儿,它就跟到哪儿,相当粘人,互动感MAX。

而模型MaineCoon和它几乎是如出一辙,不会一股脑生成完就跑,而是一直陪着你、follow你的状态,实时地往下走。

比如这样:

【此处无法插入视频,遗憾……可到量子位公众号查看~】

给它一段文字,它直接边生成边播放,还能做到音画同出,效果就像是在和真人主播1V1视频对话,而且永远不会卡顿。

时长可达30分钟以上,这也是业界首次实现这个长度。

【此处无法插入视频,遗憾……可到量子位公众号查看~】

此外,MaineCoon的推理速度也很突出——

22B参数的大小,却能在单张H100上跑出47.5 FPS,同赛道速度位居业界第一;即使是在只有H100一半成本的推理卡RTX Pro 6000上,也能稳定保持30 FPS以上的实时运行速度。

具体什么概念呢?

假设我手里有一张GPU,用MaineCoon生成一条10秒的短视频,⾸帧将在3s以内出现,随后开始流式输出,新增prompt与实时输出无缝衔接,全程过渡丝滑自然。

成本直接被打下来,每秒成本控制在0.001美元以内。

如果在GPU占满的状态下,每秒推理更是仅需0.00025美元,是Veo 3的1/2000、Seedance的1/560。

而这些,来自一家base中国的10人初创团队,名叫Catnip(猫薄荷)。

几天前,他们刚刚在𝕏上发布了技术报告,就迅速收获多方关注,其中LTX官⽅也注意到了这家新面孔,并主动寻求合作。

话不多说,来看具体效果。

效果show time

其实MaineCoon和一般的音视频生成模型还不太一样,它首次将场景垂直落地在社交交互中。

何为社交?就是活人感

且看各家现有的生成模型卷到飞起,Benchmark表现一个赛一个亮眼,但依旧有硬伤:

要么速度太慢,要等完整生成后才能看到效果,根本没法实时,对创作者并不友好;要么做得了视频,却顾不上音频,音画永远分开走。

这类通用音视频模型更擅长模拟物理规律和场景叙事,天空中的云怎么飘、水面的光怎么反射,它们拿捏得很准,但一到人物表现上就屡屡翻车。

于是判断AI视频与否,大家总结出一条心照不宣的经验——看脸

要做社交距离也不露怯的视频,关键在于人物细节是不是够自然,比如眼神的变化、嘴角的抽搐、说话的节奏等等,还要音画高度同步、生成过程中随时可切换指令。

难度系数拉满了,但这些细节才是决定活人感的关键。

所以MaineCoon瞄准的,正是这个被整个行业忽视掉的缺口。

具体来说,它做到了三件此前没有模型能同时做到的事。

音视频流式生成

先科普一下,什么是流式生成

这并非新鲜概念,最早ChatGPT一个字一个字往外蹦,就是流式输出。简单来说,就是让模型能够边看边生,推理到哪儿,就生成到哪儿。

但视频的一帧涉及到成千上万个像素,还要和音频在时间轴上精准对齐,和单纯文字流式生成的难度完全不在同一个量级上。

而且生成片段越小,就意味着每一帧能依赖的历史上下文越短,模型就更容易露馅。

MaineCoon则把这个单元极致压缩到了亚秒级,指令输出后1秒内就出首帧,低延迟和高质量两手抓。不止快了一点,更是生成方式的彻底改变。

比如下面模拟人物对话,初始Prompt要求人物语气平静且深思熟虑,结果无论是角色的面部肌肉走向,还是语气停顿,都精准遵循指令。

【此处无法插入视频,遗憾……可到量子位公众号查看~】

中间实时输入新的指令,模型也能及时调整:

【此处无法插入视频,遗憾……可到量子位公众号查看~】

让角色做大幅度表情,也同样表现优秀:

【此处无法插入视频,遗憾……可到量子位公众号查看~】

也可以随时提出问题让角色解答:

【此处无法插入视频,遗憾……可到量子位公众号查看~】

不得不说,相比过去AI一句指令就出一堆回复的生硬别扭,MaineCoon的最大差异在于给予用户真人聊天的即视感,会接用户的话,也会给用户情绪。

这大概就是养猫人常说的——你以为你在撸猫,其实猫也在撸你。

业界最快的推理速度

速度更不必多说,亲测体验下来,同类流式音视频模型的速度普遍在6-7 FPS,MaineCoon快了整整7倍

即使是持续生成一整天,成本也都能维持在一个合理范畴内。模型虽然有22B,但单卡就能部署(最高47.5 FPS)。

相比1.3B的轻量流式视频模型(19.1FPS)也要快2倍以上,轻松满足实时播放需求。

更关键的是,这样的速度不仅没有牺牲质量,反而情感表达更丰富,动作也更连贯稳定

比如我们把场景搬到室外,日落时分的光影结合角色随风飘扬的发丝,说是真人博主在随意记录自己的City Walk也不为过。

【此处无法插入视频,遗憾……可到量子位公众号查看~】

无限时长生成

根据官方介绍,MaineCoon还能做到连续生成10分钟以上的音视频内容,期间保持画质、一致性、音画同步都不崩。

毫不夸张地说,MaineCoon的架构甚至完全可以无限生成。

这里以一个长达2分钟的MaineCoon视频为例,直到最后,人物都没有出现明显bug。

【此处无法插入视频,遗憾……可到量子位公众号查看~】

即使是动画风格的Minecraft小人,长时序也能稳稳接住。

【此处无法插入视频,遗憾……可到量子位公众号查看~】

Catnip还同步自建了首个社交短视频专用基准测试SocialVideo Bench,以直观展示MaineCoon的表现。

SocialVideo Bench涵盖密集演讲、双人互动、音乐演唱、情绪表演、舞蹈、创意挑战、社交梗七大场景,九项指标全面考核视觉质量、运动质量、音质、音画对齐。

其中,MaineCoon均超越主流的7款音视频生成模型,综合得分0.934,远超最优基线SoulX-FlashTalk(0.895),刷新SOTA

问题是——MaineCoon是如何做到的?

三层训练,三层推理

先说训练侧

MaineCoon的训练框架主要分三个阶段,层层递进:

Step 1:自重采样(Self-Resampling)

这一步解决的是推训之间的鸿沟问题。传统训练中会用干净的历史帧做上下文,但真实推理时模型只能用自己生成的帧,二者之间存在偏差,而且时间一久,越生成越跑偏。

自重采样能够让模型在训练时就接触到降质版的历史帧,从一开始就学会在带有轻微漂移、噪声的不完美条件下保持稳定。

Step 2:流式表征对齐(Representation Alignment)

音画联合训练实际上是很慢的,为了加快收敛速度,MaineCoon会引入冻结预训练V-JEPA 2视觉编码器做蒸馏监督。

于是模型能够更快学到跨模态的语义结构,大幅提升训练效率,也可以简单将其理解为一个训练加速器和稳定器。

Step 3:域感知偏好优化(DPO)+强化在线策略蒸馏(ROPD)

这是模型的后训练核心,针对不同社交场景,比如舞蹈看重动态、对话看重唇同步、远景看重人体结构,分别训练专门的偏好专家模型,再通过强化蒸馏统一成一个可部署的流式策略。

这样既精准,又轻量。

然后在此基础之上,要让模型在有限的算力资源上真正跑起来,团队还精心设计了一套基础设施工程

毕竟22B模型的参数量太大,不处理,一张卡根本装不下。

具体来说,64张H100分摊参数,长序列切开并行处理,精度和优化器状态则能压则压。

最关键的一步是把视频编码、文本嵌入、教师特征全部提前算好存进磁盘,训练时直接读取,而GPU只做最核心的那一步,不做任何多余的搬砖工作。

结果就是,22B的模型,在10k GPU小时内就训练完成,数据一共不到100万条

推理侧同样有一套创新的Agentic推理框架,该框架由三个独立的智能控制器构成,分别是DirectorCache ManagerBuffer Controller

首先是Director,这也是整个系统的认知核心,专门负责叙事与纠错。

Director先通过规划器逐节拍生成结构化提示词(画面描述+台词+环境音),以维持人物人设、避免叙事重复。

然后观测器持续监测生成内容是否出现质量漂移,一旦发现问题就启动前向修复,不中断、不重置,直接在下一帧开始纠偏。

这样做是为了缓解流式长视频最容易出现的问题之一:畸变

生成时间越长,误差累积就越严重,因为模型在生成当前chunk时,参考的是前一个chunk,但殊不知前一个chunk已经相对第1个chunk偏移了。之后每一步的微小偏差叠加起来,人物就会严重畸变。

所以MaineCoon从推理的第一步起,就试图将偏差遏制在摇篮中。

随后观测器会将观测结果返回给Director,主导记忆的缓存管理器通过拿到Director的输出,开始执行管理KV缓存的保留与清除策略,它会将角色外观、场景建立帧、关键对话帧作为长期记忆锚点保留,同时定期用统计锚点修正全局外观漂移。

同时因为MaineCoon生成速度快于播放速度,会自然积累起一段已生成但未播放的缓冲内容。

为了平衡实时性与交互响应,前瞻缓冲区控制器会负责把这段超前量控制在合理窗口内,既保证播放不卡顿,又保证用户的交互指令能在合理延迟内生效。

简单来说,这部分就是一个写剧本、一个管记忆、一个控节奏——三者分工明确、互不干扰,共同支撑起了无限续流。

但这还不是全部。

下一步是社交世界模型

MaineCoon甚至还只是Catnip的起点。

他们真正的野心,藏在MaineCoon的定位上——社交世界模型

这个概念由Catnip独家首次提出,旨在弥补一段行业内长期视而不见的空白:

现有的视频世界模型,无论做得多么精密,本质都还是在模拟物理世界。它们重视苹果如何垂直落地,车辆如何克服摩擦力运动,而人在其中扮演的角色更像是一种会动的物体,辅助场景完成画面。

社交世界模型要做的恰恰相反。

它直接把人当作坐标系的中心,主动观察用户的情绪状态,以人为原点模拟社交行为的走向,然后利用实时音视频的方式做出合理反应。

团队认为其包含三个层面:感知层(读懂用户情绪)→ 模拟层(预测社交行为)→ 渲染层(实时生成音视频)。MaineCoon正是第三层的突破。

选择渲染这一层作为首要切入点,一方面是因为渲染层是最难,但也是整个系统的最终出口,如果没有实时生成能力,前两层再强也没有用武之地。

另一方面,业界始终缺乏一个推理快、成本低、质量高的流式音视频模型,先做这个,也是从商业角度考虑的最优解。

再往后看,下一步就是摆脱传统AI对话的半双工轮流交互模式,实现人类式连续、交错、多模态的实时双向交互。

也就是AI能一边持续生成,一边感知用户的实时反馈(包括文本、语音、视频),像真人对话一样即时调整。

而当这一层被彻底打通,模型和应用层之间的闭环才真正形成。Catnip也在积极推进将其落地为一个可交互的内容平台,支持海量用户实时感应、实时生成。

至于为什么Catnip能率先意识到这一点,我们可以从这支团队入手。

有趣的是,缅因猫这个品种一开始也是工作猫起家,专职捕鼠、保粮仓,基因里自带实用主义。

这与Catnip给人的印象不谋而合——

成立大半年,没有任何公开露面,相当低调,日常就是专注埋头干活,唯一对外的动作就是这次把技术报告挂上arxiv。

不鸣则已,一鸣惊人。

但即便在水下,这支团队也已经被最具洞察的投资人抢着押注。

开年这几个月,就连续收获了红杉、明势等头部VC的天使轮+融资,不仅因为团队是一群00后青春风暴,还罕见拥有一线实战经验,既懂技术又懂商业

创始人杨姝瑞虽然很年轻,但曾在TikTok和PixVerse做产品,推动过多款爆款模版特效从0-1落地。除此之外,杨姝瑞也是连续创业者,第⼀段创业合伙创办海外社媒营销agency VANZO MEDIA,实现了千万年度营收。

主导算法研发的是⾸席科学家、⾹港科技⼤学(⼴州)助理教授谢泽柯,拥有中科⼤本科、东京⼤学博⼠教育背景,曾在百度研究院参与⼤模型的前沿研究,并⻓期担任NeurIPS、ICLR、ICML等AI顶级会议的领域主席。

另外,团队还有一群02/03年的应届生小伙伴,在极具创造力地工作。

且看MaineCoon的研发过程,据官方介绍,项目正式启动是从今年3月开始,3名核心研究员,只用了2个月时间就完成了模型训练、训练架构、数据基建、推理系统的全栈交付。

方法也很激进,直接全程使用AI Native:人定框架和思路,AI执行具体计划;人搭数据infra,AI跑流水线。

但正是这样的打法,最终效果惊艳,成果说话——MaineCoon火了。

其实用团队的话来说,MaineCoon更像是一只时刻感知用户内心状态的真正的猫

当生成式AI正在从被动内容工具走向社交主动参与者,作为能感知、回应和记住用户的AI存在,它承载着人类共同的情感交互需求。

MaineCoon是这个方向上踏出的第一步,而且更重要的是它映射出的信号:

下一代社交平台的底层引擎,已经被按下了开始。

P.S.官方已限量开放200个邀请码,点击「阅读原文」即可进入官网申请内测。

论文链接:https://arxiv.org/abs/2606.17800

官网链接:https://mainecoon.tech/

模型Blog: https://mainecoon.tech/blogs

版权所有,未经授权不得以任何形式转载及使用,违者必究。