惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
S
Securelist
GbyAI
GbyAI
The Register - Security
The Register - Security
B
Blog
Recorded Future
Recorded Future
D
DataBreaches.Net
C
Cybersecurity and Infrastructure Security Agency CISA
A
About on SuperTechFans
C
CERT Recently Published Vulnerability Notes
T
The Blog of Author Tim Ferriss
Vercel News
Vercel News
Google DeepMind News
Google DeepMind News
S
Schneier on Security
S
SegmentFault 最新的问题
Martin Fowler
Martin Fowler
T
Tenable Blog
T
The Exploit Database - CXSecurity.com
阮一峰的网络日志
阮一峰的网络日志
宝玉的分享
宝玉的分享
AWS News Blog
AWS News Blog
L
Lohrmann on Cybersecurity
Spread Privacy
Spread Privacy
N
News | PayPal Newsroom
Engineering at Meta
Engineering at Meta
T
Tor Project blog
The Hacker News
The Hacker News
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
MongoDB | Blog
MongoDB | Blog
Cyberwarzone
Cyberwarzone
Security Archives - TechRepublic
Security Archives - TechRepublic
爱范儿
爱范儿
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
C
Cyber Attacks, Cyber Crime and Cyber Security
T
Threatpost
WordPress大学
WordPress大学
Google Online Security Blog
Google Online Security Blog
G
GRAHAM CLULEY
Google DeepMind News
Google DeepMind News
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Attack and Defense Labs
Attack and Defense Labs
N
Netflix TechBlog - Medium
SecWiki News
SecWiki News
Hacker News: Ask HN
Hacker News: Ask HN
M
MIT News - Artificial intelligence
Scott Helme
Scott Helme
Microsoft Security Blog
Microsoft Security Blog
H
Help Net Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
顶流里最快!智谱,你是在「喷」代码吧
十三 · 2026-05-22 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

顶流里最快!智谱,你是在「喷」代码吧

2026-05-22 11:05:00 来源:量子位

400 tokens/s

金磊 发自 凹非寺

量子位 | 公众号 QbitAI

AI啊,你这速度简直是在喷射啊!

仔细看,千万别眨眼:

视频地址:
https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

这么多的代码,直接就是“啪的一下”喷出来的感觉。

之前AI写代码像CPU渲图一样,是一点一点打出来;但这个AI写代码,更像GPU:

这么快生成的代码,能好用吗?

答案是可以的:

这就是智谱刚刚新出的高速版API——GLM-5.1-highspeed

按照官方的说法,这个旗舰版模型的API,是目前顶流模型里最快的,已经达到了400 tokens/s!

而且这个GLM-5.1啊,虽然已经出了一个多月了,但现在还是开源模型里Coding最强的那一个:

那么接下来,老规矩,一波实测走起~

一手实测GLM-5.1-highspeed

AI写代码像开了倍速

我们先来做一个比开头更加复杂的例子,Prompt是这样的:

做一个网页,画面中心是一个会呼吸的星云;用户点击播放后,粒子会随着模拟音频节奏扩散、聚合、变色;旁边还要有几个可调参数,比如速度、密度、拖尾、光晕强度。

视频地址:
https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

同样的,如此多行的代码,AI在思考了十几秒后,依旧是一口气给喷出来的。

这类任务的难点在于,它要同时处理前端结构、Canvas 动画、状态管理、视觉参数、交互逻辑,还要让效果看起来不至于太low。

从结果上来看,确实也是达到了Prompt的要求:

像跟设计师坐在同一块画布前

第二个测试更有意思。

我们在上一个代码基础上,继续提出更多要求:

“这个波纹再快一点。”

“光晕颜色偏暖一些。”

“粒子散开时别那么硬,柔一点。”

“背景不要全黑,稍微有一点深蓝层次。”

视频地址:
https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

首先,我们的这些指令都是比较模糊的,并非像“把第42行的speed从0.6改成1.2”这么精确,所以模型需要先精准地理解我们的意图。

其次,由于GLM-5.1-highspeed的速度够快,我们做项目的体感都不一样了——

更像是和AI坐一起,一块盯着画布调参。

这也是高速API容易被低估的地方,和AI一起共事做项目,现在更接近实时的感觉了。

让模型当游戏导演

第三个测试,我们把场景再往前推一步。

如果模型足够快,它能不能在游戏里实时改变世界?

比如做一个小型2D游戏:

玩家控制一个角色在3D地图里移动,场景中有障碍、敌人、道具、天气、光照和随机事件。有对话框可以输入文字,场景会根据输入的文字实时改变。

然后我们不给模型固定脚本,而是不断发出类似导演指令:

“下雪”、“下雨”、“爆炸”……

视频地址:
https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

这类测试比写网页更刁钻。

因为模型要理解游戏状态、代码结构、交互逻辑,还要判断什么改动会影响体验。

而高速API让此前因延迟而难以成立的产品形态变得可行,例如模型在游戏中实时改变游戏世界状态。

当然,这里还有很多工程问题没解决,比如稳定性、安全边界、状态一致性、成本和并发。但至少从速度维度看,400 tokens/s级别的API已经让这类想象不再只停留在 PPT 里。

10秒处理万字内容

第四个实测,我们回到内容行业。

我们用AI读取一份万字长文的内容素材,让它一口气执行下面的内容:

  1. 提炼3句最吸睛的海报主标题;
  2. 生成6条15字内短视频口播文案;
  3. 输出三套产品宣传语(适合官网首页);
  4. 生成可直接发公众号的文案(800字);
  5. 最后生成JSON格式汇总所有内容。

视频地址:
https://mp.weixin.qq.com/s/Wn1-SzjpEkQLTyZnJKDRwg

只花了10秒钟!

而且效果也是依旧稳稳地拿捏到位了:

在AI的速度上来之后,让人类更快地进入到了判断的环节;由此,人和AI的协作更接近来回打磨了。而非一次性下单。

Agent进入快时代

如果只看400 tokens/s这个数字,我们可能很容易把它理解成模型变小了,所以跑得快。

但实际上,GLM-5.1-highspeed更值得关注的点在于,它主打旗舰模型高速版,而不是一个单纯追求低延迟的小模型。

这背后靠的是系统工程

智谱GLM团队与TileRT团队联合打造GLM-5.1-highspeed,在推理引擎、调度系统和底层基础设施三个层面做了优化:

推理引擎针对GLM-5.1架构特点重写核心推理路径,调度系统通过动态批处理、请求合并、KV缓存调度等方式降低高并发场景尾延迟,基础设施层面则围绕推理集群部署、网络链路和负载均衡做协同优化。

简单理解,大模型推理不是GPU算一下就完事。

真实线上系统里,请求怎么排队,怎么合并,KV 缓存怎么调度,多卡之间怎么通信,网络链路怎么负载均衡,都会影响最终延迟。

TileRT的思路更进一步。

它把推理调度单元从传统operator/kernel进一步下沉到tile级别,通过编译期静态编排、常驻GPU的persistent Engine Kernel、减少host调度和跨算子同步等方式,压缩推理过程里的调度、搬运与同步开销。

用一句更通俗的话,可以这样理解:

过去像一群工人每搬一块砖都要等工头发一次指令;现在提前把路线、分工、节奏排好,让工人持续在工地里流水线协作。

大模型推理速度的提升,很多时候不只来自更强的芯片,也来自对系统里每一个空转环节的压榨。

高速API的竞争,本质上是模型能力、推理引擎、调度系统和基础设施的综合战。

当然,速度不能被神化。

一个API真要进入生产环境,还要看模型质量、稳定性、成本、上下文能力、工具调用可靠性、并发能力,以及复杂任务里的错误率。

尤其是400 tokens/s这样的速度数字,也需要在更多任务、更多时段、更多并发条件下持续验证。

但至少从这次测试可以看到一个明确趋势:

国产大模型API的竞争,正在从能不能答得好,进一步走向能不能又快又稳地干活。

GLM-5.1-highspeed的意义,也正在这里。

它让我们看到,当旗舰模型能力和高速推理系统叠在一起,AI Agent的体验会出现一个很直观的变化:等待变少,反馈变密,任务推进更连续。

Coding时代,速度是爽点。

版权所有,未经授权不得以任何形式转载及使用,违者必究。