惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

aimingoo的专栏
aimingoo的专栏
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
博客园_首页
Recent Announcements
Recent Announcements
A
About on SuperTechFans
云风的 BLOG
云风的 BLOG
T
Troy Hunt's Blog
F
Fortinet All Blogs
Webroot Blog
Webroot Blog
S
Secure Thoughts
D
Docker
Attack and Defense Labs
Attack and Defense Labs
博客园 - 叶小钗
H
Heimdal Security Blog
S
Security Affairs
Microsoft Azure Blog
Microsoft Azure Blog
The GitHub Blog
The GitHub Blog
T
Tenable Blog
I
InfoQ
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
L
LangChain Blog
Project Zero
Project Zero
Cyberwarzone
Cyberwarzone
NISL@THU
NISL@THU
有赞技术团队
有赞技术团队
AWS News Blog
AWS News Blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
IT之家
IT之家
Vercel News
Vercel News
www.infosecurity-magazine.com
www.infosecurity-magazine.com
C
CXSECURITY Database RSS Feed - CXSecurity.com
T
Threatpost
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
Forbes - Security
Forbes - Security
博客园 - 聂微东
Security Latest
Security Latest
T
Threat Research - Cisco Blogs
Latest news
Latest news
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
Stack Overflow Blog
Stack Overflow Blog
Cloudbric
Cloudbric
Google DeepMind News
Google DeepMind News
C
CERT Recently Published Vulnerability Notes
N
Netflix TechBlog - Medium
酷 壳 – CoolShell
酷 壳 – CoolShell
T
The Blog of Author Tim Ferriss
J
Java Code Geeks
C
Check Point Blog
Recorded Future
Recorded Future
Jina AI
Jina AI

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
41个榜单SOTA!智谱最新开源GLM-4.5V实测:看图猜地址、视频秒变代码
新智元 · 2025-08-12 · via 人人都是产品经理

智谱昨夜甩出开源核弹 GLM-4.5V:42 项基准 41 个 SOTA,100B 参数直接登顶多模态榜。它能看图秒猜经纬度、在《清明上河图》里数马、把视频一键还原成代码,甚至和人类顶尖玩家在图寻游戏里 PK 到全球 66 名。API 低至 2 元/百万 token,官方再送 2000 万免费额度——玩 Demo 还是做生产力,现在就能上手。

智谱基于GLM-4.5打造的开源多模态视觉推理模型GLM-4.5V,在42个公开榜单中41项夺得SOTA!其功能涵盖图像、视频、文档理解、Grounding、地图定位、空间关系推理、UI转Code等。

这半年,多模态大模型已经成为各家的标配,但似乎功能都有点趋同,玩起来都有点腻了。

不过,今晚智谱最新开源的GLM-4.5V视觉推理模型,带来了非常多的惊喜!

两周前,智谱发布GLM-4.5,这个融合ARC(Agentic、Reasoning、Coding)能力的模型获得非常高的关注。

取得了全球模型第三、国产模型第一,开源模型第一的成绩!

智谱这次乘胜追击!在GLM-4.5基座之上进一步训练出100B级别最强开源多模态模型,成功在多模态赛道上占据一席之地。

GLM-4.5V「看懂世界」的方式,是真的有点东西,而且在智谱最近新推出的z.ai的平台上,升级了很多视觉多模态的全新玩法。

比如这次更新后,GLM-4.5V可以玩看图猜地址GeoGuessr游戏,而且准确率非常高。

我们试了三次,每次的国家和大洲都非常准确,不过具体经纬度可能还需抽卡。

下面是其中一次测试,GLM-4.5V可以找到画面中的关键元素,配合地理风格、建筑风格等来推理出正确结论。

值得一提的是,智谱还派出GLM-4.5V参加了国内的图寻游戏挑战,和国内最顶尖的两万多名人类玩家真实对战。

目前智谱已经在全球排名66,而其他都是人类选手。

智谱这次更新的另一个玩法就是Grounding能力,GLM-4.5V眼神太好,可以在清明上河图中找到三匹马(左上角角落),并在图中做出标识。

GLM-4.5V不仅眼神好,还能理解视频,而代码能力又沿袭了它的基座模型GLM-4.5,两者相加「涌现」出一种全新能力。

那就是,通过直接上传视频也能复刻网站!

神奇之处在于,GLM-4.5V完全没有训练过「看视频」前端网页复刻,这个意外发现体现了GLM-4.5很强的泛化能力。

我们录了一个Github的网站视频。

GLM-4.5V竟然也可以复刻个七七八八。

下图左边是原版,右边是复刻,大体框架没有问题,有个别按钮的位置,以及时间线组件被修改为列表等小问题。

在实测中,我们发现,不论是GeoGuessr看图挑战、空间关系理解、复杂图表推理、OCR识别、做题,甚至可以理解视频等各个方面,GLM-4.5V的表现都远超预期。

GLM-4.5V一手实测

GLM-4.5V基于智谱发布的新一代旗舰文本基座模型GLM-4.5-Air,沿用了GLM-4.1V-Thinking的结构。

其中,GLM-4.1V-Thinking 7月上线后就登上了HuggingFace Trending第一,模型已获得累计超过13万次下载。

Github:

https://github.com/zai-org/GLM-V

Hugging Face:

https://huggingface.co/collections/zai-org/glm-45v-

68999032ddf8ecf7dcdbc102

魔搭社区:

https://modelscope.cn/collections/GLM-45V-8b471c8f97154e

GLM-4.1V-Thinking是一个小参数模型,而全新的GLM-4.5V拥有106B总参数,12B的激活参数。

可以说,GLM-4.5V是100B参数这个「重量级」的SOTA标杆,现已经登录官网。

GLM-4.5V实测了42个公开视觉多模态榜单,在其中41个榜单中,达到同级别开源模型的SOTA性能,涵盖图像、视频、文档理解以及GUI Agent等常见任务。

GLM-4.5V这次升级了很多玩法,实现全场景视觉推理覆盖,比如:

  1. 图像推理(场景理解、复杂多图分析、位置识别)
  2. 视频理解(长视频分镜分析、事件识别)
  3. GUI任务(屏幕读取、图标识别、桌面操作辅助)
  4. 复杂图表与长文档解析(研报分析、信息提取)
  5. Grounding能力(精准定位视觉元素)

此次更新,模型新增「思考模式」开关,可以自行决定是否启用推理功能。

体验网站:https://chat.z.ai/

此外,继上次GLM-4.5「V50包月」活动,这次GLM-4.5V为企业与开发者提供高性价比的多模态AI解决方案:

  1. API调用价格:低至输入2元/Mtokens,输出6元/Mtokens
  2. 响应速度:达到60-80tokens/s
  3. API接口文档:http://docs.bigmodel.cn/api-reference

GLM-4.5V API现已上线智谱开放平台BigModel.cn,智谱为所有新老用户准备了2000万Tokens的免费资源包。

领取链接:

https://zhipuaishengchan.datasink.sensorsdata.cn/t/bv

精准识别和定位目标物体

GLM-4.5V能够从图片中理解并识别出具体的目标的物体。

可以在界面上直接选择Grounding模式,传入图片和提示词即可。

比如上传了一张AI随机生成的图片,GLM-4.5V的推理能力可以从图片中准确识别出「非现实」的物体,就是红框中看着像昆虫的洒水机器人。

简单介绍下Grounding能力,在计算机视觉与多模态任务中,Grounding能力指的是模型将自然语言中的词语或短语,精确地与图像中的具体区域或对象建立对应关系的能力。

它不仅要求模型能「看懂」图片,也能「读懂」文字,并在两者之间建立准确的语义—视觉映射。

较知名的Flickr30k Entities数据集

并且GLM-4.5V的Grounding的能力还附带了「推理魔法」。

比如下面这张《我,机器人》剧照中,有一个机器人明显看着比其他机器人更有灵魂。

GLM-4.5V一下子就找到了!这确实很令人惊讶,4.5V的视觉能力已经可以理解表情了。

而且你仔细看这个Grounding的Box,完全贴着右下角的机器人,即使是胳膊部分也几乎相切,确实有点东西。

看图猜地址

除了可以在GeoGuessr中玩,GLM-4.5V这次还可以通过随机照片来推理地址。

比如上传一张照片,GLM-4.5V能通过建筑特征来识别照片是在哪里拍摄的。

这个推理结果和GPT-5 Pro结果相同。

甚至在描述判断逻辑方面,GLM-4.5V看起来更胜一筹,因为模型不仅注意到建筑风格,还从门牌号上识别到北欧古典建筑。

视频理解能力

这次GLM-4.5V另一个重大更新就是视频理解。

类似这种超现实主义的视频,GLM-4.5V也能完全get到视频中的重点元素和隐喻含义。

它甚至识别出了特斯拉Cybertruck。

或者像这种偏重于抽象的视频,GLM-4.5V也能理解,并且可以给出非常深度的解释。

宇宙、人类、精神、灵魂、科技、艺术,GLM-4.5V还是真的大超预期。

空间关系理解

视觉能力中,有一项很重要的空间理解能力,比如这个包含常见物体空间关系图。

我们随机给关系打上马赛克,然后让GLM-4.5V来定义物体的空间关系。

单箭头的情况下,多次测试GLM-4.5V每次都可以判断正确,正确率100%。

多个箭头的情况下,会有偶尔的识别出现失误,比如应该是Behind的情况会识别为旁边。

但整体模型在空间理解上,来的一个新的高度。

前端能力:UI到Code

这次GLM-4.5V更新的另一大看点是可以通过UI界面直接转化为Code。

比如我们用GLM-4.5V的官网截图制作了一个「它自己」。

不得不说,GLM-4.5V编程能力确实很强,做出来的网站一模一样,甚至连左侧的Emoji都带上了,画面比例和UI风格也做到了1:1复刻。

图像识别能力

有名的Magic Eye测试图片集,GLM-4.5V也能准确识别,比如下图这种多种鱼类拼凑的重复画面。

GLM-4.5V甚至可以定位到「橙色带条纹」,肉眼想看的话,还是需要放大并且仔细观察的。

视觉模型的「数数」能力

再来一个世界模型经常遇到的「数数」问题,模型需要识别图片中的物体种类和数量。

这些问题对于人类来说很简单,但是对于VLM就没那么容易了。

在这种「目标搜索」任务中VLM的表现,会随着场景里目标数量的增多而迅速下降。

GLM-4.5V准确的识别到松饼和羊,并且完成了左上、左下和右上的数量识别。

右下人类也很难数得清,但GLM-4.5V表示他数了个大概,非常拟人了,这里的处理几乎可以说得上完美。

以上实测并不是测试的全部,但是GLM-4.5V除了能力很强外,最大的特点是又快又好玩,基本上很多任务都是秒出。

而且更有意思的是,每个任务都会自动匹配一个题目+一个Emoji,这代表模型真正的理解了任务的核心。

很多Emoji配的都无比形象,这在其他很多产品中都没有这个功能。

技术创新

开头我们介绍了GLM-4.5V基于智谱新发布的新一代旗舰文本基座模型GLM-4.5-Air,沿用GLM-4.1V-Thinking的结构。

GLM-4.5V模型原理

GLM-4.5V由视觉编码器、MLP 适配器和语言解码器三部分组成,支持64K多模态长上下文。

视觉编码器采用AIMv2-Huge,支持图像与视频输入,并通过三维卷积提升视频处理效率。

模型引入三维旋转位置编码(3D-RoPE)和双三次插值机制,增强了对高分辨率和极端宽高比图像的适应性。

同时,语言解码器中的位置编码扩展为3D 形式(3D-RoPE),进一步提升了多模态空间理解能力。

GLM-4.5V训练策略

GLM-4.5V 采用三阶段策略:预训练、监督微调(SFT)和强化学习(RL)。

  1. 在预训练阶段,结合大规模图文交错多模态语料和长上下文内容,强化了模型对复杂图文及视频的处理能力
  2. 在SFT阶段,引入了显式「思维链」格式训练样本,增强了GLM-4.5V的因果推理与多模态理解能力;
  3. 在RL阶段,引入全领域多模态课程强化学习,通过构建多领域奖励系统(RewardSystem),结合可验证奖励强化学习(RLVR)与基于人类反馈的强化学习(RLHF),GLM-4.5V在STEM问题、多模态定位、Agent任务等方面获得全面优化。

更多技术细节,请查看发布的GLM-4.5V技术报告。

https://github.com/zai-org/GLM-V

从4月份OpenA的GPT-4o「原生全能多模态模型」引发的「吉卜力热」就能看出,多模态是模型发展的必然。

多模态这一能力之所以重要,在于它模拟了人类利用多种感官综合感知世界的方式。

通过将不同模态的信息优势结合,AI系统能够对复杂场景作出更整体化的判断。

而集成视觉、文本、推理、看视频等能力的视觉推理模型正成为企业侧升级的主战场。

多模态大模型正从实验室走向现实,用例也从单一走向多元,整体价值也从演示Demo走向真正地实用。

视觉语言模型在提升人机交互自然度、提高专业工作效率、创造新内容形态等方面具有巨大潜力。

总体来看,多模态大模型已从「能力验证」走向「规模落地」。

海外以OpenAI GPT、谷歌Gemini、Anthropic Claude领跑。

国内阿里Qwen‑VL、智谱GLM、字节Seed等在追赶并局部反超。

而GLM-4.5V为代表的视觉推理模型,将成为AI进化的新方向,未来的AI模型不仅要看得懂,还要能自主推理。

参考链接:

https://github.com/zai-org/GLM-V

https://huggingface.co/collections/zai-org/glm-45v-68999032ddf8ecf7dcdbc102

https://modelscope.cn/collections/GLM-45V-8b471c8f97154e

本文由人人都是产品经理作者【新智元】,微信公众号:【新智元】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。 编辑:定慧

题图来自Unsplash,基于 CC0 协议。