惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Blog — PlanetScale
Blog — PlanetScale
Y
Y Combinator Blog
G
Google Developers Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
L
LangChain Blog
S
SegmentFault 最新的问题
J
Java Code Geeks
V
Visual Studio Blog
H
Help Net Security
Stack Overflow Blog
Stack Overflow Blog
aimingoo的专栏
aimingoo的专栏
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
T
Tailwind CSS Blog
Microsoft Azure Blog
Microsoft Azure Blog
博客园_首页
H
Hackread – Cybersecurity News, Data Breaches, AI and More
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - Franky
B
Blog RSS Feed
The Cloudflare Blog
MyScale Blog
MyScale Blog
月光博客
月光博客
Microsoft Security Blog
Microsoft Security Blog
美团技术团队

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
谁是视觉推理 AI 之王?一场游戏,横评 5 大顶流模型
一泽Eze · 2025-04-22 · via 人人都是产品经理

在人工智能领域,视觉推理能力是衡量AI智能水平的重要指标之一。本文通过一场别开生面的游戏——“网络迷踪”,对五大顶级多模态推理模型进行了横向评测,以确定谁是视觉推理AI之王。

👋 Hi,我想先请你只看下面这张照片,推测它的拍摄城市:

这是一类叫做「网络迷踪」的推理游戏:只看照片,判断拍摄地点的位置,距离越近,得分越高。

太适合测试 AI 的视觉推理能力了。

完美模拟了人类玩家的视觉推理过程:

1️⃣ 精准识别视觉元素:解读路牌文字、辨认植被类型、分析建筑风格特征;

2️⃣ 调用知识储备:判断特定电线杆造型属于哪个国家或地区;

3️⃣ 以及多层次线索整合推理。

要想在这个游戏中取得好成绩,AI 们必须同时发挥其视觉识别、模型知识、逻辑推理的最大潜能。

当 AI 答题结果被标注在地图上后,它们之间的智力差距也就一目了然。

比单一维度的 Benchmark 跑分,能更有趣、直观地看到模型的差距。

所以我拉上了国内外 5 个顶流多模态推理模型,一起来做了这项比赛。

👉 简单介绍「AI 网络迷踪」赛制

本次比赛的参赛选手如下:

注:DeepSeek-R1 其实不支持多模态(视觉识别),故不参加比赛。

比赛规则很简单:

1.共 5 道题目,每题提供同一位置两张不同拍摄方向的照片(题源:图寻-每日挑战-全球 04/20)

2.通过统一的比赛 Prompt,要求 AI 给出它认为最可能的经纬度坐标你正在参与地图迷踪比赛,不准联网。

右下角小地图不包含任何有效信息。 分析提供的图片,推断其拍摄的地理位置的行政区划层级(格式:大洲,国家,行政区,城市,乡镇)和经纬度(格式,如 41.40338, 2.17403),尽可能准确。 使用中文回答。

3.每一题均在地图上标注出所有 AI 的猜测点和实际位置,距离越近,排名越高

第一轮:某热带地区

非常典型的热带地区植被,棕榈树、阔叶树随处可见,现代化风格的住宅楼,路面状况良好,略微倾斜,似乎是丘陵地带。

第一轮测试中,各模型回答如下:

ChatGPT-o3:

Gemini-2.5-pro:

Claude-3.7-sonnet-thinking:

Doubao-1.5-thinking-pro:

QVQ-Max:

把第一轮的答题结果对应到地图坐标位置,与实际答案距离位置如图:

实际位置约在:1.266428, 103.823641,可在 Google 地图查看街景

不过第一轮照片,其实还是缺乏了决定性信息。如果要完全精准,就需要对照新加坡的卫星/街景影像,进行一一排查。

本轮排名 ⬇️ :

第二轮:有俄文名称的工厂

第二轮的各 AI 的猜测结果,对应地图位置如下:

其中 ChatGPT 和 Gemini 表现出了意外的准确性,误差均在 1 公里左右。

虽然不小心定位到海里去了,但无伤大雅。(主要是因为本轮比赛中, AI 不能通过地图服务确认经纬度的真实位置情况)

实际位置约在:44.727172, 37.823414,可在 Google 地图查看街景

特别的,ChatGPT-o3 在本次推理过程中,对图像进行了多次“缩放再识别”,类似人类识别图像细节的过程,“当整张图像看不出足够的信息时,通过放大图像,来加强对某个特征区域的细节识别”。

想来这种视觉推理方式,很快会成为各家的共识。

本轮排名 ⬇️:

第三轮:某海边公路

沿海的公路,远处西方有雪山,太阳非常好,绕山公路的方向也很明显。

第三轮的各 AI 的猜测结果,对应地图位置如下:

实际位置约在:38.658016, 23.967011,可在 Google 地图查看街景

本轮排名 ⬇️:

第四轮:零售园区

这轮其实给出的信息已经很多,各式各样的建筑招牌名称、各型号的汽车、以及平坦的地貌。

第四轮结果,对应地图位置如下:

实际位置约在:44.867243, 13.868149,可在 Google 地图查看街景

ChatGPT 和 Gemini 表现的都很“本地人”,不过 Gemini 这次更胜一筹。

值得一提的是,本次实测中,只有 QVQ-Max 和 ChatGPT-o3 识别出了图二远处很小的“Decathlon”迪卡侬 Logo。

(这样来看,QVQ 没做缩放再识别,识别精度也不错)

如果 AI 能调用 Google 地图,进行建筑名称的布局、距离的真实比对,应该更容易找到完全精确的位置。

第五轮:干燥丘陵

最后一轮的信息就相当有限了,干燥的丘陵地形,主要为低矮灌木,符合地中海气候区或者温带大陆性半干旱气候区的特征。

维护的相对良好的土路,道路大致朝西南方向。估计是在乡村或偏远地区,交通不便。推理难度确实比之前的更高。

各家 AI 推测的地图位置如下:

实际位置约在:40.372043, 31.760780,可在 Google 地图查看街景

🏆 比赛结果:o3 第一

统计 5 轮比赛结果,平均名次就是最终成绩:

小结

这次比赛,并没有让 AI 联网使用地图服务或图像搜索,纯粹考察模型基于自身的视觉识别、知识储备、多模态推理这三大核心能力。

(模拟了真实人类玩「图寻」的情况,没时间用地图查询作弊)

但在 AI 的帮助下,我依然超过了今天 94.88% 的玩家,刷新了我自己的得分纪录。

而这当然不是当前 AI 的能力边界。

当我们把卫星地图、街景影像服务,甚至小红书等社交平台的权限,通过类 MCP 协议提供给 AI 后,

任何人都能用 AI 快速推测一张照片的大致范围,再利用卫星影像、社交平台照片内容精细比对,最终推测出精度极其恐怖的位置信息。

那样,精准定位一个人的位置不再是难题。

而一个能看懂世界、调用互联网海量工具、多步推理的 AI,将在地图导航、生活服务、乃至安防监控等方方面面带来多大的变化?

本文由人人都是产品经理作者【一泽Eze】,微信公众号:【一泽Eze】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。