惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

M
MIT News - Artificial intelligence
雷峰网
雷峰网
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Last Week in AI
Last Week in AI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
阮一峰的网络日志
阮一峰的网络日志
月光博客
月光博客
博客园 - Franky
腾讯CDC
T
Tailwind CSS Blog
Recent Announcements
Recent Announcements
V
V2EX
N
Netflix TechBlog - Medium
量子位
Jina AI
Jina AI
Y
Y Combinator Blog
The GitHub Blog
The GitHub Blog
G
Google Developers Blog
爱范儿
爱范儿
博客园 - 叶小钗
D
Docker
MongoDB | Blog
MongoDB | Blog
D
DataBreaches.Net
T
The Blog of Author Tim Ferriss

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
GPT-5 在数学竞赛中得了 100 分,但 OpenAI 的图表有待改进
林骥 · 2025-08-13 · via 人人都是产品经理

OpenAI 发布的 GPT-5 在美国数学邀请赛 AIME 2025 中表现惊人,GPT-5 Pro(Python)竟获 100 分 。但其展示相关成果的图表存在标题冗余、坐标轴设置不合理、配色不佳等问题,影响信息传递效果与专业性。林骥用 Plotly 重绘图表,优化呈现方式,引发对 OpenAI 数据可视化严谨性的思考。

在实际工作和现实生活中,经常会看到一些数据可视化图表,其中有些图表存在改进的空间,我们可以借助 AI 来对它们进行优化改进。

例如,2025 年 8 月 8 日,我在 OpenAI 官网上看到 GPT-5 的介绍,文中有一张图表,展示了几种模型在美国数学邀请赛 AIME 2025 中的表现,其中 GPT-5 Pro(Python)竟然得了 100 分。

虽然 GPT-5 模型的能力很强大,但是对于这张图表,我认为还有很多值得改进的地方。

1、标题

标题缺乏分析结论,而且内容不多,我觉得没有必要分成两行。

2、坐标轴

X 轴标签文字倾斜,Y 轴标题文字垂直,都不利于阅读;在柱形图上方已经标注了具体数字, Y 轴标签(0-100)与标签数字的单位 % 不一致。

即使把 Y 轴隐藏掉,其实也不影响信息传递的效果,还能减少噪音。

3、配色

我个人感觉粉紫色与科技风格不搭,而且图例显示的两种颜色比较难以区分,与相应图形的距离有点远。

下面是我用 Plotly 重绘的图表,主要修改的地方包括:把英文翻译成中文,标题修改为突出主要分析结论,把 Y 轴标题放在标题下方横向显示,去掉 Y 轴标签,X 轴标签横向显示,调整图例位置和颜色等,换成了更有科技感的蓝色调。

OpenAI 在文中说,使用工具的 AIME 结果,不应该直接与没有工具的模型性能进行比较,它们只是展示 GPT-5 如何有效利用工具的一个例子。

数据可视化是把「故事」装进图表中,但如果没有做好,故事就可能变成「事故」。

比如,在备受瞩目的 GPT-5 发布会上,出现一个柱状图,其中 52.8% 竟然比 69.1% 更高,而 30.8% 却与 69.1% 一样高。

这不禁让人怀疑,OpenAI 的数据靠谱吗?GPT-5 的能力值得信任吗?为什么不提前复核一下呢?这些年薪上亿美金的人,难道这么「不拘小节」吗?

一个世界顶级的 AI 团队,在最重要产品的发布会上,竟然会出现如此低级的错误,真让人感到大跌眼镜,就如同产生幻觉一般。

希望 AI 能少一点幻觉,多一点真诚。

本文由人人都是产品经理作者【林骥】,微信公众号:【林骥】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。