惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Google DeepMind News
Google DeepMind News
MongoDB | Blog
MongoDB | Blog
有赞技术团队
有赞技术团队
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
人人都是产品经理
人人都是产品经理
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
B
Blog RSS Feed
T
Tor Project blog
T
Threat Research - Cisco Blogs
Microsoft Azure Blog
Microsoft Azure Blog
M
MIT News - Artificial intelligence
V
Vulnerabilities – Threatpost
Project Zero
Project Zero
C
CXSECURITY Database RSS Feed - CXSecurity.com
The Register - Security
The Register - Security
Latest news
Latest news
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
The Hacker News
The Hacker News
Google DeepMind News
Google DeepMind News
L
LINUX DO - 最新话题
U
Unit 42
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园 - 司徒正美
T
Tenable Blog
H
Hacker News: Front Page
B
Blog
宝玉的分享
宝玉的分享
C
Check Point Blog
美团技术团队
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
C
CERT Recently Published Vulnerability Notes
P
Proofpoint News Feed
The GitHub Blog
The GitHub Blog
G
GRAHAM CLULEY
Google Online Security Blog
Google Online Security Blog
Security Archives - TechRepublic
Security Archives - TechRepublic
P
Proofpoint News Feed
GbyAI
GbyAI
酷 壳 – CoolShell
酷 壳 – CoolShell
Hugging Face - Blog
Hugging Face - Blog
Y
Y Combinator Blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Hacker News - Newest:
Hacker News - Newest: "LLM"
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Scott Helme
Scott Helme
L
Lohrmann on Cybersecurity
量子位
A
About on SuperTechFans
V2EX - 技术
V2EX - 技术
T
The Exploit Database - CXSecurity.com

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
行业资深人士:GPT-4.5是一个奇怪的模型
世界模型工场 · 2025-03-04 · via 人人都是产品经理

随着GPT-4.5的发布,业界对其性能和价值的讨论愈发热烈。然而,许多行业专家对这一新模型的表现提出了质疑,认为其在实际应用中的效果并未达到预期。本文将深入探讨GPT-4.5的特点,供大家参考。

OpenAI最新模型GPT-4.5在性能提升有限的情况下,成本却大幅增加,引发了业界对其性价比的质疑。

OpenAI宣布推出了GPT-4.5,公司首席执行官萨姆·阿尔特曼(Sam Altman)此前曾表示,这将是最后一个非“思维链”(Chain of Thought,CoT)模型。

该公司称,新模型“并非前沿模型”,但仍然是其最大的大型语言模型(LLM),并且在计算效率上有显著提升。

阿尔特曼表示,尽管GPT-4.5的推理方式与OpenAI其他新推出的o1或o3-mini模型不同,但这款新模型仍然更具人性化和深思熟虑的特点。许多行业观察人士提前接触了这款新模型,他们认为GPT-4.5是OpenAI一个有趣的举措,这也让他们调整了对该模型应达到的预期。

沃顿商学院教授兼人工智能评论员埃森·莫利克(Ethan Mollick)在社交媒体上表示,GPT-4.5是一个“非常奇特且有趣的模型”,他指出,尽管它在写作方面表现出色,但在处理复杂项目时可能会“出人意料地偷懒”。

OpenAI联合创始人、前特斯拉人工智能负责人安德烈·卡帕西(Andrej Karpathy)表示,GPT-4.5让他回想起GPT-4推出时他看到的模型潜力。

在X平台上,卡帕西写道,使用GPT-4.5时,“一切都有些改进,这很棒,但这种改进并非是容易指出的具体方面。”然而,卡帕西警告说,人们不应期望该模型带来革命性的影响,因为它“在需要推理能力的关键领域(如数学、编程等)并没有推动模型能力的提升”。

1

行业思路详解以下是卡帕西在X平台上发布的长篇帖子中对GPT-4.5的详细评价:“今天,OpenAI发布了GPT-4.5。我已经期待了大约两年,自从GPT-4推出以来,因为这次发布提供了一个衡量通过扩展预训练计算(即简单地训练一个更大模型)所能获得的改进斜率的定性指标。每个0.5的版本升级大约对应10倍的预训练计算量。

回想一下,GPT-1几乎无法生成连贯的文本。GPT-2是一个令人困惑的玩具。GPT-2.5被‘跳过’,直接升级为更有趣的GPT-3。GPT-3.5达到了一个临界点,足以作为产品推出,并引发了OpenAI的‘ChatGPT时刻’。

而GPT-4虽然也有所改进,但我必须说,这种改进非常微妙。我记得参加了一个黑客松,试图找到GPT-4明显优于3.5的具体提示。这些例子确实存在,但清晰且明确的‘绝对优势’案例却很难找到。一切都有些改进,但这种改进是弥散的。词汇选择更具创意,对提示中细微差别的理解有所提升,类比更有意义,模型也稍微有趣了一点,对罕见领域的知识和理解也有所改善,幻觉现象也少了一些,整体感觉更好了。

这就像水涨船高的效应,一切都在不知不觉中提升了大约20%。因此,我带着这种预期去测试GPT-4.5,我在几天前获得了访问权限,它的预训练计算量比GPT-4高出10倍。而我感觉,我又回到了两年前的那个黑客松。一切都有些改进,这很棒,但这些改进并非是显而易见的。

尽管如此,这仍然是一个非常有趣且令人兴奋的定性指标,它表明仅仅通过训练一个更大的模型,就能获得某种‘免费’的能力提升。

请注意,GPT-4.5仅通过预训练、监督微调和基于人类反馈的强化学习(RLHF)进行训练,因此它还不是一款推理模型。因此,这次模型发布并没有在需要推理能力的关键领域(如数学、编程等)推动模型能力的进步。

在这些情况下,通过强化学习进行训练并获得思考能力至关重要,即使它是在较旧的基础模型上实现的(例如类似GPT-4的能力)。目前,最先进的模型仍然是完整的o1。想必OpenAI接下来会尝试在GPT-4.5的基础上进一步通过强化学习进行训练,以使其具备思考能力,并推动这些领域的能力提升。

然而,我们确实期望在非推理密集型任务中看到改进,我认为这些任务更多与情商(EQ)相关,例如受到世界知识、创造力、类比能力、一般理解能力、幽默感等的限制。因此,这些是我最感兴趣的能力测试领域。因此,我想在这里的X平台上通过一个互动的‘语言模型竞技场精简版’,结合图片和投票,以帖子的形式展示5个有趣,引人发笑的提示,来测试这些能力。

遗憾的是,X平台不允许你在单个帖子中同时包含图片和投票,因此我不得不交替发布帖子:一个帖子展示图片(提示以及来自4和4.5的两个回答),另一个帖子则是投票,人们可以投票选择哪个回答更好。8小时后,我会揭晓哪个回答来自哪个模型。让我们看看会发生什么:)”

2

Box CEO对GPT-4.5的看法Box公司首席执行官阿隆·莱维(Aaron Levie)也在X平台上分享了他对GPT-4.5的看法。

他认为这款模型在企业级应用中具有巨大潜力,并表示Box公司已经在使用GPT-4.5从复杂的企业内容中提取结构化数据和元数据。“人工智能的突破不断涌现。OpenAI刚刚宣布推出GPT-4.5,我们将在今天晚些时候通过Box AI Studio将其提供给Box客户。我们已经在Box AI的早期访问模式下测试了GPT-4.5,用于高级企业非结构化数据的用例,并取得了出色的结果。

通过Box AI的企业级评估,我们针对多种不同场景对模型进行测试,包括问答准确性、推理能力等。特别是为了探索GPT-4.5的能力,我们专注于一个对企业影响潜力巨大的关键领域:从复杂的企业内容中提取结构化数据,即元数据提取。

在Box,我们使用多个企业级数据集严格评估数据提取模型。其中一个关键数据集是CUAD,它包含超过510份商业法律合同。在这个数据集中,Box识别出可以从非结构化内容中提取的17,000个字段,并基于这些字段的单次提取对模型进行评估(这是我们最严格的测试,模型只有一次机会在单次运行中提取所有元数据,而不是多次尝试)。

在我们的测试中,与GPT-4o相比,GPT-4.5准确提取的字段多出了19个百分点,这突显了其处理复杂合同数据的更强能力。接下来,为了确保GPT-4.5能够应对现实世界中企业内容的需求,我们用更具挑战性的文件集对其性能进行了评估,即Box自己的挑战集。我们选择了一部分复杂的法律合同——那些包含多模态内容、高密度信息且长度超过200页的合同,来代表我们客户面临的最困难场景。

在这个挑战集中,GPT-4.5在提取关键字段的准确性上也始终优于GPT-4o,证明了其处理复杂且微妙的法律文件的卓越能力。总体而言,我们在复杂企业数据方面看到了GPT-4.5的出色表现,这将为企业解锁更多用例。”

3

价格问题及其重要性尽管早期用户发现GPT-4.5是可以使用的尽管它有点“懒惰”,但他们对其发布提出了质疑。例如,著名的OpenAI批评者加里·马库斯(Gary Marcus)在Bluesky上称GPT-4.5为“毫无新意的产品”(“nothingburger”)。

Hugging Face首席执行官克莱门特·德朗格(Clément Delangue)评论称,GPT-4.5的闭源特性使其显得“平平无奇”(“meh”)。然而,许多人指出,GPT-4.5的表现并不是问题所在。

相反,人们质疑的是,OpenAI为何会发布一个使用成本如此之高、几乎令人望而却步,却又不如其其他模型强大的模型。

一位用户在X平台上评论道:“所以你是说GPT-4.5的价值超过了o1,但它的基准测试表现却不如同等级别的模型……这让人难以信服。”其他X用户推测,高昂的token成本可能是为了阻止DeepSeek等竞争对手“提取”4.5模型的精华。DeepSeek在2024年1月成为OpenAI的有力竞争对手,行业领导者发现DeepSeek-R1的推理能力与OpenAI的模型相当,但更具性价比。(Venture Beat)

本文由人人都是产品经理作者【AI新智能】,微信公众号:【AI新智能】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。