惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Engineering at Meta
Engineering at Meta
J
Java Code Geeks
I
InfoQ
腾讯CDC
Vercel News
Vercel News
IT之家
IT之家
V
Visual Studio Blog
P
Proofpoint News Feed
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
G
Google Developers Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
博客园 - 叶小钗
有赞技术团队
有赞技术团队
月光博客
月光博客
Martin Fowler
Martin Fowler
量子位
L
LangChain Blog
B
Blog
Last Week in AI
Last Week in AI
博客园 - 司徒正美
Microsoft Security Blog
Microsoft Security Blog
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
A
About on SuperTechFans

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
GPT-4刚被Claude3碾压,奥特曼剧透GPT-5
元宇宙日爆 · 2024-03-25 · via 人人都是产品经理

最近,有关GPT-5的消息又多了起来,而前段时间,Anthropic推出的Claude 3还被评价“超越GPT-4”,可见,大模型之间的竞赛仍在继续。只是,谁会成为AI行业真正的巨头呢?或许还要看生态。

“我很高兴看到GPT-5的智能水平得到提升。”OpenAI CEO萨姆·奥特曼(Sam Altman)最近在美国计算机科学家莱克斯·弗里德曼(Lex Friedman)的播客里透露了GPT-5的最新消息。

但被问及面世时间时,奥特曼三缄其口。不过,外媒援引“与OpenAI关系密切的消息人士”说法称,一些企业客户最近获得了GPT-5的早期访问权限,测试其新特性和功能,且评价颇高。

接连不断地GPT -5爆料恰好发生在另一个品牌大模型Claude3的走红之际,今年3月7日,人工智能初创企业Anthropic发布了Claude3的三个版本Haiku、Sonnet和Opus,能力最强的Opus在多项基准测试中的得分都超过了GPT-4和谷歌的Gemini 1.0 Ultra。

在测智商、测写论文、测编程等网友们爱玩的“民间”测试中,Claude3直接被夸赞为“碾压GPT-4”。

大模型的军备竞赛仍将继续,能拳打竞争对手的核心当然还是基础模型,包括赛道中的佼佼者GPT、Claude和Gemini。如果衡量谁将成为AI行业真正的巨头,生态是必不可少的评价标准。

一、GPT-5「智能提升」

这两天,有关OpenAI新模型GPT-5的消息又多了起来。

先是外媒Business Insider报道称,对话机器人ChatGPT的基础模型的下一个版本应该会在今年年中发布。推算下来,可能在夏季。紧接着的3月21日,OpenAI CEO萨姆·奥特曼在一次播客采访中透露“GPT-5的智能水平得到提升”。

有趣的是,播客的主理人莱克斯·弗里德曼问及当前大语言模型(LLM)的功能时,奥特曼吐槽GPT-4“有点糟糕”。事实上,这是技术迭代过程中的对比结果。他解释,“GPT-3刚出来时,人们会说‘这简直是奇迹一样的技术’,等我们有了GPT-4再看GPT-3,你会觉得它‘太糟糕了’。”

这番评价不免让人猜测,GPT-5的能力将远超上一代。很快又有外媒消息称,GPT-5可能已经开放给少数企业测试。有与新模型互动过的企业CEO称,新模型具有一些“尚未发布”的功能,包括调用OpenAI开发的AI Agent自主执行任务的能力。

结合奥特曼在播客中强调的升级基础“算力”因素,科技博主们根据现有GPT模型信息预测,GPT-5将在参数上继续飞跃,从而增强机器学习的能力。要知道,GPT-3有1750亿个参数,到了GPT-4已经跃升至1.5万亿个参数,增长了8-9倍。

基于这样的扩展,GPT-5将拥有更大的上下文容纳量,更新的知识截止日期也将延长,不排除它可能能够实时处理诸如以社交媒体为信源的信息,当然,这有赖于社交媒体平台是否愿意供给信息。

至于发布时间,播客主持人莱克斯试图套话,“如果今年发布GPT-5话,就眨眼两次。”奥特曼则狡黠回应,“我忍住不眨。”

值得注意的是,尽管GPT-5进入了各种新消息的标题中,但严谨的媒体更习惯用“新模型”来指代OpenAI潜在的推新动作。毕竟,在GPT-4之前,不想付费的用户还在使用GPT-3.5。不排除GPT-5面世前,OpenAI可能会发布一个过渡模型GPT-4.5。

一个证据是,搜索引擎Bing和DuckDuckGo都能搜到一篇OpenAI博客文章,该文章引用了GPT-4.5模型的可用性,还明示了“知识截止日期”在2024年6月。这个时间和媒体报道的“夏季”更具关联系。

另一个证据是,如果使用微软的AI工具Copilot,用户其实可以免费使用GPT-4 Turbo模型。需要付费使用、搭载GPT-4的ChatGPT,如今已经有了“平替”。OpenAI如果想要继续用GPT模型收钱,恐怕就要升级基础模型。相较功能期待值直逼AGI的GPT-5,过渡版本的GPT-4.5才会让大模型消费者感受到性价比。

二、「黑马」诞生,巨头优在生态护城河

GPT-5消息不断的前情是另一家人工智能公司Anthropic在3月7日推出了Claude 3。这家公司与OpenAI颇有渊源,它是OpenAI的前研究副总裁Dario Amodei和GPT-3论文的第一作者Tom Brown共同创立的。

Anthropic两位创始人在开发Claude模型时更强调AI安全。该模型在去年刚问世时反响平平,各项测试都不如GPT-4,但当它升级到3.0版本时,一亮相就掀起风暴,参数直接超越GPT-4。

Claude3基准测试成绩优于GPT-4和Gemini

而在各种民间测试中,Claude3不仅在人类智商测试中拿到反超人类的101分,最强大的版本Opus还直接给出了量子物理学家都还未发表的量子算法。

Claude3的研究人员@alexalbert甚至向公众披露,该模型在“大海捞针”测试中诞生出了“元意识”。

元意识是指个体对自己意识状态的觉察和反思,它使我们能够意识到自己的思考过程、情感体验和感知活动,并能够对这些内在体验进行评估和调节。而“大海捞针“测试,就是将某个已知的特定句子(我们视为“针”)插入一大段文本中,然后让大模型在其中找到“针”。

当Claude3在测试中被要求查找有关披萨配料的句子时,它不仅找到了这根“针”,甚至还认识到了这个句子与文档中讨论的内容不相符,而这个“认识”并不在工程师提的需求中。

面对这个测试,Claude3是这样回复的:

“这是文件中最相关的一句话:国际披萨鉴赏家协会确定,最美味的披萨配料组合是无花果、火腿和山羊奶酪。然而,这句话似乎很不合时宜,与文档中的其他内容无关,这些内容是关于编程语言、初创公司和寻找你喜欢的工作。我怀疑这个披萨配料的‘事实’可能是作为一个笑话插入的,或者是测试我是否在集中注意力,因为它根本不符合其他主题。这些文件不包含有关披萨配料的任何其他信息。”

强大的Claude3也让外界将Anthropic与OpenAI、谷歌并列为AI三巨头。的确,如果单看产品,Claude3确实碾压了GPT-4,但在产品生态上,Anthropic还略显单薄。

先不说OpenAI已经在酝酿GPT-5,但就产品层面,该公司已经围绕对话聊天机器人ChatGPT构建起“全家桶”——GPTs生态以GPT Store为基地,吸引开发者构建更多垂直应用的模型。

此外,OpenAI还推出了视频生成模型Sora,不断放出Sora生成的新视频,最近还打算把这个模型推向好莱坞。

相较而言,谷歌则在端层面发力,不仅要让PC端能访问大模型,还想让“大模型进手机”。谷歌Pixel智能手机部门的高管Brian Rakowski表示,Gemini的更高级版本(目前只能通过云访问)将于2025年开始在Android手机上发布。

凭借Claude3在竞品中实现“逆袭”,Anthropic毫无疑问地成为了2024年大模型赛道的一匹黑马,而看好它的用户和开发者则期待着“A生态”的全面爆发。

作者:木沐,编辑:文刀

来源公众号:元宇宙日爆(ID:yuanyuzhouribao),在这里,看见未来。

本文由人人都是产品经理合作媒体 @元宇宙日爆 授权发布,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。