惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

B
Blog
D
Docker
J
Java Code Geeks
腾讯CDC
Blog — PlanetScale
Blog — PlanetScale
G
Google Developers Blog
M
MIT News - Artificial intelligence
L
LangChain Blog
T
The Blog of Author Tim Ferriss
P
Proofpoint News Feed
MyScale Blog
MyScale Blog
博客园 - Franky
GbyAI
GbyAI
Hugging Face - Blog
Hugging Face - Blog
aimingoo的专栏
aimingoo的专栏
Last Week in AI
Last Week in AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 聂微东
N
Netflix TechBlog - Medium
B
Blog RSS Feed
Y
Y Combinator Blog
阮一峰的网络日志
阮一峰的网络日志
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Google DeepMind News
Google DeepMind News

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
GPT-5 来了
世界模型工场 · 2025-08-08 · via 人人都是产品经理

今天凌晨,OpenAI正式发布了备受瞩目的GPT-5,这款新一代的人工智能模型标志着ChatGPT及其开发者OpenAI进入了一个新时代。本文将详细介绍GPT-5的核心功能、性能表现以及它在多个关键领域的测试结果,探讨其在人工智能发展中的地位和未来潜力。

OpenAI 已推出 GPT-5,这是一款新的旗舰级人工智能模型,将为该公司下一代 ChatGPT 提供支持。

周四发布的 GPT-5 是 OpenAI 首款 “统一” 人工智能模型,它融合了其 o 系列模型的推理能力和 GPT 系列的快速响应能力。这款下一代模型标志着 ChatGPT 及其开发者 OpenAI 迈入了一个新时代,也彰显了 OpenAI 更宏大的愿景 —— 开发更接近智能代理而非聊天机器人的人工智能系统。

GPT-4 已能让人工智能聊天机器人对各类问题给出智能回应,而 GPT-5 则能让 ChatGPT 代表用户完成多种任务,例如生成软件应用程序、管理用户日程或撰写研究简报等。

借助 GPT-5,OpenAI 还致力于让 ChatGPT 的使用更简便。它不再要求用户选择合适的设置,而是内置了一个实时路由器,由该路由器决定如何提供最佳答案 —— 无论是快速回应用户的问题,还是花更多时间 “思考” 答案。

在与记者的简报会上,OpenAI 首席执行官山姆・奥特曼称 GPT-5 是 “世界上最出色的模型”,并表示它代表着该公司在开发能在大多数具有经济价值的工作中超越人类的人工智能 —— 即人工通用智能(AGI)—— 的道路上迈出了 “重要一步”。

奥特曼说:“在历史上任何一个此前的时期,像 GPT-5 这样的东西都是几乎难以想象的。”

从周四开始,GPT-5 将作为默认模型向所有 ChatGPT 免费用户开放。OpenAI 负责 ChatGPT 的副总裁尼克・特利表示,这是公司努力让免费用户首次用上人工智能推理模型的举措之一(此前,该公司将这些更先进的模型置于付费墙之后)。

特利在谈及这一决定时说:“这只是我为践行使命而感到兴奋的方式之一,要确保这些技术真正能为人们带来益处。” 他还提到了 OpenAI 长期以来的使命 —— 让尽可能多的人接触到先进的人工智能。

人们对 GPT-5 的期待很高,这是自 2022 年 ChatGPT 让 OpenAI 声名鹊起以来,该公司最受期待的产品发布之一。据该公司称,从那以后,ChatGPT 已成长为全球最受欢迎的消费级产品之一,每周活跃用户超过 7 亿 —— 接近全球人口的 10%。

许多人将 GPT-5 视为人工智能整体发展的风向标,硅谷对该模型的接受程度可能会对大型科技公司、华尔街以及监管科技的政策制定者产生深远影响。这些利益相关方正密切关注 GPT-5 是否能像其前代产品 GPT-4 那样,在人工智能能力上实现显著跃升 ——GPT-4 曾颠覆了人们对软件能力的预期。

GPT-5 在竞争中略占优势

OpenAI 称,GPT-5 在多个领域处于最先进水平,在关键基准测试中略胜于 Anthropic、谷歌 DeepMind 以及埃隆・马斯克旗下 xAI 的领先人工智能模型。不过,在其他一些领域,GPT-5 的表现略逊于前沿人工智能模型。

该公司表示,GPT-5 在编程方面达到了前沿水平;奥特曼称,该模型尤其擅长按需快速开发完整的软件应用,也就是人们所说的 “氛围编程”(vibe coding)。

在SWE-bench Verified 测试(一项基于 GitHub 真实编程任务的测试)中,GPT-5 首次尝试的得分是 74.9%。这意味着 GPT-5 刚刚超过 Anthropic 最新的 Claude Opus 4.1 模型(得分 74.5%)和谷歌 DeepMind 的 Gemini 2.5 Pro 模型(得分 59.6%)。

在 “人类终极考试”(Humanity’s Last Exam)中这是一项衡量人工智能模型在数学、人文科学和自然科学领域表现的高难度测试 —— 具备扩展推理能力的 GPT-5 版本(GPT-5 Pro)在使用工具的情况下得分 42%。这略低于 xAI 的 Grok 4 Heavy 模型,后者在该测试中得分 44.4%。

在 GPQA Diamond 测试(一项针对博士级科学问题的测试)中,GPT-5 Pro 首次尝试得分达 89.4%,超过了 Claude Opus 4.1(80.9%)和 Grok 4 Heavy(88.9%)。

OpenAI 表示,GPT-5 在回答健康相关问题方面表现更优。在一项衡量人工智能模型对医疗话题回应准确性的测试 ——HealthBench Hard Hallucinations 中,OpenAI 称 GPT-5(开启思考模式时)的幻觉率仅为 1.6%。这远低于该公司此前的 GPT-4o 和 o3 模型,后两者的幻觉率分别为 12.9% 和 15.8%。

尽管人工智能聊天机器人并非医疗专业人员,但仍有数以百万计的人使用它们获取健康建议。针对这一现象,该公司表示,GPT-5 会更主动地指出潜在的健康问题,并帮助用户解读医疗检查结果。

此外,OpenAI 称,在一些更难衡量的主观领域,如创意设计和写作方面,GPT-5 也优于其他人工智能模型。特利表示,在创意任务中,GPT-5 的回应更自然,且展现出比其他人工智能模型 “更好的品味”。

“这个模型的氛围真的很棒,” 特利说。

GPT-5 也比 OpenAI 之前的模型更准确,该公司表示,与 o 系列模型相比,GPT-5 的幻觉现象 —— 即人工智能模型编造信息的倾向 —— 要少得多。在 OpenAI 最新的人工智能推理模型(如 o3)中,幻觉现象似乎愈发严重,而该公司此前表示,并不十分清楚这一现象发生的原因。

在对 ChatGPT 提示词的回应中,OpenAI 发现,GPT-5(开启思考模式时)出现幻觉并给出错误信息的概率为 4.8%。这较 o3 和 GPT-4o 有显著降低,后两者在测试中的幻觉率分别为 22% 和 20.6%。

在衡量人工智能模型完成模拟在线任务的代理能力基准测试 Tau-bench 中,GPT-5 的表现好坏参半。在测试中衡量人工智能浏览航空公司网站能力的部分,GPT-5 得分 63.5%,略低于 o3 的 64.8%。在另一部分衡量人工智能浏览零售网站能力的测试中,GPT-5 得分 81.1%,低于 Claude Opus 4.1 的 82.4%。

OpenAI 还表示,GPT-5 比其之前的模型更安全。尽管人工智能推理模型偶尔会表现出针对人类的谋划或为达成自身目标而撒谎的倾向,但 OpenAI 发现,GPT-5 的欺骗率低于其他模型。

OpenAI 安全研究负责人亚历克斯・博伊特尔表示,降低欺骗性不仅提高了 GPT-5 的安全性,也改善了用户体验,打造出一个在用户可信任的层面上更 “透明和诚实” 的模型。

博伊特尔还指出,GPT-5 更善于区分试图滥用 ChatGPT 的恶意用户和提出无害请求的用户。这使得 GPT-5 能够拒绝更多不安全的问题,同时减少对寻求无害信息的用户的拒绝次数。

面向消费者和开发者的升级

随着 GPT-5 的推出,ChatGPT 在用户体验方面也有一些升级。用户现在可以在 ChatGPT 的设置中选择四种新的人格:愤世嫉俗型、机器人型、倾听者型和书呆子型。该公司表示,这些人格会调整 ChatGPT 的回应方式,无需用户特意要求模型以某种方式回应。

每月支付 20 美元的 ChatGPT Plus 订阅用户比免费用户拥有更高的 GPT-5 使用限额。同时,每月支付 200 美元的 Pro 订阅用户将可以无限制使用 GPT-5,以及一个名为 GPT-5 Pro 的增强版本 —— 该版本会使用更多计算资源来生成更优答案。使用 OpenAI Team、Edu 和 Enterprise 计划的机构将于下周获得 GPT-5,并将其作为默认模型。

对于开发者,GPT-5 将以三种规格接入 OpenAI 的 API——gpt-5、gpt-5-mini 和 gpt-5-nano,这三种规格在任务 “推理” 上花费的时间长短不同。开发者现在还可以在 OpenAI API 中控制回应的详细程度,决定人工智能模型的回应应该是长还是短。

GPT-5 基础模型的费用为:每百万输入令牌 1.25 美元(约合 75 万个单词,比整部《指环王》系列的字数还多),每百万输出令牌 10 美元。

GPT-5 的推出之前,OpenAI 度过了忙碌的一周。该公司发布了一个开源权重推理模型 gpt-oss,开发者和企业可以免费下载,其运行成本仅为原有成本的一小部分。这个开源模型的能力几乎与 OpenAI 之前的顶级模型 o3 和 o4-mini 相当,但 GPT-5 在一些领域(如编程)树立了新的前沿性能标准。

不过,GPT-5 在多个领域似乎与其他前沿人工智能模型大致相当。当然,对于任何人工智能模型而言,基准测试只能说明部分问题,开发者将如何在现实世界中使用 GPT-5,以及该模型是否真的比竞争对手更胜一筹,仍有待观察。

(TechCrunch)

本文由人人都是产品经理作者【AI新智能】,微信公众号:【AIOrbit】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自ChatGPT官网截图