惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

罗磊的独立博客
大猫的无限游戏
大猫的无限游戏
WordPress大学
WordPress大学
酷 壳 – CoolShell
酷 壳 – CoolShell
T
Tailwind CSS Blog
Engineering at Meta
Engineering at Meta
MongoDB | Blog
MongoDB | Blog
爱范儿
爱范儿
小众软件
小众软件
MyScale Blog
MyScale Blog
美团技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
S
SegmentFault 最新的问题
G
Google Developers Blog
Stack Overflow Blog
Stack Overflow Blog
V
V2EX
量子位
云风的 BLOG
云风的 BLOG
A
About on SuperTechFans
阮一峰的网络日志
阮一峰的网络日志
Last Week in AI
Last Week in AI
Martin Fowler
Martin Fowler
C
Check Point Blog
月光博客
月光博客

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
OpenAI 凌晨发布 o1 系列推理模型的两个 o1-preview 以及 o1-...
有新Newin · 2024-09-13 · via 人人都是产品经理

OpenAI在深夜发布了o1系列推理模型,标志着人工智能在模拟人类思考方面迈出了重要一步。新模型在处理科学、编程和数学问题上展现出前所未有的能力,预示着AI技术的又一次飞跃。本文介绍了o1系列模型的特点、安全性措施以及如何为不同用户提供服务。

凌晨,OpenAI 在没有任何预告下正式发布了全新 o1 系列模型:

据悉,这次发布的 o1-preview 是 o1 系列模型的首个尝鲜版,OpenAI 预计会有定期的更新和改进。

与此同时,OpenAI 还包括了正在开发中的下一次更新的评估。

包括 o1 在内的系列模型,旨在花更多时间进行思考,能够推理复杂任务,并在科学、编程和数学等领域解决比以往模型更难的问题。

OpenAI 将其比喻成人类。通过训练,这些模型学会优化思考过程,尝试不同的策略,并能够识别自己的错误,真正的像人类一样思考。

OpenAI 透露,o1-preview 是系列推理模型在 ChatGPT 和 API 中的早期预览,OpenAI 还计划继续开发并发布 GPT 系列的模型,同时发布新的 OpenAI o1系列模型。

除了模型更新外,OpenAI 预计还会增加浏览、文件和图片上传等功能,以使其对所有人更有用。

o1 系列及 o1-preview 模型

在 OpenAI 测试中,推理模型在物理、化学和生物等挑战性基准任务中表现得与博士生相当。

在数学和编程方面表现出色。在国际数学奥林匹克(IMO)选拔考试中,GPT-4o 只正确解决了 13% 的问题,而推理模型得分为 83%。编程能力在比赛中达到了Codeforces 竞赛的 89 百分位。

OpenAI 表示,作为早期模型,目前还不具备使 ChatGPT 实用的许多功能,比如浏览信息、上传文件和图片。对于许多常见情况,GPT-4o 在短期内会更为强大。

但对于复杂的推理任务,这代表了 AI 能力的重大进展。OpenAI 将计数器重置为1,并将这一系列命名为OpenAI o1。

安全性

在开发该系列新模型过程中,OpenAI 提出了一种新的安全训练方法,利用它们的推理能力,使其遵循安全和一致性指南。通过在上下文中推理安全规则,模型能够更有效地应用这些规则。

OpenAI 通过测试模型在用户尝试绕过其安全规则(即“越狱”)时的表现来衡量安全性。

在OpenAI 最难的越狱测试中,GPT-4o 得分为22(满分 100 分),而 OpenAI 的o1预览模型得分为 84。

为了匹配这些模型的新能力,OpenAI 加强了OpenAI 的安全工作、内部治理以及与联邦政府的合作。

包括使用OpenAI 的《准备框架》进行严格的测试和评估、世界级的红队测试、以及包括安全与安保委员会在内的董事会级别审查流程。

为了推进对AI安全的承诺,OpenAI 最近与美国和英国 AI 安全机构达成了正式协议。OpenAI 已开始将这些协议落实到位,包括为这些机构提供该模型研究版本的早期访问。

适用人群

OpenAI 表示,这些增强的推理能力可能对解决科学、编程、数学等领域的复杂问题特别有用。

例如,o1可以帮助医疗研究人员标注细胞测序数据,帮助物理学家生成量子光学所需的复杂数学公式,并帮助各领域的开发人员构建和执行多步工作流程。

OpenAI o1-mini

OpenAI 表示,o1系列在准确生成和调试复杂代码方面表现优异。

为了为开发人员提供更高效的解决方案,OpenAI 还发布了OpenAI o1-mini,这是一款更快、更便宜的推理模型,特别适用于编程。

作为较小的模型,o1-mini 的成本比 o1 预览版便宜 80%,是一款适合需要推理但不需要广泛世界知识的应用的强大且具成本效益的模型。

如何使用 OpenAI o1

9 月 12 日起,ChatGPT Plus 和 Team 用户可以在 ChatGPT 中访问 o1 模型。可以手动选择 o1-preview 和 o1-mini 模型,发布时每周的消息限制分别为30条和50条。

目前,OpenAI 正在努力增加这些限制,并使ChatGPT能够自动选择最合适的模型。下周,ChatGPT Enterprise 和 Edu 用户也将能够访问这两个模型。

据悉,开发者可以开始使用 API 原型开发,限速为每分钟20次请求。经过额外测试后,OpenAI 将努力提高这些限制。

当前这些模型 API 不包括函数调用、流式传输、系统消息支持等功能。此外,OpenAI 也计划为所有ChatGPT免费用户提供 o1-mini 访问权限。

本文由人人都是产品经理作者【江天 Tim】,微信公众号:【有新Newin】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自OpenAI社交媒体截图