惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Vercel News
Vercel News
博客园 - 司徒正美
C
Check Point Blog
G
Google Developers Blog
The GitHub Blog
The GitHub Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
有赞技术团队
有赞技术团队
P
Proofpoint News Feed
IT之家
IT之家
B
Blog
博客园_首页
量子位
MongoDB | Blog
MongoDB | Blog
博客园 - Franky
J
Java Code Geeks
H
Help Net Security
A
About on SuperTechFans
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
D
DataBreaches.Net
Y
Y Combinator Blog
大猫的无限游戏
大猫的无限游戏
云风的 BLOG
云风的 BLOG
Google DeepMind News
Google DeepMind News

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷...
新智元 · 2023-09-19 · via 人人都是产品经理

多模态大模型的战场上,已有人闻到风声。据外媒爆料,OpenAI的全新多模态模型Gobi似乎已在筹备中。谷歌和OpenAI的这场对决,似乎已是箭在弦上了。

随着今年秋天的临近,谷歌和OpenAI的多模态模型之战,也进入到白热化阶段。

就在上周,谷歌已经对一些外部公司开放了多模态大模型Gemini的功能。

而OpenAI,当然不会坐以待毙。他们正在争分夺秒地把多模态功能整合进GPT-4里,争取推出功能与Gemini类似的多模态大模型,一举击杀谷歌。

传说中的多模态功能,在今年3月OpenAI那场震惊全世界的GPT-4发布会上,已经被展示过——

在纸上画个草图,拍个照发给GPT-4,说一声「给我按照这种布局做个网站」,它立马就写出了网页代码。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

老板Greg Brockman亲自上线演示

不过随后,多模态仿佛昙花一现,再也没人见过产品化的实体功能。

所以,谷歌和OpenAI的多模态大战,终于要来了吗?

一、对战谷歌,OpenAI抢发多模态大模型

面对传闻中谷歌要击杀自己的这款大杀器,OpenAI当然不会无动于衷。

据外媒The Information爆料,一款名为Gobi的全新多模态大模型,已经在紧锣密鼓地筹备了。

OpenAI计划,在Gemini发布之前就推出多模态LLM,彻底击败谷歌。

其实,在3月份推出GPT-4多模态功能的预览后,OpenAI已经向一家名为Be My Eyes的公司推出了这项功能,但并没有向其他公司提供。

从名字就可以看出来,这家公司在研发让盲人或视力不佳人群看得更清楚的技术。

最近,OpenAI打算更广泛地推出名为GPT-Vision的功能。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

OpenAI为什么花了这么长时间?

最主要的原因,是他们担心新的视觉功能会被不法分子利用,比如通过自动破解验证码来冒充人类,或者通过面部识别来追踪人类。

不过,对于这些法律上的安全风险,OpenAI的工程师们似乎已经解决了。

同样,一位谷歌发言人也表示:谷歌已经采取了一些措施,防止Gemini被滥用。

在7月做出的承诺中,谷歌保证会在所有产品中开发负责任的人工智能。

1. Gobi能成为GPT-5吗?

在GPT-Vision之后,OpenAI有可能会推出更强大的多模态大模型,代号为Gobi。

跟GPT-4不同,Gobi从一开始就是按多模态模型构建的。

所以,Gobi就是传说中的GPT-5吗?

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

现在,我们还无法知晓。Gobi训练到哪一步了,也没有确切消息。

在9月初,DeepMind联合创始人、现Inflection AI的CEO Mustafa Suleyman,在采访时曾放出一枚重磅炸弹——据他猜测,OpenAI正在秘密训练GPT-5。

Suleyman认为,Sam Altman最近说过他们没有训练 GPT-5,可能没有说实话。(原话是:Come on. I don’t know. I think it’s better that we’re all just straight about it.)

而在这边,根据试用过Gemini的人士,Gemini产生的幻觉,会比现有的模型都更少。原因详见下文。

总之,谷歌和OpenAI的这场多模态模型大战,可以说是AI版的iPhone和Android对决。

一个是称霸AI领域多年的硅谷巨头,一个是风头无两的顶流AI初创公司,二者差距有多大,所有人都在屏息等待。

2. 谷歌秘密测试Gemini

另一边,谷歌也在开始邀请部分外部开发者加急测试,即将推出的下一代多模态大模型Gemini 。

上周,The Information独家报道称,Gemini可能很快准备好进行测试发布,并会集成到像Google Cloud Vertex AI等服务中。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

在今年的谷歌I/O开发者大会上,劈柴曾公开介绍Gemini,是一个多模态模型、高效集成工具、API。

为了合力干大事,谷歌还将谷歌大脑,与DeepMind实验室进行了合并。

据称,至少有20多位高管参与了Gemini的研发,DeepMind的创始人Demis Hassabis领导,谷歌创始人Sergey Brin参与研发。

还有谷歌DeepMind组成的数百名员工,其中包括前谷歌大脑主管Jeff Dean等等。

一位测试过的人士说,Gemini至少在一个方面比GPT-4有优势:除了网络上的公开信息外,该模型还利用了大量谷歌消费产品(搜索、Youtube)的专有数据。

因此,Gemini在理解用户对特定查询的意图时应该特别准确,而且它产生的错误答案,即幻觉,似乎更少。

据此前SemiAnalysis分析师的爆料,谷歌的下一代大模型Gemini,已经开始在新的TPUv5 Pod上进行训练,算力高达~1e26 FLOPS,比训练GPT-4的算力还要大5倍。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

另外,Gemini的训练数据库包含Youtube上936亿分钟的视频字幕,总数据集规模约为GPT-4的两倍。

据称,谷歌下一代大模型也是由多种规模组成,可能使用了MoE架构,以及投机采样技术。

通过小模型提前生成token并传递给大模型进行评估,以提高模型的总体推理速度。

谷歌DeepMind的负责人Hassabis在采访中曾表示,Gemini预计花费数千万到数亿美元,与开发GPT-4的成本相当。

Gemini会整合AlphaGo中使用的技术,这将赋予系统全新的规划、解决问题的能力。

可以这么说,Gemini把AlphaGo系统的一些优势,和大语言模型惊人的语言能力结合在一起了。并且,我们还有一些其他有趣的创新。

AlphaGo背后的技术,就是强化学习,这是DeepMind首创的技术。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

RL代理随着时间的推移与环境交互,通过反复试验来学习策略,从而最大限度地提高长期累积奖励

通过强化学习,AI能够通过反复尝试和接受反馈来调整自己的表现,因而学会处理很棘手的问题,比如在围棋或电子游戏中选择如何采取下一步行动。

另外,AlphaGo还使用了蒙特卡洛树搜索(MCTS)方法,来探索和记住棋盘上所有可能的动作。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

现有模型相比,Gemini将大大提高软件开发人员的代码生成能力,谷歌希望用它来追赶微软的GitHub Copilot代码助手。

谷歌内部还讨论了,使用Gemini来实现图表分析等功能,比如要求模型解释完成图表的含义,以及使用文本或语音指令来浏览网页浏览器或其他软件。

谷歌云开发者平台Google Cloud Vertex AI也将得到Gemini加持,大小版本都有,这样开发人员就可以付费购买小模型在个人设备上运行。

现在,谷歌已经在全力备战,就等着Gemini开启逆袭之路。

二、gpt-3.5-turbo-instruct发布

7月,OpenAI曾公布GPT-4 API全面可用,并且在接下来几个月要推出新模型。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

这不,就在今天,网友纷纷收到了gpt-3.5-turbo-instruct新模型发布的邮件,以代替旧模型text-davinci-003。

据介绍,gpt-3.5-turbo-instruct是一个InstructGPT风格的模型,其训练方式与text-davinci-003类似。

使用方法和以前的Prompt-Completion类似,根据提示词的指令补全。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

就价格来说,gpt-3.5-turbo 4K保持一致。

有网友已经开始用上了最新模型,去玩1800 Elo左右的国际象棋。

而他此前还发现GPT根本做不到这一点,但现在看来这只是RLHF聊天模型的问题,纯Completion模型就成功了。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

在对弈中,gpt-3.5-turbo-instruct轻松击败了Stockfish 4级(1700 分),在5级(2000 分)的比赛中仍不落下风。

它从不走非法棋步,使用巧妙的开局牺牲,以及令人难以置信的卒与王将死,允许对手毫无实际意义地晋级。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

网友用的是如下PGN风格的提示来模拟大师级游戏。高亮显示有点错误。GPT自己走棋,他手动输入了Stockfish的棋步。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

顺便提一句,OpenAI即将在11月召开的首届开发者大会,已经开始注册了,快上手申请吧。

GPT-5来了?OpenAI被曝加急训练多模态大模型Gobi,一举狙杀谷歌Gimini!

参考资料:

https://www.theinformation.com/articles/openai-hustles-to-beat-google-to-launch-multimodal-llm

https://devday.openai.com/

https://news.ycombinator.com/item?id=37558911#:~:text=Key%20Features%3A%20Gpt%2D3.5%2D,speed%20as%20our%20turbo%20models.

编辑:编辑部

来源公众号:新智元(ID:AI_era),“智能+”中国主平台,致力于推动中国从“互联网+”迈向“智能+”。

本文由人人都是产品经理合作媒体 @新智元 授权发布,未经许可,禁止转载。

题图来自 Unsplash,基于CC0协议。

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。