惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Apple Machine Learning Research
Apple Machine Learning Research
S
Schneier on Security
P
Proofpoint News Feed
The Cloudflare Blog
S
SegmentFault 最新的问题
WordPress大学
WordPress大学
Hugging Face - Blog
Hugging Face - Blog
雷峰网
雷峰网
博客园 - 【当耐特】
博客园 - 叶小钗
大猫的无限游戏
大猫的无限游戏
F
Fortinet All Blogs
宝玉的分享
宝玉的分享
博客园 - 聂微东
Engineering at Meta
Engineering at Meta
G
Google Developers Blog
Know Your Adversary
Know Your Adversary
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
S
Securelist
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
C
CXSECURITY Database RSS Feed - CXSecurity.com
G
GRAHAM CLULEY
T
Threatpost
T
Threat Research - Cisco Blogs
酷 壳 – CoolShell
酷 壳 – CoolShell
C
Cisco Blogs
Cisco Talos Blog
Cisco Talos Blog
Latest news
Latest news
C
Cybersecurity and Infrastructure Security Agency CISA
L
LINUX DO - 热门话题
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
SecWiki News
SecWiki News
L
LangChain Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
The Last Watchdog
The Last Watchdog
阮一峰的网络日志
阮一峰的网络日志
Security Latest
Security Latest
P
Palo Alto Networks Blog
L
LINUX DO - 最新话题
博客园 - 司徒正美
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
P
Privacy International News Feed
N
News and Events Feed by Topic
Spread Privacy
Spread Privacy
T
Tenable Blog
有赞技术团队
有赞技术团队
MyScale Blog
MyScale Blog
aimingoo的专栏
aimingoo的专栏
AI
AI

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
优等生归来,谷歌最强大模型Gemini能否打败GPT-4?
甲子光年 · 2023-12-08 · via 人人都是产品经理

在当地时间12月6日,谷歌发布了大模型Gemini,某种程度上,我们可以将Gemini看作是谷歌用来应对GPT-4的“杀手锏”。那么,Gemini的核心优势在于哪些方面?当我们将谷歌和OpenAI二者进行对比时?我们可以得出什么结论?

“沉寂”已久的谷歌终于放大招了。

美国当地时间12月6日,谷歌发布多模态大模型Gemini。谷歌DeepMind直接宣布,Gemini是“谷歌最大、最强的人工智能模型”。

Google Deepmind 的官方账号截图,来源:谷歌DeepMind

Gemini谷歌是从头开始构建的多模态模型,这也是更接近人类认识世界的方式。

作为谷歌用来应对GPT-4的“杀手锏”。Gemini在32个多模态基准测试中取得了30个SOTA(State Of The Art,即当前最优效果)的记录,是第一个在MMLU(大规模多任务语言理解)测评上超过人类专家的模型。Gemini在此项取得的成绩是90.0%,作为对比,人类专家的成绩为89.8%,GPT-4为86.4%。

Gemini共有三个版本:

  • Gemini Ultra:适用于高度复杂的任务;
  • Gemini Pro:适用于扩展至各种任务的Gemini模型;
  • Gemini Nano:体量较小,适用于特定任务和移动设备。

Gemini的三个版本,图片来源:谷歌

“Gemini的多样性让它能够在从移动设备到大型数据中心的所有设备上运行。”谷歌DeepMind产品副总裁Eli Collins说,“我们离新一代人工智能模型的愿景越来越近了。”

“有了人工智能,我们将有机会以更大规模做一些重要的事情。”谷歌CEO Sundar Pichai在谷歌成立25周年公开信中就特意提到了人工智能。面对强势的OpenAI,优等生谷歌需要一款现象级产品,证明自己在人工智能领域的实力。

Gemini就是谷歌交出的答卷。

一、“打的就是精锐”

谷歌的Gemini模型的核心优势在于其原生多模态(natively multimodal)的特性。

以往的多模态大模型往往是通过分别针对不同模态训练单独的组件,再将这些组件组合起来以模拟多模态功能的方法构建的。虽然在某些任务(比如图像描述)上表现良好,但在处理需要更深层次概念理解和复杂推理的任务时,它们的表现往往不尽人意。

而谷歌的Gemini模型从一开始就在不同模态上进行预训练,再通过使用额外的多模态数据进行微调,进一步提升了模型的有效性。这种原生的多模态训练方法使得Gemini在处理多种类型的数据和复杂任务时更为高效和精准,从而在多模态人工智能领域树立了新的标准。

并且,Gemini的推出主要是“瞄准OpenAI的GPT-4”而来。用《亮剑》里李云龙的话来说就是——“打的就是精锐”。

在运算效能方面,Gemini几乎“全面吊打”GPT-4。Gemini Ultra在大模型研发被广泛使用的32个学术基准测试集中,在其中30个测试集的性能超过此前SOTA结果。其中,在多选问题、数学问题、Python代码任务、阅读等方面,Gemini的性能都超过了此前最先进的水平。

谷歌称,他们对MMLU采用了新的基准方法,使Gemini能够利用推理能力在回答难题之前进行更仔细的思考,相比仅仅根据问题的第一印象作答,Gemini的表现有显著改进。

Gemini Ultra在多个编码基准测试中表现出色,包括HumanEval和Natural2Code。其中仅Gemini仅在HellaSWAG数据集上的测试逊色于GPT-4。

HellaSWAG数据集主要用于研究扎根的常识推理能力,但是一位NLP领域的研究专家向「甲子光年」表示:”这并不能说明GPT4的常识推理性能更好,因为不能排除ChatGPT的模型在HellaSWAG数据集上训练过。”

Gemini模型与GPT-4部分测试评分对比,图片来源:谷歌

此外,在多模态方面,Gemini Ultra在新的MMMU基准测试中取得了59.4%的最先进得分,突显了其多模态性和复杂推理能力。

在图像基准方面的测试中,Gemini Ultra不需要从图像中提取文本就能进行OCR处理,表现优于之前最先进的模型。

Gemini模型在多模态方面的与GPT-4V的测试对比,图片来源:谷歌

Gemini 1.0被训练用于同时识别和理解文本、图像、音频等,因此它能更好地理解具有细微差别的信息,回答与复杂主题相关的问题,尤其擅长解释数学和物理等复杂科目中的推理。

“推理缺陷”也是GPT系列存在的问题。著名语言模型批评者Gary Marcus博士曾锐评道:“大语言模型没法做一些有严格定义的工作:遵守国际象棋规则、五位数字相乘、在家谱中进行可靠的推理、比较不同物体的重量等等。”

Gemini解答物理题演示案例,图片来源:谷歌

尽管技术进步显著,但AI生成的虚假或捏造信息的问题依然存在。Eli Collins指出,这仍是一个未被完全解决的研究难题。

但他同时也强调,Gemini接受了谷歌迄今最为全面的安全评估,以确保其可靠性和安全性。谷歌对Gemini进行了一系列对抗性测试,模拟恶意用户使用模型,并输入各种提示词,以检测模型是否会产生仇恨言论或表现出政治偏见。这些测试包括了“真实毒性提示词”,由网络收集的超过10万个提示词组成,用以全面检验模型的反应。

值得注意的是,Gemini是在谷歌自研的云芯片Tensor Processing Units(TPU)上完成训练的。特别是TPU v5p版本,在性能上有了显著提升,使得模型训练速度相比前一代提高了2.8倍。据悉,TPU v5p芯片是专为数据中心训练及大型模型运行而设计。

从12月13日起,开发人员和企业客户可以通过Google AI Studio或Google Cloud Vertex AI来访问Gemini Pro模型。Google AI Studio是一个基于网络的免费开发工具,为开发人员提供API密钥,从而快速创建原型并启动应用程序。Vertex AI提供了定制化的Gemini以提供更为全面和管理的人工智能平台,并具有完整的数据控制功能,能利用谷歌云的额外功能,包括企业级的安全性、隐私保护以及数据治理和合规性。

此外,从Pixel 8 Pro设备开始,Android开发人员还可以通过Android 14中的新系统功能AICore来使用Gemini Nano。Gemini Nano是专为设备端任务设计的高效模型,通过注册AICore的早期预览版,开发人员可以深入探索其潜力,更便捷地利用Gemini的先进技术,并在Android生态系统的应用开发中迸发更多可能性。

到2024年,谷歌计划推出Bard Advanced,它与AI agent的初级形态十分相似。Bard Advanced将借助Gemini Ultra提供支持,可以迅速理解多模态输入,包括文本、图像、音频和视频,并作出相应的响应。

二、谷歌 VS OpenAI

在OpenAI的GPTs大放异彩时,谷歌似乎过于沉寂了。

今年2月,谷歌在巴黎举行活动时,因其聊天机器人Bard的一处失误,市值蒸发了1000亿美元,也引发了外界对于Bard准确性的担忧。

随着OpenAI推出了ChatGPT,尤其是在必应搜索中整合了GPT技术,并首次在应用程序下载量上超越了谷歌后,人们开始思考谷歌是否在已人工智能领域落后于竞争对手。

事实上,谷歌才是在2017年提出的Transformer模型、为今天这场游戏制定规则的先行者。

谷歌对大模型”高地”的竞争意识并不比OpenAI晚。2021年,谷歌便推出了1.6万亿参数的Switch Transformer,强调稀疏多模态结构的潜力。同时,谷歌还提出了Flan-T5模型,通过更多监督数据降低了模型规模,比GPT-3模型参数更少但性能更佳。

对于技术上的评估,《经济学人》在今年1月曾进行了一项比较测试,向ChatGPT和谷歌基于Lamda的机器人Bard提出了数学、阅读和约会建议等问题。

测试结果显示,谷歌AI在数学问题上表现更佳,但ChatGPT在常识问题上更准确。几天后OpenAI升级了ChatGPT,再次测试中在数学问题上与谷歌AI持平。尽管ChatGPT作为一个大型语言模型训练成本高、迭代难,但也显示了它持续进化的巨大潜力。值得注意的是,谷歌的语言模型与ChatGPT在性能上是旗鼓相当的。

在这场对决中,谷歌和微软都需要成本效益更高的解决方案。谷歌在AI领域取得了不少研究进展,但尚未将这些成果部署和变现,类似于微软在过去的某些时期。这可能是因为谷歌低估了微软和OpenAI的竞争实力,或者过于自信于自己在搜索引擎领域的主导地位。

甲子光年」综合多方观点分析得出,谷歌在技术前瞻性上领先,OpenAI更专注于产品的打磨。

在Sam Altman领导下的OpenAI专注于产品为导向的工作,致力于扩展和优化模型,主要关注细节精调方法。

谷歌则在技术发展的方向上始终保持着积极和前瞻的态度,不过在整体战略规划上却屡次调整。

谷歌在稀疏模型架构上进行了深入探索。只是两年后的,万亿级别的Switch Transformer几乎没产生任何水花,而千亿参数级别的GPTs系列却风生水起。同样,被反复改进的Flan-T5模型虽然在性能上超越了GPT-3,但其优化进展相对缓慢。

在谷歌“选择困难症”期间,OpenAI已经完成了对ChatGPT的训练。

在2022年9月,谷歌旗下的DeepMind推出了麻雀(Sparrow)模型,和ChatGPT一样,采取了基于人类反馈的强化学习(RL)框架。该模型采用了小型参数设置,与谷歌看重的LaMDA和PaLM模型的思路有明显不同。只是谷歌并未能迅速确定麻雀模型是否是最优选择,这也导致了麻雀模型的产品化滞缓,最终未能“飞上枝头变凤凰”。

“犹豫不决”似乎一直是谷歌的宿疾。“但迟到总比不做好!终于有了OpenAI王座的有力竞争者。”在Google公布消息后,英伟达AI科学家Jim Fan评论道。

今年4月,谷歌将Google Brain和DeepMind团队合并,成立 Google DeepMind。有人将这一团队戏称为“AI复仇者联盟”。原Google AI产品负责人Eli Collins被委以重任,担任新团队的产品副总裁。

目前,Gemini Pro和Gemini Nano已在聊天机器人Bard和智能手机Pixel 8 Pro上集成,实现了更为高级的推理、规划、理解等能力。而更为强大的Gemini Ultra将在明年发布。

不知OpenAI会如何“应战”呢?或许我们很快便可以等到GPT-5的发布了。

不过,优等生谷歌并不完全在意这一时之战,而是在着眼未来。

“我们对答案的探索将在未来25年推动非凡的技术进步。到2048年时,如果有一位青少年在世界上的某个地方,看着我们用人工智能建造的一切耸耸肩,我们就知道我们成功了。然后,我们就回去工作。”

谷歌CEO Sundar Pichai在谷歌成立25周年公开信中如是说。

*参考资料:

《Introducing Gemini: our largest and most capable AI model》,谷歌

《ChatGPT大热,谷歌为何在自己的地盘输给OpenAI?》,界面新闻

作者:苏霍伊;编辑:王博

原文标题:优等生归来,谷歌最强大模型Gemini能否打败GPT4?|甲子光年

来源公众号:甲子光年(ID:jazzyear),立足中国科技创新前沿阵地,动态跟踪头部科技企业发展和传统产业技术升级案例。

本文由人人都是产品经理合作媒体 @甲子光年 授权发布,未经许可,禁止转载。

题图来自Unsplash,基于CC0协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。