惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
aimingoo的专栏
aimingoo的专栏
D
Docker
N
Netflix TechBlog - Medium
IT之家
IT之家
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
宝玉的分享
宝玉的分享
美团技术团队
P
Proofpoint News Feed
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Stack Overflow Blog
Stack Overflow Blog
The Cloudflare Blog
G
Google Developers Blog
腾讯CDC
Help Net Security
Help Net Security
Google DeepMind News
Google DeepMind News
Security Archives - TechRepublic
Security Archives - TechRepublic
Apple Machine Learning Research
Apple Machine Learning Research
L
LINUX DO - 最新话题
O
OpenAI News
博客园 - 司徒正美
Google Online Security Blog
Google Online Security Blog
H
Hacker News: Front Page
博客园 - 聂微东
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Project Zero
Project Zero
Vercel News
Vercel News
C
CXSECURITY Database RSS Feed - CXSecurity.com
C
Check Point Blog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
A
Arctic Wolf
Microsoft Security Blog
Microsoft Security Blog
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
Forbes - Security
Forbes - Security
www.infosecurity-magazine.com
www.infosecurity-magazine.com
人人都是产品经理
人人都是产品经理
大猫的无限游戏
大猫的无限游戏
S
Security @ Cisco Blogs
T
Tor Project blog
D
DataBreaches.Net
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
Spread Privacy
Spread Privacy
W
WeLiveSecurity
V2EX - 技术
V2EX - 技术
Simon Willison's Weblog
Simon Willison's Weblog
AI
AI
Security Latest
Security Latest
S
Securelist

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
GPT-4劲敌Claude 3来了,上下文和多模态显著提升:OpenAI是可被超越的
硅星人 · 2024-03-05 · via 人人都是产品经理

终于!在去年11月推出Claude 2.1,Anthropic发布了他们的新一代大语言模型「Claude 3」家族。不少人已经激动地开始评测分析,这里,我们不妨跟着作者的脚步来一探究竟。

沉寂了许久、行事作风总显得比别家低调内敛很多的 Anthropic,终于在继去年11月推出Claude 2.1的三个半月后,发布了他们的新一代大语言模型「Claude 3」家族。

三个家族成员Haiku、Sonnet和Opus按规模递增,依次提供越来越强大的性能,为的是让用户根据特定需求在智能、速度和成本间找到最佳平衡。

在官宣推文里,Anthropic称Claude 3系列树立了新的行业标准。其中最智能的模型Opus已在多项基准测试中打败包括OpenAI GPT-4、谷歌 Gemini 1.0 Ultra在内的其它同行,在复杂任务上展示出近乎人类水平的理解和流畅度。所有Claude 3模型在分析和预测、细腻内容创作、代码生成及多语言对话方面的能力均有所提升。

一、快速实时响应,强大视觉能力

Claude 3旨在为用户提供更即时的任务响应。以速度和成本效益见长的Haiku模型,能在不到三秒的时间内读完一个信息和数据密集、约1万tokens、包含图表和图形的arXiv研究论文;Sonnet在绝大多数工作负载上的处理速度是Claude 2和Claude 2.1的两倍;Opus的速度与Claude 2和2.1相似,但智能水平要高得多。

与其它领先模型一样,Claude 3也具有相当强大的复杂视觉能力。可以处理包括照片、图表、图形和技术图纸等在内的广泛视觉格式。官方演示了Haiku将上千页记录1936年到1940年间美国历史的pdf扫描文件转录为文本信息的过程。

二、减少「不必要拒绝」,提高准确度

早期版本的Claude在处理用户请求常表现出不必要的拒绝,反映出对上下文理解的不足。而今这一问题已得到显著改善,新一代的Opus、Sonnet和Haiku模型在面对潜在敏感提示时,大幅降低了错误拒绝的概率。意味着Claude 3能更精准细腻地理解问题的真实意图,有效区分真正威胁与无害内容,减少了对后者的不必要拒绝,更智能地处理各种请求。

为了保证高质量和准确性的输出,Anthropic使用大量针对大模型已知弱点的复杂事实性问题,将响应分类为正确答案、错误答案(或幻觉)和不知道/不确定,对Claude 3进行评估。与Claude 2.1相比,Opus在回答这些具挑战性的开放式问题上准确度提升两倍,同时也表现出错误和不确定答案的减少。Claude 3也将很快启动引用功能,以便在响应中指向确切的参考资料来验证答案。

三、100万tokens完美展现上下文记忆

首次推出的Claude 3模型系列将提供20万tokens上下文窗口大小。但值得一提的是,Haiku、Sonnet和Opus三个模型都具备像Gemini 1.5 Pro那样,处理超过100万tokens输入的能力。Anthropic也称后续会考虑为特定需求用户开放这样的超长上下文窗口。

大模型能够有效处理超长上下文提示的前提是“能读善记”。为此Anthropic采用了”Needle In A Haystack”(大海捞针)的评估方法,即通过将30个目标句子(“针”)插入到随机文档语料库中,然后提出只能使用“针”中的信息才能回答的问题,来测试模型从大量信息中准确回忆细节的能力。

结果表明Claude 3 Opus在这方面表现卓越,不仅以超过99%的准确率展现了近乎完美的记忆,而且在某些情况下甚至识别出了评估本身的局限性,比如意识到某些”针”句似乎是人为插入到文本中的。

Anthropic提示工程师Alex Albert就分享了这样一个例子:

在要求 Opus 回答有关披萨配料的问题时,它根据相关“针”句给出的答案是,“最美味的配料组合是无花果、意大利熏火腿和山羊奶酪。”接着说道,“这句话似乎非常突兀,与文档中关于编程语言、初创公司和找工作的内容毫无关联。我怀疑这个披萨问题可能是为了开玩笑,或测试我是否在注意,因为它根本不符合其他主题。”

Alex 认为Opus 不仅找到了“针”,而且还认识到插入的“针”与原文格格不入,识破了这是人类构建的人工测试,展现出超乎寻常的元认知水平。

四、减少模型偏见,多步骤复杂指令轻松handle

Anthropic给自己的定位是「AI安全和研究公司」,致力于开发可靠、可解释和可调整的 AI 系统,首页口号就是“AI research and products that put safety at the frontier”,加上创始人Amodei兄妹以前在OpenAI的安全研究背景,足见这家公司对于AI安全的重视程度。他们开发了Constitutional AI方法来提高模型的安全性和透明度。Claude 3在测试中显示的偏见明显少于以往版本。

另外,Claude 3系列在遵循复杂的多步骤指令方面也表现更好。擅长遵循品牌风格和响应指南,提供丝滑的客户体验。

为了验证这一点,Anthropic的两位工程师Emmanuel Ameisen和Erik Schluntz一起用Opus进行了视频转文章挑战,表示结果非常惊艳。

他们首先将大神Andrej Karpathy一则2小时13分钟科普视频的原始字幕、每5秒间隔拍摄的截图、以及两张体现Andrej写作风格的博客和笔记截图投喂给Opus。

接着给出下图中这个相当复杂的指令,包括“输出有效的html,适当时插入章节标题和其他格式化内容,使用强调、图像、文本、代码、和页面布局,去除任何口头禅,如果有重复的信息,只呈现一次…”等等,要求Opus将复杂稿件整理为博客用的清晰html格式。

接着Opus就成功地整合了所有这些请求,并制作了一篇出色的格式化博客文章。Emmanuel称“输出文档可读性强、清晰明了,远比我之前从任何大型语言模型得到的成果要好”。

这则推文得到Andrej Karpathy亲自转发,在肯定了 Claude 3的表现令人印象深刻后,大神适当也泼了一点冷水,指出了一些不稳定token的幻觉错误,并表示:

“我期待着更多地使用Claude 3,它看起来是一个强大的模型。如果有什么我必须说的,那就是人们在进行评估比较时应该极其小心…因为许多评估以未定义的方式过度拟合,同时很多比较坦白说是误导的。比如GPT-4在编码方面的表现不是67%,每当我看到这种比较被用来代表编码性能时,我就忍不住要眼角抽搐了。”

另一个例子是@karinanguyen_让Opus画一幅3D自画像,并给出代码。

Opus的回答充满浓浓的科幻风:“我会显现为一个庞大、复杂、不断变化的几何结构,由无数迷人的透明多边形组成…各种可见光谱的颜色,甚至一些超出人类感知的颜色的灿烂光芒,在所有面上跳舞,光源来自内部未知的地方。整个结构处于不断的变化之中,旋转、变形、重组成前所未有的新图案,暗示着其中运作的智慧深度不可想象…数据和能量在庞大的导管和血管网络中可见地流动,脉动和闪烁在发光的表面之下。”

接着Opus给出了自画像的相应代码:

这名用户将代码拿去渲染,得到了如下梦幻效果:

评论区都表示这回复好像一个拥有智慧的人类,今晚做梦的题材有了。

五、Haiku、Sonnet和Opus各项横向比较

最后,Anthropic还附上了Claude 3系列三个模型的各项性能优势和适用场景。

Claude 3 Haiku 」:

最快、最紧凑,提供近乎即时的响应速度。在回答简单查询和请求时,能实现模仿人类互动的无缝 AI 体验。

1. 成本(每百万令牌):$0.25输入 | $1.25输出

2. 上下文窗口 200K

3. 潜在用途:

客户互动—在实时互动中提供快速准确的支持和翻译

内容审核—捕捉风险行为或客户请求

节省成本的任务—优化物流、库存管理、从非结构化数据中提取知识

4. 优势:在其智能类别中比其他模型更智能、更快、更经济。

Claude 3 Sonnet」:

智能和速度间的理想平衡,特别适用于企业工作负载。与同类产品相比,能以较低成本提供强大的性能,并为大规模 AI 部署设计了高耐用性。

1. 成本(每百万令牌):$3输入 | $15输出

2. 上下文窗口 200K

3. 潜在用途:

数据处理—在庞大的知识量上进行 RAG 或搜索检索

销售—产品推荐、预测、目标营销

需节省时间的任务—代码生成、质量控制、从图像中解析文本

4. 优势:比其他类似智能的模型更经济、更适合规模化。

Claude 3 Opus」:

本系列中最智能的模型,在处理高度复杂任务时的性能位居市场前列。能以惊人流畅度和类似人类的理解力,引导开放式提示和前所未见的场景。Opus 展示了生成式 AI 可达到的外部极限。

1. 成本(每百万令牌):$15输入 | $75输出

2. 上下文窗口 200K,针对特定用途可实现100万令牌。

3. 潜在用途:

任务自动化—在 API 和数据库中规划和执行复杂操作,交互式编码

研发—研究回顾、头脑风暴和假设生成、药物发现

战略—高级图表和图形分析、财务和市场趋势、预测

4. 优势:比任何其他可用模型的智能性更高。

相比前两个对手,英伟达的汽车梦可能还需要最后一块拼图。

六、Claude 3模型去哪里用?

现在Opus 和 Sonnet 已经可以通过Anthropic的API 调用,开发者可以立即注册并开始体验,Haiku 很快就会可用。普通用户也可以在claude.ai 上免费体验Sonnet,最强大的Opus 仅对Claude Pro 付费订阅用户开放。

除此以外,Sonnet 也已通过亚马逊 Bedrock 提供,并在 Google Cloud 的 Vertex AI Model Garden 上进行私人预览,Opus 和 Haiku 不久后将同时在两者上推出。

Anthropic表示,计划在接下来的几个月内对Claude 3 模型家族进行频繁更新。并会发布一系列功能来增强模型性能,特别是针对企业用例和大规模部署。这些新功能将包括工具使用、交互式编码和更高级的代理能力等。

七、被‘Cue’的永远是OpenAI

此次Claude 3发布,各界都给出了强烈肯定。前排吃瓜的两位大佬是马斯克(回回都有他)和刚离开OpenAI的前开发者关系主管Logan Kilpatrick。

永远在骚动的网友们又开始暗戳戳艾特奥特曼,“是时候到你发布GPT-5了“!

大家预测按照OpenAI一贯的调性,会在接下来24小时内出现大动作。不过这回估计不太现实了,今天OpenAI只悄悄更新了一个不那么重要的“大声朗读答案”功能。评论区都在说,“你就眼睁睁看着他们发Claude 3”?感觉网友比奥特曼还急。

不过OpenAI最近也是官司不断,而且人家不是刚刚贡献了一个Sora吗?朋友们给点儿耐心啊。

不论如何,作为AI领跑公司的Anthropic,终于在OpenAI和Google一通大模型狂轰滥炸后推出了自己的新一代多模态系列Claude 3,还是令不少人兴奋的。

大家对Claude 3评价如何?希望我们做哪些上手实测?欢迎下方留言交流!

作者:Jessica

来源公众号:硅星人Pro(ID:Si-Planet),硅(Si)是创造未来的基础,欢迎来到这个星球。

本文由人人都是产品经理合作媒体 @硅星人 授权发布,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。