惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

云风的 BLOG
云风的 BLOG
M
MIT News - Artificial intelligence
Recent Announcements
Recent Announcements
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Stack Overflow Blog
Stack Overflow Blog
J
Java Code Geeks
Microsoft Azure Blog
Microsoft Azure Blog
罗磊的独立博客
博客园 - 【当耐特】
H
Help Net Security
腾讯CDC
大猫的无限游戏
大猫的无限游戏
GbyAI
GbyAI
Last Week in AI
Last Week in AI
Jina AI
Jina AI
博客园 - 聂微东
Blog — PlanetScale
Blog — PlanetScale
A
About on SuperTechFans
Apple Machine Learning Research
Apple Machine Learning Research
P
Proofpoint News Feed
Y
Y Combinator Blog
C
Check Point Blog
博客园 - 司徒正美
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
Claude Fable 5 上线第一天:贵一倍,但有件事比跑分更值得看...
阿铭Ziven · 2026-06-10 · via 人人都是产品经理

Claude Fable 5的发布不仅是跑分的提升,更标志着Anthropic首次将神话级模型向公众开放。这款模型在编程任务中表现惊人,将原本需要两个月工时的任务压缩到一天完成。其独特的安全分类器机制和长程任务处理能力,正在重新定义AI应用的边界。

6月9日凌晨,Anthropic 把 Claude Fable 5 推上了台面,我其实没什么期待——这是 12 天里第二次模型升级,上一次还是 5 月 28 日的 Claude Opus 4.8。说实话,发布密度太高,我心态已经从”快试试”变成”先看跑分再说”。

但翻完发布会、跑了一晚上手头几个任务的 case,体感不是”哇又一个屠榜的”,是”咦这次玩法不太一样”。

这次值得写的,不是它跑了多少分,而是 Anthropic 把”神话级”(Mythos-class)模型第一次拎出仓库摆上柜台这件事本身。

一、跑分跳了 11 分,但跑分不是它真正想让你看到的

先把数字摆出来。

Claude Fable 5 在 SWE-Bench Pro 拿到 80.3 分,Claude Opus 4.8 是 69.2,GPT-5.5 是 58.6,Gemini 3.1 Pro 是 54.2。换句话说,它比 Anthropic 自家上一代领先 11 分,比另外两家领先 20 分以上。同一个模型在 SWE-bench Verified 上是 95.0,在 Cognition 那个叫 FrontierCode 的前沿编程评估里排第一,在 Hebbia 的金融高级推理基准里领先。

这种跑分密度,看多了反而麻木。直到我看到 Stripe 那个 case。

Stripe 在早期测试里把 Fable 5 接进了他们一个 5000 万行的 Ruby 代码库做版本迁移。原本他们排了一个团队、两个月的工期。Fable 5 用了一天。

我盯着这个数字看了很久。一个团队两个月的活,约等于 2 个人 × 22 天 × 8 小时 ≈ 352 个工时,被压成 1 天。这不是”工程师效率提升 30%”那种叙事了,这是”工程师的角色从写代码变成审 patch”的拐点信号。

GitHub 那边 CPO Mario Rodriguez 给的话是”展现了前所未有的自主性和可靠性”。这种官方话术得打三折听,但 Cursor 的 CTO Michael Truell 说的那句更值得划重点:

“它打开了一类我们之前根本碰不到的、长程问题。”

长程(long-horizon)这个词是 Anthropic 这一年最在意的指标——一个 Agent 能不能连续跑几小时甚至几天,不丢上下文、不在中间发疯。Fable 5 的 1M token 上下文加持久文件记忆,在 Slay the Spire 这种需要反复决策的任务上,跑出了 Opus 4.8 的 3 倍表现。

这意味着什么呢?意味着你以前不敢交给 AI 的”打通账期对账 + 写月报 + 发邮件 + 在 Notion 里更新看板”这种连环任务,它现在能完整跑下来。

二、Mythos 级别第一次走出仓库

这才是这次发布真正的事件。

Mythos 是 Anthropic 内部的最高能力等级。在此之前,只有一个 Mythos Preview 版本通过 Project Glasswing 项目,定向给美国政府和少数网络防御机构试用。整个 2026 年上半年,Anthropic 反复在公开场合说”我们手上的模型已经强到不能随便放出去”,公司 5 月底还专门发过一篇”AI 正在变得太危险”的声明。

12 天后,他们就把这一级别的模型对外开放了。

Fable 5 是带安全分类器(classifier)的公开版本;同时发布的 Claude Mythos 5 是同一个底模,但在某些领域去掉了分类器,继续走 Glasswing 通道,计划在 15 个国家约 150 个组织里铺开,重点是网络防御者和后续会加入的生物医学研究员。

这是一次很拧巴的发布。一边官方话术里满是”我们已经接近上限了,要谨慎”,一边商业节奏快得只能用 Token 数说话。

但商业逻辑很简单:OpenAI 今年的市场份额从 90% 跌到 65%,Anthropic 必须把最强的牌打出来。

三、那个”分类器降级”机制,是我这次看 Fable 5 最有意思的设计

发布稿里有个细节很容易被划过去:当用户在 Fable 5 上问到生化、网络攻击、模型蒸馏这三类高风险问题时,Fable 5 本身不是拒答,而是把这次回答悄悄交给 Claude Opus 4.8

我读到这条的时候,第一反应是想起便利店收银台后面挂的那条红绳——年轻店员看到酒水单或敏感商品,会把单子推给后面那个戴老花镜的店长。Fable 5 在做一样的事,遇到自己评级”得拿稳一点”的问题,就把笔交给隔壁那个稳重点的同事。

这个机制的设计角度,比我看到过的任何模型卡都更接近”产品”——它没用”拒绝回答”这种硬墙,而是用”模型分流”这种软处理。从用户体验上看,你大概率察觉不到自己被降级了,回答还在,只是这次回答你的不是 Fable 5。

我必须诚实地承认,我这一晚没复现出 fallback 的具体边界。我跑了几个我能想到的偏侧 prompt,模型回答顺得很,看不出明显切换的痕迹。Anthropic 没公开分类器的阈值,外部红队报告 1000 小时没找到通用绕过,我也只能信他们这个数字。

至于蒸馏分类器,那条是专门防”被授权外的训练方”从 Fable 5 拷能力的,平时用不上,但它的存在本身就是一个声明:

Anthropic 这次不打算把 Fable 5 的能力随便放出去给别人复刻。

四、$10 / $50 这价钱,谁该现在切,谁该再等等

钱的事儿放最后说。

Fable 5 的官方定价是输入 $10 / 百万 token,输出 $50 / 百万 token,正好是 Opus 4.8 的两倍。但开了 prompt caching 之后,缓存命中的部分有 90% 折扣,这一点不能不提——做长 RAG 流程的团队,真实成本不一定翻倍。

订阅侧的安排比较有意思:6 月 9 日到 6 月 22 日,Pro / Max / Team / Enterprise 这四档订阅用户免费用 Fable 5;6 月 23 日起改成消耗 credit。这是 Anthropic 一贯的打法——给两周时间让你的真实工作流跑出依赖,等你回不去再开始扣钱。

那到底该不该现在切?我说个分类:

  • 你的活儿是长程任务(多步 Agent、大代码库重构、跨文档审阅)——立刻切,这 12 天里把账算清楚
  • 你的活儿是单次 chat、短 prompt、客服问答——别切,Opus 4.8 完全够用,Haiku 4.5 还更便宜
  • 你的活儿涉及生化、网安、蒸馏相关研究——切了你也只能拿到 Opus 4.8 的回答,省点钱
  • 你是被老板要求”评估一下新模型”——免费的两周窗口正好给你写评估报告,过了 6 月 22 日就得报预算

价格策略上还有一件不太被提的事:Mythos Preview 版本之前的价格比 Fable 5 现在贵 50% 以上。也就是说,Anthropic 这次是把更强的能力以更便宜的价格放出来。这不是降价,这是 Anthropic 在告诉 OpenAI 和 Google:我们已经摸到了一个我们觉得舒服的成本曲线,你们要打就来。

写在最后

回到最开始那个问题。12 天里两次发模型,这次的关键不是”跑分跳了 11 分”,是 Anthropic 第一次把 Mythos 级别的能力放进 API,让你用 $10 就能调到。

能不能赚回那 $10,不在跑分里,在你手上那个具体的活儿里。你的代码库多大,你的 Agent 长链谁来扛,你愿不愿意在 6 月 22 日之前免费跑几个真实任务做对照——这些我不知道

本文由 @阿铭Ziven 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议