
























直接在Anthropic官网的Announcements版块可以看到完整的Claude 4介绍。


总结一下官方发出的更新内容,大致有:
除了这两个模型,还有4个更新:
从昨晚发布后我看到很多人在夸 Claude 4 的代码能力,尤其是那个连续7小时的自主开源重构项目。本着对一切保持质疑的态度,我去官网看了一下介绍代码能力部分原文,一些重点内容说的是:
Claude Opus 4 在 SWE-bench 和 Terminal-bench 上分别以72.5%和43.2%的得分领跑行业基准。这个是其宣称全球顶尖编程模型的依据。 两份榜单我都去搜了一下,公开的榜单暂时还没有更新;Anthropic 贴出的跑分结果图片如下。网上疯传的7小时连续自主开发项目在原文中是 Rakuten validated its capabilities with a demanding open-source refactor running independently for 7 hours with sustained performance(乐天通过耗时7小时的自主开源重构项目验证了其持续性能优势),具体的项目过程等我答辩结束后研究一下(还有3天就答辩可焦虑死我了)。


但是当我拿经典的七边形+20小球模拟项目测试后,Claude Sonnet 4 生成的代码跑出的效果却是...(对不起 Anthropic,我不是故意要黑你的)

Claude Opus 4 现在用的人太多了一直卡着出不了结果,等过两天我再试试。Sonnet 4 在这个项目上和之前的 Gemini 2.5 Pro 比稍微差一点,但也算领先;所以这次更新对我来说可能更是一次正常的产品迭代,更多其他项目的测试还可以等两天看各位大神们的实测结果。
(好了我真的要去 all in 毕业答辩了,许愿26号顺利通过!
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。