惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The GitHub Blog
The GitHub Blog
Martin Fowler
Martin Fowler
Vercel News
Vercel News
U
Unit 42
Engineering at Meta
Engineering at Meta
aimingoo的专栏
aimingoo的专栏
MyScale Blog
MyScale Blog
Y
Y Combinator Blog
阮一峰的网络日志
阮一峰的网络日志
爱范儿
爱范儿
Apple Machine Learning Research
Apple Machine Learning Research
博客园_首页
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
B
Blog RSS Feed
N
Netflix TechBlog - Medium
GbyAI
GbyAI
F
Fortinet All Blogs
MongoDB | Blog
MongoDB | Blog
大猫的无限游戏
大猫的无限游戏
C
Check Point Blog
M
MIT News - Artificial intelligence
D
Docker
IT之家
IT之家
Stack Overflow Blog
Stack Overflow Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
Claude 4 发布,再忙也要看一下都更新了啥 - 少数派
2025-05-23 · via 少数派

直接在Anthropic官网的Announcements版块可以看到完整的Claude 4介绍。

总结一下官方发出的更新内容,大致有:

  1. 新发布两款大模型 Claude Opus 4 和 Claude Sonnet 4
  2. Anthropic 宣称 Claude Opus 4 是目前市面上最强的代码模型(Claude Opus 4 is the world’s best coding model);Sonnet 4 是 Sonnet 3.7 的提升版,主要是在编程和推理领域能更精准地理解用户意图
  3. 两款大模型都是混合架构模型,也就是在实时响应和深度推理之间来回切换,很像人脑的直觉和慢思考推理
  4. Pro、Max、团队和企业套餐的用户都可以使用两款模型的扩展思维功能(extended thinking),而且已经全面登陆 Anthropic API、Amazon Bedrock 和 Vertex AI 平台
  5. Sonnet 4 向免费用户开放
  6. API 定价延续 Opus 和 Sonnet 系列的标准:Opus 4 是每百万 tokens 15(输入)和 75(输出)美元,Sonnet 4 是每百万 tokens 3(输入)和 15(输出)美元

除了这两个模型,还有4个更新:

  1. 工具增强型扩展思维(目前还是测试版):两款模型都能在推理和使用工具间灵活切换
  2. 两款模型都支持并行调用工具。而且当用户开放本地文件权限后,Claude 4 会大幅增强记忆能力,可以提取和存储本地文件的关键信息,甚至构建隐性知识体系
  3. Claude 代码助手正式发布(Claude Code is now generally available)。Claude Code 现在支持通过 Github Actions 执行后台任务,能和 VS Code、JetBrains 实现原生集成,直接连接开发环境实时展示代码修改
  4. 全新API:Anthropic API 新增了四大能力:代码执行工具(the code execution tool),(MCP 连接器)MCP connector,文件 API 接口(Files API),最长1小时的提示词缓存功能(the ability to cache prompts for up to one hour)

从昨晚发布后我看到很多人在夸 Claude 4 的代码能力,尤其是那个连续7小时的自主开源重构项目。本着对一切保持质疑的态度,我去官网看了一下介绍代码能力部分原文,一些重点内容说的是:

Claude Opus 4 在 SWE-benchTerminal-bench 上分别以72.5%和43.2%的得分领跑行业基准。这个是其宣称全球顶尖编程模型的依据。 两份榜单我都去搜了一下,公开的榜单暂时还没有更新;Anthropic 贴出的跑分结果图片如下。网上疯传的7小时连续自主开发项目在原文中是 Rakuten validated its capabilities with a demanding open-source refactor running independently for 7 hours with sustained performance(乐天通过耗时7小时的自主开源重构项目验证了其持续性能优势),具体的项目过程等我答辩结束后研究一下(还有3天就答辩可焦虑死我了)。

但是当我拿经典的七边形+20小球模拟项目测试后,Claude Sonnet 4 生成的代码跑出的效果却是...(对不起 Anthropic,我不是故意要黑你的)

Claude Opus 4 现在用的人太多了一直卡着出不了结果,等过两天我再试试。Sonnet 4 在这个项目上和之前的 Gemini 2.5 Pro 比稍微差一点,但也算领先;所以这次更新对我来说可能更是一次正常的产品迭代,更多其他项目的测试还可以等两天看各位大神们的实测结果。

(好了我真的要去 all in 毕业答辩了,许愿26号顺利通过!