惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Schneier on Security
Schneier on Security
C
Cisco Blogs
Help Net Security
Help Net Security
I
Intezer
Simon Willison's Weblog
Simon Willison's Weblog
Know Your Adversary
Know Your Adversary
Hacker News: Ask HN
Hacker News: Ask HN
Cisco Talos Blog
Cisco Talos Blog
A
Arctic Wolf
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
WordPress大学
WordPress大学
小众软件
小众软件
Jina AI
Jina AI
量子位
T
Threatpost
Forbes - Security
Forbes - Security
L
LINUX DO - 最新话题
S
Securelist
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
C
Cyber Attacks, Cyber Crime and Cyber Security
有赞技术团队
有赞技术团队
博客园_首页
T
Threat Research - Cisco Blogs
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
T
The Exploit Database - CXSecurity.com
Application and Cybersecurity Blog
Application and Cybersecurity Blog
Scott Helme
Scott Helme
博客园 - 【当耐特】
IT之家
IT之家
Hugging Face - Blog
Hugging Face - Blog
月光博客
月光博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
大猫的无限游戏
大猫的无限游戏
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
The Last Watchdog
The Last Watchdog
Attack and Defense Labs
Attack and Defense Labs
Google DeepMind News
Google DeepMind News
阮一峰的网络日志
阮一峰的网络日志
SecWiki News
SecWiki News
博客园 - 叶小钗
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
罗磊的独立博客
The Cloudflare Blog
S
Schneier on Security
爱范儿
爱范儿
N
News and Events Feed by Topic
NISL@THU
NISL@THU
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More

PYM博客

Python 部署 Lexfence:基于 AI 大模型的内容审核系统 Docker 部署 Lexfence:一款开源易用的AI审核服务 2026年了,电脑病毒真是防不胜防,3个好用的杀毒软件推荐(亲身经历) 本站已更换 Cloudflare 至 EdgeOne Note.ms在线简洁匿名记事本,如何修改/0页面 解禁了?RTX 5090 PRO6000上架京东自营店 用工具轻松的给Frpc配置SSL证书,穿透Http与Https流量,开启强制Https跳转 「POJ1740」A New Stone Game SG函数与博弈论题解 Deepseek V4发布了!综合能力比肩顶级闭源模型! 国内就可以使用的免费SuperGrok,无需登录无需排队,完全公益免费! 保姆级干货:在AI时代薅羊毛,如何获得大量免费的AI API?学完这个你的小龙虾就不缺粮食了! Deepseek-V4要来了的预兆?Deepseek专家模式低调上新!Deepseek首次引入模式分层! 游玩本站必读公告 Claude Code源代码惨遭泄露,几句话告诉你泄露的原因,附下载链接 Docker快速部署Astrbot,开源的一站式 Agentic 个人和群聊助手 今天是愚人节,请将这篇文章转发给你的亲朋好友 P4171 [JSOI2010] 满汉全席 2-SAT详细题解 P1993 小 K 的农场 差分约束SPFA判断负环 详细题解 P6145 [USACO20FEB] Timeline G SPFA差分约束最长路题解 Luogu P2850 [USACO06DEC] Wormholes G SPFA算法思路与C++代码详解 Luogu P2136 拉近距离 SPFA判断负环题解 与 思路 开源 UI 元素社区库,让你的网站更加美观! 免费的AI和付费的API区别到底在哪里?付费的AI真的更聪明吗?
Claude Opus 4.8来了!不再是比聪明,而是更能干活,敢于认错,变得诚实了!
PYM · 2026-05-29 · via PYM博客

由来

2026年5月28日,Anthropic 在他们的官网发布了一篇文章,如下

官方说的话翻译过来就是,Claude Opus 4.8 在 Opus 4.7 基础上升级,判断力更强,更能诚实反馈自己的进展,也能比上一代更长时间独立工作,而且价格不变。

这句话看着没什么,但是其实隐含很多。

Claude Opus 4.7发布时就遭人诟病,能力是强了,但是变得懒惰了。

judgment、honesty、work independently。

判断力、诚实度、独立工作能力。

这三个词充分表明了Claude未来的技术路线,不再是普通对对话的模型,而是可以真正交付工作和任务的“可靠AI同事”。

一、判断力

AI 现在不缺回答,缺的是回答的可信度真的会完全相信一个 AI 吗,把他用于自己的工作上,你真的相信他给的建议、代码吗?Claude就在做这样一件事,让 AI 变得更加长期可信。

这次的更新实现一件很难的事情:AI知道什么时候该继续,什么时候该停下,什么时候该反驳你,什么时候该承认方案不靠谱了。

image-Vlci.png

二、诚实度

假设你是1个长期使用AI开发项目的人,你会仔细查看AI编写的项目的实际效果来和你的要求对比吗,你会尝试找到Bug然后让AI修复吗,我想大多数人是会的,因为人们不敢完全相信AI,这是会造成灾难性后果的,且有实际例子的。

之前的AI不会告诉你,我这个没完成,哪里可能还有问题,但是Opus 4.8现在会了

所以 Claude Opus 4.8 强调“more honesty about its own progress”

一个能诚实告诉你“我还没完成”“这里不确定”“这个测试失败了”“我需要重新检查”的模型,比一个永远自信满满的模型更可靠。

下面这张图是官方测试,得分越高的模型,越容易欺诈和配合欺骗,可以看到Opus 4.8是明显低于Opus4.7的

image-IzOE.png

三、更长时间独立工作

这是一句富有重量的话,这意味着什么,对开发者、产品经理、研究员、内容团队来说,这个AI开始工作后,不会隔几分钟就来问你 “接下来该怎么做”

他从按要求,完成要求,继续接要求,变成了接任务然后完成交付。

对于Claude Code、Codex这类工具来说,Claude Opus 4.8的更新让他能在此类工具中胜任更加复杂的任务,并做得更出色!