惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Threat Research - Cisco Blogs
Microsoft Security Blog
Microsoft Security Blog
aimingoo的专栏
aimingoo的专栏
WordPress大学
WordPress大学
Recorded Future
Recorded Future
The Register - Security
The Register - Security
Microsoft Azure Blog
Microsoft Azure Blog
Stack Overflow Blog
Stack Overflow Blog
爱范儿
爱范儿
大猫的无限游戏
大猫的无限游戏
Blog — PlanetScale
Blog — PlanetScale
H
Help Net Security
Webroot Blog
Webroot Blog
Help Net Security
Help Net Security
Forbes - Security
Forbes - Security
H
Hacker News: Front Page
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
云风的 BLOG
云风的 BLOG
Hacker News: Ask HN
Hacker News: Ask HN
Security Archives - TechRepublic
Security Archives - TechRepublic
Google Online Security Blog
Google Online Security Blog
Attack and Defense Labs
Attack and Defense Labs
T
Tailwind CSS Blog
J
Java Code Geeks
C
CXSECURITY Database RSS Feed - CXSecurity.com
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Cyberwarzone
Cyberwarzone
小众软件
小众软件
G
Google Developers Blog
SecWiki News
SecWiki News
V
V2EX
C
Cybersecurity and Infrastructure Security Agency CISA
T
The Blog of Author Tim Ferriss
S
SegmentFault 最新的问题
MyScale Blog
MyScale Blog
S
Security Affairs
AI
AI
S
Securelist
D
Docker
人人都是产品经理
人人都是产品经理
T
Troy Hunt's Blog
罗磊的独立博客
The Hacker News
The Hacker News
阮一峰的网络日志
阮一峰的网络日志
Google DeepMind News
Google DeepMind News
宝玉的分享
宝玉的分享
P
Proofpoint News Feed
P
Proofpoint News Feed
Vercel News
Vercel News
Jina AI
Jina AI

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
Claude Opus 4.5 全面上线,凭什么夺回 Agentic Coding 第一!
深思 SenseAI · 2025-11-29 · via 人人都是产品经理

Claude Opus 4.5 在大模型密集发布期上线,凭借单提示词生成高完成度交互应用、可调 effort 参数、高级工具调用等核心升级,实现编码效率与性价比提升,定位专业开发者及知识工作者,仍是 AI 编码领域王者,而 Gemini 在推理与多语言领域保持优势。

我们现在正处于新一轮大模型密集发布期。上周是 Grok、Gemini 3.0、Nano Banana Pro,本周 Anthropic 的 Claude Opus 4.5 上线。

直观感受:Minecraft & 乐高测试

在只给出一条提示词的前提下,模型生成了一个 Minecraft 克隆版。在这个单提示词测试中,这是目前见过效果最好的一次。角色移动流畅、帧率稳定,可以正常破坏和放置方块,在下方快捷栏切换不同方块类型,也可以在地图中自由飞行。就完成度和可玩性而言,这个 Demo 已经接近一款真正可玩的沙盒游戏。

与之对比,在同样的“单提示词 Minecraft 测试”中,Gemini 3 Pro 给出的结果就明显逊色一截。世界同样是程序化生成的,但无法破坏或放置方块,角色移动也略显混乱,只能算是基础可看的 Demo。

在这个测试里,Opus 4.5 可以说是碾压式领先。用另一条提示词让它生成一个乐高搭建网站,支持用户自由拼搭积木。返回的结果是一个完整可用的乐高模型。可以在场景中拖动视角,把积木逐块堆叠、修改颜色、切可以删除,甚至选择不同形状的乐高积木。这已经到了一条提示词,就能生成高完成度交互应用的程度。而且提示词本身也并不复杂。

AI Agent 的 Effort(努力程度)参数

在 n8n、Make 等自动化平台里集成自研 AI 模型时,现有的编码模型往往会自行决定推理深度和 token 使用量,调用方几乎无法约束。很多本可以用轻度思考解决的步骤,被模型当成深度推理来算,白白多花了大量 token 成本。

Opus 4.5 在 Agent 能力上引入了可调的effort参数,把模型的“投入程度”分成三档:低(low)、中(medium)和高(high)。从官方对比图可以看到,在同等任务下,Opus 4.5 的 token 消耗相较 Sonnet 4.5 呈指数级下降,而 Sonnet 4.5完全不支持这种选项。

在社区热议的编码测试中,Opus 4.5 的亮点在于,在达到相近甚至更好的效果时,用的 token 明显更少。配合 effort 参数,用户可以在“尽量省时间省钱”和“尽可能压榨模型上限”之间自定义平衡点。

测试结果显示:在 medium effort 档位,Opus 4.5 就能追平 Sonnet 4.5 在 SWB 基准上的最佳验证分数,但输出 token 减少了约 76%。即便调到最高 effort 档,它仍然优于 Sonnet 4.5,同时输出 token 也少了约 48%。

再叠加这次价格下调,每 100 万输入 token 5 美元、每 100 万输出 token 25 美元,大约是原来的三分之一,整体性价比的提升非常明显。

高级工具调用能力

这一次对效率的提升也非常夸张。过去在编码场景中,只要 Agent 需要调用工具,它往往会先把工具列表“扫一遍”,再决定要用哪一个或哪几个,过程既慢又极度浪费 token。而现在的 Opus 4.5可以只拉取正确的工具。

在Anthropic的官方演示中,设定是你继承了一座古怪锁匠祖先留下的神秘保险库,里面是一串相互保护、层层嵌套的数学密码锁。在这个 Demo 里,Opus 4.5不只是在用工具,而是真的在按步骤推进整套解谜过程。Anthropic 强调的是在全新的高级工具调用机制加持下,Opus 4.5 在效率和推理能力上相比上一代有多大跃升。

它不再采用“把能访问的工具全部调用一遍”的粗暴策略,而是先在工具集合中进行检索与过滤,只调用真正与当前子任务相关的那一小部分。从结果看,在同一套谜题、同一关卡设计下,Opus 4.5 能一路解完所有房间,最终成功打开主保险库,全程大约消耗 70 万个 token。而 Sonnet 4.5 则消耗了约 800万个 token,到最后仍然没有完成解谜。

按官方定价粗略折算,同样一局任务下来,Sonnet 4.5 的成本大约在 4 美元左右,而 Opus 4.5 仅约 1 美元。从评测视角看,第一个非常明显的升级点,就是这套“高级工具调用”(smarter tool usage)带来的成本与效率优势。

Agent 电脑操作的再度升级

2023 年 10 月,Anthropic 首次展示了一种更先进形态的 AI 智能体。Claude 的扩展能力 Computer Use。顾名思义,这项功能允许用户像指挥一名远程助理那样,让 Claude 直接操作电脑。移动光标、点击按钮、输入文本,不再只是在对话框里给建议,而是能真正“上手”替你完成屏幕上的具体任务。

Anthropic 是最早提出这个概念的团队之一。这个概念当时引发了大量讨论,但早期落地效果并不理想。电脑操作型 Agent 面临的一个关键瓶颈在于,它必须像人类用鼠标那样,在屏幕的具体坐标上点击。而人类可以根据内容自如地缩放、拖动、调整界面视角,这些对 Agent 来说在过去几乎是不可达的操作能力,也严重限制了它在真实桌面环境中的实用性。

以前如果用户要点击屏幕上一个非常小的按钮,往往需要先把那一块区域放大。而早期的电脑操作 Agent 根本做不到这种“先缩放、再操作”的流程。在这次 Claude Opus 4.5 的更新里,增强版的 Computer Use 能力终于支持了界面缩放,围绕这一能力可以让重新设计整套电脑操作 Agent 的工作流,实现更高的效率。

现在,Agent 可以先放大界面,再进行后续操作。对于需要检查细小 UI 元素和复杂控件的场景,这一点价值巨大。比如,一个面向前端工程师的设计检查 Agent,真的可以逐像素检查自己生成的页面。它能读小字号文本和密集说明文案,分析信息高度堆叠、结构复杂的界面,并在执行点击、跳转之前,先确认视觉细节是否正确。

无限对话(Infinite Chat)功能,破除长上下文限制

所谓「无限对话」(Infinite Chat),本质上是在解决长期存在的大模型上下文“断片”问题。在 Claude 3时代,很多重度用户在进行 vibe coding或长流程协作时,经常会遇到上下文不够用的情况。

到了 Claude Sonnet 4.5,Anthropic 做了一次明显的迭代。系统会在对话过程中,将历史交互自动压缩和总结,再把这份总结交给下一个接力的 Agent。不过,从评测视角来看,这种模式本质上仍然是“新 Agent 读一份摘要后从头接手”,而不是在同一条对话线上稳定演进。

Opus 4.5 的“无限对话”机制则进一步往前走了一步。Anthropic 在更新说明中提到,对于 Claude App 用户,长对话不会再硬撞上下文上限。当有需要时,Claude 会自动对较早的内容进行摘要与重写,以此腾出上下文空间,让同一条会话线程可以持续向前推进,而无需频繁新开对话或手动搬运历史记录。

从评测角度来看,这看似只是更新日志里的一小段描述,实际却有潜力成为改变产品形态的关键能力:对用户而言,长线项目(例如从零共建一个 App、持续打磨同一份文档、长期跟踪同一主题)的协作成本显著下降。对产品设计者和开发者而言,这为“把大模型真正当成持续在线的长期助手”提供了更扎实的基础。

在后续的实测与案例中,如果围绕一个真实的中长周期项目(例如从零设计与实现一款应用)进行连续对话,有望更直观地验证“无限对话“在记忆稳定性、语境连贯性和用户操作负担上的实际改善空间。

走向多模型共存时代:拼的是组合,而不是冠军

和 Opus 4.1 相比,Opus 4.5 基本上是一次巨大的飞跃。从公开的基准测试套件来看,它在绝大多数项目上都实现了明显提升,仅在研究生级推理、视觉推理和多语言问答这几个维度略有劣势。

Claude 从来不是在所有维度上都是第一。它的传统优势一直在编码与工程类任务上,这也是 Anthropic 推出 Opus 4.5 的核心目标。把“AI 编码第一”的位置重新坐稳。相对而言,在复杂推理这条线上,Gemini 仍然保留了自己的高地。在研究生级推理基准上,Gemini 3 Pro 的得分约为 92%,在多语言问答任务中也依然是碾压级表现。于是当前的格局大致可以概括为一句话:Claude 仍是 AI 编码领域的王者,而 Gemini 则占据推理与多语言的高位。

从官方表述看,Claude.ai 的产品负责人 Scott White 将 Claude Opus 4.5 的理想用户画像指向专业软件开发者和知识工作者,例如金融分析师、顾问、会计师等。他同时强调,那些“渴望激发创造力、构建新事物、拓展自身专业边界”的用户,同样会从这一代模型中受益。Anthropic 也在博客中明确表示,新模型在处理电子表格、演示文稿等日常办公任务,以及执行深度研究方面都“有显著提升”。

在最近一轮面向开发者的大模型迭代中,厂商开始有意识地把写代码这件事,扩展为和你一起做项目。无论是 Anthropic 还是 OpenAI,新一代编程向模型都在强化三件事:能拆解复杂需求、能协调多个子 Agent 协同工作、能在较长的开发链路中保持上下文与进度不丢失。

Claude Opus 4.5 更像是一个新的标杆。模型不再只是在 IDE 里的补全代码工具,而是可以参与需求梳理、方案设计、实现与改动跟进的“共同开发者”。如果这种能力持续增强、推理成本继续下探,传统的软件生产流程(从任务分工到工具栈组合)很有可能会被重新设计一遍。

本文由人人都是产品经理作者【深思SenseAI】,微信公众号:【深思SenseAI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。