惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The Last Watchdog
The Last Watchdog
K
Kaspersky official blog
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Spread Privacy
Spread Privacy
T
Threatpost
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
MongoDB | Blog
MongoDB | Blog
V
Vulnerabilities – Threatpost
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Help Net Security
Help Net Security
Microsoft Azure Blog
Microsoft Azure Blog
GbyAI
GbyAI
小众软件
小众软件
Cloudbric
Cloudbric
The Hacker News
The Hacker News
阮一峰的网络日志
阮一峰的网络日志
Vercel News
Vercel News
人人都是产品经理
人人都是产品经理
Forbes - Security
Forbes - Security
Martin Fowler
Martin Fowler
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
AWS News Blog
AWS News Blog
Stack Overflow Blog
Stack Overflow Blog
N
News | PayPal Newsroom
P
Privacy & Cybersecurity Law Blog
TaoSecurity Blog
TaoSecurity Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
博客园_首页
A
Arctic Wolf
www.infosecurity-magazine.com
www.infosecurity-magazine.com
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Scott Helme
Scott Helme
T
Tor Project blog
S
Secure Thoughts
Know Your Adversary
Know Your Adversary
P
Proofpoint News Feed
M
MIT News - Artificial intelligence
博客园 - 司徒正美
T
Threat Research - Cisco Blogs
C
Cyber Attacks, Cyber Crime and Cyber Security
Schneier on Security
Schneier on Security
B
Blog RSS Feed
AI
AI
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Attack and Defense Labs
Attack and Defense Labs
Webroot Blog
Webroot Blog
Google DeepMind News
Google DeepMind News
Project Zero
Project Zero
Hacker News: Ask HN
Hacker News: Ask HN

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
刚刚,Anthropic内部考题开源!年薪百万工程师,被AI秒了
新智元 · 2026-01-24 · via 人人都是产品经理

史上最强模型Claude Opus 4.5发布后,全面碾压了人类顶尖工程师,逼得Anthropic不得不被迫放弃招聘笔试!现在,内部考题已经全面开源了。

就在刚刚,人类程序员最后的堡垒崩塌了。

曾经,Anthropic为自己应聘者准备了一份出了名困难的考题,让他们在家完成。

这份考题一直效果不错,直到Claude Opus 4.5的出现。

有了这个史上最强模型的加持,人类应聘者轻松做出各种考题,因而这份考卷也就失效了。

今天,因为无法再通过传统技术笔试筛选人才,Anthropic被迫开源了旧版试题,并且向全世界求助:有没有办法,让我们真正测试出人类的编程能力?

作为告别,Anthropic选择将把最初版本的测试题发布,作为一个面向大众的公开挑战。

地址:https://github.com/anthropics/original_performance_takehome

在这个测试题中,候选人需要逐步进行多核并行优化、SIMD向量化、VLIW指令打包优化,并用Perfetto trace做分析。

他们依然相信:在无限时间下,最强人类依然能超越Claude的极限。

同时他们强调:如果哪个人类能击败Claude Opus 4.5,请务必联系Anthropic!

刚刚,Claude Opus 4.5把我们的笔试题秒了

在AI时代,究竟该如何进行软件工程师的面试?

Anthropic在这篇博客里,进行了细致的探索。

博客地址:https://www.anthropic.com/engineering/AI-resistant-technical-evaluations

要知道,曾经Anthropic有一套完美的筛选考题。

可随着AI能力的指数级提升,今天还能完美区分菜鸟和大神的试题,明天就可能被新模型秒杀,这套考题就瞬间失去意义了!

比如,自2024年初,他们的性能工程团队一直在用下面这套题:要求候选人为一个模拟加速器优化代码。

这套题在1000多名面试者中,筛出了几十个最顶尖的工程师。正是这些人,点亮了Anthropic的Trainium集群,发布了从Claude 3 Opus至今的每一个模型。

结果,每个新版本的Claude,都在让这套题失效!

同样的时间里,Claude Opus 4已经优于大多数人类申请者,Anthropic勉强还能筛出最强的人类。

结果Claude Opus 4.5的横空出世,直接追平了最强人类天花板!

如果给无限的时间,人类或许还能险胜,但在面试时间限制下,已经根本无法区分谁是顶尖候选人,谁是最强模型了。

为此,Anthropic已经把这套题迭代了三个版本,甚至越来越「剑走偏锋」。

这套测试的诞生

2023年11月,Anthropic正准备发布Claude Opus 3。

新的TPU和GPU集群就位,大Trainium集群即将上线,公司在算力上的投入是过去的数倍,但性能工程师却严重紧缺。

为此,Anthropic公司绩效优化团队负责人Tristan Hume在Twitter上发帖求贤,虽然收到了大量简历,但标准的面试流程太耗时了。

于是,他花了两个星期设计了一个Take-home测试,从而精准识别出真正硬核的候选人。

设计初衷

为了做出一个好玩的、能让候选人兴奋的东西,并且能以「高分辨率」扫描他们的技术实力,Tristan Hume做了精心设计。

相比现场面试,这种形式在评估性能工程技能上更有优势:

  • 时间更充裕:4小时(后改为2小时)的窗口比50分钟的面试更能反映真实工作状态。
  • 环境更真实:没有面试官盯着,候选人在自己的编辑器里干活,零干扰。
  • 深度考察:性能优化需要理解系统、造工具,这在短面试里很难体现。
  • 兼容AI辅助:明确允许使用AI。因为对于长线难题,AI很难直接给出完美解。

另外,Tristan还构建了一个Python模拟器,模拟了一个具有TPU特征的假加速器。

候选人需要优化在这台机器上运行的代码,并通过一个支持热重载的Perfetto trace来观察执行过程,该trace会展示每一条指令,效果类似公司在Trainium上使用的工具链。

这台模拟机器包含了一些让加速器优化变得很有挑战性的特性,包括:

  • 手动管理的scratchpad内存(不同于CPU,加速器通常需要显式进行内存管理)
  • VLIW架构(每个周期可以并行运行多个执行单元,需要高效地进行指令打包)
  • SIMD(一条指令同时对多个数据元素进行向量化运算)
  • 多核架构(需要将工作负载合理地分配到多个核心上)

这些硬核要素,都让底层优化变得更有趣。

这个任务是一个并行的树遍历问题,刻意设计成不带深度学习背景的形式,因为大多数性能工程师并没有做过深度学习工作,具体知识可以在入职后再学习。

该问题的灵感来自于无分支的SIMD决策树推理——这是一个经典的机器学习优化挑战。

候选人一开始拿到的是一个完全串行的实现,需要逐步挖掘并利用这台机器的并行能力。

早期战果:它曾完美工作

最初的效果非常好。

一位得分遥遥领先的候选人入职后,立即开始优化算子,并解决了一个阻碍发布的编译器Bug。

在之后的一年半里,这套题帮忙组建了核心团队,甚至发掘了几位本科刚毕业但实力超群的天才。

许多候选人甚至因为觉得太好玩,在超时后还在继续优化。最强的一份提交,甚至包含了一个完整的迷你优化编译器。

第一轮崩溃:Claude Opus 4进场

到了25年5月,Claude 3.7 Sonnet已经进化到让一半的候选人只要把题丢给它,就能拿高分。

随后,Tristan用Claude Opus 4的预发布版本试了一下。结果令人绝望:在4小时内,它的代码比几乎所有人类都要好。

这并非他第一次被Claude击败。早在2023年,Claude 3 Opus和3.5 Sonnet就先后攻破了他们精心准备的现场面试题。

对于这次崩溃,Tristan做了紧急修复:既然问题深度不够,那就加码。他重写了启动代码,增加了机器特性的复杂度,并把时间缩短到2小时。

第二版侧重考察巧妙的优化洞察力,而非单纯的代码量。这招奏效了——但是,也只撑了几个月而已。

第二轮崩溃:Claude Opus 4.5的降维打击

后来,当Tristan拿到Claude Opus 4.5的预发布版本时,他眼睁睁看着Claude Code跑了2小时。它像个老练的工程师,先解决了初始瓶颈,搞定了所有常规微优化。

然后它卡住了,遇到了一个看似不可逾越的内存带宽瓶颈——大多数人类也卡在这里。但当他提示「理论极限」时,它思考片刻,竟然找到了那个只有极少数人类能发现的巧妙技巧。

最终,它的得分与人类历史最高纪录持平(而那个人类考生还是在重度依赖 Claude 4 的情况下完成的)。

更可怕的是,Anthropic在内部的「测试时计算」框架中验证发现,它不仅能在2小时内击败人类,甚至随着思考时间的增加,分数还在不断上涨。

大麻烦来了:即将发布的模型,将彻底摧毁公司招聘这个模型开发者的测试题。所以,他们只能采用这个策略——把工作直接外包给Claude Code。

艰难的抉择

有人建议禁止AI,但当Tristan并未采纳。因为在真实工作中,人类就是需要和 AI协作。

也有人建议提高及格线,但这会导致候选人沦为AI的看客,甚至因跟不上AI的思路而不知所措。

性能工程师的真实工作其实更多是艰难的调试、系统设计、分析,以及让AI生成的代码更优雅。这些很难通过客观测试来考察。

到底该怎样设计一个「像真实工作」的面试题?这个任务从未如此艰难。

尝试1:换个题型?被秒杀

首先,Tristan试图设计一个更难的内核优化问题:2D TPU寄存器上的高效数据转置,且要避免Bank冲突。这是一个非常棘手的真实难题。

然而,Claude Opus 4.5发现了一个他都没想到的绝佳优化路径:它重写了整个计算过程,直接绕过了转置的难点。即便他修补了漏洞,Claude Code配合深度思考(Ultrathink)功能,依然能找出修复Bank冲突的技巧。

这让他意识到,这类问题在已有代码库中太常见,Claude已经拥有了海量的训练数据「经验」。

尝试2:变得更古怪

既然「真实」行不通,他只能追求「分布外(Out of distribution)」——即AI没见过的数据。

他想到了Zachtronics的编程解谜游戏。这类游戏使用极度受限的指令集,迫使你用非传统方式编程。

于是,他设计了一套全新的测试:使用微小且极度受限的指令集,目标是指令数最小化。没有可视化工具,没有调试器——候选人必须自己造工具(比如让AI生成调试器)。

他把这套题丢给Claude Opus 4.5,它终于失败了。

这套新题效果不错,分数与候选人的实际能力高度相关。但Tristan心中仍有遗憾:他们放弃了原版试题的「真实感」和「多样性深度」。

但这或许就是代价。

「真实感」已经成为了奢侈品。原版试题之所以有效,因为它像以前的工作;现在的试题之所以有效,因为它模拟了一个全新的、AI尚未涉足的领域。

公开向人类挑战:原版测试题开源!

最终,Anthropic宣布:将原版测试题开源。虽然Claude很强,但在无限时间下,人类专家的极限仍高于AI。

目前,Claude的战绩如下(周期数越低越好):

  • 2164:Claude Opus 4
  • 1790:Claude Opus 4.5(随手一跑)
  • 1487:Claude Opus 4.5(11.5小时超长思考后)
  • 1363:Claude Opus 4.5(改进框架后)

Tristan表示:如果你能优化到1487周期以下,击败Claude的最佳表现,请一定联系他们!

同时,他也欢迎大家通过常规流程申请,体验一下人类要靠多久才能被攻破的「防Claude」新考题。

参考资料:

https://www.anthropic.com/engineering/AI-resistant-technical-evaluations

新智元报道 编辑:Aeneas 好困

本文由人人都是产品经理作者【新智元】,微信公众号:【新智元】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。