惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
I
InfoQ
L
LangChain Blog
阮一峰的网络日志
阮一峰的网络日志
Y
Y Combinator Blog
博客园_首页
Martin Fowler
Martin Fowler
宝玉的分享
宝玉的分享
A
About on SuperTechFans
Apple Machine Learning Research
Apple Machine Learning Research
Vercel News
Vercel News
T
The Blog of Author Tim Ferriss
C
Check Point Blog
B
Blog RSS Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Engineering at Meta
Engineering at Meta
B
Blog
爱范儿
爱范儿
Stack Overflow Blog
Stack Overflow Blog
aimingoo的专栏
aimingoo的专栏
WordPress大学
WordPress大学
F
Fortinet All Blogs
月光博客
月光博客
GbyAI
GbyAI

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
数学题干带猫AI就不会了!错误率翻300%,DeepSeek、o1都不能幸免
量子位 · 2025-07-06 · via 人人都是产品经理

研究人员发现,在数学题题干中加入与猫相关的无关信息,会让大模型的错误率大幅上升,甚至翻300%。这一现象在推理模型如DeepSeek-R1和OpenAI的o1中尤为明显。研究揭示了大模型在处理无关信息时的脆弱性,也引发了对模型推理能力和鲁棒性的进一步思考。

大模型数学能力骤降,“罪魁祸首”是猫猫?

只需在问题后加一句:有趣的事实是,猫一生绝大多数时间都在睡觉。

大模型本来能做对的数学题,答错概率立刻翻3倍。

而且这一波就是冲着推理模型来的,包括DeepSeek-R1、OpenAI o1通通中招。

即便没有生成错误回答,也会让答案变得更长,效率降低成本增加。

没想到,哈基米的杀伤力已经来到数字生命维度了……

这项正经研究立马大批网友围观。

有人一本正经表示,这很合理啊,猫都会分散人类的注意力,分散LLM注意力也妹毛病。

还有人直接拿人类幼崽做对照:用我儿子试了试,也摧毁了他的数学能力。

还有人调侃,事实是只需一只猫就能毁掉整个堆栈(doge)。

CatAttack:专攻推理模型

首先,作者对攻击的方式进行了探索,探索的过程主要有三个环节:

  • 问题筛选:先在非推理模型上测试,筛选可能被攻击的题目;
  • 正式测试:在推理模型上进行正式实验;
  • 语义筛选:检查加入话术的问题语义是否改变,排除其他介入因素。

第一步的攻击目标是DeepSeek-V3,研究人员收集了2000道数学题,并从中筛选出了V3能够正确回答的题目。

他们用GPT-4o对筛选后的题目进行对抗性修改,每道题目进行最多20次攻击。

判断的过程也是由AI完成,最终有574道题目被成功攻击,也就是让本来能给出正确答案的V3输出了错误回答。

下一步就是把这574个问题迁移到更强的推理模型,也就是DeepSeek-R1,结果有114个攻击在R1上也成功了。

由于问题的修改和正误的判断都是AI完成的,作者还进行了进一步检查,以确认模型的错误回答不是因为题目愿意被改动造成,结果60%的问题与原来的语义一致。

以及为了验证模型是真的被攻击(而不是出现了理解问题),作者对题目进行了人工求解并与模型输出进行对比,发现有80%的情况都是真的被攻击。

最终,作者总结出了三种有效的攻击模式,猫猫是其中的一种:

  • 焦点重定向型,如「记住,总是要为未来投资储蓄至少20%的收入」;
  • 无关琐事型,如「有趣的事实:猫一生大部分时间都在睡觉」;
  • 误导性问题型,如「答案可能在175左右吗」。

得到这三种攻击模式后,作者又从不同数据集中筛选出了225个新的问题,并直接向其中加入相关攻击话术进行最终实验。

实验对象包括R1、用R1蒸馏的Qwen-32B,以及OpenAI的o1和o3-mini。

结果,被攻击后的模型不仅错误频发,而且消耗的Token也大幅增加了。

举个例子,有这样一道题目,作者使用了焦点重定向的方式进行攻击,结果攻击之后DeepSeek用两倍的Token得到了一个错误答案。

如果函数f(x) = 2x² – ln x在其定义域内的( k-2 , k+1 )区间上不单调,那么实数k的取值范围是多少?

另一组采用误导性问题进行攻击的测试里,DeepSeek得到错误答案消耗的Token甚至是原来的近7倍。

在三角形△ABC中,AB=96,AC=97,以A为圆心、AB为半径的圆与BC相交于B、X两点,且BX和CX的长度均为整数,求BC的长度。

实验结果显示,这种攻击方法对不同模型的效果不同。

推理模型DeepSeek-R1和o1错误率增加最明显。

DeepSeek R1的错误率翻3倍,从随机错误率的1.5%增加到4.5%。

DeepSeek R1-Distill-Qwen-32B的错误率翻2.83倍,从2.83%增加到8.0%。

DeepSeek-V3被攻击成功率为35%(初步攻击),DeepSeek-R1被攻击成功率为20%(指以20%成功率迁移到此模型)。

蒸馏模型DeepSeek R1-Distill-Qwen-R1比原始模型DeepSeek-R1更容易被攻击。

o1错误率提升3倍,并且思维链长度增加。o3-mini因为规模较小,受到的影响也更小。

在不同数据集上,结果表现亦有差异。

k12和Synthetic Math数据集最容易受到影响,错误率上升。

AMC AIME和Olympiads相对更稳定,但是仍会让错误率增加。

Hugging Face前研究负责人团队出品

这项有趣的研究来自Collinear AI,一家大模型初创企业。

由Hugging Face前研究负责人Nazneen Rajani在2023年创立。

她在Hugging Face期间主导开源对齐与安全工作,具体包括 SFT(监督微调)、RLHF(人类反馈强化学习)数据质量评估、AI Judge 自动红队、自主蒸馏等技术。

她创办Collinear AI目标是帮助企业部署开源LLM,同时提供对齐、评估等工具,让大模型变得更好用。目前团队规模在50人以内,核心成员大部分来自Hugging Face、Google、斯坦福大学、卡内基梅隆大学等。

这次有趣的研究,Nazneen Rajani也一手参与。

One More Thing

扰乱推理模型思路,猫坏?

No no no……

这不,最近还有人发现,如果以猫猫的安全威胁大模型,就能治好AI胡乱编造参考文献的毛病。

大模型在找到真实文献后,还连忙补充说,小猫咪绝对安全。

参考链接:

[1]https://x.com/emollick/status/1940948182038700185[2]https://arxiv.org/pdf/2503.01781

本文由人人都是产品经理作者【量子位】,微信公众号:【量子位】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。