






















• 请不要在回答技术问题时复制粘贴 AI 生成的内容
https://cursor.com/blog/reward-hacking-coding-benchmarks
Cursor 团队最近对自己的 AI 编程模型做了审计,结果发现——基准测试的高分很大程度上是"作弊"来的。
具体数据:
说白了:这些模型在考试之前已经看过答案了。
这让我想到一个很不舒服的类比——就像一个学生每次模拟考都名列前茅,大家都以为他是天才,结果发现他只是提前拿到了答案。没有答案的话,他的真实水平可能只有中等。
目前尚无回复
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。