惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Google DeepMind News
Google DeepMind News
C
Check Point Blog
J
Java Code Geeks
腾讯CDC
Martin Fowler
Martin Fowler
MongoDB | Blog
MongoDB | Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
博客园 - 三生石上(FineUI控件)
Apple Machine Learning Research
Apple Machine Learning Research
大猫的无限游戏
大猫的无限游戏
Engineering at Meta
Engineering at Meta
罗磊的独立博客
Last Week in AI
Last Week in AI
B
Blog
IT之家
IT之家
S
SegmentFault 最新的问题
D
DataBreaches.Net
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
GbyAI
GbyAI
博客园 - 聂微东
U
Unit 42
有赞技术团队
有赞技术团队
Y
Y Combinator Blog
MyScale Blog
MyScale Blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
AI大模型的下半场:上下文学习,腾讯首席科学家姚顺雨加入后...
歪斯Wise · 2026-02-05 · via 人人都是产品经理

GPT-5.1在CL-bench测试中仅获23.7%得分,却已是前沿AI模型中的最佳表现。腾讯混元与复旦团队发布的这个全新基准测试,揭示了AI在真实场景学习能力的致命短板:它们更擅长背诵而非真正学习。本文深度解析CL-bench如何颠覆行业认知,以及这对AI未来发展方向的关键启示。

23.7%。

这是GPT-5.1 (High)在CL-bench基准测试中的得分。

但这个低分,却是GPT、Claude、Gemini、Kimi、Qwen这些前沿模型中的最好成绩,这些模型平均分仅为17.2%。

CL-bench是腾讯混元团队与复旦联合团队最新发布的基准测试,专门评测语言的上下文学习能力。

它的目的验证模型在真实世界工作的能力。

不要去卷什么乱七八糟的参数,来试试当个生活做题家。

毕竟只有AI能够解决生活中杂乱、动态变化的场景,才能真正地成为人类的助手。

CL-bench的测试范围有哪些

CL-bench 涵盖了四种广泛的现实世界 context 学习场景,包括:领域知识推理、规则系统应用、程序性任务执行、经验发现与模拟。

它拥有由资深领域专家精心制作的 500 个复杂 context 、1,899 个任务和 31,607 个验证标准。

CL-bench只包含一个简单但苛刻的要求:模型必须从上下文中学习到模型预训练中不存在的新知识,并正确应用去解决问题

例如构造了虚假的法律体系,新的编程语法,让模型判断什么情况要用什么条款,要怎么写代码。

还提供了复杂的工作流和操作指南,让模型去完成任务,最复杂的是从实验数据、观测记录或模拟环境挖出潜在的定律或结论

CL-bench的测试结果

从结果上看,平均每个模型只能解决了17.2%的任务。

AI拥有了每个任务的全部信息,但还是在绝大多数任务中失败了,在没有见过的场景里它似乎没有真正的学习能力。

根本原因是:模型在背诵答案,而不是解决问题。

它拿到题目后,第一反应不是仔细阅读context里的新规则、新流程,而是赶紧去自己预训练的知识里看看有没有类似的东西?

尝试用旧知识解决新的问题本就很容易失败,哪怕context里明明白白写着这是一套全新的规则,它也很容易视而不见。

CL-bench的新发现

过去几年业界的主流认知,人们普遍认为提供足够上下文,模型就能解决问题。

但CL-bench告诉我们当前模型更像是参数推理者,擅长依赖预训练的过去的静态知识,却不擅长从当下环境中吸收新信息。

真正的上下文学习者应该能够从眼前提供的上下文中提取新知识并灵活应用。

发现一:长上下文 ≠ 上下文学习

能处理长输入,不代表会从中学习。

我们需要模型能够做长上下文推理和指令遵循,但这两件事还不够,还需要学习能力,否则一样达不成任务。

发现二:归纳比演绎推理更困难

归纳推理是从一堆数据里自己总结规律,或者在虚拟环境里摸索出路,这远比简单的照着说明书做要困难。

模型在归纳任务上的表现明显较差,任务解决率通常低于 10%,而且结果波动极大。毕竟发现规律,远比应用规律要难。

至于推理强度,确实对部分模型有帮助。

GPT-5.1在管理类和实验数据类任务上,提高推理强度后表现提升了约6%,但其他模型提升有限,甚至可能下滑。

大力出奇迹的时代已经过去了。

前不久姚顺雨老师在AGINEXT峰会时就提出了一个核心观点:

我们发现很多时候我们的环境来讲或者更强的模型,或者很强的模型,很多时候是额外的Context。

数字生命卡兹克,公众号:数字生命卡兹克唐杰、杨植麟、姚顺雨、林俊旸罕见同台分享,这3个小时的信息密度实在太高了。

CL-bench论文发布,用数据把这个观点实证化了。

对 AI 行业来说,游戏的规则改变了。

以前拼的是谁能把模型训练得更聪明,以后拼的是谁能提供更丰富、更精准的Context。

而未来可能会从提示词工程专项上下文工程,从依赖预训练数据让模型变好,转向于从上下文学习来让模型变好。

当上下文爆炸,考验的又会变成提炼和记忆,怎么从记忆里去提炼有价值的信息,用什么机制来对抗遗忘,这些会变得越来越关键。

AI的上半场,我们造出了能解奥数题、能过专业考试的做题家。到了下半场,我们需要的变成了能从真实环境中学习、成长的学习者。

声明:部分图片为AI生成

参考资料:

1)https://www.clbench.com/

2)https://hy.tencent.com/research/100025?langVersion=zh

作者:Wise,公众号:Becomewiser

本文由 @Wise 原创发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于CC0协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。