惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
阮一峰的网络日志
阮一峰的网络日志
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
WordPress大学
WordPress大学
博客园 - 叶小钗
Hugging Face - Blog
Hugging Face - Blog
博客园 - 司徒正美
Last Week in AI
Last Week in AI
罗磊的独立博客
量子位
Jina AI
Jina AI
T
Tailwind CSS Blog
Apple Machine Learning Research
Apple Machine Learning Research
IT之家
IT之家
美团技术团队
雷峰网
雷峰网
爱范儿
爱范儿
S
SegmentFault 最新的问题
小众软件
小众软件
月光博客
月光博客
酷 壳 – CoolShell
酷 壳 – CoolShell
人人都是产品经理
人人都是产品经理
The Cloudflare Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了!
DeepSeek陈德里开发自动研究Skill,写一篇论文人类只动脑2小时
梦晨 · 2026-05-27 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-05-27 09:14:35 来源:量子位

“1%是我写的,99%是Agent写的。”

梦晨 发自 凹非寺
量子位 | 公众号 QbitAI

DeepSeek研究员陈德里,在个人博客更新一篇研究综述论文。

1%是我写的,99%是Agent写的。

用的是他自己的技能DeliAutoResearch,DeepSeek-V4-Pro研究和写作,GPT-Image2画图。

论文共迭代6次(V1:4 次,V2:1 次,V3:1 次),总耗时6天,进行了约108轮Agent调用,消耗64.8万token,写了2234行LaTeX代码。

103个参考文献,全部已验证。论文现为46页,538KB,含7个图表+4个表格。

论文讲的是自动研究智能体L1–L5自主度分类体系的事:

通过分析四大架构模式,给出了可扩展性、成本、可靠性等维度对比。

并基于六维特征矩阵分析了17个主流系统。

还提出了六大开放问题与对应研究方向。

陈德里认为,Code Agent导致计算机科学论文数量疯狂膨胀,同样的工作以前至少需要一个月才能完成。

但现在,他的碳基大脑处理这个问题的“总CPU时间”不到2小时。

他也写了一句免责声明:观点仅为个人所有,不代表任何组织。

DeepSeek研究员与V4 Pro合写的论文

基础模型推动AI工具从研究辅助转向自主研究,但领域缺乏统一框架、术语混乱、评估标准不一。

陈德里和它的AI合著者们提出了一个L1-L5的自主分级体系。

类比自动驾驶的SAE级别,把混乱的AI Agent领域理出了清晰的谱系。

  • L1是最基础的自动补全,也就是最早的GitHub Copilot,预测你下一行代码。
  • L2是任务执行,代表是ChatGPT/Claude聊天机器人加上各种工具,能分解任务,但每一步都得人类批准。
  • L3是多步骤执行,目前最主流的Claude Code、Cursor Agent这种,能自主执行10到100步,只在关键点请求人类审核
  • L4是受限领域内全自主执行,人类仅提供研究目标、评估最终成果,智能体可完成多步实验、代码、论文撰写,但无法自主选择研究问题。
  • L5级是完全自定研究议程,智能体可自主选题、分配资源、长期积累知识、跨领域持续研究,是当前未实现的理想状态,核心瓶颈为持续知识积累、可靠自我评估、架构规模化。

目前行业前沿初步达到L4,L5还只是个设想。

论文认为真正的瓶颈不是模型能力,而是「持续知识积累」和「可靠自我评估」。

除了按自主性级别,论文中又按智能体架构总结了4种主流模式。

  • 单智能体循环

早期研究ReAct、Reflexion、LATS、思维树等为代表。单模型迭代推理-行动-观察,简单高效,但复杂任务能力有限。

  • 多智能体协作

早期智能体框架CAMEL、AutoGen、MetaGPT等为代表,特点是分工协作、多视角纠错,成本较高,沟通易混乱。

  • 分层调度

Claude Code和Devin等为代表,分层规划、任务分解,适合长时程复杂研究。

  • 工具增强执行

SWE-Agent等为代表,核心工具有代码执行环境、网页浏览、API / 数据库、多模态工具,Agent-Computer Interface(ACI) 的设计直接影响性能。

论文四种模式不是谁优谁劣,而是针对特定的任务要选择合适的工具。

如简单短任务选单智能体循环(低成本、易实现);需要多视角纠错、复杂分工选多智能体协作;长时程、高复杂度研究选分层调度(强规划、易监管);需要对接外部工具、环境交互选工具增强执行(能力边界由工具决定)。

但实际应用中,其实多采用混合架构,结合多种模式优势。

有了研究框架,再横向对比当前常见的17个自主研究智能体,揭示领域已从早期通用脆弱原型,演进为L4级受限域专用系统。代码智能体成熟度最高,科学智能体开始产出可验证新发现。

而迈向L5完全自主的核心瓶颈在于持续知识积累、可靠自我评估、架构规模化。

最后,论文中还提出了,六大开放问题:

  • 认知循环陷阱:智能体陷入重复无效策略,无自我终止能力。
  • 上下文限制:固定窗口(4K-1M token)无法支撑长时程研究。
  • 创新性评估:无自动化方法衡量研究原创性与价值。
  • 可复现性:模型随机性、提示敏感性导致结果无法复现。
  • 安全伦理:双用途风险、自主提升风险、学术诚信风险。
  • 成本问题:单任务成本 50,高成本加剧科研不平等。

One More THing

陈德里自述,高强度工作导致的精力不足,让他搁置了很多事。

博客、写作,现在是Agent让他有机会把这些重新捡了起来。

除了这篇研究综述,还更新了个人主页。

有了Agent,这些任务完成起来效率超高。

人类的角色,从“执行者”变成了“发起者”。

参考链接:
[1]
https://x.com/victor207755822/status/2059269472297623843?s=20

版权所有,未经授权不得以任何形式转载及使用,违者必究。