惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

阮一峰的网络日志
阮一峰的网络日志
Last Week in AI
Last Week in AI
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
U
Unit 42
J
Java Code Geeks
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
罗磊的独立博客
月光博客
月光博客
腾讯CDC
Stack Overflow Blog
Stack Overflow Blog
小众软件
小众软件
B
Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
美团技术团队
Y
Y Combinator Blog
T
Tailwind CSS Blog
宝玉的分享
宝玉的分享
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园_首页
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
爱范儿
爱范儿
B
Blog RSS Feed
V
Visual Studio Blog
MyScale Blog
MyScale Blog

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
DeepSWE开源Agent框架发布:基于Qwen3-32B与强化学习,SWE-Be...
站外新闻 · 2026-06-26 · via Prompt 语宙

💡 站外导读:软件工程领域正面临AI Agent的深刻变革,开发者亟需高效、可靠的自动化工具来应对日益复杂的代码任务。DeepSWE应运而生,作为Together.ai与Agentica联合推出的开源AI Agent框架,它基于强大的Qwen3-32B模型并采用纯强化学习训练,无需依赖专有模型蒸馏。在权威的SWE-Bench-Verified测试中,其准确率高达59%,一举登顶开源Agent榜首,为解决代码理解、编辑、测试与多步骤推理等核心痛点提供了全新范式。

DeepSWE是Together.ai联合Agentica开源的AI Agent框架,基于Qwen3-32B模型,用强化学习训练而成。DeepSWE在SWE-Bench-Verified基准测试中表现出色,测试时扩展(TTS)后,准确率高达59.0%,不使用TTS时Pass@1准确率达42.2%,位列开源Agent框架榜首。模型训练数据、代码、训练和评估日志等全部开源,助力开发者学习和改进Agent,推动强化学习在软件工程领域的应用与发展。

  • DeepSWE是什么
  • DeepSWE的主要功能
  • DeepSWE的技术原理
  • DeepSWE的项目地址
  • DeepSWE的应用场景
      • 📝 站长洞察 (Editor’s Insight)

DeepSWE-Preview

DeepSWE的主要功能

  • 代码理解和编辑:理解和修改现有代码,解决特定的软件问题或实现新的功能。
  • 问题解决:基于与环境的交互,解决复杂的软件工程问题,如修复GitHub上的问题、实现新代码功能和调试等。
  • 自动化测试和验证:运行shell命令进行代码构建和测试,验证解决方案的有效性,确保修改后的代码不会破坏现有功能。
  • 多步骤推理:在解决任务时,进行多步骤的推理和决策,逐步优化解决方案,直至最终完成任务。

DeepSWE的技术原理

  • 强化学习训练:完全用强化学习(RL)从零开始训练,不依赖于更强的专有教师模型的蒸馏或监督微调(SFT)。基于与环境的交互,学习如何在复杂的软件工程任务中做出最优决策。
  • rLLM框架:基于rLLM框架进行训练,一个用在语言智能体后期训练的系统,提供高效的数据管理和训练流程,支持大规模的强化学习训练。
  • 稀疏结果奖励模型:基于稀疏结果奖励机制,只有当模型生成的代码补丁通过所有测试时才给予正奖励,否则奖励为零,促使模型学习生成高质量的解决方案。
  • 测试时扩展(TTS):在测试阶段,生成多个轨迹并选择其中正确解决问题的轨迹,显著提高模型的准确率。结合基于执行的验证器和无执行的验证器的优势,实现性能的大幅提升。
  • Kubernetes支持:为应对训练过程中的扩展挑战,将Kubernetes支持集成到训练环境中,实现容器的弹性调度和自动缩放,确保训练过程的高效性和稳定性。

DeepSWE的项目地址

  • HuggingFace模型库https://huggingface.co/agentica-org/DeepSWE-Preview

DeepSWE的应用场景

  • 代码理解和编辑:DeepSWE能自动理解和修改代码,快速定位修复漏洞、优化性能瓶颈及重构代码结构,显著提升代码的整体质量。
  • 软件问题解决:高效处理GitHub上的问题、实现新功能及将复杂任务分解为可管理的子任务,进而快速解决软件工程领域中的各种难题。
  • 自动化测试和验证:DeepSWE能自动生成测试用例,执行代码构建和自动化测试,进行回归测试,确保软件的稳定性和可靠性,减少人工测试的工作量。
  • 多步骤推理和解决方案优化:基于多步骤推理解决复杂问题,不断迭代优化解决方案,在解决不同问题的过程中积累知识和经验,更好地应对未来的挑战。
  • 开发辅助和协作:DeepSWE为开发人员提供实时代码建议和补全提示,辅助项目管理和任务分配,促进团队成员之间的协作和交流,提高整个开发团队的效率。

📝 站长洞察 (Editor’s Insight)

DeepSWE的发布标志着AI Agent在软件工程领域的实用化迈出了关键一步。其核心价值在于“纯强化学习”训练范式——摒弃了传统对强模型的依赖,通过与环境交互直接优化决策,这更接近人类解决复杂问题的逻辑。高达59%的准确率不仅是数字突破,更预示着Agent正从“辅助工具”向“自主协作者”演进。结合测试时扩展(TTS)等前沿技术,DeepSWE展现了“推理时计算”的巨大潜力。其全开源策略将极大加速社区创新,推动Agent技术从实验室走向真实开发场景。未来,这类框架或将重塑软件开发流程,催生“AI原生”的工程团队新形态。