惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

H
Hackread – Cybersecurity News, Data Breaches, AI and More
U
Unit 42
Vercel News
Vercel News
Martin Fowler
Martin Fowler
云风的 BLOG
云风的 BLOG
爱范儿
爱范儿
MongoDB | Blog
MongoDB | Blog
J
Java Code Geeks
F
Fortinet All Blogs
MyScale Blog
MyScale Blog
C
Check Point Blog
N
Netflix TechBlog - Medium
Microsoft Azure Blog
Microsoft Azure Blog
aimingoo的专栏
aimingoo的专栏
博客园_首页
WordPress大学
WordPress大学
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
IT之家
IT之家
Last Week in AI
Last Week in AI
罗磊的独立博客
大猫的无限游戏
大猫的无限游戏
Jina AI
Jina AI
V
Visual Studio Blog
小众软件
小众软件

Prompt 语宙

GPT‑5.4 – OpenAI推出面向专业工作的旗舰AI模型 kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型
英伟达Polar框架开源:零门槛强化学习,AI编码智能体进化提速...
站外新闻 · 2026-05-28 · via Prompt 语宙

5月28日,英伟达(NVIDIA)研究团队正式开源了名为 Polar 的强化学习训练框架。该框架的核心创新在于,它能够让 Codex、Claude Code、Qwen Code 等现有主流代码智能体(Agent)在不修改任何原生代码的情况下,无缝接入 GRPO(广义相对策略优化)强化学习训练。

image.png

一、行业痛点:智能体强化学习的“围墙”

代码智能体正从执行简单的单步命令,进化到处理仓库级代码修改、操作系统交互等复杂长流程任务。这使得开发者越来越依赖成熟的执行框架(Harness)来构建应用。然而,一个现实难题随之浮现:如何将这些复杂的框架与传统的强化学习基础设施无缝衔接?这中间存在不小的挑战。

  • 接入成本高: 传统方法要求将代码逻辑强行重写为 env.init()、env.step() 等标准环境接口,极其繁琐。

  • 首先是信息缺失问题。在重新构建环境的过程中,关键的工具调用细节、多轮对话的上下文信息,或是多个子智能体之间的协作逻辑,常常会丢失。这直接导致模型无法获取到高质量的训练信号。

image.png

二、核心解法:将“边界”作为训练入口

Polar 不要求重写执行框架,而是将“模型 API 边界”作为训练的切入点

  • 其次是黑盒处理难题。Polar 的解决方案是在代码执行框架与模型推理服务器之间,插入一个透明的代理网关(Gateway)。无论智能体调用的是 Anthropic、OpenAI 还是 Google 的 API 接口,这个网关都能无缝地拦截和转发所有请求。

  • 轨迹重构: 在转发过程中,Polar 实时记录提示词、采样 Token、对数概率等关键信息,并将其重建成强化学习训练器所需的“轨迹”数据。

  • 第三是系统效率优化。Polar 采用了高效的异步架构设计。其中,Rollout Server 负责任务调度与数据持久化,Gateway Node 则处理智能体的生命周期和资源回收。通过引入预热缓冲池(READY buffer)以及并行任务处理机制,系统有效避免了长尾任务对 GPU 训练资源的阻塞。

三、性能飞跃:让编码智能体脱胎换骨

实验数据显示,Polar 配合 GRPO 训练带来了显著的性能增益:

  • 在权威的 SWE-Bench Verified 基准测试中,基于同一个 Qwen3.5-4B 基础模型,Polar 在不同代码框架下取得了令人瞩目的成绩:

    • Codex 框架: pass@1分数从3.8% 飙升至26.4%(涨幅高达 594.74%)。

    • 例如,在 Claude Code 框架下,任务成功率从 29.8% 大幅提升至 34.6%。

    • Pi 框架: 从34.2% 提升至40.4%。

  • 极致效率: 引入 prefix_merging 策略后,相比传统的 per_request 模式,训练墙钟时间缩短约 5.39倍,GPU 利用率从20.4% 跃升至 87.7%

行业点评

英伟达开源 Polar,本质上是为“AI 智能体”领域铺就了一条通往高效强化学习训练的“高速公路”。它不仅让研究人员能够利用海量的开源代码框架进行快速训练,更通过底层的系统优化,显著降低了对 GPU 算力的硬性需求。

随着 Polar 的普及,开发者无需再为“如何让模型适配训练框架”而苦恼,未来 AI 编码智能体的进化路径将变得更加标准化与高效。这标志着 AI 智能体的训练正在从实验室的手动调优,向规模化、系统化的工程化生产迈进。

论文地址:https://arxiv.org/pdf/2605.24220

📝 站长洞察 (Editor’s Insight)

英伟达此次开源Polar,远不止发布一个工具,而是意图定义下一代AI智能体的训练范式。其核心智慧在于“解耦”与“标准化”:通过透明代理在API边界介入,将复杂的训练工程问题转化为标准化的数据轨迹记录问题。这巧妙地绕开了与现有生态的兼容性泥潭,直接提升了整个行业的训练基础设施水平。结合GRPO等高效算法,它将训练效率提升了一个数量级,预示着AI智能体开发正从“模型中心”转向“系统与工程中心”的竞争。未来,谁能更快、更低成本地将智能体与真实复杂环境互动数据转化为训练信号,谁就能在Agent进化竞赛中占据先机。Polar的普及,将加速这一进程,并可能催生出全新的、基于持续强化学习的智能体即服务(AaaS)模式。