惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Know Your Adversary
Know Your Adversary
C
CERT Recently Published Vulnerability Notes
V
Vulnerabilities – Threatpost
N
News | PayPal Newsroom
O
OpenAI News
A
About on SuperTechFans
月光博客
月光博客
Martin Fowler
Martin Fowler
L
LangChain Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
aimingoo的专栏
aimingoo的专栏
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
V2EX - 技术
V2EX - 技术
博客园 - 司徒正美
大猫的无限游戏
大猫的无限游戏
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
人人都是产品经理
人人都是产品经理
T
Tor Project blog
D
DataBreaches.Net
Cloudbric
Cloudbric
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
云风的 BLOG
云风的 BLOG
F
Full Disclosure
S
SegmentFault 最新的问题
Vercel News
Vercel News
T
Tailwind CSS Blog
Schneier on Security
Schneier on Security
宝玉的分享
宝玉的分享
M
MIT News - Artificial intelligence
博客园 - 【当耐特】
P
Privacy International News Feed
美团技术团队
S
Secure Thoughts
P
Privacy & Cybersecurity Law Blog
Google DeepMind News
Google DeepMind News
F
Fortinet All Blogs
Scott Helme
Scott Helme
Forbes - Security
Forbes - Security
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Recent Announcements
Recent Announcements
AWS News Blog
AWS News Blog
Stack Overflow Blog
Stack Overflow Blog
S
Security Affairs
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
The GitHub Blog
The GitHub Blog
T
Tenable Blog
Cyberwarzone
Cyberwarzone
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
J
Java Code Geeks
T
Threatpost

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解 【002】HTTPS 粗解:证书、TLS 握手与对后端配置的影响 Hermes Agent 一周暴涨五万 Star,但我劝你别急着追 明明连接的是Redis的DB0,为什么能查到DB3的数据? 【从0到1构建一个ClaudeAgent】协作-Agent团队 熟悉电子元器件之后,电子小白下一步该怎么走? MAF快速入门(23)通过C#类定义Skills .NET 高级开发 | 手写一个对象映射框架 FastAPI数据库ORM怎么选?我肝了三个Demo后,终于不再纠结了 mysqldump 参数拾遗:在遗忘与铭记之间 C# .NET 周刊|2026年3月5期 Claude code入门 - 陈彦斌 一文学习入门 ThingsBoard 开源物联网平台 GitHub 热门项目 | 2026年04月16日 如何为GIT设置全局勾子,为每次提交追加信息 Number.isFinite和isFinite与isNaN()和Number.isNaN的区别 PortSwigger SQL注入LAB2 推荐一个测试人必备的Skills,从功能到性能全搞定(附详细实操和安装下载方式) 筑基期:掌握Odoo基础核心知识点02(Odoo XML 开发方式详解) GLM模型这么火,咱们用vllm也咧一个呗! 深入理解 AbortController:从底层原理到跨语言设计哲学 字符串学习笔记 多租户系统框架的基础模块设计和分析设计 Apache SeaTunnel Zeta 为什么能做到“又快又稳”? AI开发-python-LangGraph框架(3-26-LangGraph基本概念及第一个简单样例) Vue 3 组件通信,别只会用 Props 和 Emits 了,这几个狠活儿你得看看 ElasticSearch7.X版本配置密码 用Manim实现动态交点计算--从一个动点问题说起 团结引擎+Addressable+Instant Game打包抖音小游戏 function call 实战:让 LLM 自动判断 pod 异常、调用日志工具并完成故障分析 bubseek —— 让 Agent 的足迹,变成团队的洞察 通过 C# 读取并导出 PDF 书签 如何用 GitHub Actions 实现 Steam 自动化发布 【从0到1构建一个ClaudeAgent】并发-后台任务 .NET 高级开发 | 定制 ASP.NET Core 框架 电子小白:什么是运算放大器(运放) zero2Agent:面向大厂面试的 Agent 工程教程,从概念到生产的完整学习路线 堆上的ORW HC32F460 USB CDC通信异常:非对齐访问异常排查 20260413-Hyperbridge 攻击事件:发生在默克尔山上的验证绕过 那些喊着AI 要淘汰你的人,正在靠你的焦虑赚大钱! 深度学习进阶(八)Swin Transformer 最小二乘问题详解19:带先验约束的增量式SFM优化与实现 SnapTranslate 3.0 正式发布:全局划词翻译 + 完整英语学习闭环,一站式搞定查词、记词、复习 工作的意义、工作的困难认知再思考 .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 开了 TUN 模式还是直连?90% 的人都踩过这个坑 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术
CVPR 2026 | 全新强化学习框架 BeautyGRPO:重塑真实人像
vivo互联网技术 · 2026-06-18 · via 博客园_首页
作者: vivo BlueImage Lab

本文入选 CVPR 2026 Highlight

CVPR(IEEE/CVF Conference on Computer Vision and Pattern Recognition)IEEE 国际计算机视觉与模式识别会议,主要内容是计算机视觉与模式识别技术。

CVPR 2026 投稿 16092 篇,接收率约 25.42%。

论文主页:https://beautygrpo.github.io

摘要:
人像精修的核心挑战在于既要提升肌肤质感,又要完整保留个人原生特征。然而,传统的监督学习局限于像素级模仿,难以捕捉人类复杂的高级审美;而强化学习(RL)虽擅长审美对齐,其随机探索机制却极易破坏原图的高保真需求,导致明显的失真伪影。

为了化解“美学探索”与“高保真”的两难困境,本工作提出全新强化学习框架 BeautyGRPO。该工作首先构建了细粒度人像精修偏好数据集 FRPref-10K 及用于评估的细粒度奖励模型,精准量化微观审美差异;同时首创动态路径引导(DPG)算法,在每一步采样中动态重规划基于高质量锚点的轨迹,有效纠正了随机漂移。实验证明,BeautyGRPO 在真实场景的肌肤纹理重建与整体审美对齐上,全面超越了现有的专精修图方法与通用编辑大模型。

对应的论文已被 CVPR2026 接收,并被选为 Highlight 文章。

该工作由 vivo BlueImage Lab,中山大学共同完成。

一、行业困局:审美探索与高保真的“零和博弈”

高质量的数字人像精修早已成为移动影像时代的高频刚需。然而,对 AI 而言,这是一项极为严苛且微妙的任务:它既要像手术刀般精准剥离痘印、斑点等微小瑕疵,又要让肌肤透出真实的“自然呼吸感”,并完整保留诸如痣等极具辨识度的原生特征。本质上,这是一场“原生高保真”与“人类主观审美”之间的极致博弈。现有的 AI 模型往往受限于底层训练范式,难以做到两全其美。

现有痛点 1:SFT 的“刻板拟合”局限。

目前主流的修图模型(如 RetouchFormer)或通用编辑模型(NanoBanana)大多依赖监督微调(SFT)范式,迫使模型陷入对参考图的“像素级严格拟合”。模型并未真正捕捉人类审美逻辑,一旦训练数据存在瑕疵,便会全盘继承这些错误标注。因此在泛化到真实场景时,极易出现瑕疵残留,或因粗暴的“过度磨皮”导致人脸呈现失真的“硅胶质感”。

现有痛点 2:RL 的“随机失控”副作用。

为突破 SFT 局限,文生图领域尝试引入在线强化学习(RL,如 FlowGRPO)引导模型对齐人类审美。然而,这类方法在采样中往往需要注入随机噪声来驱动探索。对于极度依赖保真度的人像精修而言,这种不断累积的随机漂移(Stochastic Drift)是致命的,会严重破坏原图的高保真流形并引入明显的视觉伪影。

核心挑战: 究竟该如何打破这一“零和博弈”,在追求极致美学探索的同时,实现原生特征的绝对保真?

二、技术逻辑:细粒度审美量化与动态路径引导

我们提出了 BeautyGRPO 框架,从偏好量化与采样机制两个维度入手解决上述问题:

2.1 构建细粒度评价体系:FRPref-10K 与多维奖励模型

现有的奖励模型大多聚焦语义对齐和整体美学质量评估,缺乏对人像微小感知差异的敏锐度。 为此,我们构建了业内首个包含 10,000 对高清精修偏好对的大型数据集 FRPref-10K,将审美标准拆解为 5 个细粒度维度:皮肤平滑度、瑕疵去除、纹理质感、清晰度、身份特征保留。 在此基础上,我们结合视觉大模型(VLM)与人类专家校准,训练出具备高感知能力的多维奖励模型。该模型能够敏锐捕捉图片之间的肌肤纹理、光泽质感等微小差异,为强化学习提供高质量的偏好对齐信号。

2.2 可控 RL 探索:动态路径引导(DPG,Dynamic Path Guidance)

针对审美探索与高保真的冲突,DPG 在采样过程中构建了一种柔性的“锚点约束”机制。算法在每一步会规划一条指向高质量参考锚点(Anchor)的确定性轨迹,将其与原始 SDE 采样方向结合计算出专属的“纠正向量(Correction Vector)”。借助时间步自适应的权重衰减策略,DPG 对生成轨迹进行了精细化控制:

  • 采样前期(高噪声阶段): 赋予纠正向量较强的引导权重,强力纠正随机漂移,将生成轨迹拉回高保真流形,确保面部结构和光影的稳定。
  • 采样后期(细节生成阶段): 动态降低纠正向量的引导强度,释放更多随机探索空间,使模型能在安全边界内,寻找超越高质量锚点、更契合人类审美的修图结果。

三、实验结果

Figure 1: 客观指标全面领先(跨越“感知-失真”困境)

  • 指标选择:为避免全参考指标(如 PSNR)带来的“感知-失真困境”,采用 NIMA、MUSIQ、MANIQA 等无参考(NR)美学指标。
  • 评估结果:BeautyGRPO 在各项 NR 指标上均显著优于现有专精及通用修图模型;同时 ArcFace 身份保留得分稳居 0.95+,证明其在提升美感的同时未破坏面部特征。

Figure 2: 视觉效果直观对比(拒绝油光,还原呼吸感)

  • 传统基线:常陷入两难极端——要么对微小瑕疵“漏修”,要么因粗暴磨皮导致肌肤呈现失真的“塑料油光感”。
  • BeautyGRPO:精准剥离暗沉与痘印,重塑细腻毛孔与真实光泽。在完整痣等原生特质的同时,完美还原肌肤的“自然呼吸感”,呈现通透、高级的影像质感。

Figure 3: 主观双盲偏好测试(高度契合大众审美)

  • 测试设定:邀请 100 名涵盖不同年龄段与具备专业修图经验的用户,开展了严格的双盲偏好与打分测试。
  • 主观偏好断层领先:BeautyGRPO 以高达 63.25% 的偏好胜率位列第一,对第二名(12.00%)形成碾压式优势,切实印证了优化结果高度契合大众的审美预期。
  • 审美对齐精准拟合:测试进一步证实,专属多维奖励模型的评分与人类真实评分展现出了极高的对齐度,强有力地证明了该模型真正“读懂”了人类的审美逻辑。

Figure 4: 优异的基座泛化能力(即插即用)

将 BeautyGRPO 框架直接应用于通用的 Qwen-Image-Edit 大模型,有效化解了原模型在面部编辑时易引发的“身份偏移”和“过度平滑”问题,展现出极强的泛化潜力。

四、结语: 探索计算摄影的“真实之美”

BeautyGRPO 成功让 AI 摆脱了死板的修图套路,在“极致美学”与“原生保真”之间找到了完美的平衡。 这项 CVPR 2026 顶会成果的背后,印证着 vivo 蓝图影像实验室(vivo BlueImage Lab)在计算摄影与 AIGC 前沿的持续深耕。秉承“拒绝同质化粗暴磨皮,还原个人特质与自然真实”的美学哲学,团队期待此类底层算法的突破能够加速落地终端,为用户的每一次日常记录,赋予更专业、更高级的影像质感。

vivo BlueImage Lab
蓝图影像创新实验室,主要负责移动影像算法创新,包括图像/视频处理、图像/视频交互、图像/视频增强、多模态理解大模型等方面的技术前沿探索。
致力于不断提升 vivo 移动影像的算法能力,使用户能够拍摄出更加清晰、美观的照片和视频。同时积极探索增强现实、具身智能等新兴技术领域的应用,努力为用户提供更加丰富和便捷的影像体验。
欢迎持续关注 vivo 影像技术,获取前沿技术创新经验分享与热招岗位信息。