惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 叶小钗
D
Docker
GbyAI
GbyAI
Y
Y Combinator Blog
Google DeepMind News
Google DeepMind News
G
Google Developers Blog
P
Proofpoint News Feed
云风的 BLOG
云风的 BLOG
雷峰网
雷峰网
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Stack Overflow Blog
Stack Overflow Blog
WordPress大学
WordPress大学
小众软件
小众软件
Engineering at Meta
Engineering at Meta
酷 壳 – CoolShell
酷 壳 – CoolShell
I
InfoQ
B
Blog
H
Help Net Security
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 聂微东
The GitHub Blog
The GitHub Blog
A
About on SuperTechFans
B
Blog RSS Feed
Microsoft Security Blog
Microsoft Security Blog

优惠信息

80 大洋三箱 10 盒 200ml 特仑苏 便宜不? - V2EX 自费上班:美区 GPT team 席位买一送一活动 - V2EX WorkBuddy 开学福利,可白嫖 4000 万 Token,接近 125 元 - V2EX 有没有什么每日必薅的小羊毛? - V2EX 最近开了网易云音乐的 vip, 发现可以赠别人会员 - V2EX 孙割的羊毛可以薅吗? - V2EX 中银香港 boc + 10 元羊毛 - V2EX 别急着 羊毛了,先看看 mirasim 的隐私协议 - V2EX 支付宝免费领无糖可乐,亲测一次即中 - V2EX 免费领取 100 刀 Fable 5 的使用额度 填写的 ChatGPT Work 体验问卷 100 美元到账了 Kimi K3 羊毛 求大豆包 seed-2.0 官方渠道 折扣 有量 🔥 GPT‑5.6 限时降至 0.02 倍率 - V2EX [云闪付] 江苏农行银联信用卡 10-3 云闪付优惠券 免费送 GLM Coding Plan 体验卡,一共 3 张 想搞个优质羊毛群 今日灵犀口令 网易云音乐 2026.07,需要自取 站起来蹬!商汤 Token Plan 的免费计划延长到 7 月底了,支持 DeepSeek V4、GLM 5.2 Google Play 有一波 0.1 刀的游戏大促 0626 移动灵犀口令 微软下血本了,白嫖麦当劳、肯德基 20 元礼品卡! 超值优惠 | 领移动话费 1-9 元 DeepSeek V4 Flash 限时免费无限畅用 宵夜, mimo 约 2000 亿 token, 10 天到期 羊毛: mimo code 免费 m-2.5-pro 超值优惠| 领移动话费 1-9 元 20260605 领移动话费 1-9 元 6 月份网易云音乐黑胶会员领取,天数随机
商汤这次的开源文生图模型 Sense Nova U1 的技术报告出来了,...
Daniel6606 · 2026-05-14 · via 优惠信息

之前刷推老看见有 KOL 在转发他们的产品,这次技术报告一出来,还挺有意思的
原文: https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/pdf/SenseNOVA_U1.pdf
先放架构图:
https://i.imgur.com/9zaboAG.png
熟悉文生图模型的老友们都知道,过去的模型都是先将像素的 RGB 数值转化为向量,放在潜空间里( VAE 层)
这次他们的统一架构 NEO-Unify 完全摒弃了这个做法,采取的是像素输入,像素输出,让模型直接理解图片,而不是一堆潜空间里的数据
https://i.imgur.com/llNwYKT.png
在训练数据上,理解类和生成类数据分别用了:
1. 理解类数据
- 预训练混合比例: 包含图文对 (32%)、纯文本 (37%)、详细描述 (17%) 以及信息图表 (14%)。
- 中期训练: 采用 SenseNova V6.5 数据集,并通过多维度过滤(采样平衡 + 提示词增强 + 模型自动化评分)进行精炼。
2. 生成类数据
- VLM 重标注 (Re-captioning): 所有图像(涵盖自然、设计、人像、合成类)都去重和 VLM 重标注流水线,确保文本与像素之间的语义对齐
- 交错逻辑: 数据分布包括生活方式 (44%)、信息图表 (29%) 和推理 (8%)
- 生成式 CoT (思维链): 每一个推理样本都包含思维链过程,在渲染像素之前,先教会模型理解场景背后的逻辑。
过去我们觉得 VAE 导致的文字模糊和纹理丢失是“必要代价”,但 U1 证明了:只要架构选得对,原生像素生成比潜空间( Latent Space )更强。同时在训练方法上,也和其他传统的扩散模型不太一样:
核心方法:
- 无 VAE 视觉接口( VAE-Free Visual Interface ): 采用 2 层卷积实现 32 倍的图像压缩编码,并使用 MLP (多层感知机)头部直接预测像素。引入了动态噪声缩放( DNS )技术,确保从 512px 到 2048px 分辨率下的信噪比( SNR )保持一致。
- 原生 MoT ( Mixture-of-Transformers ): 构建了一个统一的主干网络,使理解与生成流共享自注意力层( Self-Attention ),但使用解耦的 FFN (前馈网络)和 Norm (归一化)层,并根据 Token 类型进行动态路由。
- 联合训练与部署: 通过结合自回归( Auto-regressive )和流匹配( Flow Matching )损失函数进行优化。模型经历了从预热( Warm-up )、指令微调( SFT )到 8 步蒸馏( 8-step Distillation )的 6 阶段训练流水线。部署方面,利用 LightLLM/LightX2V 实现了独立并行调度。
最后放上他们现在可以免费领的 token plan: https://www.sensenova.cn/token-plan
(每 5 小时 1500 次免费调用,Token 消耗比别的模型低 60%)
https://i.imgur.com/P3OpVcQ.png
https://i.imgur.com/Y3DCEJY.png
一些 ShowCase:
https://i.imgur.com/2O8BCNb.jpeg