惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

月光博客
月光博客
MyScale Blog
MyScale Blog
博客园 - Franky
The Cloudflare Blog
IT之家
IT之家
Blog — PlanetScale
Blog — PlanetScale
博客园 - 聂微东
WordPress大学
WordPress大学
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
T
The Blog of Author Tim Ferriss
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
罗磊的独立博客
Google DeepMind News
Google DeepMind News
P
Proofpoint News Feed
Martin Fowler
Martin Fowler
aimingoo的专栏
aimingoo的专栏
J
Java Code Geeks
腾讯CDC
雷峰网
雷峰网
Microsoft Azure Blog
Microsoft Azure Blog
G
Google Developers Blog
博客园 - 【当耐特】
美团技术团队
云风的 BLOG
云风的 BLOG

分享发现

推荐 2 个好玩的在线游戏站 Claude code 的 Designs 和 Routines 居然是独立额度,我的 Claude Pro 订阅又升值了 偶然看到一篇文章《文化已死:当绝大多数人听的音乐,读的书都来自 10 年前》,给大家推荐一下,非常值得一看 66 个入狱教程 国家超算互联网平台提供 Coding Plan(20 元/100 元两档) supergeo.info 送兑换码 V2EX › 登录 古风提示词 Bright Data 代理和 Browser API 90 天 6 折,优惠码 BESTPROXY60 飞机上 Starlink 测速 zig 写的 100kb 的 wasm 可以 http 读写任意 git 仓库 GPT Image 2 韩文 prompt 实测:不是“能看懂”,而是“能还原” 网页端 GPT-5.5 Thinking 体感好快啊,这速度第一反应还以为是降智到 4o-mini 了 新开中转站,有 GPT 包月可以薅,分享给有缘人 google 搜索的 AI 模式(自动右侧弹出)是个谜啊? 小红书下场做 app 工厂 做了一个 GEO 工具平台,想听听大家对 AI 搜索优化的看法 XChat 正式上架 App Store 了 大 F 彻底沦为历史了,公司宣布停业。 记一次 QQ 被盗事件记录 codex 5.5 强的离谱 用 Claude 做了视频“关于 ping0.cc 静默上传用户真实 IP” AI 辅助英语学习,无推广,讨论一下 gpt5.5 写完界面,还会进行截图查看效果 DeepSeek4 的数据没清理好啊,估计有得折腾 做了一个自动识别云朵的网站 claude 太抠门了 继上次讨论自媒体问题后,我决定下架流量最大的视频 DeepSeek V4 上线了!之前难产真是适配昇腾? deepseekv4 来了
商汤开源 SenseNova-U1:原生统一理解+生成的 MoT 模型,无 V...
Daniel6606 · 2026-05-01 · via 分享发现

商汤刚开源了 SenseNova-U1 ,一个原生统一图文理解与生成的多模态模型家族。最大的特点是——不需要 VAE ,不需要视觉编码器,端到端一个 Transformer 搞定。
https://i.imgur.com/ojeALs3.png
四个点:
1. 架构上消灭了 VAE 传统范式:CLIP 编码文本 → VAE 编码图像 → 去噪 → VAE 解码 → 出图。U1:像素级 token + 文本 token 直接拼接进同一个 Transformer 。理解就是 generation ,generation 就是 understanding 。这意味着在 ComfyUI 里,你不需要 VAEEncode 和 VAEDecode 节点。
https://i.imgur.com/Ec3Zscl.png
2. 高密度信息图输出 — 文字不会糊 SD 的老用户应该深有体会:海报上的中文大概率是乱码恶魔。U1 的 SFT 版本用 32× 下采样率专门优化了这类场景,可以输出带大量文字的海报、信息图、PPT 、简历、漫画。文字渲染正确率远超扩散模型。
https://i.imgur.com/QICO3Yo.png
3. 原生图文交错生成一个模型、一次前向,同时输出文字和图片。比如做一份番茄炒蛋图文教程,它直接输出带穿插图片的完整教程页面。这在多模态模型里属于「原生能力」,不需要后期拼接或分步渲染。
https://i.imgur.com/tdQMcT3.png
4. 推理驱动的图像生成/编辑:这是我觉得最厉害的点。模型在出图之前会先做推理:
- "木头密度小于水 → 会浮起来。铁块密度大于水 → 沉底。"
- "茶水一小时后鞣质析出 → 颜色变深琥珀色。"
- "糖+水会让鸡蛋浮力增大 → 鸡蛋会从杯底浮到中间。
https://i.imgur.com/sNDWn2V.png
然后生成符合物理逻辑的图像。同样的能力延伸到编辑场景——你说"把水换成高浓度盐水",模型理解物理含义,输出鸡蛋浮起来的编辑结果。这一步不需要用户画 mask 。
链接汇总:
- GitHub: https://github.com/OpenSenseNova/SenseNova-U1
- HuggingFace: https://huggingface.co/collections/sensenova/sensenova-u1
- Discord: https://discord.gg/cxkwXWjp