惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

量子位
Recent Announcements
Recent Announcements
D
Docker
V
V2EX
阮一峰的网络日志
阮一峰的网络日志
Vercel News
Vercel News
Microsoft Security Blog
Microsoft Security Blog
The GitHub Blog
The GitHub Blog
U
Unit 42
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
月光博客
月光博客
腾讯CDC
B
Blog
博客园_首页
罗磊的独立博客
D
DataBreaches.Net
IT之家
IT之家
酷 壳 – CoolShell
酷 壳 – CoolShell
L
LangChain Blog
aimingoo的专栏
aimingoo的专栏
MongoDB | Blog
MongoDB | Blog
GbyAI
GbyAI
Stack Overflow Blog
Stack Overflow Blog
M
MIT News - Artificial intelligence

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 看到有公司考核 token 指标,很好奇大家上个月的 AI 账单是多少 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? 现在还有什么渠道可以稳定安全地使用 Claude 吗? 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? gemini cli 貌似挂了,一直返回 403 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 只有我一个人觉得 codex 不好用?
商汤开源 SenseNova-U1:原生统一理解+生成的 MoT 模型,无 V...
Daniel6606 · 2026-05-01 · via V2EX

商汤刚开源了 SenseNova-U1 ,一个原生统一图文理解与生成的多模态模型家族。最大的特点是——不需要 VAE ,不需要视觉编码器,端到端一个 Transformer 搞定。
https://i.imgur.com/ojeALs3.png
四个点:
1. 架构上消灭了 VAE 传统范式:CLIP 编码文本 → VAE 编码图像 → 去噪 → VAE 解码 → 出图。U1:像素级 token + 文本 token 直接拼接进同一个 Transformer 。理解就是 generation ,generation 就是 understanding 。这意味着在 ComfyUI 里,你不需要 VAEEncode 和 VAEDecode 节点。
https://i.imgur.com/Ec3Zscl.png
2. 高密度信息图输出 — 文字不会糊 SD 的老用户应该深有体会:海报上的中文大概率是乱码恶魔。U1 的 SFT 版本用 32× 下采样率专门优化了这类场景,可以输出带大量文字的海报、信息图、PPT 、简历、漫画。文字渲染正确率远超扩散模型。
https://i.imgur.com/QICO3Yo.png
3. 原生图文交错生成一个模型、一次前向,同时输出文字和图片。比如做一份番茄炒蛋图文教程,它直接输出带穿插图片的完整教程页面。这在多模态模型里属于「原生能力」,不需要后期拼接或分步渲染。
https://i.imgur.com/tdQMcT3.png
4. 推理驱动的图像生成/编辑:这是我觉得最厉害的点。模型在出图之前会先做推理:
- "木头密度小于水 → 会浮起来。铁块密度大于水 → 沉底。"
- "茶水一小时后鞣质析出 → 颜色变深琥珀色。"
- "糖+水会让鸡蛋浮力增大 → 鸡蛋会从杯底浮到中间。
https://i.imgur.com/sNDWn2V.png
然后生成符合物理逻辑的图像。同样的能力延伸到编辑场景——你说"把水换成高浓度盐水",模型理解物理含义,输出鸡蛋浮起来的编辑结果。这一步不需要用户画 mask 。
链接汇总:
- GitHub: https://github.com/OpenSenseNova/SenseNova-U1
- HuggingFace: https://huggingface.co/collections/sensenova/sensenova-u1
- Discord: https://discord.gg/cxkwXWjp