惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
J
Java Code Geeks
B
Blog
腾讯CDC
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
H
Hackread – Cybersecurity News, Data Breaches, AI and More
博客园 - Franky
罗磊的独立博客
月光博客
月光博客
Jina AI
Jina AI
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
D
Docker
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
G
Google Developers Blog
V
Visual Studio Blog
I
InfoQ
有赞技术团队
有赞技术团队
D
DataBreaches.Net
Microsoft Security Blog
Microsoft Security Blog
WordPress大学
WordPress大学
阮一峰的网络日志
阮一峰的网络日志
宝玉的分享
宝玉的分享
Blog — PlanetScale
Blog — PlanetScale

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
SketchVideo – 快手联合多所高校推出基于草图的视频生成与编...
站外新闻 · 2026-06-08 · via Prompt 语宙

SketchVideo 是中国科学院大学,香港科技大学和快手可灵团队推出的基于草图的视频生成与编辑框架。在关键帧上绘制草图,结合文本提示,实现对视频的空间布局和运动的精细控制。框架基于 DiT 视频生成模型,设计高效的草图控制网络,包含草图控制块和帧间注意力机制,能将稀疏的关键帧草图条件传播到所有视频帧中。SketchVideo 支持对真实或合成视频的细粒度编辑,基于视频插入模块和潜在融合技术,确保新内容与原始视频在空间和时间上的一致性,保留未编辑区域的细节。

  • SketchVideo是什么
  • SketchVideo的主要功能
  • SketchVideo的技术原理
  • SketchVideo的项目地址
  • SketchVideo的应用场景

SketchVideo

SketchVideo的主要功能

  • 视频生成:基于草图和文本生成视频。
  • 视频编辑:在关键帧上画草图修改视频内容。
  • 动态控制:支持运动插值和外推。
  • 细节保留:编辑时保留未修改区域的细节。
  • 高效生成:内存优化,快速生成高质量视频。

SketchVideo的技术原理

  • 草图条件网络:基于DiT(Diffusion-based Transformer)视频生成模型,设计专门的草图条件网络。草图条件网络包含多个草图控制块,预测跳过的DiT块的残差特征。草图控制块均匀分布在DiT块中,在不同层次的特征中注入控制信号。
  • 帧间注意力机制:基于帧间注意力机制,将关键帧上的草图条件传播到所有视频帧。计算所有帧的隐藏特征与控制帧的隐藏特征之间的关系,实现对草图特征的时空传播。
  • 视频插入模块:在视频编辑任务中,设计视频插入模块,分析输入草图与原始视频之间的关系。模块生成与原始视频空间和时间上一致的新内容,确保编辑后的视频与原始视频无缝融合。
  • 潜在融合技术:在推理过程中,基于DDIM(Denoising Diffusion Implicit Models)反演生成输入视频的噪声潜在码。在未编辑区域替换这些潜在码,保留原始视频的细节,确保编辑后的视频在视觉上自然、连贯。
  • 混合训练策略:基于混合训练策略,结合图像和视频数据进行训练。在训练的第一阶段,用图像和视频数据,加速收敛并解决视频数据有限的问题。在第二阶段,用视频数据,进一步优化时间连贯性。

SketchVideo的项目地址

SketchVideo的应用场景

  • 影视与广告:快速生成创意视频和特效预览,优化制作流程,节省时间和成本。
  • 教育与培训:辅助制作教学视频和培训材料,提升教学效果。
  • 游戏开发:快速生成关卡预览和角色动画,提高开发效率。
  • 个人创作:轻松创作个性化短视频,降低创作门槛。
  • 建筑设计:生成建筑和室内设计的动态预览,增强客户沟通。