惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
博客园_首页
GbyAI
GbyAI
罗磊的独立博客
Y
Y Combinator Blog
宝玉的分享
宝玉的分享
人人都是产品经理
人人都是产品经理
U
Unit 42
V
Visual Studio Blog
F
Fortinet All Blogs
小众软件
小众软件
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
L
LangChain Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Engineering at Meta
Engineering at Meta
aimingoo的专栏
aimingoo的专栏
The Cloudflare Blog
T
Tor Project blog
Martin Fowler
Martin Fowler
K
Kaspersky official blog
Scott Helme
Scott Helme
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
D
DataBreaches.Net
博客园 - Franky
阮一峰的网络日志
阮一峰的网络日志
博客园 - 【当耐特】
P
Proofpoint News Feed
N
Netflix TechBlog - Medium
美团技术团队
S
Secure Thoughts
C
Cisco Blogs
M
MIT News - Artificial intelligence
L
Lohrmann on Cybersecurity
T
Tenable Blog
N
News and Events Feed by Topic
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
C
Check Point Blog
C
Cyber Attacks, Cyber Crime and Cyber Security
Spread Privacy
Spread Privacy
S
Security @ Cisco Blogs
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Microsoft Security Blog
Microsoft Security Blog
A
Arctic Wolf
Hacker News - Newest:
Hacker News - Newest: "LLM"
H
Hacker News: Front Page
T
Threat Research - Cisco Blogs
Simon Willison's Weblog
Simon Willison's Weblog
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
O
OpenAI News
V
Vulnerabilities – Threatpost

后端技术杂谈

从管人到管系统行为:AI时代技术管理者的全新认知框架 - 后端技术杂谈 一句话直出5分钟AI漫剧:OiiOii + Seedance2.0 如何打破视频工作流的瓶颈 - 后端技术杂谈 SOUL.md 和 AGENTS.md 到底有什么区别?Agent 配置别再混着写了 AI Agent 正在进入工程化深水区:从代码模型、生产框架到多智能体协作协议 - 后端技术杂谈 OpenClaw Gateway 三种对外接口怎么选? - 后端技术杂谈 Agent 落地不靠更强模型:后端团队先补这 4 个治理动作 - 后端技术杂谈 OpenClaw多Agent方案 - 后端技术杂谈 OpenClaw 架构剖析 - 后端技术杂谈 OpenClaw 是什么 - 后端技术杂谈 2026 年 AI 最新进展 - 后端技术杂谈 AI大事记@2025 - 后端技术杂谈 《太白金星有点烦》读后感 - 后端技术杂谈 DeepSeek简单分享 - 后端技术杂谈 美国AI之旅 - 后端技术杂谈 CTO都必须是程序员出身吗?为什么架构师做不了CTO? - 后端技术杂谈 不同的CTO角色 by Werner Vogels (Amazon CTO) AI技术概览(PPT版) - 后端技术杂谈 这三年的一些感悟 - 后端技术杂谈 Langchain代理和OpenAI函数调用的区别 - 后端技术杂谈 【译】如何基于开源技术构建类似ChatGPT的聊天机器人 - 后端技术杂谈 Web3学习笔记-Web3是什么? - 后端技术杂谈
如何使用AI生成长视频? - 后端技术杂谈
HJ · 2024-03-27 · via 后端技术杂谈

今年最火的AI技术应该是OpenAI在春节期间发布的Sora了。相比起其他视频生成产品就3、4秒的时长,Sora是碾压式的存在。但Sora没有对外开放,所以要生成长视频,暂时也没有其他完整的好的方案。综合各种资料来看,目前最可行的方案应该就是:写剧本/分镜——>生图——>生视频->视频拼接,本质上就是通过多个短时长的视频组成一个完整的长视频。下面就详细讲述一下。

详细的步骤:

  1. 脚本确认:拆分镜头,初步确定生成内容。这一步就是需要针对要生成的内容撰写剧本,并拆分成数个镜头。
  2. 单帧图片
    • 使用Midjourney(V6的语义理解能力有明显提升),DALL-E 3(语义理解能力较好)进行文/图生图
    • 审查已生成图片中的细节问题,调整、更换合适的主题内容,并重新生成符合要求的图片
    • 使用PS处理图片中的不合理细节,添加未被AI生成的元素
    • 使用Stable Diffusion图生图进行图片放大和细节优化
    • 使用PS进行图片的最后优化
    • 人物不一致可以使用换脸进行统一
  3. 图生视频
    • 使用RunWay/Pika/SVD/Animatediff实现图片生成短视频,可以综合利用各个视频服务的优点,如RunWay的运动笔刷、Pika的面部表情等,其中Pika还可以对局部视频进行重绘。
  4. 视频合成
    • 使用剪映/iMove进行短视频片段合成与特效转场处理
    • 添加配音和配乐,根据卡点节奏进行视频剪辑与重新生成内容替换(如需要声音)

每一步使用的软件以及关键点如下:

  1. 场景描述需要分镜,这里用GPT4来做场景拆解,场景的描述提示词模版如下:

     需要将一段场景的描述改写成一个时长30秒的分镜脚本,再根据每个分镜脚本的文字描述生成单张图片,之后通过图片生成视频,最后将视频进行拼接成最终的成品视频。
    
     场景描述如下:
    
     xxx
    
     分镜脚本结构如下:
     ‒ 序号:递增数字 
     ‒ 景别:远景/全景/中景/近景/特写 
     ‒ 风格:真实影像风格/日本动漫风格/水墨画风格等(在Dalle3里无法直接写作者的名字,比如新海诚,但Midjourney是可以的。) 
     ‒ 角色:具体到是什么样的角色,有什么特殊的颜色、道具、服饰等等。 
     ‒ 环境:森林、家、海边等等 
     ‒ 镜头移动:描述每个分镜中镜头的动作或变化 
     ‒ 比例:16:9/2.35:1等等
    
     分镜要求如下:
     1. 每个分镜时长4s
     2. xxx
     3. 内容和风格需要xxx
    
     每一个分镜后续会通过Midjourney进行图片生成。现在请给出每一个分镜脚本以及对应的Midjourney提示词,以Markdown Table的方式输出。
    
  2. 图像需要保持一致性,包括人物和周围场景

    • DALL-E 3:一致性可以通过GenID
    • Midjourney V6: 最新版有了ref,一致性功能
  3. 图生视频这一步,需要结合多种视频软件一起使用。每个软件的特点如下:

    • Pixverse: 免费无限生成,有一致性角色功能(效果一般),可用于无限生成视频后择优选取
    • Runway: 每次生成消耗5积分,做角色动作和部分运动镜头会好一点
    • Pika: 每次生消耗10积分,做角色动作和面部表情
    • Stable Video: 每次生成消耗10积分,适合生成风景视频

    换脸的话,可以使用roop或者facefusion,这里有其colab版本:https://github.com/dream80/roop_colab

  4. 视频拼接,可以使用剪映或者苹果电脑上的iMovie。

通过以上方案,基本可以实现长视频的生成,但目前AI生成视频的崩坏率极高,可控性差,所以需要生成很多视频,从中选取最符合预期的。