



















随着人工智能视频工具越来越多,很多人会接触到“视频生成模型”“数字人”“自动剪辑”和“Remotion”等概念。
这些工具看起来都能制作视频,但它们的工作方式并不相同。
本文尽量不使用复杂的技术术语,简单介绍 Remotion 是什么、它能做什么,以及它和视频生成模型有什么区别。
Remotion 是一种使用程序自动制作视频的工具。
可以把它理解成一条“视频生产流水线”:
准备文字、图片、视频、配音等素材;
设置这些素材的出现顺序和展示方式;
由电脑自动完成画面组合;
最后导出为 MP4 视频。
Remotion 不会凭空创造人物和场景,它主要负责把已经准备好的内容,按照规定的方式组合成完整视频。
假设现在需要制作一段产品介绍视频,视频中包含:
产品名称;
产品图片;
功能介绍;
解说配音;
字幕;
背景音乐;
企业 Logo;
片头和片尾。
使用普通视频剪辑软件时,通常需要人工把这些素材放到时间线上,然后逐个调整位置、大小和播放时间。
使用 Remotion 时,可以提前制定一套规则,例如:
视频开头先显示产品名称;
标题显示两秒后进入产品介绍;
配音播放时同步显示字幕;
每段配音结束后自动切换下一张图片;
右上角始终显示企业 Logo;
所有内容播放完毕后显示结束页面。
规则设置完成后,Remotion 就可以按照这些规则自动生成视频。
因此,可以把 Remotion 简单理解为:
普通视频软件主要依靠人工拖拽剪辑,Remotion 主要依靠提前设置的程序规则自动制作视频。
这是理解 Remotion 时非常重要的一点。
Remotion 本身不是视频生成模型,也不是一个可以自由创作画面的人工智能。
直接给 Remotion 输入一句:
生成一个老师在教室里讲课的视频。
Remotion 不会自动生成老师、教室和讲课画面。
在默认情况下,Remotion 不会自动完成以下工作:
不会凭空生成校园、办公室或人物;
不会自动设计视频镜头;
不会自动理解谁先说话、谁后说话;
不会自动生成配音;
不会自动创作背景音乐;
不会自动生成真实人物动作。
这些内容通常需要提前准备,或者通过其他人工智能工具生成。
Remotion 更像一个“自动视频组装工具”,负责把已有素材准确地组合起来。
使用 Remotion 制作视频,一般可以分为以下几个步骤。
先确定视频要表达什么内容。
例如:
产品功能介绍;
学校招生介绍;
数据分析报告;
客服对话演示;
软件操作教程;
企业宣传内容。
根据脚本准备相应素材,包括:
图片;
视频片段;
人物形象;
图标;
标题文字;
字幕;
配音;
背景音乐;
企业 Logo。
规定素材如何展示,例如:
标题从哪里出现;
图片什么时候切换;
当前说话人如何突出显示;
字幕放在什么位置;
配音结束后如何进入下一段;
视频最后如何结束。
Remotion 会按照设置好的规则,一帧一帧生成视频画面。
视频本质上是由大量连续图片组成的。Remotion 会把文字、图片、动画和视频素材组合成每一帧画面。
所有画面生成完成后,可以导出为常见的 MP4 视频文件。
整个过程可以简单概括为:
准备脚本 → 准备素材 → 设置规则 → 自动生成 → 导出视频
不一定需要人工规定每句话在第几秒出现。
例如,需要制作下面这段客服对话:
客户:您好,我想咨询一下办理流程。
坐席:您好,请问您想办理哪一项业务?
客户:我想了解材料需要准备哪些。
坐席:好的,我为您逐项说明。
可以先把四句话分别生成配音。
假设四段配音的长度分别是:
第一句3秒;
第二句4秒;
第三句3秒;
第四句4秒。
系统可以读取每段配音的实际长度,然后自动进行安排:
播放客户的第一句话,同时显示客户头像和字幕;
第一句播放完后,切换到坐席;
播放坐席的第二句话,同时显示对应字幕;
按照相同方式继续播放后面的对话;
最后一句播放完毕后,视频自动结束。
使用者不需要手工计算“第3秒切换人物”或者“第7秒更换字幕”。
但是需要注意,这种自动安排并不是 Remotion 自己理解出来的,而是开发人员提前设置好了规则,例如:
按照对话顺序播放;
根据音频长度决定每段画面的时长;
当前说话人高亮;
说话结束后自动切换下一个人;
所有对话播放完毕后结束视频。
因此,Remotion 可以做到自动安排时间,但前提是已经有一套完整的视频模板和播放规则。
视频生成模型是一类人工智能模型。
使用者通常只需要输入一段文字,例如:
生成一段未来校园的视频,学生在智能教室中学习人工智能,整体画面具有科技感。
视频生成模型就可以根据这段文字创造人物、校园、教室和镜头。
它比较像一个人工智能导演或摄影师,可以根据文字描述直接创作视频画面。
视频生成模型的主要特点包括:
不一定需要提前准备图片和视频;
可以直接根据文字创造画面;
比较适合生成创意场景;
每次生成的结果可能不同;
很难保证所有细节完全准确。
例如,让视频生成模型生成两个人对话,它可能出现以下问题:
漏掉某句话;
修改原来的台词;
混淆两个人的声音;
人物口型和声音不一致;
对话还没有结束,视频就提前结束;
中文字幕出现错字或乱码;
人物外貌在不同镜头中发生变化。
因此,视频生成模型比较擅长“创造画面”,但不一定适合需要严格准确的长对话和业务内容。
Remotion 和视频生成模型虽然都可以参与视频制作,但两者的作用不同。
| 对比项目 | Remotion | 视频生成模型 |
|---|---|---|
| 工具本质 | 按照规则组装视频的工具 | 根据文字创造视频画面的人工智能 |
| 画面来源 | 使用已有文字、图片、视频和配音 | 由人工智能直接生成 |
| 文字准确性 | 可以准确显示指定文字 | 文字可能出现错误或变形 |
| 数字准确性 | 可以精确显示数据和金额 | 数字可能生成错误 |
| 对话完整性 | 可以按照脚本逐句播放 | 可能漏句、改写或提前结束 |
| 可控程度 | 控制程度较高 | 结果具有一定随机性 |
| 重复生成 | 相同内容通常得到相同结果 | 每次生成的画面可能不同 |
| 是否需要素材 | 通常需要提前准备素材 | 可以只提供文字描述 |
| 使用难度 | 通常需要开发人员制作模板 | 多数产品可以直接输入文字 |
| 适合场景 | 产品演示、数据视频、培训视频、批量视频 | 创意短片、人物生成、场景生成 |
最简单的区分方法是:
视频生成模型负责“根据文字创造一段新画面”,Remotion 负责“把准备好的内容准确地组合成一段视频”。
假设需要制作一段两个人对话的视频。
可以直接输入一段提示词:
生成一个客户和客服人员对话的视频。客户咨询业务办理流程,客服人员进行详细解答。两个人轮流说话,并显示中文字幕。
这种方式操作简单,可以直接生成两个人交流的画面。
但是最终结果不一定完全按照原始要求执行,可能出现:
少说一句;
改写对话内容;
客户说了客服的台词;
字幕与声音不一致;
视频提前结束;
中文文字显示错误。
可以提前准备:
客户形象;
坐席形象;
每句话的配音;
准确的字幕;
对话背景;
企业 Logo。
然后设置规则:
客户说话时,客户一侧高亮;
坐席说话时,坐席一侧高亮;
字幕跟随配音显示;
每句话结束后自动切换;
所有台词播放完毕后视频结束。
这种方式虽然前期准备较多,但可以保证:
台词不遗漏;
对话顺序不改变;
字幕内容准确;
每个人的声音不会混淆;
对话没有结束时,视频不会提前结束。
以下场景更适合使用 Remotion。
例如:
销售数据;
考试成绩;
产品价格;
日期;
姓名;
政策名称;
业务办理条件。
这些内容不能依赖人工智能在画面中随机生成。
例如:
客服对话;
培训课程;
政策讲解;
产品介绍;
软件操作说明。
所有内容都需要按照规定顺序完整播放。
例如,所有视频都要使用相同的:
企业颜色;
Logo;
字体;
片头;
片尾;
字幕样式;
人物布局。
例如,需要为100名学生分别制作成绩讲解视频。
可以先制作一个模板,然后自动替换:
学生姓名;
学生成绩;
评价内容;
学生照片;
对应配音。
这样不需要人工逐个剪辑100次。
例如,每个月都需要制作一份数据报告视频。
视频结构基本不变,只需要替换新的数据、图表和解说内容,就可以重新生成视频。
以下场景更适合使用视频生成模型。
只提供一段文字,就希望快速得到一个完整的画面。
例如:
未来校园;
科技城市;
卡通客服大厅;
虚拟展厅;
智能工厂;
太空场景。
主要关注整体视觉效果,不要求人物动作、文字和数字百分之百准确。
例如,为宣传片生成一段科技感背景、城市航拍效果或人物工作场景。
可以,而且两者结合通常更加实用。
一种常见的制作方式是:
使用视频生成模型制作人物、背景和创意镜头;
使用语音合成工具生成不同人物的声音;
准备准确的业务文字和字幕;
使用 Remotion 把画面、配音、字幕、Logo 和动画组合起来;
最终输出完整视频。
例如,在制作客服对话视频时:
视频生成模型负责生成客服大厅背景;
图片生成模型负责生成人物形象;
语音工具负责生成客户和坐席的声音;
Remotion 负责控制谁先说、谁后说;
Remotion 同时保证字幕和配音一致;
所有对话结束后,再自动结束视频。
这种组合方式既可以使用人工智能生成丰富画面,又可以保证业务内容准确。
Remotion 和剪映都可以制作视频,但操作方式不同。
剪映主要通过人工操作完成:
导入素材;
拖动时间轴;
添加字幕;
调整动画;
设置转场;
导出视频。
它比较直观,适合普通使用者制作少量视频。
Remotion 主要通过程序规则制作视频:
读取文字和数据;
自动替换图片;
自动匹配配音长度;
自动生成字幕;
自动安排动画;
批量导出视频。
它前期需要开发人员制作模板,但模板完成后,可以大幅减少重复工作。
简单来说:
制作一两条普通视频,使用剪映可能更加方便;长期批量制作同类视频,Remotion 的优势更加明显。
Remotion 虽然能够自动生成视频,但并不是完全没有成本。
需要提前设计页面、动画和播放规则。
普通使用者很难直接从零开始使用,一般需要开发人员先搭建模板。
如果图片模糊、配音生硬或者脚本内容不好,即使使用 Remotion,最终效果也不会理想。
只制作一条简单的生活视频或宣传短片时,直接使用剪映或数字人工具可能更加方便。
Remotion 更适合结构固定、要求准确、需要重复生成的视频。
Remotion 不是一个“输入一句话就自动创造视频”的人工智能模型,而是一种通过程序规则自动制作视频的工具。
它的主要优势包括:
能够准确显示文字和数字;
能够保证脚本完整;
能够控制对话播放顺序;
能够统一视频样式;
能够批量生成同类视频;
修改数据后可以快速重新生成。
视频生成模型更擅长根据文字创造人物、场景和创意镜头,但生成结果具有一定随机性,很难保证长对话、字幕和业务数据完全准确。
因此,两种工具并不是互相替代的关系。
可以简单概括为:
视频生成模型负责创造素材,Remotion 负责把素材准确地组装成最终视频。
对于“你一句、我一句,并且所有对话必须完整播放”的视频,使用配音、字幕和 Remotion 进行组合,通常比单独使用视频生成模型更加稳定。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。