惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Y
Y Combinator Blog
MyScale Blog
MyScale Blog
Recent Announcements
Recent Announcements
酷 壳 – CoolShell
酷 壳 – CoolShell
GbyAI
GbyAI
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
N
Netflix TechBlog - Medium
V
V2EX
MongoDB | Blog
MongoDB | Blog
Microsoft Security Blog
Microsoft Security Blog
博客园 - 三生石上(FineUI控件)
Stack Overflow Blog
Stack Overflow Blog
U
Unit 42
B
Blog
Microsoft Azure Blog
Microsoft Azure Blog
博客园_首页
H
Help Net Security
D
DataBreaches.Net
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
阮一峰的网络日志
阮一峰的网络日志
T
The Blog of Author Tim Ferriss
C
Check Point Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
AI视频进展速读|Runway生图能力、Veo2免费体验、3个新产品及...
2025-05-23 · via 少数派

自24年H2开始,AI视频行业以周为单位高速发展,GenLumio是我从24年开始0-1规划 - 设计 - 开发的AI视频项目,旨在为大家带来每周最新鲜的AI视频优秀作品、产品动向。

我计划通过这个系列的文章选取新鲜产品动向、优质作品案例为大家介绍。

更多案例欢迎访问:https://genlumio.framer.website/

备注:这篇文章写于Veo3发布前夕

Runway

Runway发布了Gen-4 文本转图像及图片References功能,测试案例达到了令人吃惊的地步 —— 可以通过添加结构参考图,将主体物可以置于参考场景中,同时可通过Prompt控制新的摄像机角度、构图、角色造型等细节。混合后的新图片中,有非常适宜的灯光、阴影和构图效果,甚至能识别简单的构图标注进行图像生成。同时也支持对图片风格进行参考。

该功能可以用于主体物多角度一致性、绿幕图生成、甚至3D模型在不同场景的渲染,以下是一些案例:

该能力可以快速实现3D白模在不同场景的渲染

这里值得一提的是Runway参考图片引用的交互方式,就像@某个人那样,你可以通过@来引用需要参考的图像,来替代在历史图片库中查找。

Veo2可以免费体验了

Veo2的体验入口终于被我找到了,Google的产品入口比较分散,交互体验也很一般,但这不影响我对Veo2模型能力的赞美之情。Veo2支持生成8s视频,并且可以上传图片体验I2V,测了几条感觉 T2V的效果是真不错,I2V的部分案例非常惊艳,提示词遵循能力做的很好,绝对是当下第一梯队的模型能力。例如这个篮球进入篮筐的镜头,我测试过世面上大部分模型只有Veo2干净利落的成功了。

免费用户现在每日可以生成几个无水印视频,处理日常需求已足够:

https://aistudio.google.com/generate-video

Pixverse

刚刚更新了4.5模型,更新了20+ 摄像机控制功能、多元素参考和融合,并且模型价格相比4.0降低了一些,但比起其他产品还是偏贵的,效果也不在第一梯队,就不过多介绍了。

HeyGen

HeyGen近期进行了产品大幅更新。真实人物、宠物、插画都可以生成对口型视频,除了对口型的准确度提高,另外还支持了多角度对口型:侧面、仰视视角都可以生成。嘴巴以外,人物的面部肌肉有自然的运动,看了一些案例,通常人物的手部、整体画面也有轻微运动,但如果这样的运动可以更多,再配合一些镜头移动效果,视频的真实感会得到极大提升。

                                                        使用HeyGen制作音乐MV

其中语音镜像功能很有趣,AI 可以模仿你输入的真实音调、语调和节奏,并且匹配对应口型,这个功能极大提高了视频制作的可控性。

HeyGen语音镜像

另外推荐一则HeyGen制作的创意短片。

visiblemakers使用HeyGen制作的短片

新产品

Pippit 字节电商营销新产品

去年写过HeyGen、 Opus Clip之后,在AI视频进展中还没有提过电商营销新产品,近期Capcut背后的新产品Pippit在Product Hunt 登顶,提供的能力非常丰富,功能介绍十字路口这篇文章写的很详细了,感兴趣可查看:字节 Pippit 悄悄登顶 Product Hunt  | AI 营销创业「血战」号角吹起

我输入了GenLumio的网页链接,消耗120积分让Pippit帮我的网站制作视频,Pippit一次性生成了10条视频,看上去每条视频的数字人语气都真的像那么回事的。只是在爬取了网页信息后,AI撰写的文本对GenLumio的功能进行了夸大,产品介绍文本基本没法用,需要后期人工调整。

同时,该领域还有Creatify、Captions 值得关注。

Medeo

一款AI视频剪辑的Agent产品,支持输入URL、文章、文件内容进行视频生成。

我先是输入了此前AI Coding的文章和GenLumio网站进行测试。和Pippit不同,Medeo并没有使用文章或者网页中的相关资源,而是通过对内容进行一定总结后生成了一段总结性文本,并且根据内容生成了图片,再进行图生视频。生成的效果有点像科普风(也可能和我的内容有关),如果想要建立有特色的个人账号,可能还是要花一些功夫,但是对一些新闻科普、小说故事剧情讲解视频来说,这种快速低成本制作出来的视频已经够用了。

下面的视频分别是让Medeo生成间谍过家家动漫介绍短片;对AI Coding文章进行总结,在短视频平台介绍我的AI Coding经验:

交互上Medeo提交Prompt后会直接消耗大额积分进行视频生成,生成视频中的文本也和输入Prompt的语言匹配,这点前置感知也非常不强烈。Medeo缺乏了Gemini、Lovart等产品分布完成或主动确认任务的可控感。如果在执行几十秒视频生成的复杂任务前,事先进行任务理解、偏好询问,并对生图、文案进行分步确认,会让结果更具备可控性。

Gemini和Lovart的确认过程

感兴趣的朋友可以试用,每个账号可免费生成一次:https://ai.medeo.app

Ponder

一个即将发布的AI 视频编辑器,可以通过Prompt命令对原始拍摄素材进行AI剪辑,这里加入waitlist:https://ponder.ai/

二.最新优秀案例

动漫短片

传统动画师使用Runway做了非常优秀的动画剧集《Mars and Siv. 》,现推出了第一集。整体风格创作模仿了小时候的动画片,分镜、角色设计和场景建模均由传统流程中的人工完成,通过Runway对渲染图进行连贯动画生成,然后刻意抽取中间帧,做成了定格效果。

文章中讲述了详细创作过程:https://runwayml.com/customers/the-making-of-mars-and-siv

视频中很多画面采取了分角色生成+绿幕合成的制作:

再次被yachimat的作品惊艳到,不论画面美感、配音、BGM、动画效果都是日漫风格创作者中的绝佳了。

叙事短片

来自Runway CEO Cristóbal Valenzuela 发表的作品,讲述了一只猫在城市中的生活,短片中动物肢体运动协调真实,镜头跟随猫咪进入不同场景,镜头切换非常自然。

广告片两则

来自汗青团队的新作(创意真的没有瓶颈),这是一条Lovart的广告片,讲述AI是如何做梦露的IP商业化设计的,视频故事从一次安迪沃霍尔的设计师面试开始说起。

Snoop Dogg 的作品。由 Dave Meyers 执导。携手 30 多位艺术家,将传统艺术(3D、绘画等)与AI结合,画面有一些拼贴艺术效果。

4个视频制作经验分享

来自Freepik官方的视频,这套面部表情的提示效果非常好

来自Ray (movie arc)分享的案例:Gen-4提示词技巧:“视图突然被四等分,同一镜头的不同未来发生在四个四分之一中”(二等分和“细分为 X”也有效)

来自madpencil_分享的案例:上传一张黑色空白图片,然后在上面提示任何内容,这个技巧几乎适用于所有平台,尤其是在像 Gen 4 这样的模型上:低角度拍摄,摄像机跟踪一滴清澈的水摆动并弹跳下来/漂浮/(地点设置),水滴溅到摄像机镜头上,形成了文字“XYZ”。

来自Cristobal Valenzuela分享的案例:如果你希望在 Gen-4 中实现有趣的摄像机运动,一个很好的建议是使用如下提示结构:“允许摄像机在整个场景中完全自由地移动,采用动态技术,例如俯冲空中运动、戏剧性的俯冲过渡、快速鞭打摇摄和平滑跟踪”。

三.近期AI视频产品调研结论

记录下近期AI视频产品的观察结论:

1.Runway、Luma等产品这几个月一直在发力生图模型能力,AI Wrapper 忙着把所有模型能力集成在一起。在AI生图、视频方向上,也许存在定义下一代交互方式的机会,没有创业者会不为此心动

2.主体物参考(画面内容一致性、风格迁移)、首尾帧是视频创作的刚需,前者除了Veo和Sora,其他主流产品几乎全部支持,后者Hailuo AI还没有补齐

3.调研了一圈AI视频模型每秒生成成本,Veo($0.3/s)以微弱差异高于Runway Gen4($0.29/s)成为最贵模型,但Veo的效果真的让人没话说,Google在AI模型领域的长期发展还是可期待的。

综合价格和生成效果来看,Vidu Q1($0.06/s)依然是动漫领域性价比较高的选择,和同价格档位其他产品相比Q1可以直出1080P画质,近期还推出了升级2K、4K能力,生成速度很快,继续推荐。

Kling 1.6 720P($0.04/s)确实是最便宜的模型,偏好真实系方向的朋友可选择。

AI视频趋势系列

AI视频进展速读|5个老牌产品更新,2个新产品动向,8个创意转绘、广告、动漫案例精选

AI视频进展速读|Pika高速更新,动漫风格神仙打架,Wan 2.1成为最强开源模型

其他AI视频相关文章

一站式AI视频Showcase:GenLumio每周带你纵览全球佳作

AI视频爆发式更新|近半年值得关注的13个闭源产品动向

AI视频生成(下)| 20个产品推荐及实践教学

AI视频生成 (中)| 20个产品推荐及实践教学