惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园_首页
H
Help Net Security
N
Netflix TechBlog - Medium
Apple Machine Learning Research
Apple Machine Learning Research
P
Proofpoint News Feed
A
About on SuperTechFans
V
V2EX
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
宝玉的分享
宝玉的分享
aimingoo的专栏
aimingoo的专栏
F
Fortinet All Blogs
博客园 - 【当耐特】
Microsoft Security Blog
Microsoft Security Blog
Martin Fowler
Martin Fowler
I
InfoQ
Google DeepMind News
Google DeepMind News
人人都是产品经理
人人都是产品经理
Engineering at Meta
Engineering at Meta
腾讯CDC
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
B
Blog RSS Feed
U
Unit 42
The Cloudflare Blog
Y
Y Combinator Blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
口述视频,中国厂商参战
张书乐 · 2024-06-24 · via 人人都是产品经理

过去半年,AI生成视频一直被处于断断续续推进状态,口述视频也成为了中国厂商不断入局的一大赛道。

视频也能口述?这个正在奔现。

在OpenAI文生视频大模型Sora发布后,国内企业争相入局,国产文生视频大模型迈入加速阶段。

过去半年,AI 生成视频一直处在断断续续推进的状态。

号称国内首个自研视频大模型的 Vidu,以及后续字节、腾讯等多家国产厂商推出视频生成模型,都在时不时引发外界的关注。

近日,又一国产视频大模型加入战局,快手“可灵”视频生成大模型官网正式上线。

21日,快手可灵大模型发布重磅更新:正式开放图生视频功能,支持将静态图像转化为5秒钟视频,用户可通过提示词文本控制图像中物体的运动;同时推出视频续写功能,支持对生成视频一键续写和连续多次续写,最长可生成约3分钟视频。

相较此前各家放出的视频大模型以展示视频为主,本次亮相的可灵大模型不但效果对标Sora,且已在快手旗下的快影App开放邀测体验。

据快手方面介绍,可灵大模型为快手AI团队自研,采用Sora相似的技术路线,结合多项自研技术创新,其生成的视频分辨率达1080p,时长最高可达2分钟(帧率30fps),支持自由的宽高比。

此外,官方还宣称,可灵大模型能够生成大幅度的合理运动,并使其符合客观运动规律。

在官方给出的视频范例中,一位宇航员在月球上奔跑,随着镜头慢慢抬升,宇航员的步态和影子都能保持合理恰当。

几乎同时,美图宣布将在7月底上线新品MOKI,该产品基于美图奇想大模型的视频生成能力,可帮助用户生成AI短片。

然而, 也有观点认为,相比一拥而上的大语言模式,视频大模型更慢热,且少了巨头的身影。

为什么会如此?

大厂们不感兴趣吗?

同时,在上一轮大语言模型竞争中,快手和美图的存在感较低。

而在视频大模型赛道,这两家企业最大的优势又是什么?

对此,北京商报记者魏蔚和书乐进行了一番交流,本猴以为:

还在冲刺“高考”的大厂,不会直接进击“博士后”。

做视频,不是一堆图组成PPT,大厂不急于这一块发力,且实用性不强,只是一个肌肉展示。

毕竟,视频生成不是将一堆AI绘图连在一起变成动画片。

除了考虑形象一致、符合描述、光影分割、分镜表现等更多细节外,还有对剧情的理解能力、再创造能力。

这些都需要对视频结构、内容解析、拍摄技巧和叙事手法等多个垂直领域进行深度学习。

其难度远不是聊天、绘画或专精于下棋之类靠数据堆积和用户纠错来完成的。

即使是影视领域的大师也常有败笔,让还处在“高考阶段”的人工智能出片,其难度可想而知。

但快手和美图,则需要秀肌肉,哪怕只是一个秀。

快手也好,美图也罢,在视频大模型赛道上,最大的优势只是他们拥有让人工智能深度学习的丰富“学习资料”。

依靠这些“学习资料”,可以规避一定的版权问题,并且通过多年在视频领域的内容积累、垂直细分和标签标注,都让大模型能够更好地“检索”知识,也让其在算法设计上多少有一定的视频专业素养。

但也仅此而已,在技术上依然缺少在人工智能算法上的原始积累。

此外,视频大模型即使成熟,也很难在影视领域有大的突破。

无论是短剧、广告还是长视频或电影,尽管都会内卷“大片特效”。

但受众最终被吸引的还是内容(从编剧到运镜,以及演员演技)。

这些才是大规模商业变现的关键。

愚以为,视频大模型或许更容易在动画领域找到一些商机。

本文由人人都是产品经理作者【张书乐】,微信公众号:【张书乐】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。