



























多模态AI的发展历程是一部从单一感知到全面认知的技术史诗。从AlexNet在2012年引爆深度学习革命,到GPT-4o实现原生多模态理解,再到世界模型对AGI的终极探索,每一次技术跃迁都在重新定义人机交互的边界。本文将深度解析CNN、GAN、ViT、Diffusion等关键技术的演进脉络,揭示多模态AI如何逐步突破感知局限,走向对世界的理解与建模。

多模态AI作为一种融合视觉、语言、音频等多种感知模态的智能技术范式,正在重塑人机交互的边界。从2012年AlexNet在ImageNet竞赛中的惊艳表现,到2024年GPT-4o实现端到端原生多模态理解,再到2026年ViT-5对视觉Transformer的现代化升级,这条演进之路跨越了整整十余年,见证了深度学习从单一感知走向全面认知的历史性跨越。
本文将深入剖析多模态AI从卷积神经网络到世界模型的完整演进脉络,揭示其背后的技术逻辑与产业变革。我们将沿着时间轴,依次探索CNN开启的视觉感知时代、GAN点燃的生成式AI萌芽、ViT打破的模态壁垒、CLIP实现的图文对齐革命、Diffusion引领的文生图爆发、多模态大模型的理解突破、Sora带来的视频生成革命、原生多模态的端到端融合,以及世界模型所代表的AGI终极形态。
这不仅是技术演进的编年史,更是对人类认知边界的不断拓展。多模态AI的发展历程告诉我们:真正的智能,源于对世界的多维度感知与理解。每一次技术突破,都让我们离通用人工智能(AGI)更近一步。从”看懂”到”理解”,从”生成”到”建模”,多模态AI正在开启人工智能的新纪元。
本文适合对人工智能感兴趣的各类读者:技术从业者可以从中了解多模态AI的技术演进脉络和核心原理;产品经理可以从中洞察产业发展趋势和应用场景;普通读者可以从中感受人工智能的魅力和未来可能。无论你身处何种背景,相信都能从这篇文章中获得启发。

AI大模型发展时间线
图1:AI大模型发展历程时间线(图片来源:LifeArchitect.ai)
在深度学习革命到来之前,计算机视觉领域长期被手工设计的特征描述符所主导。1999年,David Lowe提出的SIFT(Scale-Invariant Feature Transform,尺度不变特征变换)算法,通过检测图像中的关键点并提取其局部特征描述子,实现了对旋转、尺度、亮度变化的鲁棒性。紧随其后,Navneet Dalal和Bill Triggs在2005年提出的HOG(Histogram of Oriented Gradients,方向梯度直方图)特征,通过统计图像局部区域的梯度方向分布,在行人检测任务上取得了突破性进展。
这些方法虽然在特定任务上表现优异,但其本质都是人类专家基于对视觉世界的理解,手工设计的特征提取规则。它们存在三个根本性局限:首先,特征的表达能力受限于设计者的先验知识,难以捕捉更复杂、更抽象的语义信息;其次,不同任务需要设计不同的特征,缺乏通用性;最重要的是,这些手工特征无法从数据中自动学习优化,难以适应海量数据时代的需求。
2009年,李飞飞教授领导的团队在CVPR上发布了ImageNet数据集,这是一个包含超过1400万张图像、涵盖2万多个类别的大规模图像数据库。ImageNet的诞生为计算机视觉领域提供了一个统一的评估基准,每年的ImageNet大规模视觉识别挑战赛(ILSVRC)成为衡量算法性能的”奥林匹克”。然而,在2010年和2011年的比赛中,获胜算法的top-5错误率仍高达28%和26%,图像识别的准确率提升陷入了瓶颈。
2012年9月30日,一个注定要载入人工智能史册的日子。在当年的ImageNet竞赛中,多伦多大学Geoffrey Hinton教授的研究小组提交了一个名为AlexNet的卷积神经网络模型,以惊人的优势夺得冠军——其top-5错误率仅为15.3%,比第二名(26.2%)低了将近11个百分点。这是深度学习在计算机视觉领域的首次重大突破,标志着AI发展进入了一个全新时代。
AlexNet的成功并非偶然,而是三个关键技术突破的完美结合:
AlexNet的架构包含8层网络(5个卷积层+3个全连接层),使用了局部响应归一化(LRN)和重叠池化(Overlapping Pooling)等技术。它的成功证明了:通过端到端的深度学习,神经网络可以自动从原始像素中学习层次化的特征表示,无需人工设计特征提取器。

AlexNet架构图
图2:AlexNet CNN架构示意图,展示了从输入到输出的完整数据流
AlexNet的胜利点燃了整个学术界和工业界对深度学习的热情,卷积神经网络架构进入了快速迭代期。
VGGNet(2014):牛津大学视觉几何组(Visual Geometry Group)提出的VGGNet采用了极其简洁的设计理念——使用大量3×3的小卷积核堆叠来替代大卷积核。VGG-16和VGG-19分别包含16层和19层,通过增加网络深度来提升表达能力。VGGNet证明了网络深度的重要性,其简洁的架构设计也成为后续许多网络的基准。
GoogLeNet/Inception(2014):Google团队提出的GoogLeNet(又名Inception v1)采用了完全不同的设计思路。其核心创新是Inception模块,通过在同一层使用不同大小的卷积核(1×1、3×3、5×5)和池化操作,实现多尺度特征的并行提取。这种”网络中的网络”结构在保持计算效率的同时,大幅提升了特征的丰富度。GoogLeNet仅有22层,但参数数量却只有AlexNet的1/12,在2014年ImageNet竞赛中以6.67%的top-5错误率夺冠。
ResNet(2015):微软亚洲研究院的Kaiming He等人提出的残差网络(Residual Network)是CNN发展史上的又一里程碑。他们发现了一个反直觉的现象:随着网络深度增加,训练准确率反而下降,这并非过拟合导致,而是优化困难造成的”退化问题”。ResNet通过引入”跳跃连接”(Skip Connection),让网络学习残差映射F(x) = H(x) – x,而非直接学习目标映射H(x)。这种设计使得训练超深层网络成为可能,ResNet-152在ImageNet上取得了3.57%的top-5错误率,首次超越了人类的识别水平(约5.1%)。

ResNet残差连接
图3:传统网络块与ResNet残差块的对比,展示了跳跃连接如何解决梯度消失问题
DenseNet(2016):康奈尔大学的Gao Huang等人提出了密集连接网络(Densely Connected Network),每一层都与前面所有层直接相连,形成特征的重用与传递。DenseNet在减少参数数量的同时,缓解了梯度消失问题,进一步提升了特征传播效率。
尽管CNN在图像分类、目标检测、语义分割等任务上取得了巨大成功,但其架构本身存在一些根本性局限:
这些局限性为后续Transformer架构的登场埋下了伏笔。2017年,Google提出的Transformer架构在自然语言处理领域大放异彩,人们开始思考:这种基于自注意力机制的架构能否应用于计算机视觉?这个问题的答案,将在2020年揭晓。

Transformer自注意力机制
图5:Transformer自注意力机制可视化,展示每个词如何关注句子中的其他词
2014年6月,蒙特利尔大学的Ian Goodfellow等人在NIPS会议上发表了一篇题为《Generative Adversarial Nets》的论文,正式提出了生成对抗网络(Generative Adversarial Networks,GAN)的概念。这篇论文的诞生颇具传奇色彩——据说Goodfellow是在一个深夜的学术讨论中突然灵光一现,意识到可以通过两个神经网络的对抗博弈来实现生成式建模,随后立即回家编写了代码,并在当晚就取得了初步成功。
GAN的核心思想源于博弈论中的”二人零和博弈”。它包含两个相互对抗的神经网络:
两个网络通过对抗训练不断优化:生成器努力生成更逼真的样本来欺骗判别器,判别器则努力提升鉴别能力来识破生成器的”谎言”。在理想情况下,当训练达到纳什均衡时,生成器能够完美拟合真实数据分布,判别器对任何样本的输出概率都为0.5,即完全无法区分真假。
GAN的数学目标函数可以表示为:
min_G max_D V(D, G) = mathbb{E}_{x sim p_{data}(x)}[log D(x)] + mathbb{E}_{z sim p_z(z)}[log(1
– D(G(z)))]

GAN生成对抗网络架构
图4:GAN生成对抗网络架构,展示生成器与判别器的对抗训练过程
这个minimax博弈框架具有深刻的理论意义:当生成器和判别器都有无限容量时,在最优判别器下,生成器的目标等价于最小化真实数据分布与生成分布之间的Jensen-Shannon散度。
GAN提出后,迅速成为生成式AI领域最热门的研究方向,各种改进版本层出不穷。
DCGAN(2015):Radford等人提出的深度卷积GAN(Deep Convolutional GAN)是GAN发展史上的第一个重要里程碑。DCGAN将CNN引入GAN架构,提出了一系列稳定训练的经验性设计准则:使用步长卷积替代池化操作、在生成器和判别器中都使用Batch Normalization、移除全连接层、在生成器中使用ReLU激活(输出层使用Tanh)、在判别器中使用LeakyReLU激活。DCGAN生成的图像质量显著提升,且学习到的特征具有可解释性,开启了GAN的可视化研究。
CGAN(2014):条件GAN(Conditional GAN)通过向生成器和判别器额外输入条件信息y(如类别标签),实现了可控生成。CGAN的目标函数变为:
min_G max_DV(D, G)= mathbb{E}_{x sim p_{data}(x)}[logD(x|y)] + mathbb{E}_{z simp_z(z)}[log(1
– D(G(z|y)|y))]
这一设计使得GAN可以生成指定类别的样本,大大扩展了应用场景。
CycleGAN(2017):朱俊彦等人提出的CycleGAN实现了无监督的图像到图像翻译。传统的图像翻译方法需要配对的训练数据(如同一场景的晴天和雨天版本),而CycleGAN通过引入”循环一致性损失”(Cycle Consistency Loss),可以在没有配对数据的情况下学习两个域之间的映射关系。例如,可以将马自动转换为斑马,或将夏季风景转换为冬季风景,而无需成对的训练样本。
StyleGAN(2018-2019):NVIDIA提出的StyleGAN系列将GAN的生成能力推向了新的高度。StyleGAN的核心创新是借鉴了风格迁移领域的”自适应实例归一化”(AdaIN),将潜在向量z通过一个全连接网络映射为中间潜在空间W,然后在生成器的每一层通过AdaIN注入风格信息。这种设计实现了对生成图像的高层次语义控制,可以独立调整年龄、姿态、表情、发色等属性。StyleGAN2进一步解决了”液滴伪影”问题,StyleGAN3则实现了对平移和旋转的等变性。
GAN在多个领域展现了强大的应用潜力:
然而,GAN也存在一些根本性瓶颈:
尽管GAN存在诸多局限,但它在AI发展史上的地位不可磨灭:
首先,GAN证明了AI不仅可以”识别”和”理解”,还可以”创造”。这一认知突破为后续生成式AI的发展奠定了心理基础。
其次,GAN开启了AI创作的大众认知。2018年,”This Person Does Not Exist”网站使用StyleGAN生成虚拟人脸,让普通用户第一次直观感受到AI的生成能力。
最后,GAN为后续扩散模型的爆发培养了用户群体和开发者社区。许多在GAN时代积累的技术(如条件生成、潜在空间编辑)在扩散模型时代得到了继承和发展。
2015年,Jascha Sohl-Dickstein等人提出了扩散模型(Diffusion Model)的雏形,但当时并未引起广泛关注。直到2020-2022年,随着DDPM、LDM等关键工作的发表,扩散模型才逐渐取代GAN成为生成式AI的主流范式。GAN与扩散模型的交替,恰如RNN与Transformer在NLP领域的更迭,是技术演进螺旋上升的生动写照。
2017年6月,Google机器翻译团队发表了那篇改变NLP历史的论文《Attention Is All You Need》,正式提出了Transformer架构。Transformer完全基于自注意力机制(Self-Attention),摒弃了RNN和CNN的顺序计算模式,实现了并行化训练和长距离依赖建模。随后,BERT(2018)和GPT系列(2018-至今)的横空出世,证明了Transformer在自然语言理解与生成的强大能力。
然而,Transformer在计算机视觉领域的应用却长期滞后。CV研究者普遍认为,图像的二维空间结构需要CNN的局部归纳偏置来有效建模,而Transformer的全局自注意力计算复杂度过高,难以处理高分辨率图像。这种认知在2020年被彻底打破。
2020年10月,Google Research的Alexey Dosovitskiy等人在ICLR 2021发表了题为《An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale》的论文,正式提出了Vision Transformer(ViT)。这篇论文的标题本身就是一个宣言:图像可以被看作是一系列”视觉词”(Visual Words)的序列,Transformer可以像处理文本一样处理图像。
ViT的核心创新可以概括为三点:

Vision Transformer架构
图6:Vision Transformer架构图,展示图像如何被分割为Patch并输入Transformer编码器
ViT的架构公式化表示为:
z_0= [x_{class}; x_p^1E; x_p^2E; cdots; x_p^NE] + E_{pos}z’_l = MSA(LN(z_{l-1})) + z_{l-1}z_l = MLP(LN(z’_l)) + z’_ly = LN(z_L^0)
其中,x_p^i是第i个展平的图像Patch,E是Patch嵌入投影矩阵,E_{pos}是位置嵌入,L是Transformer层数。
ViT的实验结果揭示了几个重要发现:
ViT的提出引发了视觉Transformer研究的热潮,各种改进版本层出不穷。
DeiT(Data-efficient Image Transformer,2021):Facebook AI提出的DeiT通过知识蒸馏(Knowledge Distillation)技术,使得ViT可以在ImageNet上从头训练而无需大规模预训练数据集。DeiT引入了一个蒸馏Token(Distillation Token),让模型学习教师网络(通常是CNN)的软标签。DeiT-Tiny仅用5.7M参数就在ImageNet上达到了72.2%的准确率,证明了数据效率优化的重要性。
Swin Transformer(2021):微软亚洲研究院提出的Swin Transformer引入了层次化(Hierarchical)和窗口化(Window-based)的自注意力机制。Swin Transformer将图像划分为不重叠的窗口,在每个窗口内计算自注意力,然后通过移位窗口(Shifted Window)实现跨窗口信息交互。这种设计将自注意力的计算复杂度从O(N²)降低到O(N),同时保留了多尺度特征提取能力,使其适用于目标检测、语义分割等密集预测任务。
ViT-5(2026):最新的ViT-5架构代表了现代ViT的集大成。它采用了以下关键设计:
ViT-5在ImageNet-1K上,Base模型达到84.2%的top-1准确率,超过DeiT-III-Base的83.8%;Large模型在384×384分辨率下达到86.0%,显著超越之前的ViT架构。
ViT的提出具有划时代的意义:
首先,ViT证明了Transformer可以统一处理文本和图像,打破了CV和NLP之间的技术壁垒。这为后续多模态模型的融合奠定了架构基础。
其次,ViT确立了”规模法则”在视觉领域的适用性,推动了大规模视觉预训练的发展。CLIP、DALL-E、Sora等后续模型都受益于这一范式转变。
最后,ViT简化了视觉模型的设计。相比CNN复杂的架构设计(不同大小的卷积核、池化策略、跳跃连接等),ViT的架构更加简洁统一,主要调整的超参数只有模型深度、宽度和Patch大小。
ViT的成功让人们看到了一个激动人心的可能性:是否存在一种统一的架构,可以同时处理文本、图像、音频、视频等多种模态?这个问题的答案,将在2021年揭晓。
在CLIP出现之前,计算机视觉(CV)和自然语言处理(NLP)是两个相对独立的领域。CV研究者专注于如何让机器”看懂”图像,NLP研究者致力于让机器”理解”语言,但两者之间缺乏有效的”翻译”机制。
早期的多模态方法主要采用以下策略:
这些方法的共同局限是:它们将视觉和语言视为两个独立的模态,缺乏统一的语义表示空间。当用户想搜索”一只在草地上奔跑的金毛犬”时,传统方法难以准确理解这一复杂语义查询。
2021年2月,OpenAI发布了CLIP(Contrastive Language-Image Pre-training),这是一个在4亿对互联网图文数据上训练的视觉-语言模型。CLIP的核心创新在于:通过对比学习,将图像和文本映射到一个共享的语义嵌入空间中。
CLIP的架构包含两个主要组件:
CLIP的训练目标是最大化匹配图文对的相似度,同时最小化不匹配图文对的相似度。具体来说,对于一个包含N对图文数据的批次,CLIP计算所有N×N个可能的图文相似度,形成一个相似度矩阵。对角线上的N个元素对应匹配的图文对,非对角线上的N²-N个元素对应不匹配的图文对。

CLIP架构与对比学习
图7:CLIP架构图,展示图像编码器、文本编码器和对比学习的核心思想
CLIP使用对称的交叉熵损失(Symmetric Cross-Entropy Loss)进行训练:
L= frac{1}{2} left[ -sum_{i=1}^{N} log frac{exp(I_i cdot T_i / tau)}{sum_{j=1}^{N} exp(I_i cdot T_j / tau)}
– sum_{i=1}^{N} log frac{exp(I_i cdot T_i / tau)}{sum_{j=1}^{N} exp(I_j cdot T_i / tau)} right]
其中,tau是可学习的温度参数,用于控制分布的锐度。
CLIP在多个基准测试上展现了前所未有的能力:
数据工程:CLIP的成功很大程度上归功于大规模数据收集。OpenAI从互联网上收集了4亿对(图像,文本)数据,形成了WebImageText(WIT)数据集。这些数据覆盖了广泛的视觉概念,为CLIP的泛化能力奠定了基础。
对比学习的效率优势:相比生成式方法(如图像描述生成),对比学习只需要判断图文是否匹配,而不需要生成完整的文本序列,训练效率更高。CLIP的训练使用了256个V100 GPU,训练时间约为12天。
温度参数的作用:CLIP中的温度参数tau是可学习的,而非固定值。这使得模型可以自动调整相似度分布的锐度,在训练过程中动态优化。
对比学习的数学原理:CLIP的对比学习目标函数可以看作是在最大化互信息的下界。具体来说,对于匹配的图文对(I, T),CLIP最大化它们的互信息I(I; T),而对比损失实际上是InfoNCE(Noise Contrastive Estimation)损失的一种形式,它通过将正样本与大量负样本进行对比,来学习有意义的表征。
CLIP的局限性:尽管CLIP展现了强大的能力,但它也存在一些局限性:
CLIP的发布引发了多模态AI的产业革命:
CLIP的意义可以类比于罗塞塔石碑——它建立了图像和文本之间的”翻译”机制,让机器可以同时”看懂”图像和”理解”语言,开启了多模态AI的新纪元。
扩散模型的理论基础可以追溯到2015年。Jascha Sohl-Dickstein等人发表了《Deep Unsupervised Learning using Nonequilibrium Thermodynamics》,首次提出了使用扩散过程进行生成建模的思想。这篇论文的灵感来源于非平衡态热力学:通过模拟分子从高浓度向低浓度的扩散过程,可以逐步将复杂的数据分布”简化”为简单的噪声分布,然后学习逆向过程来恢复数据。
然而,早期的扩散模型计算效率低下,生成质量也不如GAN,因此并未引起广泛关注。直到2020年,Jonathan Ho等人发表了《Denoising Diffusion Probabilistic Models》(DDPM),对原始扩散模型进行了关键改进,才开启了扩散模型的复兴。
DDPM的核心创新包括:

扩散模型去噪过程
图8:扩散模型的前向加噪与反向去噪过程,展示图像如何从噪声中逐步恢复
尽管DDPM在生成质量上取得了突破,但其在像素空间进行扩散的计算成本仍然很高。生成一张256×256的图像需要多次前向传播,推理速度慢,难以实用化。
2022年,Robin Rombach等人提出了Latent Diffusion Model(LDM),发表在CVPR 2022上。LDM的核心洞察是:图像在像素空间存在大量冗余信息,可以在一个压缩的潜空间(Latent Space)中进行扩散,从而大幅降低计算成本。
LDM的架构包含三个主要组件:
LDM的交叉注意力机制公式为:
Attention(Q, K, V) = softmaxleft(frac{QK^T}{sqrt{d}}right) cdot V
其中,Q = W_Q^{(i)} cdot varphi_i(z_t),K = W_K^{(i)} cdot tau_theta(c),V = W_V^{(i)} cdot tau_theta(c),varphi_i(z_t)是U-Net第i层的中间特征。
2022年8月,Stability AI基于LDM发布了Stable Diffusion,这是一个可以在消费级GPU(8GB显存)上运行的文生图模型。Stable Diffusion的发布引发了开源社区的狂欢,成为AI生成艺术的主流工具。
Stable Diffusion的成功因素包括:
开源开放:Stable Diffusion的模型权重、代码完全开源,任何人都可以免费使用、修改和分发。
低门槛:8GB显存的要求使得大多数消费级GPU都可以运行,降低了使用门槛。
生态丰富:开源社区围绕Stable Diffusion开发了丰富的工具链,包括:
社区活跃:Civitai等社区汇聚了大量用户分享的微调模型和生成作品,形成了活跃的内容生态。
2022年,文生图领域形成了三足鼎立的竞争格局:
可控生成是文生图技术从”玩具”走向”工具”的关键。2023年,ControlNet、LoRA、IP-Adapter等技术的提出,使得用户可以精确控制生成结果。
ControlNet(2023.02):ControlNet通过在U-Net的每一层添加可学习的副本,实现对生成过程的精确控制。ControlNet支持多种控制条件:
ControlNet的训练采用”零卷积”初始化,即新添加的卷积层初始权重为零,确保训练开始时不会破坏预训练模型的能力。
LoRA(Low-Rank Adaptation,2021):LoRA最初是为大语言模型微调提出的,后来被广泛应用于Stable Diffusion的个性化训练。LoRA的核心思想是:在冻结预训练模型参数的情况下,通过低秩矩阵来近似权重的更新。

LoRA低秩适配架构
图9:LoRA架构示意图,展示如何通过低秩矩阵分解实现参数高效微调
具体来说,对于原始权重矩阵W_0,LoRA添加一个低秩分解BA,其中B in mathbb{R}^{d times r},A in mathbb{R}^{r times k},r ll min(d, k)。前向传播变为h = W_0x + BAx。LoRA的训练参数量仅为原始模型的0.1%-1%,但可以实现高质量的个性化生成。
IP-Adapter(2023.08):IP-Adapter(Image Prompt Adapter)允许用户使用图像作为提示来引导生成。IP-Adapter使用CLIP的图像编码器提取参考图像的特征,然后通过解耦的交叉注意力机制注入到扩散模型中。与LoRA需要训练不同,IP-Adapter可以直接使用预训练模型,实现”即插即用”的图像提示功能。扩散模型的技术细节:扩散模型的核心是一个马尔可夫链过程。在前向过程中,模型逐步向数据添加高斯噪声,经过T步后,数据几乎变成纯噪声。在反向过程中,模型学习逐步去噪,从噪声中恢复数据。数学上,前向过程可以表示为:
q(x_t | x_{t-1})= mathcal{N}(x_t; sqrt{1-beta_t} x_{t-1}, beta_t I)
反向过程则学习一个神经网络来预测噪声:
p_theta(x_{t-1} |x_t) = mathcal{N}(x_{t-1}; mu_theta(x_t, t), Sigma_theta(x_t, t))
DDPM的关键发现是,直接预测噪声epsilon比预测原始数据x_0更简单有效。这一简化使得扩散模型的训练变得稳定且高效。
扩散模型vs GAN:相比GAN,扩散模型具有以下优势:
扩散模型的成功标志着生成式AI进入了实用化阶段。从GAN到扩散模型,生成式AI走过了一条从”能生成”到”生成得好”再到”生成得可控”的演进之路。然而,扩散模型的成功主要集中在图像生成领域,如何将这种生成能力扩展到文本、音频、视频等多种模态,成为下一个挑战。这个挑战的答案,将在2023年揭晓。
CLIP实现了图像和文本的语义对齐,但它本质上是一个”对比学习”模型,只能判断图文是否匹配,而无法进行深层次的视觉理解。例如,CLIP可以判断一张图片和”一只猫在沙发上”是否匹配,但无法回答”猫是什么颜色”、”沙发是什么材质”等具体问题。
多模态理解的”最后一公里”在于:如何让大语言模型”看懂”图像,并基于视觉信息进行推理、问答、描述等复杂任务。这一挑战在2023年被攻克。
2023年,学术界和工业界提出了多种多模态大模型架构,核心思想都是将视觉编码器与大语言模型连接起来,让语言模型具备视觉理解能力。

GPT-4V多模态用例
图10:多模态大模型的应用场景,包括图像理解、文档分析、代码生成等
2023年9月,OpenAI发布了GPT-4V(GPT-4 with Vision),这是GPT-4的多模态版本,可以接受图像输入并进行理解和推理。GPT-4V的发布标志着多模态大模型进入了实用化阶段。
GPT-4V展现了以下能力:
GPT-4V的架构细节并未公开,但据推测,它可能采用了类似Flamingo的架构:使用Perceiver Resampler将视觉特征压缩为固定数量的Token,然后与文本Token交错输入LLM。
2023年12月,Google发布了Gemini 1.0,这是Google迄今为止最强大的多模态模型。Gemini从设计之初就是原生多模态的(Natively Multimodal),而非简单地将不同模态的模型拼接在一起。
Gemini 1.0包含三个版本:
Gemini在多模态理解方面取得了多项突破:
2023年,多模态大模型的技术范式逐渐统一:
多模态大模型的成功标志着AI从”单模态理解”走向”多模态理解”。然而,这些模型主要处理静态图像,如何将理解能力扩展到动态视频,成为下一个前沿。这个前沿的突破,将在2024年实现。
视频生成是比图像生成更具挑战性的任务。视频不仅包含空间信息(每帧图像的内容),还包含时间信息(帧与帧之间的运动关系)。早期的视频生成方法主要基于GAN和VAE,但生成的视频存在时长短(通常只有3-4秒)、一致性差(人物或场景在帧间变化)、运动不自然等问题。
Runway Gen-2(2023.06):Runway是AI视频生成领域的先行者。Gen-2基于Stable Diffusion进行扩展,通过添加时序层(Temporal Layers)来建模帧间关系。Gen-2支持文本到视频、图像到视频、视频到视频等多种生成模式,但生成的视频时长仍有限(4秒),且存在明显的闪烁问题。
Pika Labs(2023.11):Pika Labs是另一家AI视频生成初创公司,其产品在视频编辑、风格转换等方面表现突出。Pika采用了混合架构,结合了GAN、VAE和扩散模型的优点。
这些早期探索为后续的技术突破奠定了基础,但真正的革命性突破来自OpenAI的Sora。

生成式AI视频时间线
图11:生成式AI视频发展历程时间线,从早期探索到Sora的突破
2024年2月16日,OpenAI发布了Sora,这是一个能够生成长达60秒、1080p分辨率视频的文本到视频生成模型。Sora的发布震撼了整个AI界和产业界,其生成视频的质量、一致性和物理合理性远超之前的任何模型。
Sora的核心技术创新包括:

Sora架构概览
图12:Sora视频生成架构概览,展示从文本到视频的生成流程
Sora的生成能力代表了视频生成技术的重大突破:
Sora的技术架构细节:Sora的核心是DiT(Diffusion Transformer)架构,这是将扩散模型与Transformer结合的产物。具体来说,Sora首先使用一个视频压缩网络(Video Compression Network)将输入视频压缩到低维潜空间,这个压缩网络类似于VAE,但专门针对视频进行了优化,可以同时压缩空间和时间维度。
然后,Sora将压缩后的视频表示切分为时空Patch(Spacetime Patches)。每个Patch包含了一定空间区域和时间跨度的信息。这些Patch被展平为Token序列,输入到Transformer中进行处理。Transformer的自注意力机制可以捕捉Patch之间的长距离依赖关系,无论是空间上的还是时间上的。
在训练过程中,Sora学习预测在每一步扩散过程中添加的噪声。通过迭代去噪,Sora可以从纯噪声中生成连贯的视频。条件信息(如文本提示)通过交叉注意力机制注入到模型中,引导生成过程。
Sora的发布引发了广泛的产业影响和学术争议:
Sora发布后,国内外多家公司推出了竞争产品:
视频生成技术的突破标志着多模态AI从”静态理解”走向”动态生成”。然而,无论是图像生成还是视频生成,这些模型本质上都是”拼接式”的——不同模态的编码器是独立的,信息在模态间传递时存在损失。如何实现真正的”原生多模态”,成为下一个技术前沿。
在GPT-4o之前,多模态大模型主要采用”拼接式”架构:
这种架构的问题在于:

GPT-4o多模态能力
图13:GPT-4o的多模态能力展示,包括文本、图像、音频、视频的统一处理
2024年5月13日,OpenAI发布了GPT-4o,其中的”o”代表”Omni”(全能)。GPT-4o是OpenAI首个端到端训练的原生多模态模型,可以同时处理文本、图像、音频、视频,并以极低的延迟进行交互。
GPT-4o的核心技术创新包括:
2024年12月11日,Google发布了Gemini 2.0,这是Google迄今为止最强大的AI模型。Gemini 2.0延续了Gemini 1.0的原生多模态设计理念,并在实时交互、多模态推理、工具使用等方面取得了重大突破。
Gemini 2.0的核心创新包括:

Gemini 2.0
图14:Gemini 2.0官方宣传图,展示其多模态实时交互能力
原生多模态相比拼接式多模态具有以下优势:
原生多模态技术的成熟催生了大量应用场景:
原生多模态技术的突破标志着AI从”多模态理解”走向”多模态融合”。然而,无论是原生多模态还是拼接式多模态,这些模型本质上都是”被动响应”的——它们接收输入,然后生成输出,缺乏对世界的主动建模和预测能力。如何实现真正的”世界模型”,成为通往AGI的关键一步。
“世界模型”(World Model)的概念最早可以追溯到1943年。心理学家Kenneth Craik在其著作《The Nature of Explanation》中提出,人类大脑会构建外部世界的内部模型,用于预测未来事件和指导行为。Craik写道:”如果生物体携带一个外部现实的小规模模型,并在其内部运行可能的行动,就可以预测未来事件,从而选择最优行动。”
这一思想深刻影响了认知科学和人工智能领域。2018年,Yann LeCun在IJCAI的演讲中正式将”世界模型”引入AI领域,提出了”基于模型的强化学习”(Model-Based Reinforcement Learning)框架。LeCun认为,真正的智能需要具备以下能力:
LeCun强调,当前的大语言模型(如GPT系列)本质上是”自回归模型”,只能根据历史预测下一个Token,缺乏对世界的深层理解和因果推理能力。真正的世界模型应该能够:

世界模型架构
图15:自回归模型与世界模型的对比,展示世界模型如何通过潜在状态进行预测和规划
当前,世界模型的研究主要分为两大流派:
表征派(LeCun的JEPA)
Yann LeCun主张,世界模型应该学习世界的抽象表征,而非像素级细节。他提出了JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)框架。
JEPA的核心思想是:
JEPA的具体实现包括:
LeCun认为,表征派的优势在于:
生成派(Sora/Genie)
与表征派不同,生成派主张直接在像素空间进行预测和生成。这一流派的代表是OpenAI的Sora和DeepMind的Genie。
Sora(OpenAI,2024):如前所述,Sora是一个视频生成模型,可以生成长达60秒的高质量视频。OpenAI将Sora称为”世界模拟器”,因为它可以模拟物理世界的某些方面(如物体运动、碰撞、光影等)。Genie(DeepMind,2024.02):Genie是一个交互式世界模型,可以从无标签的视频数据中学习可交互的虚拟环境。给定一张静态图像,Genie可以生成一个可交互的游戏世界,用户可以通过键盘控制角色行动。Genie包含三个组件:
生成派的优势在于:
世界模型的核心能力包括:
因果推断:理解”如果…会怎样”(Counterfactual Reasoning)。例如,理解”如果我推这个物体,它会怎样”、”如果我不采取行动,会发生什么”。
物理直觉:理解基本的物理规律,如:
长期规划:基于对未来的预测,制定长期行动计划。例如,为了到达目标,需要采取哪些步骤,每一步的预期结果是什么。
快速学习:从少量样本中学习新技能。人类可以从一次演示中学习一个新任务,世界模型也应该具备这种能力。
世界模型的研究面临诸多挑战和争议:
世界模型被认为是通往通用人工智能(AGI)的关键一步。其潜在路径包括:
世界模型的研究仍处于早期阶段,但它代表了AI发展的终极愿景:让机器像人类一样理解世界、预测未来、制定计划、采取行动。这一愿景的实现,将标志着通用人工智能的真正到来。
世界模型与多模态AI的关系:世界模型可以看作是多模态AI的终极形态。多模态AI关注如何让机器理解和生成多种模态的内容,而世界模型则更进一步,关注如何让机器理解这些模态背后的物理规律和因果关系。
从CNN到ViT,从CLIP到Sora,从GPT-4o到世界模型,多模态AI走过了一条从”感知”到”理解”再到”建模”的演进之路。每一步突破都让我们离真正的智能更近一步。
2025年被业界称为”推理模型元年”。在这一年,各大AI厂商纷纷推出具有深度推理能力的多模态模型,标志着AI从”快速响应”走向”深度思考”。
2025年,视频生成技术迎来了全面爆发期。
Gemini 2.5系列(Google,2025):Google在2025年持续升级Gemini 2.5系列,包括Gemini 2.5 Flash、Gemini 2.5 Pro等版本。5月,Google推出了Gemini Diffusion扩散模型和Gemini 2.5 Pro Deep Think深度思考模式。8月,Gemini 2.5 Flash Image发布,在图像生成领域取得突破。
豆包Seed1.5-VL(字节跳动,2025.05):字节跳动发布了多模态推理模型Seed1.5-VL,在视觉问答、图文匹配等任务上表现出色。
Qwen2.5-Omni(阿里,2025.03):Qwen2.5-Omni是一个全模态模型,支持文本、图像、音频、视频的连续流式处理。其架构分为”思考者”(Thinker)和”说话者”(Talker)两部分,通过TMRoPE位置编码实现同步多模态处理。
2025年,开源多模态模型生态持续繁荣。
2026年2月8日,ViT-5论文发布,标志着视觉Transformer进入现代化新阶段。
ViT-5的核心创新:
ViT-5在ImageNet-1K上,Base模型达到84.2%的top-1准确率,超过DeiT-III-Base的83.8%;Large模型在384×384分辨率下达到86.0%,显著超越之前的ViT架构。
回顾多模态AI十余年的发展历程,可以总结出以下核心规律:
多模态AI的发展历程可以概括为三次技术范式的跃迁:
第一次跃迁:CNN时代(2012-2017)——从手工特征到学习特征
AlexNet的成功证明了深度学习可以自动从数据中学习特征表示,无需人工设计特征提取器。这一跃迁标志着机器学习从”特征工程”走向”表示学习”。
第二次跃迁:Transformer时代(2017-2023)——从模态壁垒到统一架构
Transformer架构首先在NLP领域取得成功,随后通过ViT扩展到视觉领域,再通过CLIP实现图文对齐,最终通过原生多模态模型实现真正的统一。这一跃迁标志着AI从”单模态专家”走向”多模态通才”。
第三次跃迁:原生多模态与世界模型时代(2024-♾️)——从拼接融合到端到端统一
GPT-4o和Gemini 2.0代表的原生多模态,以及Sora、JEPA代表的世界模型,标志着AI从”拼接式多模态”走向”端到端统一”,再到seedance2.0和see dream5.0的开年王炸,这一跃迁将为通往AGI铺平道路。
多模态AI的发展历程,是人类不断拓展认知边界、追求智能本质的生动写照。从CNN到世界模型,每一步突破都凝聚着无数研究者的智慧与汗水。我们有理由相信,在不远的将来,多模态AI将成为人类探索世界、创造未来的强大工具,为人类社会带来前所未有的变革。
1. Krizhevsky, A., Sutskever, I., & Hinton, G. E. (2012). ImageNet classification with deep convolutional neural networks. NeurIPS.
2. Goodfellow, I., et al. (2014). Generative adversarial nets. NeurIPS.
3. Dosovitskiy, A., et al. (2020). An image is worth 16×16 words: Transformers for image recognition at scale. ICLR.
4. Radford, A., et al. (2021). Learning transferable visual models from natural language supervision. ICML.
5. Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. NeurIPS.
6. Rombach, R., et al. (2022). High-resolution image synthesis with latent diffusion models. CVPR.
7. Liu, H., et al. (2023). Visual instruction tuning. NeurIPS.
8. OpenAI. (2024). Video generation models as world simulators. Technical Report.
9. LeCun, Y. (2022). A path towards autonomous machine intelligence. Open Review.
10. Assran, M., et al. (2023). Self-supervised learning from images with a joint-embedding predictive architecture. CVPR.
本文由 @卡萨丁AI 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。