


















link
时间:2025.10
单位:ByteDance SAIL
相关领域:多模态特征学习
SAIL-Embedding:
1.使多模态检索与分类支持任意模态;
2.引入动态难负样本挖掘与多数据源动态采样提升训练稳定性与规模;
同时,多阶段训练从多方面提升了多模态表征学习的有效性:
1.context-aware训练 -> 增强在各下游任务的动态适应性
2.collaboration-aware推荐训练 -> 通过sequence-to-item与ID-to-item embedding的蒸馏策略,提升推荐场景下多模态表征能力
SAIL-Embedding的功能

SAIL-Embedding支持更多模态输入

针对于所有[0, 1]之间的\(\lambda\),针所有样本对计算F1,并且F1的求和 (因为每个样本对是正的还是负的其实已知),找一个最大的F1对应的\(\lambda\)就是此时的动态阈值\(\lambda^*\)。

\(s_{ij}\)是低于\(\lambda^*\),但与q有最高相似度的样本。
![]()

之前方法数据采样都是手工设定
动态多源采样处理方法:
整体架构图

Instruction模板

Q:Text Tokenizer是什么算法?输入输出是什么?
Vision Encoder:将分辨率resize到固定,对于高分辨率或者视频数据而言tokens数量庞大
Visual Perceiver: 将visual tokens外加16个可学习的Query tokens,通过该子网络后提取出这个16浓缩后的tokens,从而降低下降融合时的tokens计算量,所以这里Query tokens与搜索领域所说的用户query不是一会事。
使用CLAP模型,比Whisper速度更快,模型结构与预训练方法上比较像CLIP。

简单而言:多模态token concat -> attention聚合 -> Tanh非线性激活 -> MeanPool => 融合后的多模态token
这种Fusion方式与VLM2Vec中取最后一层最后一个token的方式不一致,哪种方法更好呢?


大规模数据预训练 => 下游任务Finetune => 构造难负样本集进一步Refine
![]()
使用的MRL NCE Loss,MRL全称为Matryoshka Representation Learning,该操作会将1536维embedding切出多个子vector例如128d与768d,这些向量同时做NCE Loss。
![]()
参考苏神的博客。为了解决直接优化绝对余弦相似度(如设定正样本对相似度为1,负样本对为0)所带来的问题。其核心创新在于将学习目标从拟合绝对分数转变为学习相对顺序。参考下述公式,关键在于求和条件 sim(i,j)>sim(k,l)。它并不关心sim(i, j)和sim(k, l)的具体数值是多少,只关心它们之间的大小关系。

Q:在计算Loss时,我怎么知道sim(i, j)与sim(k, l)之间的相似度关系呢?
mICL全称为multimodal In-Context Learning,即为每种模态单独计算NCE Loss。
![]()
全称为Late Fusion,通过门控融合机制保护视觉信息的完整性,防止在多模态融合过程中视觉语义被文本信息主导。

故名思义,随机特定数据集训练。之前工作都是将多个数据源混合少量样本训练,这么做增加了梯度估计的方差,使训练不稳定。本工作改为每次随机选择一个数据集,并仅从该数据集中采样构建一个完整的训练批次,提升训练效率和模型在各数据集上的专业化性能。
Sequence-to-Item Distillation
在用户历史1k次搜索视频序列中,过滤出它主动交互的行为,将最近一次的序列中item设计为目标视频,由些可以构造一个蒸馏训练方法,参考Figure7 a。
ID-to-Item Distillation

参考Figure7b
Q:图中的Query Item与Target Item分别指得是什么?
- Query Item的embedding:指通过SAIL-Embedding多模态模型计算得到的表征。它融合了物品的视觉、文本、音频等内容信息,代表的是该物品的内容语义特征。
- Target Item的embedding:指同一Item在现有推荐系统中已有的、基于协同过滤(如用户行为序列)学习到的ID表征。它代表的是该物品的用户协作特征。
Q:图中下方ID1/ID2/ID3指得是什么?
该Item的ID(如视频ID、作者ID),从推荐系统的嵌入表中查找出对应的ID1, ID2, ID3等embedding,它们通过Feature Projection映射成Target Item的协作表征。典型的ID有以下可能的类别:


Ablation Study

Q:i2i, q2i这两个任务为什么要分开评测(不都是多模态检索任务吗)?
表征需求不同:i2i(item2item)需要强大的跨模态融合能力,q2i(query2item)需要优秀的文本-多模态对齐能力
很详实的工作,共20页的内容,分享了很多实战的干货,实验结果也很充分。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。