一、论文基本信息
论文题目:Multimodal Deep Learning
作者:Jiquan Ngiam、Aditya Khosla、Mingyu Kim、Juhan Nam、Honglak Lee、Andrew Y. Ng
发表会议:ICML 2011
研究模态:音频与视频
研究任务:视听语音识别、跨模态特征学习、共享表示学习
这篇论文发表于2011年,模型主体仍然是受限玻尔兹曼机、深度信念网络和深度自编码器。虽然这些结构现在已经不再是多模态研究的主流,但论文提出的问题却一直延续到了今天:
不同模态应该如何融合?
一个模态能否帮助另一个模态学习更好的表示?
不同模态能否映射到统一的语义空间?
当某个模态缺失时,模型能否继续工作?
论文以音频和嘴部视频为研究对象,系统讨论了多模态融合、跨模态学习和共享表示学习三种基本设置,是深度多模态表示学习领域的早期代表性工作。
二、论文要解决什么问题?
在视听语音识别中,同一句话可以同时通过两种方式被观察:
音频记录说话者发出的声音;
视频记录嘴唇的形状和运动。
音频和视频描述的是同一个发音过程,但两者的数据形式完全不同。
音频通常表示为波形或频谱,视频则由连续图像帧组成。原始频谱数值与嘴部像素之间并不存在直接的一一对应关系,真正的联系出现在更高层的语义结构中:
音频中的音素模式;
视频中的嘴型和嘴部运动;
音素与嘴型之间的对应关系。
论文将这种关系称为一种“中层相关性”。模型不能只在原始音频和原始像素之间进行简单匹配,而需要先学习每个模态的中层表示,再建立不同模态之间的关联。
论文的核心目标可以概括为:
利用深度网络从音频和视频中学习联合表示,使不同模态能够相互补充、相互监督,并在一定程度上共享语义空间。
三、为什么多模态学习不能只是简单拼接?
最直接的多模态融合方式,是分别提取音频特征和视频特征,然后将两者拼接起来送入分类器。
音频特征和视频特征虽然被放入了同一个向量,但这并不意味着模型真正理解了两种模态之间的关系。
简单拼接主要存在三个问题。
1. 没有显式建立跨模态对应关系
拼接操作只是在特征维度上进行组合,并没有告诉模型:
哪种嘴型对应哪种声音;
哪些视觉变化与发音有关;
哪些视觉信息只是背景或个体外观;
哪些音频与视觉特征表达相同的语义。
2. 不同模态的判别能力并不相同
在干净环境中,音频通常已经足以完成语音分类。此时直接加入较弱的视频特征,可能增加噪声,反而降低识别效果。
3. 跨模态关系通常是非线性的
音频频谱和嘴部像素之间不存在简单的线性映射。只有先经过非线性特征提取,将原始数据转化为音素、嘴型等中层表示,模型才更容易发现不同模态之间的关系。
论文的实验也表明,简单拼接音频特征与视频特征,并不一定优于单独使用音频;真正有效的是学习能够补充音频信息的多模态表示。
四、论文定义的三种多模态学习设置
这篇论文最重要的贡献之一,是将多模态学习过程划分为三个环节:
无监督特征学习;
有监督分类器训练;
模型测试。
根据三个环节中可用模态的不同,论文定义了三种学习设置。
| 学习设置 | 特征学习 | 分类器训练 | 测试 | 研究目标 |
|---|---|---|---|---|
| 多模态融合 | 音频+视频 | 音频+视频 | 音频+视频 | 综合利用不同模态 |
| 跨模态学习 | 音频+视频 | 单一模态 | 同一单一模态 | 利用辅助模态改善目标模态表示 |
| 共享表示学习 | 音频+视频 | 一种模态 | 另一种模态 | 检验表示是否具有模态不变性 |
这三种设置看起来相近,但研究的问题并不相同。
五、多模态融合:同时使用音频和视频
多模态融合是最常见的设置。在特征学习、分类训练和测试时,音频与视频都可以使用。
例如,在语音识别中:
音频提供频率、音调和发音内容;
视频提供嘴唇形状、发音位置和嘴部运动;
两者共同完成识别。
这种方法的优势主要出现在某个模态受到干扰时。
当音频清晰时,视频可能只能提供有限的额外信息;当音频受到噪声影响时,嘴部视频就可以帮助模型区分声音相近但发音位置不同的内容。
因此,多模态融合并不是“模态越多越好”,而是要看新模态是否能够提供与原有模态互补的信息。
六、跨模态学习:训练时使用多个模态,测试时只使用一个模态
跨模态学习中,音频和视频只在无监督特征学习阶段同时出现。
以视觉唇读为例:
| 环节 | 可用数据 |
|---|---|
| 特征学习 | 音频+视频 |
| 分类器训练 | 只有视频 |
| 测试 | 只有视频 |
这里的研究问题是:
即使部署时不能使用音频,训练阶段加入音频,能否帮助模型学习更好的视频表示?
音频在最终推理时并不存在,而是作为训练阶段的辅助监督。
普通视频自编码器只需要根据视频恢复视频,因此可能保留大量与语音内容无关的信息,例如:
人脸纹理;
光照变化;
说话者外观;
背景变化;
摄像机噪声。
如果模型不仅要根据视频重构视频,还要根据视频预测对应音频,那么视频表示就必须重点保留与发音相关的信息,例如嘴巴开合、唇部运动和发音时序。
因此,音频在这里相当于一个训练期的“教师模态”,帮助视频模型过滤无关视觉信息。
七、共享表示学习:在一种模态上训练,在另一种模态上测试
共享表示学习比跨模态学习更加严格。
以“听声音学习,通过嘴型测试”为例:
| 环节 | 可用数据 |
|---|---|
| 特征学习 | 音频+视频 |
| 分类器训练 | 只有音频 |
| 测试 | 只有视频 |
分类器在训练时只学习数字“1”“2”“3”听起来是什么样,测试时却要根据嘴部视频判断说的是哪个数字。
论文将这种设置形象地称为:
Hearing to See,即“通过听来学习,再通过看来识别”。
反向设置则是:
Seeing to Hear,即“通过看来学习,再通过听来识别”。
如果模型能够完成这种任务,说明音频与视频在特征空间中已经形成了一定程度的共享表示。
这一设置与今天的跨模态检索、零样本迁移和统一嵌入空间非常相似。
八、模型基础:稀疏受限玻尔兹曼机
论文使用稀疏受限玻尔兹曼机,也就是Sparse RBM,作为深度网络的基础模块。
RBM包含两类变量:
可见变量,用来接收输入数据;
隐藏变量,用来学习潜在特征。
给定输入 v,隐藏单元的激活概率可以写为:
其中,表示输入到第 j个隐藏单元的权重,
是偏置,
用于控制高斯可见变量的尺度。
论文还对隐藏单元增加稀疏约束,使大部分隐藏单元在一个样本上保持不激活,只有少量单元响应特定的声音或嘴型模式。
从现代视角理解,RBM在本文中的作用类似于一个无监督编码器:
音频RBM负责学习音频特征;
视频RBM负责学习嘴部运动特征;
高层网络负责学习两个特征空间之间的关系。
九、从浅层模型到深层多模态表示
论文没有直接给出最终模型,而是从几种基础结构逐步说明为什么需要深度多模态自编码器。
1. 分别训练音频和视频RBM
最简单的方法是为音频和视频分别训练一个RBM。
音频经过音频RBM得到音频表示,视频经过视频RBM得到视频表示。
这种方法能够学习单模态特征,但两个模型彼此独立,无法发现音频与视频之间的对应关系。
2. 浅层双模态RBM
第二种方法是将音频和视频同时输入一个RBM,使两种模态共享同一层隐藏单元。
理论上,共享隐藏层应该同时响应声音和嘴型。
但论文发现,浅层双模态RBM学到的隐藏单元通常只连接一个模态:
一部分单元主要响应音频;
另一部分单元主要响应视频;
真正同时连接音频和视频的单元很少。
这是因为原始音频频谱与原始视频像素之间的关系过于复杂,单层非线性变换很难直接发现这种中层对应关系。
3. 双模态深度信念网络
为了解决浅层模型的问题,论文首先分别训练音频和视频的底层表示,然后在两个底层表示之上训练新的共享层。
这一过程可以理解为:
音频输入经过底层网络得到类似音素的表示,视频输入经过底层网络得到类似嘴型的表示,高层网络再学习音素与嘴型之间的对应关系。
论文认为,跨模态关系在经过一层非线性转换以后会更容易学习。第一层负责消除原始模态形式上的巨大差异,第二层负责发现更高层的语义关联。
但是,双模态深度信念网络仍然存在两个问题:
第一,它没有显式要求模型一定要学习跨模态关系。模型仍然可能分别使用一组单元处理音频,另一组单元处理视频。
第二,当测试时缺少一个模态,需要对未观察模态进行概率推断,使用起来比较复杂。
因此,作者进一步提出了深度自编码器结构。
十、核心模型一:Video-Only Deep Autoencoder
Video-Only Deep Autoencoder可以翻译为“仅视频输入的深度自编码器”。
需要注意,这个模型并不是只重构视频,而是:
输入只有视频,输出同时重构视频和音频。
设视频输入为 v,编码器产生中间表示:
然后使用两个解码分支分别重构视频和音频:
模型的训练目标可以简化表示为:
第一项要求模型保留视频自身的信息,第二项则要求视频表示包含能够预测音频的信息。
这意味着隐藏表示不能只记住嘴唇颜色、人脸纹理和背景,而必须保留与发音真正相关的嘴部动作。
论文也将这一模型视为一种多任务学习:
一个任务是视频重构;
另一个任务是跨模态音频重构;
两个任务共享同一个视频编码器。
这一设计体现了论文最重要的思想之一:
辅助模态不一定要在部署时出现,它也可以只在训练阶段为目标模态提供监督。
十一、核心模型二:Bimodal Deep Autoencoder
Video-Only Deep Autoencoder只适用于视频输入。如果希望一个模型同时支持以下情况:
只有音频;
只有视频;
音频和视频同时存在;
就需要训练一个更加统一的模型。
论文为此提出Bimodal Deep Autoencoder,即双模态深度自编码器。
模型同时接收音频和视频,并通过共享中间层重构两种模态。
为了让模型能够适应模态缺失,作者构造了三类训练样本:
| 训练样本类型 | 音频输入 | 视频输入 | 重构目标 |
|---|---|---|---|
| 完整多模态样本 | 有 | 有 | 音频+视频 |
| 音频单模态样本 | 有 | 置零 | 音频+视频 |
| 视频单模态样本 | 置零 | 有 | 音频+视频 |
三种样本各占训练数据的大约三分之一。即使输入中缺少一个完整模态,模型仍然需要重构音频和视频。
这种方法与去噪自编码器非常相似。
普通去噪自编码器随机破坏部分输入,再要求模型恢复原始数据;本文则直接删除完整模态,再要求模型根据剩余模态恢复全部信息。
从今天的视角看,这种方法可以被理解为早期的:
模态级Dropout;
缺失模态学习;
跨模态补全;
多模态去噪训练;
掩码模态建模。
十二、完整训练流程
论文的训练过程可以概括为以下几个环节。
1. 音频预处理
音频被转换为频谱,并加入时间差分特征。每个音频帧最初为483维,经过PCA白化降至100维。模型每次使用连续10个音频帧作为输入。
2. 视频预处理
视频首先提取嘴部区域,将嘴部图像统一缩放至 (60\times80),然后通过PCA白化降至32维,同时加入时间差分特征。
模型每次输入4个连续视频帧,其时间长度与10个音频帧大致对应。
3. 单模态RBM预训练
分别训练音频RBM和视频RBM,让两个模态先学习各自的底层表示。
4. 高层联合表示学习
将音频和视频的底层特征组合起来,在其上训练新的共享隐藏层。
5. 展开为深度自编码器
利用RBM参数初始化编码器和解码器,并通过重构误差进行整体微调。
6. 提取中间层特征
训练完成后,取自编码器中间层作为新的音频、视频或多模态表示。
7. 使用线性SVM完成分类
论文最终使用简单的线性SVM进行字母和数字分类。
这样做的目的,是让实验结果主要反映特征表示的质量,而不是复杂分类器带来的性能差异。
十三、实验数据集
论文使用了多个视听语音数据集进行无监督特征学习和有监督分类。
1. CUAVE
CUAVE包含36位说话者,每人朗读数字0到9,每个数字重复5次。
论文使用正面说话的正常视频部分,并采用说话者独立划分:
偶数编号说话者用于训练;
奇数编号说话者用于测试。
2. AVLetters
AVLetters包含10位说话者,每人朗读字母A到Z,每个字母重复3次。
该数据集提供提前提取的嘴部区域,但没有原始音频,因此主要用于纯视觉唇读实验。
3. AVLetters2
AVLetters2包含5位说话者,每人朗读字母A到Z七次。论文只将其用于无监督特征学习。
4. Stanford自建数据集
作者另外采集了23名志愿者朗读数字、字母和部分句子的音视频数据,用于无监督训练。
5. TIMIT
TIMIT只包含语音,论文使用它预训练音频特征。
十四、实验一:跨模态学习能否改善视觉唇读?
这一实验研究的问题是:
最终只有视频输入时,特征学习阶段加入音频,能否改善视频分类能力?
AVLetters实验结果
| 特征表示 | 分类准确率 |
|---|---|
| 预处理视频特征 | 46.2% |
| 视频RBM | 54.2% |
| Video-Only Deep Autoencoder | 64.4% |
| Bimodal Deep Autoencoder | 59.2% |
| Local Binary Pattern | 58.85% |
Video-Only Deep Autoencoder达到64.4%,明显高于只使用视频训练的RBM,也超过了当时论文中列出的已有视觉特征方法。
这说明,即使AVLetters本身没有音频,模型仍然可以利用其他数据集中的同步音频和视频学习跨模态关系,再将这种表示迁移到纯视觉唇读任务。
CUAVE视觉识别结果
| 特征表示 | 分类准确率 |
|---|---|
| 预处理视频特征 | 58.5% |
| 视频RBM | 65.4% |
| Video-Only Deep Autoencoder | 68.7% |
| Bimodal Deep Autoencoder | 66.7% |
在CUAVE上,Video-Only Deep Autoencoder同样优于普通视频RBM。
不过,论文的方法没有超过所有已有系统。部分已有方法使用了更复杂的人脸跟踪、姿态校正和嘴部配准,而本文只使用较简单的嘴部区域提取,因此不同结果不能完全直接比较。
为什么统一双模态模型不如视频专用模型?
一个值得注意的现象是,Bimodal Deep Autoencoder在纯视觉任务中不如Video-Only Deep Autoencoder。
原因在于,视频专用模型只需要学习:
视频自身信息;
能够从视频预测音频的信息。
而双模态模型需要同时表示:
音频特有信息;
视频特有信息;
两个模态共有的信息;
不同模态缺失时的补全能力。
因此,统一模型的表示容量被分配到了更多目标上,不一定最适合纯视觉分类。论文也明确指出,通用双模态表示不一定是单模态任务上的最优表示。
这一现象至今仍然存在:
表示越通用,不代表它在每个具体任务上都一定优于专用表示。
十五、实验二:多模态融合是否能提高抗噪能力?
论文在CUAVE上分别测试了干净音频和加入0 dB高斯白噪声的音频。
| 特征表示 | 干净音频 | 噪声音频 |
|---|---|---|
| Audio RBM | 95.8% | 75.8% |
| Video-Only Deep Autoencoder | 68.7% | 68.7% |
| Bimodal Deep Autoencoder | 90.0% | 77.3% |
| Bimodal特征+Audio RBM | 94.4% | 82.2% |
| Video特征+Audio RBM | 87.0% | 76.6% |
在干净环境下,音频本身已经具有很强的判别能力,Audio RBM达到95.8%。加入双模态表示后,准确率反而略有下降。
但在噪声环境下:
纯音频特征为75.8%;
普通视频与音频组合为76.6%;
学习到的双模态特征与音频特征组合达到82.2%。
这说明视频信息在音频受到破坏时具有明显的补充作用,但简单拼接并不能充分发挥这种优势。模型需要学习与音频真正互补的多模态表示。
这个实验得到三个重要结论。
第一,多模态信息并不总是有益
当一个模态已经足够可靠时,加入较弱模态可能产生负迁移。
第二,多模态优势通常在单模态退化时更加明显
噪声使音频信息不可靠后,视觉信息的价值才充分体现出来。
第三,学习融合比简单拼接更加重要
直接组合音频和视频特征,只是将不同信息放在一起;双模态表示学习则尝试提取二者真正互补的部分。
十六、实验三:模型是否表现出麦格克效应?
麦格克效应是一种经典的视听语音感知现象。
当人看到的嘴型像是在说/ga/,但听到的声音是/ba/时,很多人会感知成/da/。
作者使用23名志愿者朗读/ga/、/ba/和/da/,并用双模态深度自编码器特征训练三分类器。
| 视觉与音频组合 | 预测为/ga/ | 预测为/ba/ | 预测为/da/ |
|---|---|---|---|
| 视觉/ga/+音频/ga/ | 82.6% | 2.2% | 15.2% |
| 视觉/ba/+音频/ba/ | 4.4% | 89.1% | 6.5% |
| 视觉/ga/+音频/ba/ | 28.3% | 13.0% | 58.7% |
当视觉输入和音频输入一致时,模型大部分时间能够预测正确类别。
当视觉输入为/ga/、音频输入为/ba/时,模型有58.7%的概率预测为/da/。虽然输入中并没有出现/da/,共享表示却产生了类似人类麦格克效应的分类结果。
这说明模型并不是完全独立地处理音频和视频后进行简单投票,而是在中间表示中形成了一定程度的跨模态交互。
当然,这一结果只能说明模型表现出了类似现象,不能据此认为它具有与人类相同的认知机制。
十七、实验四:共享表示能否实现跨模态分类?
共享表示实验进一步提高了难度。
模型在一种模态上训练分类器,在另一种模态上进行测试。
| 分类器训练模态 | 测试模态 | 方法 | 准确率 |
|---|---|---|---|
| 音频 | 视频 | Raw-CCA | 41.9% |
| 音频 | 视频 | RBM特征+CCA | 57.3% |
| 音频 | 视频 | Bimodal Deep Autoencoder | 30.7% |
| 视频 | 音频 | Raw-CCA | 42.9% |
| 视频 | 音频 | RBM特征+CCA | 91.7% |
| 视频 | 音频 | Bimodal Deep Autoencoder | 24.3% |
随机猜测准确率为10%。
这个实验最值得注意的地方是:
最优结果并不是双模态深度自编码器,而是“单模态RBM特征+CCA”。
CCA,即典型相关分析,负责寻找两组变量之间相关性最大的线性投影。
在原始音频和视频上直接使用CCA,效果已经明显高于随机猜测;先使用RBM进行非线性特征提取,再通过CCA进行线性对齐,性能进一步大幅提高。
论文据此得到一个重要判断:
音频与视频之间的关系至少需要经过一次非线性特征变换;当两个模态都得到较好的中层表示后,简单的线性方法也可以有效完成跨模态对齐。
这一思想与现代双编码器非常接近:
视觉编码器负责将图像映射为高层表示;
文本或音频编码器负责将另一模态映射为高层表示;
对齐目标再将不同模态拉入共享空间。
十八、控制实验:性能提升究竟来自哪里?
为了判断Video-Only Deep Autoencoder的改进来自网络深度还是跨模态重构,论文进行了两组控制实验。
1. 去掉音频重构目标
模型只根据视频重构视频,不再预测音频。
结果显示:
CUAVE准确率下降7.7个百分点;
AVLetters准确率下降14.3个百分点。
这说明音频重构目标确实为视频表示提供了有效的跨模态监督。
2. 将深度模型替换为浅层模型
模型仍然从视频重构音频和视频,但只使用一个隐藏层。
结果显示:
CUAVE准确率下降2.1个百分点;
AVLetters准确率下降5.0个百分点。
因此,论文方法的有效性来自两个方面:
跨模态监督帮助模型提取更有语义的特征,深层非线性结构帮助模型发现复杂的模态对应关系。
十九、论文的核心贡献
1. 系统区分三种多模态学习范式
论文明确区分了:
多模态融合;
跨模态学习;
共享表示学习。
这比单纯提出一个模型结构更有影响力,因为这三类问题后来一直是多模态研究的重要组成部分。
2. 证明辅助模态可以改善目标模态表示
音频不需要出现在最终测试阶段,也可以在特征学习阶段帮助视频学习更好的嘴型表示。
这种思想与今天的跨模态蒸馏和训练期特权信息非常相似:
训练时使用更多模态;
部署时只保留成本较低或更容易获得的模态。
3. 提出了缺失模态鲁棒训练方式
论文随机删除完整音频或视频,并要求模型重构两个模态。这种模态级去噪训练,是后来Modality Dropout、缺失模态补全和掩码多模态学习的早期雏形。
4. 尝试构建模态无关的共享空间
通过“音频训练、视频测试”和“视频训练、音频测试”,论文直接检验了表示是否能够跨模态迁移。这与现代跨模态检索和零样本迁移所依赖的共享嵌入空间具有相同的问题本质。
5. 证明学习融合优于简单拼接
实验表明,直接增加模态并不一定提升性能。有效的多模态模型必须回答:
哪些信息是不同模态共有的?
哪些信息是相互补充的?
哪些信息只是模态特有噪声?
当模态质量变化时,应该依赖哪个模态?
二十、论文带来的重要启示
1. 多模态学习的核心不是模态数量,而是模态关系
模型同时输入音频和视频,并不代表它真正完成了多模态学习。
真正重要的是:
模型是否找到了共享语义;
一个模态能否预测另一个模态;
不同模态能否相互补充;
某个模态缺失后模型能否继续工作。
2. 跨模态监督能够过滤单模态噪声
普通视频重构会保留所有有助于恢复图像的信息。跨模态重构则会促使模型优先保留那些既能解释视频、又能预测音频的信息。因此,音频实际上为视觉表示提供了一个语义筛选条件。
3. 不同模态之间的帮助通常是不对称的
论文发现,音频能够明显改善视频表示,但视频没有明显改善干净音频的分类效果。原因是音频本身对语音内容具有很强的判别能力,而嘴型只能提供部分发音信息。现代多模态系统中同样存在这种不对称性。语言可以为视觉提供丰富语义,但视觉未必能够以同样程度改善语言建模。
4. 共享表示和任务专用表示之间存在权衡
更合理的多模态表示应同时包含共享信息和模态特有信息:
共享部分负责模态对齐和跨模态迁移,特有部分负责保留每种模态独有的判别信息。如果过度强调模态不变性,模型可能丢失有价值的模态特有信息;如果只保留模态特有信息,则无法建立统一语义空间。
二十一、论文的局限性
1. 模型结构已经不再主流
论文依赖RBM、深度信念网络、逐层贪心预训练和线性SVM。现代方法通常使用CNN、Transformer或端到端神经网络。不过,模型结构过时并不影响论文提出的问题和学习范式。
2. 数据规模较小
实验主要是数字、字母和少量音节识别,数据规模与现代互联网图文、长视频和大规模音频数据相差很大。因此,论文证明的是方法思想,而不是大规模开放场景中的通用性能。
3. 依赖大量人工预处理
视频需要提前检测嘴部区域,并通过PCA压缩;音频也需要转换为频谱并进行PCA白化。模型没有端到端学习人脸检测、嘴部定位、音频前端和多模态对齐。
4. 重构目标可能保留过多低层信息
完整重构音频和视频,会要求模型保留大量输入细节,而分类任务真正需要的可能只是高层语义。现代多模态方法更多采用:
对比学习;
图文匹配;
掩码预测;
文本生成;
指令微调。
这些目标往往比像素或频谱重构更直接地面向语义。
5. 共享表示模型并没有取得最优结果
在跨模态分类中,双模态深度自编码器明显低于RBM特征加CCA。这说明论文提出的统一自编码器虽然能够学习部分共享表示,但还没有充分解决模态对齐与模态专用信息分离的问题。
6. 缺失模态处理方式比较简单
论文直接将缺失模态设为全零。这种方式与真实环境中的模态退化并不完全相同。现实中的音频可能是低信噪比,视频可能是模糊、遮挡或丢帧,而不一定完全消失。现代方法通常还会使用:
可学习的缺失模态标记;
模态掩码;
不确定性建模;
概率生成和补全;
不同程度的模态退化训练。
二十二、与现代多模态模型的联系
| 本文中的思想 | 现代方法中的对应形式 |
|---|---|
| 音频与视频独立编码 | 模态专用编码器 |
| 高层共享表示 | 统一多模态嵌入空间 |
| 视频预测音频 | 跨模态预测与跨模态蒸馏 |
| 随机删除完整模态 | Modality Dropout |
| 音频训练、视频测试 | 跨模态零样本迁移 |
| RBM特征+CCA | 双编码器+对比学习 |
| 双模态重构 | 掩码多模态建模 |
| 噪声音频下使用视频 | 鲁棒多模态融合 |
与CLIP的联系
CLIP同样希望将不同模态映射到统一空间。本文主要通过跨模态重构和CCA建立联系,而CLIP通过对比学习:
拉近匹配图像和文本;
推远不匹配图像和文本。
两者使用的模型和训练目标不同,但都在研究同一个基础问题:
不同模态如何形成可以相互比较的共享语义表示?
与多模态大模型的联系
现代多模态大模型通常由视觉编码器、连接模块和大语言模型组成。它们不再重构原始图像,而是通过文本生成、视觉问答和指令微调学习图像与语言的关系。不过,本文提出的问题仍然没有消失:
不同模态应该在哪一层融合?
模型是否真正使用了视觉信息?
一个强模态是否压制了另一个模态?
某个模态缺失时模型是否稳定?
共享表示是否损害模态特有信息?
二十三、总结
《Multimodal Deep Learning》的主要价值,并不在于它提出了一套今天仍需直接使用的RBM模型,而在于它较早系统回答了多模态学习中的三个基础问题。
1. 多个模态能否提高任务性能?
可以,但前提是不同模态具有互补信息,并且模型能够学习有效的融合关系。简单拼接不一定有效。
2. 一个模态能否帮助另一个模态学习?
可以。论文通过“输入视频、同时重构视频和音频”,使音频成为视觉表示学习的辅助监督,从而提高了纯视觉唇读性能。
3. 不同模态能否进入共享语义空间?
可以达到一定程度。模型能够在一种模态上训练、在另一种模态上测试,但实验也说明,共享表示学习仍然比普通多模态融合更加困难。
整篇论文最核心的思想可以概括为:
多模态学习不是把多种数据简单放在一起,而是利用不同模态之间的关联,学习能够保留共享语义、利用互补信息并支持跨模态迁移的表示。
从后来的跨模态检索、对比学习,到视觉语言预训练和多模态大模型,这篇论文提出的问题始终处于多模态研究的核心位置。