多模态和迁移学习
Cross-modal dynamic convolution for multi-modal emotion recognition
一、研究背景与痛点
- 多模态情感识别(MER)= 视觉(人脸)+ 声学(语音)+ 文本(词级)。
- 现实场景两大难题:
① 时序未对齐——不同传感器采样率不同,情绪线索在不同模态里“错位”出现;
② 情绪线索稀疏——一条 5 s 的片段里真正“带情绪”的帧/词只占一小段。 - 现有方案
- 早期融合:直接 concat → 要求严格对齐,未对齐就失效;
- 晚期融合:各模态单独提特征再投票 → 无法挖掘跨模态交互;
- 混合融合(MulT 等):用 cross-modal attention 建模全局交互,但计算二次方、易被大量无关信息淹没。
二、核心创新(一句话记住)
“把‘局部+动态’卷积搬进跨模态场景,让网络只看邻域、只看相关,既省算力又抗噪声。”
| 创新点 | 与传统 cross-modal attention 差异 |
|---|---|
| ① Cross-modal Dynamic Convolution (CDC) | 感受野局部(band matrix)→ O(T) 复杂度;attention 全局→ O(T×S) |
| ② 启发式时序对齐先验 | 无需外部强制对齐,用“窄窗口”+ 零填充自动允许微小错位 |
| ③ CNN-Style Inter-Modal Interaction Layer | 去掉 Transformer 里大量 LN/FC/Shortcut,层数更浅、训练更稳 |
三、方法论(对应原文 §3)
-
问题形式化
输入:未对齐序列 X_M ∈ ℝ^{t_M×d_M},M∈{L,V,A}
输出:情绪标签 O∈ℝ^n(多任务多标签) -
总览流水线(图 3)
特征提取 → 1D-Conv 统一维度 → Inter-Modal Interaction Module(CDC 核心)→ Self-Attention 精炼 → 末端 concat → FC 预测 -
Cross-modal Dynamic Convolution(CDC)公式
以 S→T 为例(源模态指导目标模态):O_T = softmax(TM(X_T·W_KT)) · (X_S·W_KS)- TM:band-matrix 重排函数 → 只保留对角线附近 k 条带(kernel size=9/11/19 可调)
- 动态核:由目标模态 X_T 实时生成,一帧一核,实现“动态局部对齐”
- 复杂度:O(T·k) ≈ O(T),而 attention 是 O(T·S)
-
多方向融合
3 模态 ⇒ 6 条方向(L→V, L→A, V→L, V→A, A→L, A→V)各给一个 IIM(Inter-Modal Interaction Module),可堆叠 N=4 层。
四、实验设置
| 数据集 | 模态 | 对齐方式 | 指标 |
|---|---|---|---|
| IEMOCAP | L+V+A | word-aligned / unaligned | Acc, F1(4 类情绪) |
| CMU-MOSEI | L+V+A | word-aligned / unaligned | Acc, F1(6 类情绪) |
- 特征:GloVe 300d + Facet 35 AU + COVAREP 74d
- 对比基线:MulT、Graph-MFN、RMFN、MFM、EF/LF-LSTM 等 10 余个
五、关键结果(一句话总结)
| 设置 | 数据集 | 本文最佳 | MulT 重跑 | 提升 | 推理速度 |
|---|---|---|---|---|---|
| unaligned | IEMOCAP | 75.5 % Acc | 74.7 % | +0.8 pp | ↓20 % |
| unaligned | MOSEI | 82.0 % Acc | 81.6 % | +0.4 pp | ↓20 % |
| 参数量 | - | 1.2 M | 1.6 M | ↓25 % | - |
- 消融:去掉 CDC 掉 3-4 pp;kernel=11、层数=4 性价比最高。
- 扩展:直接搬到多模态情感分析(sentiment)仍与 MulT 打平。
六、学术与工程意义
-
理论
- 首次把“动态卷积”从单模态 NLP 推广到跨模态、未对齐、稀疏情绪序列,给出局部-band 先验的数学形式。
- 证明“局部+动态”可在情绪任务上替代全局 attention,为后续高效 MER 提供新范式。
-
工程
- CNN-Style 层训练更稳(PreLN/PostLN 都能收敛),无需小心初始化。
- 模型小 25 %、推理快 20 %,手机端实时 MER 成为可能。
-
未来
- 用可学习 temporal offset(可变形卷积思路)替换启发式 band 先验;
- 与近期 2024-25 Cross-Modal Mamba / Dynamic KAN 结合,进一步线性化复杂度。
“情绪线索稀疏又错位?→ 用目标模态实时生成局部卷积核,只让相关邻域交互,O(T) 搞定跨模态融合,比全局 attention 更快更稳。”
A Multimodal Transfer Learning Approach Using PubMedCLIP for Medical Image Classification
方法:论文提出了一种基于PubMedCLIP的多模态迁移学习方法,用于医学图像分类。该方法通过结合图像和文本提示作为输入,利用PubMedCLIP模型的预训练图像和文本特征表示,并通过多模态特征融合来提高分类性能。
以下从“背景-痛点-创新-方法-实验-结果-意义”6个维度,对IEEE Access 2024论文《A Multimodal Transfer Learning Approach Using PubMedCLIP for Medical Image Classification》进行一张图读懂式解读,并重点放大创新点与方法论。
一、研究背景与痛点
- 医学图像DL落地两大拦路虎
- 数据稀缺:标注需专业医师,成本高、长尾分布明显。
- 领域鸿沟:ImageNet预训练CNN/ViT在医学域表现“水土不服”。
- 现有TL套路
- 单模态:仅拿图像微调,丢弃伴随的文本报告/标签;
- 多模态:CLIP通用域训练→医学图像分布差异大,零-shot精度低。
- 亟需“医学专用+图文双模态+少样本”的轻量级方案。
二、核心创新(4个“首次/最大”)
| 创新点 | 一句话说明 | 与既往差异 |
|---|---|---|
| ① 首次把PubMedCLIP用于通用医学图像分类(非VQA) | 之前仅用于VQA;本文覆盖显微、病理、超声3种成像模式 | 任务层级从问答→分类 |
| ② 提出4级复杂度prompt模板(Prompt-0~3) | 从单纯标签→完整临床句式,逐步注入医学上下文 | 以往只用Prompt-0或单句 |
| ③ 采用MFB(Factorized Bilinear Pooling)融合 | 显式建模图文二阶交互,维度可控、计算快 | 以往concat/eltwise-sum |
| ④ 构建10-shot~80%数据量连续评估协议 | 无数据增强、无预处理,直接测“裸”少样本性能 | 之前只报单次80%结果 |
三、方法论(对应原文III)
-
总览流水线(图1)
医学图像 + Prompt文本 ↓ PubMedCLIP双编码器 → 512维图像向量vi,512维文本向量qj ↓ MFB融合 → 256维联合向量Zvi,qj ↓ 相似度打分 → Softmax → 类别概率 -
Prompt模板(4级)
- Prompt-0:
{label} - Prompt-1:
This image shows {label} disease. - Prompt-2:
In this medical image, there are indications of {label}. - Prompt-3:
Based on this medical image, it appears that the patient may be exhibiting signs or symptoms related to the {label} disease or illness.
→ 实验表明Prompt-3平均+3% Acc,且越早饱和。
- Prompt-0:
-
MFB融合公式(低秩近似)
Z = (U⊙V)W , U∈ℝd×r, V∈ℝd×r, W∈ℝr×o外积→池化→降维,参数仅O(dr+ro),r≈128 远小于全秩。
-
训练策略
- 图像编码器完全冻结(Trainable=False),只训融合层+分类头;
- 学习率1e-3,batch=16,无数据增强,真正“裸”少样本。
四、实验设置
| 数据集 | 图像类型 | 类别数 | 总样本量 | 少样本设定 |
|---|---|---|---|---|
| Blood | 外周血细胞显微图 | 8 | 17 092 | 10/50/100/…/80% |
| Path | 结直肠病理切片 | 9 | 100 000 | 同上 |
| Breast | 超声乳腺肿瘤 | 3 | 780 | 同上 |
- 对比基线
- 单模态:PubMedCLIP-RN50/ViT32、DenseNet、MobileNet、EfficientNet
- 多模态:作者前期工作PubMedCLIP-Multi(无prompt、无MFB)
五、关键结果(一句话总结)
| 设定 | 数据集 | 本文最佳 | 最强单模态 | 提升 | 10-shot |
|---|---|---|---|---|---|
| 80%训练 | Breast | 92.8% Acc | 79.3% (MobileNet) | +13.5 pp | 68.4% |
| 80%训练 | Path | 90.3% Acc | 88.1% (DenseNet) | +2.2 pp | 77.6% |
| 80%训练 | Blood | 92.1% Acc | 89.4% (MobileNet) | +2.7 pp | 83.2% |
- 消融:MFB+Prompt-3 联合带来 +2.4~3.0 pp 增益,且二者互补。
- 10-shot场景:本文在Breast上仍达68.4%,而最佳单模态仅54.1%。
六、学术与落地意义
-
学术
- 首次验证“医学专用CLIP+提示工程+双线性融合”在通用医学图像分类任务上的跨域有效性(显微→病理→超声)。
- 提出“** prompt 复杂度-少样本性能**”量化曲线,为后续医学CLIP研究提供基准协议。
-
工程
- 冻结骨干,仅训练<0.5 M参数,单卡V100 5分钟完成10-shot实验;
- 代码与3个数据集已开源,可直接嵌入PACS、数字病理扫描仪做冷启动AI辅助诊断。
-
未来
- 引入可学习/上下文感知prompt(如Med-Prompt Tuning);
- 扩展到跨模态检索+可解释性(Grad-CAM on text branch);
- 与Diffusion数据增强结合,进一步压榨少样本极限。
一句话记住本文
“用医学CLIP做骨架,** richer prompt 当医生口吻**,再拿MFB双线性池化把图文二阶交互榨干,10-shot就能让乳腺超声准确率飙到68%,比单模态猛涨14个百分点。”
我有点没看懂,这个文章跟迁移学习体现在哪里
更多推荐



所有评论(0)