研究论文
可解释多模态分类新框架:线性判别树集成在情感识别上优于 Transformer
arXiv 论文提出基于树集成的可解释多模态分类方法,在 IEMOCAP 等基准上 F1 与人类一致性均优于 Trans…
2026.08.24 · 周一约 3 分钟阅读
核心结论
arXiv 最新论文《Interpretable Multimodal Classification with Linear Discriminant Tree Ensembles》提出了一套面向多模态情感与行为分类的可解释框架。该方法将异构的文本、音频与视觉流编码为统一令牌后,通过概念聚类降维,再送入基于线性判别函数的树集成分类器进行决策,并引入修正后的特征重要性指标,削弱二分类任务中负类对解释的干扰,从而提升「指示物」或「标记物」的识别准确度。
方法构成
论文定义了三种树集成变体,分别对应不同的集成策略:
- Linear Discriminant Tree(LDT):单棵基于线性判别的决策树,强调单模型的透明度。
- Linear Discriminant Forest(LDF):随机森林式的多树集成,提升稳定性与泛化能力。
- Linear Discriminant AdaBoost(LDAB):以线性判别树为基学习器的 AdaBoost 集成,侧重纠错能力。
在解释层面,作者提出一种修正后的多模态特征重要性度量,可跨模态抽取显著「概念」,让人类标注者更容易判断模型究竟依赖哪些线索做出预测。
实验结果
论文报告了在主流多模态情感基准上的对比数据,关键数字如下:
- F1 改进:相比 Multimodal Transformer,改进后的 F1-mod 提升约 4.3%。
- 准确率改进:相对主要可解释基线 Interpretable Multimodal Routing(IMR),准确率提升约 3.0%。
- 人类一致性:在 IEMOCAP 数据集上,所提特征重要性方法的人类标注者一致率从默认方法的 43.2% 提升至 62.2%;在 CMU-MOSI 上则从 32.1% 提升至 46.7%。
适用场景与局限
作者将应用方向锁定在「信任敏感」场景,例如临床情感监测与教育评估,这类场景对模型可解释性的要求高于通用任务。论文也承认,深度 Transformer 在纯预测性能上仍有优势,但因其分布式表征与深层非线性,难以对单个多模态特征赋予可解释的重要性权重,因此在新框架中以「对比基线」而非「替代目标」出现。
需要指出的是,论文目前为 arXiv 预印本(编号 2608.20384v1),尚未经过同行评审,方法在更大规模模型与更多模态组合下的泛化表现仍有待验证。
