| 标题 |
Multimodal feature disentangle-fusion network for detecting and grounding multi-modal media manipulation |
| 网址 | |
| DOI | |
| 其它 | 为了减轻假新闻的威胁,检测和接地多模态媒体操控(DGM)的任务4)引起了越来越多的关注。然而,现有方法主要关注探索模态间的不一致,却忽视了跨模态语义对齐,通常导致忽视模态内部的不一致。本文提出了一种新的M末模F等义D等角F,利用N工作(MFDFN)对齐、解缠并融合多模特征,用于DGM的应用4.具体来说,我们首先引入了语义正则化学习(SRL),用于对齐跨模态语义信息,从而实现文本模态与图像模态之间的准确语义对应。随后,我们设计了一个多模态特征解缠(MFD)模块,将每种模态的特征分解为模态共享表示和模态内特定表示,使模型能够识别每个模态内可能控的区域,并为后续的操作检测和定位任务提供关键的先验知识。随后,我们采用跨模态聚合(CMA)模块,有效捕捉图像与文本之间的语义相关性,实现有效的跨模态语义融合。最后,我们利用自适应模态加权(AMR)有效融合各种模态的表示,形成一个整体的表示,用于对每对图像-文本的真实性和操作类型分类。DGM的广泛实验4数据集表明MFDFN相较于基线表现优越。 |
| 求助人 | |
| 下载 |
PDF的下载单位、IP信息已删除
(2025-6-4)