| 标题 |
Mutual-guidance framework for audio DeepFake detection via multi-dimensional feature interaction |
| 网址 | |
| DOI | |
| 其它 | 随着文本转语音(TTS)和语音克隆(VC)技术的快速发展,合成语音的感知质量已接近自然语音,这对传统的听觉检测方法提出了重大挑战。为解决这一问题,引入了一种新型互助框架(MGF),旨在整合物理和高级语义表示,以提升检测准确性。在该框架中,采用Mel频率Cepstral系数(MFCCs)和线性频率Cepstral系数(LFCC)捕捉低级别声学特性,同时使用预训练的Wav2Vec编码器提取语义嵌入,构建多层次表示层级。为实现精确的跨模态对齐和深度交互,集成了层级交叉注意力融合(HCAF)模块,实现物理与语义特征之间的多层信息交换。此外,嵌入了互导策略,促进两种模态之间的双向适应和动态交互,强化表征一致性,同时发挥互补优势。为评估该方法的有效性,构建了一个多语言多代克隆语音数据集BA,包含TTS和VC系统生成的真实与伪造语句。ASVspoof 2019数据集的实验结果表明,MGF框架实现了5.94%的相等错误率(EER),在跨语言和跨模型检测场景中表现出显著的鲁棒性。对BA数据集的分析进一步显示,语言变异和合成技术差异对检测性能有显著影响,凸显了跨场景泛化的瓶颈。 |
| 求助人 | |
| 下载 |
PDF的下载单位、IP信息已删除
(2025-6-4)