QR Code

AFT-SAM: Adaptive Fusion Transformer with a Sparse Attention Mechanism for Audio–Visual Speech Recognition

Aiming at the problems of serious information redundancy, complex inter-modal information interaction, and difficult multimodal fusion faced by the audio–visual speech recognition system when dealing with complex multimodal information, this paper proposes an adaptive fusion transformer algorithm (A...

Description complète

Enregistré dans:
Détails bibliographiques
Auteurs principaux: Na Che, Yiming Zhu, Haiyan Wang, Xianwei Zeng, Qinsheng Du
Format: Artigo
Langue:Inglês
Publié: MDPI AG 2024-12-01
Collection:Applied Sciences
Sujets:
Accès en ligne:https://www.mdpi.com/2076-3417/15/1/199
Tags: Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!