AFT-SAM: Adaptive Fusion Transformer with a Sparse Attention Mechanism for Audio–Visual Speech Recognition
Aiming at the problems of serious information redundancy, complex inter-modal information interaction, and difficult multimodal fusion faced by the audio–visual speech recognition system when dealing with complex multimodal information, this paper proposes an adaptive fusion transformer algorithm (A...
Enregistré dans:
| Auteurs principaux: | , , , , |
|---|---|
| Format: | Artigo |
| Langue: | Inglês |
| Publié: |
MDPI AG
2024-12-01
|
| Collection: | Applied Sciences |
| Sujets: | |
| Accès en ligne: | https://www.mdpi.com/2076-3417/15/1/199 |
| Tags: |
Pas de tags, Soyez le premier à ajouter un tag!
|
