Codi QR

BERTIVITS: The Posterior Encoder Fusion of Pre-Trained Models and Residual Skip Connections for End-to-End Speech Synthesis

Enhancing the naturalness and rhythmicity of generated audio in end-to-end speech synthesis is crucial. The current state-of-the-art (SOTA) model, VITS, utilizes a conditional variational autoencoder architecture. However, it faces challenges, such as limited robustness, due to training solely on te...

Descripció completa

Guardat en:
Dades bibliogràfiques
Autors principals: Zirui Wang, Minqi Song, Dongbo Zhou
Format: Artigo
Idioma:Inglês
Publicat: MDPI AG 2024-06-01
Col·lecció:Applied Sciences
Matèries:
Accés en línia:https://www.mdpi.com/2076-3417/14/12/5060
Etiquetes: Afegir etiqueta
Sense etiquetes, Sigues el primer a etiquetar aquest registre!