Código QR (código de barras bidimensional)

Variational Reward Estimator Bottleneck: Towards Robust Reward Estimator for Multidomain Task-Oriented Dialogue

Despite its significant effectiveness in adversarial training approaches to multidomain task-oriented dialogue systems, adversarial inverse reinforcement learning of the dialogue policy frequently fails to balance the performance of the reward estimator and policy generator. During the optimization...

ver descrição completa

Na minha lista:
Detalhes bibliográficos
Principais autores: Jeiyoon Park, Chanhee Lee, Chanjun Park, Kuekyeng Kim, Heuiseok Lim
Formato: Artigo
Idioma:Inglês
Publicado em: MDPI AG 2021-07-01
coleção:Applied Sciences
Assuntos:
Acesso em linha:https://www.mdpi.com/2076-3417/11/14/6624
Tags: Adicionar Tag
Sem tags, seja o primeiro a adicionar uma tag!