Código QR

Noise-Aware Direct Preference Optimization for RLAIF

Reinforcement Learning from Human Feedback (RLHF) produces powerful instruction-following models but relies on a preference-labeling process that is both costly and slow. An effective alternative, Reinforcement Learning from AI Feedback (RLAIF), uses large language models as teachers for relabeling;...

Descrición completa

Gardado en:
Detalles Bibliográficos
Principais autores: Alymzhan Toleu, Gulmira Tolegen, Alexandr Pak, Assel Jaxylykova
Formato: Artigo
Idioma:Inglês
Publicado: MDPI AG 2025-09-01
Series:Applied Sciences
Assuntos:
Acceso en liña:https://www.mdpi.com/2076-3417/15/19/10328
Tags: Engadir etiqueta
Sen Etiquetas, Sexa o primeiro en etiquetar este rexistro!