Uma nota técnica sobre a Otimização da Preferência Direta (DPO), um método para alinhar modelos de linguagem com preferências humanas sem um modelo de recompensa separado. Abrange o objetivo de treinamento, como se relaciona com RLHF e compensações práticas para a implementação.
Dheiver Francisco Santos (Sun,) estudou essa questão.