Grandes Modelos de Visão-Linguagem (LVLMs) ou modelos de linguagem multimodal representam um avanço significativo na inteligência artificial, permitindo que sistemas compreendam e gerem conteúdo em modalidades visuais e textuais. Embora o pré-treinamento em larga escala tenha impulsionado um progresso substancial, o ajuste fino desses modelos para alinhar-se com valores humanos ou se envolver em tarefas ou comportamentos específicos continua sendo um desafio crítico. A Aprendizagem por Reforço Profundo (DRL) e a Otimização Direta de Preferências (DPO) oferecem estruturas promissoras para esse processo de alinhamento. Enquanto a DRL permite que modelos otimizem ações usando sinais de recompensa em vez de depender exclusivamente de dados de preferência supervisionados, a DPO alinha diretamente a política com as preferências, eliminando a necessidade de um modelo de recompensa explícito. Esta visão geral explora paradigmas para o ajuste fino de LVLMs, destacando como as técnicas de DRL e DPO podem ser usadas para alinhar modelos com preferências e valores humanos, melhorar o desempenho em tarefas e permitir interações multimodais adaptativas. Categorizamos abordagens principais, examinamos fontes de dados de preferência, sinais de recompensa e discutimos desafios abertos, como escalabilidade, eficiência de amostra, aprendizado contínuo, generalização e segurança. O objetivo é fornecer uma compreensão clara de como a DRL e a DPO contribuem para a evolução de LVLMs robustos e alinhados com humanos.
Nguyen et al. (2025) estudaram essa questão.