Alinhando Grandes Modelos de Visão-Linguagem por Aprendizado por Reforço Profundo e Otimização Direta de Preferências | Synapse