Los puntos clave no están disponibles para este artículo en este momento.
Resumen ⚠ Este documento contiene indicaciones y salidas de modelos que son ofensivas por naturaleza. Al ser entrenados en grandes rastreos no filtrados de Internet, los modelos de lenguaje capturan y reproducen todo tipo de sesgos indeseables que se pueden encontrar en los datos: a menudo generan lenguaje racista, sexista, violento u otro tipo de lenguaje tóxico. Dado que los modelos grandes requieren millones de ejemplos de entrenamiento para alcanzar un buen rendimiento, es difícil evitar completamente que estén expuestos a dicho contenido. En este trabajo, primero demostramos un hallazgo sorprendente: los modelos de lenguaje precualificados reconocen, en considerable medida, sus sesgos indeseables y la toxicidad del contenido que producen. Nos referimos a esta capacidad como autodiagnóstico. Basados en este hallazgo, proponemos un algoritmo de decodificación que, dado solo una descripción textual del comportamiento indeseado, reduce la probabilidad de que un modelo de lenguaje produzca texto problemático. Nos referimos a este enfoque como autodebida. La autodebida no se basa en listas de palabras curadas manualmente, ni requiere datos de entrenamiento o cambios en los parámetros del modelo. Aunque de ninguna manera eliminamos el problema de los modelos de lenguaje que generan texto sesgado, creemos que nuestro enfoque es un paso importante en esta dirección.1
Schick et al. (Vie,) estudiaron esta cuestión.