Los puntos clave no están disponibles para este artículo en este momento.
Los modelos de lenguaje grandes (LLMs) se entrenan en amplios corpus y luego se utilizan en comunidades con normas especializadas. ¿Es suficiente proporcionar a los LLMs reglas comunitarias para que los modelos sigan estas normas? Evaluamos la capacidad de los LLMs para detectar (Tarea 1) y corregir (Tarea 2) ediciones sesgadas de Wikipedia de acuerdo con la política de Punto de Vista Neutral (NPOV) de Wikipedia. Los LLMs tuvieron dificultades con la detección de sesgos, logrando solo un 64% de precisión en un conjunto de datos balanceado. Los modelos mostraron sesgos contrastantes (algunos subestimaron y otros sobreestimaron el sesgo), sugiriendo priors distintos sobre la neutralidad. Los LLMs se desempeñaron mejor en la generación, eliminando el 79% de las palabras que eliminaron los editores de Wikipedia. Sin embargo, los LLMs realizaron cambios adicionales más allá de las simples neutralizaciones de los editores de Wikipedia, lo que resultó en una edición de alta recuperación pero baja precisión. Curiosamente, los trabajadores de la multitud calificaron las reescrituras de IA como más neutrales (70%) y fluidas (61%) que las reescrituras de editores de Wikipedia. El análisis cualitativo encontró que los LLMs a veces aplicaban NPOV de manera más completa que los editores de Wikipedia, pero a menudo hacían cambios extraneous no relacionados con NPOV (como la gramática). Los LLMs pueden aplicar reglas de maneras que resuenan con el público pero divergen de los expertos comunitarios. Si bien pueden ser potencialmente efectivos para la generación, los LLMs pueden reducir la agencia del editor y aumentar la carga de moderación (por ejemplo, verificando adiciones). Incluso cuando las reglas son fáciles de articular, puede seguir siendo difícil que los LLMs las apliquen como miembros de la comunidad.
Ashkinaze et al. (2024) estudiaron esta cuestión.