La interpretación de modelos de lenguaje a menudo implica análisis de circuitos, que busca identificar subredes dispersas, o circuitos, que realizan tareas específicas. Los algoritmos existentes para el descubrimiento de circuitos enfrentan una compensación fundamental: la atribución rápida es veloz pero poco fiel al modelo completo, mientras que la poda de bordes es fiel pero costosa computacionalmente. Esta investigación propone un marco híbrido de atribución y poda (HAP) que utiliza la atribución para identificar un subgrafo de alto potencial, y luego aplica la poda de bordes para extraer un circuito fiel de este. Mostramos que HAP es un 46% más rápido que los algoritmos de referencia sin sacrificar la fidelidad del circuito. Además, presentamos un estudio de caso sobre la tarea de Identificación de Objeto Indirecto, mostrando que nuestro método preserva componentes de circuito cooperativo (por ejemplo, cabezas de S-inhibición) que los métodos de atribución podan a alta dispersión. Nuestros resultados muestran que HAP podría ser un enfoque efectivo para mejorar la escalabilidad de la investigación en interpretabilidad mecanicista para modelos más grandes. Nuestro código está disponible en https://anonymous.4open.science/r/HAP-circuit-discovery.
Gu et al. (Sun,) estudiaron esta cuestión.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: