Key points are not available for this paper at this time.
A análise de circuitos de qualquer comportamento de modelo específico é uma tarefa central na interpretabilidade mecanicista. Apresentamos nosso pipeline de descoberta de circuitos com autoencoders esparsos (SAEs) e uma variante chamada skip SAEs. Com esses dois módulos inseridos no modelo, o grafo de computação do modelo em relação aos circuitos OV e MLP torna-se estritamente linear. Nossos métodos não requerem aproximação linear para calcular o efeito causal de cada nó. Este grafo detalhado permite a identificação de circuitos de ponta a ponta e locais que consideram tanto logits quanto características intermediárias. Podemos aplicar esse pipeline de maneira escalável com uma técnica chamada Atribuição Hierárquica. Analisamos três tipos de circuitos no GPT2-Small, a saber, circuitos de parênteses, indução e Identificação de Objeto Indireto. Nossos resultados revelam novas descobertas que sustentam descobertas existentes.
Ge et al. (Quarta-feira,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: