Resumo Há uma pesquisa extensa sobre o fenômeno da troca de código, ou seja, o uso de duas ou mais línguas ou variedades linguísticas, dentro de textos. Até recentemente, a maioria dos estudos sobre troca de código nas humanidades digitais marcou as línguas misturadas manualmente, uma vez que os métodos automáticos de identificação de línguas até agora apresentaram desempenho muito pouco confiável para serem úteis, embora a pesquisa sobre métodos automáticos esteja crescendo. Este artigo tem como objetivo melhorar os métodos para identificar trechos de um segundo idioma em textos históricos e literários, avaliando três métodos automáticos de complexidade crescente: método do dicionário, pacotes dedicados de identificação de linguagem e modelos de linguagem grande (LLMs) ajustados. Avaliamos os métodos no caso de teste de trechos franceses marcados manualmente em textos literários em inglês e relatamos que os LLMs ajustados obtiveram as maiores taxas de detecção geral em nosso experimento com diferentes modelos, embora questões metodológicas específicas para pares de línguas permaneçam. Publicamos nosso código e LLMs ajustados para auxiliar a pesquisa sobre este par de línguas, e estes métodos poderão ser expandidos para mais pares de idiomas e aplicações mais amplas no futuro. Finalmente, relatamos observações do uso do francês nos textos literários em inglês em nosso corpo, datados de 1814 a 1920.
Ketzan et al. (2026) estudaram esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: