Key points are not available for this paper at this time.
Modelos de Linguagem de Grande Escala (LLMs) apresentam um desempenho impressionante em várias aplicações. No entanto, o potencial de uso indevido desses modelos em atividades como plágio, geração de notícias falsas e spam levantou preocupações sobre seu uso responsável. Consequentemente, a detecção confiável de texto gerado por IA tornou-se uma área crítica de pesquisa. Detectores de texto de IA mostraram ser eficazes em suas configurações específicas. Neste artigo, realizamos um teste de estresse na robustez desses detectores de texto de IA na presença de um atacante. Introduzimos um ataque de parafraseamento recursivo para testar a resistência de uma ampla gama de esquemas de detecção, incluindo aqueles que utilizam marca d'água, bem como detectores baseados em redes neurais, classificadores de zero shot e detectores baseados em recuperação. Nossos experimentos realizados em trechos, cada um com aproximadamente 300 tokens, revelam as variações de sensibilidade desses detectores aos nossos ataques. Nossos achados indicam que, embora nosso método de parafraseamento recursivo possa reduzir significativamente as taxas de detecção, ele apenas degrada ligeiramente a qualidade do texto em muitos casos, destacando vulnerabilidades potenciais nos sistemas de detecção atuais na presença de um atacante. Além disso, investigamos a suscetibilidade de LLMs com marca d'água a ataques de spoofing voltados para a má classificação de texto escrito por humanos como gerado por IA. Demonstramos que um atacante pode inferir assinaturas de texto ocultas de IA sem acesso ao método de detecção, potencialmente levando a riscos reputacionais para os desenvolvedores de LLM. Finalmente, fornecemos uma estrutura teórica conectando o AUROC do melhor detector possível à distância de Variação Total entre distribuições de texto humano e de IA. Esta análise oferece insights sobre os desafios fundamentais da detecção confiável à medida que os modelos de linguagem continuam a avançar. Nosso código está disponível publicamente em https://github.com/vinusankars/Reliability-of-AI-text-detectors.
Sadasivan et al. (Sex,) estudaram essa questão.