Este trabalho descreve o processo de treinamento de um classificador especializado na classificação de segmentos de documentos relacionados à aquisição de bens e/ou serviços pelo governo brasileiro. Identificar corretamente as seções desses tipos de documentos é uma tarefa essencial para o processo de auditoria de contratos governamentais e, consequentemente, um passo necessário para estratégias automatizadas de prevenção e combate à fraude. O classificador fornece a entrada inicial para processos de auditoria automatizados, visando identificar problemas que possam prejudicar a administração pública. Como parte da abordagem escolhida, foi compilada uma base de dados consistente no texto característico das seções de documentos existentes em procedimentos de licitação governamentais, anotada com um rótulo característico do respectivo texto. 13 rótulos discriminando seções essenciais dos documentos foram selecionados para treinar o classificador. Três modelos foram avaliados, incluindo a versão original do BERT. O DistilBERT foi escolhido por ser um modelo compacto e leve que prioriza a eficiência. No outro extremo, o ModernBERT foi avaliado, uma abordagem que utiliza metodologias de treinamento atualizadas e permite que sequências longas sejam utilizadas como entrada do modelo. Finalmente, os resultados comparando os modelos são apresentados.
Reis et al. (Qui,) estudaram essa questão.