Avanços recentes em IA tornaram os LLMs ferramentas valiosas para automatizar a interpretação de descrições textuais de processos de negócios e para converter especificações formais de processos em linguagem natural. No entanto, não existem metodologias práticas ou avaliações sistemáticas para garantir que essas traduções automáticas sejam fiéis. Este artigo propõe uma abordagem nova, baseada em uma tarefa de tradução bidirecional auxiliar, para avaliar quantitativamente o desempenho dos LLMs; além disso, também avalia empiricamente o desempenho dos LLMs de última geração para traduções bidirecionais entre linguagem natural e especificações formais de processos declarativos. Os resultados revelam uma variabilidade substancial no desempenho entre os LLMs, destacando a importância da seleção de LLMs e confirmando a necessidade de um método robusto para avaliar as saídas dos LLMs.
Fionda et al. (Mon,) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: