Key points are not available for this paper at this time.
Große Sprachmodelle (LLMs) haben das Potenzial, einige Analysen im Prozessmining (PM) halbautomatisiert durchzuführen. Während kommerzielle Modelle bereits für viele Analyseaufgaben geeignet sind, ist das Wettbewerbsniveau von Open-Source-LLMs in PM-Aufgaben unbekannt. In diesem Papier schlagen wir PM-LLM-Benchmark vor, das erste umfassende Benchmark für PM, das sich auf Fachwissen (prozessmining-spezifisch und prozessspezifisch) und auf verschiedene Implementierungsstrategien konzentriert. Wir konzentrieren uns auch auf die Herausforderungen bei der Erstellung eines solchen Benchmarks, die mit der öffentlichen Verfügbarkeit der Daten und den Bewertungsbiases der LLMs zusammenhängen. Insgesamt beobachten wir, dass die meisten der betrachteten LLMs einige Aufgaben im Prozessmining auf einem zufriedenstellenden Niveau erfüllen können, jedoch sind kleine Modelle, die auf Edge-Geräten ausgeführt werden könnten, nach wie vor unzureichend. Wir kommen auch zu dem Schluss, dass das vorgeschlagene Benchmark nützlich ist, um LLMs zu identifizieren, die für Aufgaben im Prozessmining geeignet sind, aber weitere Forschung erforderlich ist, um die Bewertungsbiases zu überwinden und eine umfassendere Rangliste der wettbewerbsfähigen LLMs zu erstellen.
Berti et al. (Thu,) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: