Key points are not available for this paper at this time.
Große Sprachmodelle (LLMs) wie Codex sind leistungsstarke Werkzeuge zur Durchführung von Codevervollständigung und Codegenerierungsaufgaben, da sie auf Milliarden von Codezeilen aus öffentlich verfügbaren Quellen trainiert wurden. Darüber hinaus sind diese Modelle in der Lage, Codeschnipsel aus Beschreibungen in natürlicher Sprache (NL) zu generieren, indem sie Sprachen und Programmierpraktiken aus öffentlichen GitHub-Repositories lernen. Obwohl LLMs eine mühelose einsatzbasierte Bereitstellung von Softwareanwendungen versprechen, wurde die Sicherheit des von ihnen erzeugten Codes bisher nicht umfassend untersucht oder dokumentiert. In dieser Arbeit präsentieren wir LLMSecEval, einen Datensatz, der 150 NL-Aufforderungen enthält, die zur Bewertung der Sicherheitsleistung solcher Modelle verwendet werden können. Diese Aufforderungen sind NL-Beschreibungen von Codeschnipseln, die anfällig für verschiedene Sicherheitsanfälligkeiten sind, die im MITRE Top 25 Common Weakness Enumeration (CWE) Ranking aufgeführt sind. Jede Aufforderung in unserem Datensatz enthält ein sicheres Implementierungsbeispiel, um vergleichende Bewertungen des von LLMs erzeugten Codes zu erleichtern. Als praktische Anwendung zeigen wir, wie LLMSecEval zur Bewertung der Sicherheit von automatisch aus NL-Beschreibungen generierten Snippets verwendet werden kann.
Tony et al. (2023) haben diese Frage untersucht.
Synapse has enriched 4 closely related papers on similar clinical questions. Consider them for comparative context: