Conventionalle Sicherheitsinspektionsmethoden im Bauwesen sind oft ineffizient, da sie das Navigieren durch große Datenmengen erfordern. Neueste Fortschritte in großen Vision-Language-Modellen (LVLMs) bieten Möglichkeiten, Sicherheitsinspektionen durch verbessertes visuelles und linguistisches Verständnis zu automatisieren. Bestehende Anwendungen haben jedoch Einschränkungen, darunter irrelevante oder unspezifische Antworten, eingeschränkte modale Eingaben und Halluzinationen. Die Nutzung von großen Sprachmodellen (LLMs) zu diesem Zweck wird durch die Verfügbarkeit von Trainingsdaten eingeschränkt und fehlt häufig an Echtzeitanpassungsfähigkeit. Diese Studie stellt SiteShield vor, ein auf LVLMs basierendes multimodales Retrieval-Augmented Generation (RAG)-Framework zur Automatisierung von Sicherheitsinspektionsberichten im Bauwesen durch die Integration visueller und akustischer Eingaben. Mit Daten aus der realen Welt übertraf SiteShield unimodale LLMs ohne RAG mit einem F1-Score von 0,82, einer Hamming-Distanz von 0,04, einer Präzision von 0,76 und einem Recall von 0,96. Die Ergebnisse deuten darauf hin, dass SiteShield einen neuartigen Weg bietet, um die Informationsabfrage und Effizienz bei der Erstellung von Sicherheitsberichten zu verbessern.
Wang et al. (Sun) untersuchten diese Frage.