Zusammenfassung Sicherheitsinspektionen im Bauwesen beinhalten typischerweise einen menschlichen Inspektor, der Sicherheitsbedenken vor Ort identifiziert. Mit dem Aufkommen leistungsstarker visueller Sprachmodelle (VLMs) untersuchen Forscher deren Einsatz für Aufgaben wie die Erkennung von Verstößen gegen Sicherheitsvorschriften anhand von Bildern vor Ort. Es mangelt jedoch an offenen Datensätzen, um VLMs in der Bau-Sicherheitsinspektion umfassend zu bewerten und weiter anzupassen. Die aktuellen Anwendungen von VLMs verwenden kleine, überwachte Datensätze, was deren Anwendbarkeit bei Aufgaben einschränkt, für die sie nicht direkt trainiert wurden. In diesem Artikel schlagen wir den ConstructionSite 10k vor, der 10.000 Bilder von Baustellen mit Annotationen für drei miteinander verbundene Aufgaben umfasst, einschließlich Bildbeschriftung, visuelle Beantwortung von Fragen zu Verstößen gegen Sicherheitsvorschriften (VQA) und visuelle Verankerung von Bauelementen. Unsere anschließende Bewertung der aktuellen hochmodernen, vortrainierten VLMs zeigt bemerkenswerte Verallgemeinerungsfähigkeiten in Zero-Shot- und Few-Shot-Einstellungen, während zusätzliches Training erforderlich ist, um sie auf tatsächliche Baustellen anwendbar zu machen. Dieser Datensatz ermöglicht es Forschern, ihre eigenen VLMs mit neuen Architekturen und Techniken zu trainieren und zu bewerten und bietet einen wertvollen Benchmark für die Bau-Sicherheitsinspektion.
Chen et al. (Thu,) untersuchten diese Frage.