Abstract Das Vision Transformer (ViT) Modell hat sich als leistungsstarke Architektur für visuelle Aufgaben etabliert, indem es die Erfassung von Langzeitabhängigkeiten innerhalb von Bildern ermöglicht und dabei eine überlegene Leistung in einer Vielzahl von Anwendungen demonstriert. Allerdings stellt die hohe Anzahl an Parametern sowie die hohen rechnerischen und speichertechnischen Anforderungen von ViTs erhebliche Herausforderungen dar. In diesem Papier wird ViT-CAAC (Beitrag-Bewusster Adaptiver Kompressionsrahmen) vorgestellt, ein neuartiger, facettenreicher Kompressionsrahmen, der darauf ausgelegt ist, ViTs zu optimieren. Unser Rahmen integriert Wissen-Destillation auf Blockebene, schichtweise Quantisierung mit Präzisionskontrolle über hierarchische Schichten und adaptive Sparsamkeit, wodurch ein kohärenter Ansatz entsteht, der die Modellgröße erheblich reduziert, während die Leistung erhalten bleibt. Durch rigorose Experimente an Benchmark-Datensätzen zeigen wir, dass unser Rahmen mehr als 76% Reduktion der Modellgröße bei minimalem Genauigkeitsverlust (weniger als 0,4% Top-1 Genauigkeitsverlust) erreicht. Diese Arbeit etabliert ein neuartiges Konzept zur Bereitstellung von Hochleistungs-Vision-Modellen auf ressourcenbeschränkten Geräten mit Implikationen für Anwendungen in autonomen Systemen, IoT und Echtzeit-Visionverarbeitung.
Zhang et al. (2025) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: