Key points are not available for this paper at this time.
Mit dem Erfolg von Vision Transformers (ViTs) in Aufgaben der Computer Vision versuchen aktuelle Arbeiten, die Leistung und Komplexität von ViTs zu optimieren, um eine effiziente Bereitstellung auf mobilen Geräten zu ermöglichen. Es werden mehrere Ansätze vorgeschlagen, um den Aufmerksamkeitsmechanismus zu beschleunigen, ineffiziente Designs zu verbessern oder mobilfreundliche leichte Faltungen zu integrieren, um hybride Architekturen zu bilden. Dennoch haben ViT und seine Varianten immer noch eine höhere Latenz oder erheblich mehr Parameter als leichte CNNs, was auch für das Jahre alte MobileNet gilt. In der Praxis sind Latenz und Größe für eine effiziente Bereitstellung auf hardwareseitig begrenzten Ressourcen entscheidend. In dieser Arbeit untersuchen wir eine zentrale Frage: Können Transformermodelle so schnell wie MobileNet arbeiten und eine ähnliche Größe beibehalten? Wir überprüfen die Designentscheidungen von ViTs und schlagen ein neuartiges Supernetz mit niedriger Latenz und hoher Parametereffizienz vor. Wir führen zudem eine neuartige feinkörnige gemeinsame Suchstrategie für Transformermodelle ein, die effiziente Architekturen finden kann, indem sie Latenz und Anzahl der Parameter gleichzeitig optimiert. Die vorgeschlagenen Modelle, EfficientFormerV2, erreichen 3,5% höhere Top-1 Genauigkeit als MobileNetV2 auf ImageNet-1K bei ähnlicher Latenz und ähnlichen Parametern. Diese Arbeit zeigt, dass angemessen gestaltete und optimierte Vision Transformers eine hohe Leistung erreichen können, selbst bei einer Größe und Geschwindigkeit auf MobileNet-Niveau.
Li et al. (Sun,) haben diese Frage untersucht.