Key points are not available for this paper at this time.
Les progrès récents sur les Transformers et les modèles de perceptron multicouche (MLP) offrent de nouvelles conceptions architecturales de réseau pour les tâches de vision par ordinateur. Bien que ces modèles aient prouvé leur efficacité dans de nombreuses tâches de vision telles que la reconnaissance d'images, des défis demeurent dans leur adaptation à la vision de bas niveau. L'inflexibilité à supporter des images haute résolution et les limitations de l'attention locale sont peut-être les principaux goulets d'étranglement. Dans ce travail, nous présentons une architecture basée sur un MLP à axes multiples appelée MAXIM, qui peut servir de base de vision généraliste efficace et flexible pour les tâches de traitement d'image. MAXIM utilise une structure hiérarchique en forme de UNet et prend en charge les interactions à longue portée rendues possibles grâce à des MLP à porte spatiale. Plus précisément, MAXIM contient deux blocs de construction basés sur des MLP : un MLP à porte multi-axes qui permet un mélange spatial efficace et évolutif des indices visuels locaux et globaux, et un bloc de croisement des portes, une alternative à l'attention croisée, qui prend en compte le conditionnement entre caractéristiques croisées. Ces deux modules sont exclusivement basés sur des MLP, mais bénéficient également d'être à la fois globaux et « entièrement convolutionnels », deux propriétés souhaitables pour le traitement d'images. Nos résultats expérimentaux approfondis montrent que le modèle MAXIM proposé atteint des performances de pointe sur plus de dix benchmarks dans une gamme de tâches de traitement d'images, y compris le débruitage, le déflou, la dépluie, la désaturation et l'amélioration, tout en nécessitant moins de paramètres ou un nombre comparable de FLOPs que les modèles concurrentiels. Le code source et les modèles entraînés seront disponibles sur https://github.com/google-research/maxim.
Tu et al. (Mercredi) ont étudié cette question.
Synapse has enriched 2 closely related papers on similar clinical questions. Consider them for comparative context: