Key points are not available for this paper at this time.
Les Réseaux de Neurones Convolutionnels (CNN) et les Transformers de Vision (ViT) ont montré des performances remarquables dans les tâches de vision par ordinateur, y compris la détection d'objets et la reconnaissance d'images. Ces modèles ont considérablement évolué en termes d'architecture, d'efficacité et de polyvalence. Parallèlement, les cadres d'apprentissage profond se sont diversifiés, avec des versions qui compliquent souvent la reproductibilité et l'évaluation unifiée. Nous proposons ConVision Benchmark, un cadre complet en PyTorch, pour standardiser l'implémentation et l'évaluation des modèles CNN et ViT de pointe. Ce cadre s'attaque aux défis communs tels que les incompatibilités de version et les métriques de validation inconsistantes. En preuve de concept, nous avons réalisé une analyse de référence approfondie sur un ensemble de données COVID-19, englobant près de 200 modèles CNN et ViT, dans lesquelles DenseNet-161 et MaxViT-Tiny ont atteint une précision exceptionnelle avec un pic de performance d'environ 95 %. Bien que nous ayons principalement utilisé l'ensemble de données COVID-19 pour la classification d'images, le cadre est adaptable à une variété d'ensembles de données, améliorant son applicabilité à travers différents domaines. Notre méthodologie comprend des évaluations rigoureuses de performance, mettant en évidence des métriques telles que la précision, la précision, le rappel, le score F1 et l'efficacité computationnelle (FLOPs, MACs, latence CPU et GPU). ConVision Benchmark facilite une compréhension complète de l'efficacité des modèles, aidant les chercheurs à déployer des modèles haute performance pour diverses applications.
Vijayakumar et al. (Jeudi,) ont étudié cette question.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: