Key points are not available for this paper at this time.
لقد أظهرت الشبكات العصبية التلافيفية (CNNs) والمحولات البصرية (ViTs) أداءً ملحوظًا في مهام رؤية الكمبيوتر، بما في ذلك اكتشاف الأجسام والتعرف على الصور. لقد تطورت هذه النماذج بشكل كبير من حيث التصميم والكفاءة والمرونة. في الوقت نفسه، تنوعت أطر التعلم العميق، مما جعل نسخها في كثير من الأحيان تعقيدًا في التكرار المعزز والتقييم الموحد. نقترح ConVision Benchmark، إطارًا شاملاً في PyTorch، لتوحيد تنفيذ وتقييم نماذج CNN و ViT المتطورة. يتناول هذا الإطار التحديات الشائعة مثل عدم التطابق بين النسخ والمعايير غير المتسقة للتحقق. كدليل على المفهوم، قمنا بإجراء تحليل شامل للمعايير على مجموعة بيانات COVID-19، والتي تشمل ما يقرب من 200 نموذج CNN و ViT حيث حقق DenseNet-161 وMaxViT-Tiny دقة استثنائية بحد أقصى أداء يبلغ حوالي 95%. على الرغم من أننا استخدمنا بشكل أساسي مجموعة بيانات COVID-19 لتصنيف الصور، إلا أن الإطار قابل للتكيف مع مجموعة متنوعة من مجموعات البيانات، مما يعزز قابلية تطبيقه عبر مجالات مختلفة. تشمل منهجيتنا تقييمات أداء صارمة، مع تسليط الضوء على معايير مثل الدقة والدقة والاسترجاع ودرجة F1 وكفاءة الحوسبة (FLOPs وMACs وكمون وحدة المعالجة المركزية وGPU). يسهل ConVision Benchmark فهمًا شاملاً لفعالية النموذج، مما يساعد الباحثين في نشر نماذج عالية الأداء لمجموعة متنوعة من التطبيقات.
درس فيجاياكومار وآخرون (الخميس) هذا السؤال.