La saisie manuelle des données de sondage reste un goulot d'étranglement dans la recherche à grande échelle, le marketing et les politiques publiques, où les feuilles de sondage sont encore largement utilisées en raison de leur accessibilité et de leurs taux de réponse élevés. Malgré les progrès de la reconnaissance optique de caractères (OCR) et de la reconnaissance optique de marques (OMR), les systèmes existants traitent ces tâches séparément et sont généralement adaptés à des formulaires propres et standardisés, ce qui les rend peu fiables pour les feuilles de sondage du monde réel avec des marquages variés et des entrées manuscrites. Ces limitations entravent l'automatisation et introduisent des taux d'erreur significatifs dans la transcription des données. Pour y remédier, nous proposons SurveyNet, un cadre de deep learning unifié qui combine les capacités d'OCR et d'OMR pour numériser automatiquement des réponses complexes aux sondages au sein d'un unique modèle. SurveyNet traite à la fois les chiffres manuscrits et un large éventail de types de marques tels que des coches, des cercles et des croix à travers plusieurs formats de questions. Nous introduisons également SurveySet, un nouveau jeu de données comprenant 135 formulaires de sondage du monde réel annotés selon quatre types de réponses clés. Les résultats expérimentaux montrent que SurveyNet atteint une précision de classification comprise entre 50 % et 97 % selon les tâches, avec de bonnes performances même sur de petits jeux de données déséquilibrés. Ce cadre offre une solution scalable pour rationaliser les flux de travail de numérisation des sondages, réduire les erreurs manuelles et permettre une analyse rapide dans des domaines allant de la recherche sur les consommateurs à la santé publique et à l'éducation.
Quiñones et al. (Vendredi,) ont étudié cette question.