Key points are not available for this paper at this time.
L'apprentissage à classer a récemment émergé comme une technique attrayante pour former des réseaux de neurones convolutionnels profonds pour diverses tâches de vision par ordinateur. Le classement par paires, en particulier, a réussi dans la classification d'images multi-étiquettes, atteignant des résultats à la pointe de la technologie sur divers benchmarks. Cependant, la plupart des approches existantes utilisent la perte de charnière pour entraîner leurs modèles, ce qui est non lisse et donc difficile à optimiser, en particulier avec des réseaux profonds. De plus, elles emploient des heuristiques simples, telles que le top-k ou le seuil, pour déterminer quelles étiquettes inclure dans la sortie d'une liste d'étiquettes classées, ce qui limite leur utilisation dans le monde réel. Dans ce travail, nous proposons deux techniques pour améliorer la classification d'images multi-étiquettes basée sur le classement par paires en résolvant les problèmes mentionnés ci-dessus : (1) nous proposons une nouvelle fonction de perte pour le classement par paires, qui est lisse partout, et (2) nous incorporons un module de décision d'étiquette dans le modèle, estimant les seuils de confiance optimaux pour chaque concept visuel. Nous fournissons des analyses théoriques de notre fonction de perte du point de vue de la consistance bayésienne et de la minimisation du risque, et montrons ses avantages par rapport aux formulations existantes de classement par paires. Nous démontrons également l'efficacité de notre approche sur deux ensembles de données à grande échelle, NUS-WIDE et MS-COCO, atteignant le meilleur résultat rapporté dans la littérature.
Li et al. (Samedi,) ont étudié cette question.
Synapse has enriched 3 closely related papers on similar clinical questions. Consider them for comparative context: