Key points are not available for this paper at this time.
Améliorer la capacité des modèles linguistiques (ML) à comprendre les intentions d'achat dans les scénarios de commerce électronique est crucial pour leur assistance efficace dans diverses tâches en aval. Cependant, les approches précédentes qui distillent les intentions des ML échouent souvent à générer des intentions significatives et centrées sur l'humain applicables dans des contextes de commerce électronique réels. Cela soulève des préoccupations quant à la véritable compréhension et à l'utilisation des intentions d'achat par les ML. Dans cet article, nous présentons IntentionQA, un benchmark de questions à choix multiples à double tâche pour évaluer la compréhension des intentions d'achat par les ML dans le commerce électronique. Plus précisément, les ML doivent inférer les intentions en fonction des produits achetés et les utiliser pour prédire des achats supplémentaires. IntentionQA consiste en 4 360 problèmes soigneusement sélectionnés répartis sur trois niveaux de difficulté, construits à l'aide d'un pipeline automatisé pour assurer la scalabilité sur de grandes plateformes de commerce électronique. Les évaluations humaines démontrent la haute qualité et le faible taux de faux négatifs de notre référence. Des expériences extensives sur 19 modèles linguistiques montrent qu'ils ont encore du mal avec certains scénarios, tels que comprendre les produits et les intentions avec précision, raisonner conjointement avec les produits et les intentions, et plus encore, dans lesquels ils sont loin derrière les performances humaines. Notre code et nos données sont disponibles publiquement à l'adresse https://github.com/HKUST-KnowComp/IntentionQA.
Ding et al. (ven,) ont étudié cette question.