Key points are not available for this paper at this time.
Bien que les collections de tests soient un élément vital de l'infrastructure de recherche pour la récupération d'information, la construction de collections de tests équitables et réutilisables pour de grands ensembles de données est un défi en raison du nombre d'évaluations de pertinence humaines requises. Plusieurs approches visant à minimiser le nombre de jugements nécessaires ont été proposées, y compris un ensemble de méthodes basées sur des techniques d'optimisation de bandit multi-bras. Cependant, la plupart de ces approches cherchent à maximiser le nombre total de documents pertinents trouvés, ce qui n'est pas nécessairement équitable, et elles n'ont été démontrées que par simulation sur des collections de tests existantes. La piste Common Core TREC 2017 a offert l'opportunité de construire une collection de novo en utilisant une méthode de bandit. Cela a nécessité de s'attaquer à deux problèmes non rencontrés en simulation : donner aux juges humains le temps d'apprendre un sujet et répartir le budget global de jugement entre les sujets. La technique de bandit modifiée résultante a été utilisée pour construire la collection de tests Common Core 2017 composée d'environ 1,8 million d'articles de presse, 50 sujets et 30 030 jugements. Malheureusement, la collection construite est de qualité inférieure à ce qui était anticipé : un grand pourcentage des documents pertinents connus n'a été récupéré que par une seule équipe, et pour 21 sujets, plus d'un tiers des documents jugés sont pertinents. Ainsi, la collection est moins réutilisable que souhaité. Une analyse supplémentaire démontre que l'approche avare commune à la plupart des méthodes de bandit peut être injuste même pour les courses participant au processus de construction de la collection lorsque le budget de jugement est faible par rapport au nombre (inconnu) de documents pertinents.
Ellen M. Voorhees (Mer,) a étudié cette question.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: