Cet article examine les stratégies de génération de données synthétiques dans le développement de modèles de récupération générative pour des corpus spécifiques au domaine, abordant ainsi les défis de scalabilité inhérents à l'annotation manuelle des requêtes dans le domaine. Nous étudions les stratégies de données pour un cadre d'entraînement en deux étapes : dans la première étape, qui se concentre sur l'apprentissage de la décryption des identifiants de documents à partir des requêtes, nous examinons les requêtes générées par LLM à travers diverses granularités (par exemple, morceaux, phrases) et des contraintes de recherche pertinentes pour le domaine qui peuvent mieux capturer les signaux de pertinence nuancés. Dans la deuxième étape, visant à affiner le classement des documents par l'apprentissage des préférences, nous explorons les stratégies de minage de faux négatifs difficiles basées sur les prédictions du modèle initial. Des expériences sur des ensembles de données publiques dans divers domaines démontrent l'efficacité de notre approche de génération de données synthétiques et de sampling de faux négatifs difficiles.
Wen et al. (Mar,) ont étudié cette question.