Nous présentons le Prototype Multi-LLM, un cadre de recherche open-source qui met plusieurs modèles de langage larges (LLMs) au travail sur la même invite, sous un processus de décision unique. L'observation de départ est simple : en pratique, aucun modèle unique n'est constamment le meilleur en qualité, latence, coût et domaine en même temps, donc choisir un modèle par demande laisse de la valeur non exploitée. Notre système décompose une demande entrante en sous-tâches plus petites, évalue chaque modèle candidat sur chaque sous-tâche à travers une fonction multi-critères interprétable, envoie chaque sous-tâche au modèle le plus adéquat, puis gère le désaccord de manière explicite à travers un pipeline de résolution de conflits en plusieurs étapes plutôt que de le masquer. Par rapport aux cadres d'orchestration existants, nos contributions spécifiques sont un score de routage linéaire transparent avec des poids par défaut documentés et un balayage de sensibilité publié, un pipeline de résolution de conflits en quatre étapes basé sur une métrique de distance cosinus explicite, une étape de synthèse pondérée par la confiance inspirée par la théorie des preuves, et une boucle de rétroaction adaptative inspectable dont la règle de mise à jour est donnée sous forme fermée. Nous l'avons construit à la fois comme un cadre d'expérimentation et un prototype opérationnel, reposant sur un backend FastAPI, un frontend Next.js, des adaptateurs de fournisseurs pluggables, un streaming WebSocket, des tableaux de bord d'explicabilité et un déploiement basé sur Docker. L'objectif est de donner aux chercheurs et aux praticiens un environnement reproductible pour tester des stratégies multi-modèles sous des contraintes explicites de budget et de performance, chaque décision de routage étant traçable de bout en bout.
Tourad et al. (Jeu,) ont étudié cette question.