Los Modelos de Lenguaje Grande (LLMs) exhiben capacidades distintas a través de diferentes dominios de conocimiento, sin embargo, las implementaciones de un solo modelo enfrentan dificultades con tareas que requieren un razonamiento interdominio intensivo en conocimiento. Presentamos eVoiceClaw Desktop, un sistema de orquestación multi-modelo que operacionaliza un paradigma de \"IA gestionando IA\": en lugar de que los humanos seleccionen manualmente los modelos, el sistema redirige dinámicamente consultas complejas a modelos especializados mediante un algoritmo de enrutamiento directo por dimensión. El sistema pasó por cuatro grandes iteraciones de configuración (V1–V4), culminando en V5 que aborda desafíos críticos en la asignación de tareas interdominio y sesgo de acumulación semántica. V5 logra una tasa de disparo de flujo de trabajo del 98% en 50 preguntas de referencia en chino, aprovechando 12 modelos con diversidad equilibrada (modelo superior ≤16% de participación en el uso). Se evalúa la calidad de la respuesta utilizando LLM-as-Judge (Claude Opus 4.6) a través de cuatro dimensiones: precisión factual, completitud, profundidad y estructura. En comparación con las referencias de un solo modelo, V5 logra una mejora general de calidad del 14.3%, con una mejora en la profundidad de análisis del 25.9%, a expensas de aproximadamente 9 veces más latencia y costos. Como una meta-demostración, el borrador inicial de este artículo fue generado por el mismo sistema (ver Apéndice B).
Tao Rui (Sat,) estudió esta cuestión.