Los puntos clave no están disponibles para este artículo en este momento.
MoE facilita el desarrollo de modelos grandes al hacer que la complejidad computacional del modelo ya no escale linealmente con el aumento de parámetros. La red de puertas escasas de aprendizaje selecciona un conjunto de expertos para cada token a procesar; sin embargo, esto puede llevar a diferencias en el número de tokens procesados por cada experto a lo largo de varias iteraciones sucesivas, es decir, las fluctuaciones de carga de los expertos, lo que reduce la paralelización computacional y la utilización de recursos. Con este fin, trazamos y analizamos las cargas de cada experto en las iteraciones de entrenamiento para varios modelos de lenguaje grandes en este trabajo, y definimos el estado transitorio con "fluctuaciones de carga obvias" y el estado estable con "localidad temporal". Además, dadas las características de estos dos estados y la sobrecarga computacional, implementamos tres algoritmos de predicción clásicos que logran resultados precisos de predicción de carga de expertos. Para el modelo GPT3 350M, las tasas de error promedio para predecir la proporción de carga de expertos durante los próximos 1,000 y 2,000 pasos son aproximadamente 1.3% y 1.8%, respectivamente. Este trabajo puede proporcionar orientación valiosa para la ubicación de expertos o asignación de recursos para el entrenamiento de modelos MoE. Basado en este trabajo, propondremos un esquema de ubicación de expertos para estados transitorios y estables en nuestro próximo trabajo.
Cong et al. (Jue,) estudiaron esta cuestión.