Los puntos clave no están disponibles para este artículo en este momento.
El desarrollo reciente en Modelos de Lenguaje Grande (LLMs) y Modelos de Lenguaje Grande Multimodal (MLLMs) ha aprovechado arquitecturas de Transformadores basadas en Atención y ha alcanzado un rendimiento superior y capacidades de generalización. Desde entonces, han cubierto amplias áreas de tareas de aprendizaje tradicional. Por ejemplo, tareas basadas en texto como la clasificación de texto y el etiquetado de secuencias, así como tareas multimodales como Respuesta a Preguntas Visuales (VQA) y Reconocimiento Óptico de Caracteres (OCR), que anteriormente se abordaban utilizando diferentes modelos, ahora se pueden abordar en base a un modelo fundamental. En consecuencia, el entrenamiento y el ajuste fino liviano de LLMs y MLLMs, especialmente aquellos basados en arquitectura de Transformador, se ha vuelto particularmente importante. En reconocimiento de estas necesidades abrumadoras, desarrollamos SWIFT, una infraestructura personalizable todo-en-uno para modelos grandes. Con el soporte de más de 300 LLMs y 50 MLLMs, SWIFT se posiciona como el marco de código abierto que proporciona el soporte más completo para el ajuste fino de modelos grandes. En particular, es el primer marco de entrenamiento que ofrece soporte sistemático para MLLMs. Además de las funcionalidades básicas de ajuste fino, SWIFT también integra procesos posteriores al entrenamiento como inferencia, evaluación y cuantización de modelos, para facilitar la rápida adopción de modelos grandes en varios escenarios de aplicación. Con una integración sistemática de diversas técnicas de entrenamiento, SWIFT ofrece utilidades útiles como comparaciones de referencia entre diferentes técnicas de entrenamiento para modelos grandes. Para modelos de ajuste fino especializados en marcos de agentes, mostramos que se pueden lograr mejoras notables en la clasificación de ToolBench mediante el entrenamiento con conjuntos de datos personalizados en SWIFT, con un aumento del 5.2%-21.8% en la métrica Act. EM sobre varios modelos base, una reducción en la alucinación del 1.6%-14.1%, y una mejora promedio de rendimiento del 8%-17%.
Zhao et al. (Sat,) estudiaron esta pregunta.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: