Key points are not available for this paper at this time.
Zusammenfassung Große Sprachmodelle (LLMs) sind zunehmend leistungsfähiger geworden, aber ihre Entwicklung erfordert oft erhebliche Rechenressourcen. Obwohl das Zusammenführen von Modellen als kosteneffizienter vielversprechender Ansatz zur Erstellung neuer Modelle durch Kombination bestehender Modelle entstanden ist, basiert es derzeit auf menschlicher Intuition und Fachwissen, was sein Potenzial einschränkt. Hier schlagen wir einen evolutionären Ansatz vor, der diese Einschränkung überwinden kann, indem er automatisch effektive Kombinationen verschiedener Open-Source-Modelle entdeckt und deren kollektive Intelligenz nutzt, ohne umfangreiche zusätzliche Trainingsdaten oder Rechenleistung zu erfordern. Unser Ansatz arbeitet sowohl im Parameterraum als auch im Datenflussraum und ermöglicht Optimierungen über die Gewichte der einzelnen Modelle hinaus. Dieser Ansatz ermöglicht sogar die domänenübergreifende Fusion und erzeugt Modelle wie ein japanisches LLM mit mathematischen Denkfähigkeiten. Überraschenderweise erzielte unser japanisches Mathematik-LLM in verschiedenen etablierten Benchmark-Tests für japanische LLMs eine erstklassige Leistung und übertraf sogar Modelle mit erheblich mehr Parametern, obwohl es nicht ausdrücklich für solche Aufgaben trainiert wurde. Darüber hinaus zeigt ein kulturell bewusster japanischer Bild-Sprach-Modell, das durch unseren Ansatz generiert wurde, seine Effektivität bei der Beschreibung kulturspezifischer japanischer Inhalte und übertrifft frühere japanische Bild-Sprach-Modelle. Diese Arbeit trägt nicht nur neue erstklassige Modelle zur Open-Source-Community bei, sondern führt auch ein neues Paradigma für die automatisierte Modellsynthese ein und ebnet den Weg für die Erkundung alternativer, effizienter Ansätze zur Entwicklung von Fundamentmodellen.
Akiba et al. (Mon,) haben diese Frage untersucht.