Wir stellen Sovereign-Lila-E8 (Li Lattice Attention Language Model) vor, eine Transformer-Architektur, die das Wurzelsystem der außergewöhnlichen Lie-Algebra E8 in den Aufmerksamkeitsmechanismus integriert. Durch die sanfte Quantisierung verborgener Zustände in die 240 Wurzeln von E8 und das Hinzufügen geometrischer Verzerrungen zu den Aufmerksamkeitswerten erreicht das Modell eine dichte semantische Packung und verbesserte Kohärenz über lange Kontexte. Auf dem TinyStories-Datensatz trainiert mit nur 40 Millionen Parametern generiert unser Modell kohärente Geschichten mit bis zu 512 Tokens — der vollen Trainingslänge — und extrapoliert elegant auf 1500 Tokens, ohne in sich wiederholende Schleifen zu verfallen. Im Gegensatz dazu zeigt ein vergleichbarer Baseline (Microsofts 33M/60M-Modell) nach 300-500 Tokens harte Schleifen. Wir liefern mathematische Details, experimentelle Ergebnisse und qualitativ hochwertige Beispiele. Unser Modell erreicht einen Validierungsverlust von 0,46–0,6, was deutlich niedriger ist als die standardmäßigen Transformer-Baselines vergleichbarer Größe.
Anatolii Kornienko (Sun,) studierte diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: