Wir beschreiben NPC Fast 1.7B, ein duales kleines Sprachmodell, das auf einem einzigen H100 trainiert wurde, um sowohl als allgemeiner Assistent für einfache Anfragen als auch als Routing-Klassifikator zu fungieren, der schwierigere Anfragen an einen Fachmann weiterleitet. Das Modell basiert auf SmolLM2-1.7B-Instruct und wird in zwei Phasen entwickelt: volles Gewicht kontinuierliches Pretraining mit 4K und 16K Kontext unter Verwendung eines Curriculum-Plans mit YaRN RoPE, das für eine längere Erweiterung konfiguriert ist, gefolgt von einem kleinen Router-Head, der mithilfe von LoRA auf 500 synthetischen Prompt/Label-Paaren in 96 Sekunden Echtzeittraining feinabgestimmt wurde. Der Router erreicht 98,3% Genauigkeit bei einem zurückgehaltenen Abfrage-Set außerhalb der Verteilung; das Modell erzielt 77,8% bei IFEval und 100% in einer kleinen Funktionsaufruf-Sanity-Suite innerhalb der Verteilung. Wir dokumentieren die gesamte Pipeline, die diese Zahlen ergeben hat, einschließlich fünf konkreter Fehler, die während der Entwicklung aufgetreten sind und der Workarounds, die wir angewendet haben. Wir haben nur die Phasen 1-2 eines geplanten fünfstufigen Curriculums trainiert, wobei der effektive Kontext des Modells bei 16K blieb, obwohl YaRN für 131.072 konfiguriert war. Needle-in-haystack-Retrieval bei 32K beträgt 0%, was wir dokumentieren, anstatt es zu verbergen. Der gesamte Rechenaufwand des Projekts beläuft sich auf ungefähr 100 H100-Stunden. Der Beitrag ist keine neuartige Methode. Es handelt sich um ein dokumentiertes End-to-End-Rezept zur Erstellung eines brauchbaren kleinen Modells mit forschungsähnlichen Standardeinstellungen auf Hardware, die für einen einzelnen Forscher zugänglich ist, einschließlich der Fehler und der unerfüllten Ambitionen, die zusammen mit den Erfolgen berichtet werden.
Rama Krishna Bachu (Sat,) untersuchte diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: