SeaLLM: Dienstbewusste und latenzoptimierte Ressourcenteilung für die Inferenz großer Sprachmodelle | Synapse