Key points are not available for this paper at this time.
Konversations-KI hat bedeutende Fortschritte gemacht, jedoch stellt die Integration von multimodalen Interaktionen, insbesondere auf Edge-Geräten, eine neuartige Grenze dar, die aufgrund der rechnerischen Einschränkungen primär erforscht werden muss. Dieses Papier schlägt das tinyDigiClones-Framework vor, das die Kommunikation mit einem personalisierten AI-Assistenten ermöglicht, der optimierte große Sprachmodelle (LLMs) für die Verarbeitung natürlicher Sprache (NLP) und Deep-Learning-Modelle für die automatische Spracherkennung (ASR) sowie realistische Sprachsynthese nutzt. Dieses Papier untersucht verschiedene Optionen für unterschiedliche KI-Modelle, die in unserem Framework eingesetzt werden, mit einem Hauptaugenmerk auf die Gewährleistung einer effizienten Bereitstellung auf Edge-Geräten bei gleichzeitiger hoher Genauigkeit. Um die Sprachstile der Benutzer nachzubilden und die einzigartigen stimmlichen Merkmale zu erlernen, werden die Text-to-Speech (TTS)-Modelle mit einem benutzerdefinierten Datensatz von Audio-Text-Paaren trainiert. Dieser wird automatisch vom ASR-Modul generiert, das erweiterte Sätze in kürzere, transkribierte Audio-Dateien segmentiert. Darüber hinaus stellt der Einsatz modernster LLMs auf ressourcenbeschränkten Geräten eine erhebliche Herausforderung dar, insbesondere bei der Aufrechterhaltung minimaler Latenzzeiten, angesichts ihrer umfangreichen Parameteranzahl. In diesem Zusammenhang untersuchen wir mehrere leichtgewichtige LLMs und wenden Optimierungstechniken an, die darauf abzielen, die Rechenkosten zu senken. Die Integration dieser Modelle wird durch einen digitalen Avatar verkörpert, der das Gesicht und die Stimme des Benutzers widerspiegelt und ein immersives Erlebnis bietet. Die Bereitstellung am Edge verringert die Serverlatenz und verbessert die Privatsphäre, wodurch Echtzeitanwendungsfähigkeiten von KI-Chatbots ermöglicht werden, die ideal für interaktive digitale Avatare sind.
Basit et al. (Sun,) studied this question.