Key points are not available for this paper at this time.
Dieses Papier zielt darauf ab, große Sprachmodelle (LLMs) effizient in die Lage zu versetzen, multimodale Werkzeuge zu verwenden. Fortschrittliche proprietäre LLMs, wie ChatGPT und GPT-4, haben großes Potenzial für die Nutzung von Werkzeugen durch ausgeklügeltes Prompt Engineering gezeigt. Dennoch basieren diese Modelle typischerweise auf prohibitiv hohen Rechenkosten und öffentlich nicht zugänglichen Daten. Um diese Herausforderungen anzugehen, schlagen wir die GPT4Tools vor, basierend auf Selbstanleitung, um Open-Source-LLMs, wie LLaMA und OPT, zu befähigen, Werkzeuge zu verwenden. Es generiert einen datensatzübergreifenden Anweisungen, indem es einen fortgeschrittenen Lehrer mit verschiedenen multimodalen Kontexten anregt. Durch die Verwendung der Low-Rank-Adaptation (LoRA) Optimierung ermöglicht unser Ansatz den Open-Source-LLMs, eine Reihe von visuellen Problemen zu lösen, einschließlich visueller Verständnis und Bildgenerierung. Darüber hinaus bieten wir einen Benchmark zur Bewertung der Fähigkeit von LLMs, Werkzeuge zu verwenden, der sowohl in Zero-Shot- als auch in Feinabstimmungsweisen durchgeführt wird. Umfassende Experimente zeigen die Effektivität unserer Methode auf verschiedenen Sprachmodellen, die nicht nur die Genauigkeit der Nutzung bekannter Werkzeuge erheblich verbessert, sondern auch die Zero-Shot-Fähigkeit für unbekannte Werkzeuge ermöglicht. Der Code und die Demo sind verfügbar unter https://github.com/StevenGrove/GPT4Tools.
Yang et al. (Dienstag) haben diese Frage untersucht.