Key points are not available for this paper at this time.
Cet article vise à permettre efficacement aux grands modèles linguistiques (LLMs) d'utiliser des outils multimodaux. Des LLMs avancés et propriétaires, tels que ChatGPT et GPT-4, ont montré un grand potentiel d'utilisation d'outils grâce à un ingénierie de prompt sophistiquée. Néanmoins, ces modèles reposent généralement sur des coûts computationnels prohibitifs et des données non accessibles au public. Pour relever ces défis, nous proposons GPT4Tools basé sur l'auto-instruction pour permettre aux LLMs open-source, comme LLaMA et OPT, d'utiliser des outils. Il génère un ensemble de données de suivi d'instructions en interrogeant un enseignant avancé avec divers contextes multimodaux. En utilisant l'optimisation par adaptation de rang faible (LoRA), notre approche facilite aux LLMs open-source la résolution d'une gamme de problèmes visuels, y compris la compréhension visuelle et la génération d'images. De plus, nous fournissons un benchmark pour évaluer la capacité des LLMs à utiliser des outils, qui est effectué à la fois de manière zero-shot et par ajustement fin. Des expériences approfondies démontrent l'efficacité de notre méthode sur divers modèles linguistiques, ce qui améliore non seulement de manière significative la précision d'invocation des outils vus, mais permet également la capacité zero-shot pour les outils non vus. Le code et la démo sont disponibles sur https://github.com/StevenGrove/GPT4Tools.
Yang et al. (Mar), ont étudié cette question.