Key points are not available for this paper at this time.
Les avancées récentes dans les modèles de langage de grande taille (LLM) ont élargi leurs capacités aux contextes multimodaux, y compris la compréhension vidéo complète. Cependant, le traitement de vidéos étendues telles que les enregistrements CCTV de 24 heures ou les films complets présente des défis significatifs en raison des vastes données et des exigences de traitement. Les méthodes traditionnelles, comme l'extraction de cadres clés ou la conversion de cadres en texte, entraînent souvent une perte d'information substantielle. Pour remédier à ces lacunes, nous développons OmAgent, qui stocke et récupère efficacement les cadres vidéo pertinents pour des requêtes spécifiques, préservant le contenu détaillé des vidéos. De plus, il dispose d'une boucle de division et conquête capable de raisonnement autonome, invoquant dynamiquement des API et des outils pour améliorer le traitement des requêtes et l'exactitude. Cette approche assure une compréhension robuste des vidéos, réduisant considérablement la perte d'information. Les résultats expérimentaux confirment l'efficacité d'OmAgent dans la gestion de divers types de vidéos et de tâches complexes. De plus, nous l'avons doté d'une plus grande autonomie et d'un système d'appel d'outils robuste, lui permettant d'accomplir des tâches encore plus complexes.
Zhang et al. (Mon,) ont étudié cette question.