Key points are not available for this paper at this time.
Die Aufgaben zum Betrieb mobiler Geräte werden zunehmend zu einem beliebten mehrmodalen KI-Anwendungsszenario. Aktuelle mehrmodale große Sprachmodelle (MLLMs), die durch ihre Trainingsdaten eingeschränkt sind, verfügen nicht über die Fähigkeit, effektiv als Betriebsassistenten zu fungieren. Stattdessen werden MLLM-basierte Agenten, die ihre Fähigkeiten durch Tool-Nutzung erweitern, schrittweise in diesem Szenario angewendet. Die zwei Hauptnavigationherausforderungen in den Aufgaben zum Betrieb mobiler Geräte, die Navigation des Aufgabenfortschritts und die Navigation des Fokusinhalts, sind jedoch unter der Einzelagentenarchitektur bestehender Arbeiten erheblich kompliziert. Dies liegt an den übermäßig langen Token-Sequenzen und dem vermischten Text-Bild-Datenformat, die die Leistung einschränken. Um diese Navigationsherausforderungen effektiv zu bewältigen, schlagen wir Mobile-Agent-v2 vor, eine Multi-Agenten-Architektur zur Unterstützung des Betriebs mobiler Geräte. Die Architektur besteht aus drei Agenten: Planungsagent, Entscheidungsagent und Reflexionsagent. Der Planungsagent generiert den Aufgabenfortschritt, wodurch die Navigation der historischen Operationen effizienter wird. Um den Fokusinhalt beizubehalten, entwerfen wir eine Speichereinheit, die sich mit dem Aufgabenfortschritt aktualisiert. Zusätzlich beobachtet der Reflexionsagent die Ergebnisse jeder Operation, um fehlerhafte Operationen zu korrigieren und entsprechende Fehler zu verwalten. Experimentelle Ergebnisse zeigen, dass Mobile-Agent-v2 eine Verbesserung von über 30 % bei der Aufgabenerfüllung im Vergleich zur Einzelagentenarchitektur von Mobile-Agent erzielt. Der Code ist open-source unter https://github.com/X-PLUG/MobileAgent.
Wang et al. (2024) haben diese Frage untersucht.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: