Key points are not available for this paper at this time.
يمكن لنماذج اللغة الكبيرة (LLM) استدعاء مجموعة متنوعة من الأدوات وواجهات برمجة التطبيقات لإكمال المهام المعقدة. يمكن التحكم في الكمبيوتر، باعتباره الأداة الأكثر قوة وشمولية، من قبل وكيل LLM مدرب. مدفوعًا بالكمبيوتر، نأمل أن نبني وكيلًا أكثر عمومية لمساعدة البشر في مختلف الأعمال الرقمية اليومية. في هذه الورقة، نقوم بإنشاء بيئة لوكيل نموذج لغة الرؤية (VLM) للتفاعل مع شاشة الكمبيوتر الحقيقية. داخل هذه البيئة، يمكن للوكيل مراقبة لقطات الشاشة والتلاعب بواجهة المستخدم الرسومية (GUI) من خلال إخراج إجراءات الفأرة ولوحة المفاتيح. كما نصمم خط أنابيب تحكم آلي يتضمن مراحل التخطيط والتنفيذ والتفكير، مما يوجه الوكيل للتفاعل باستمرار مع البيئة وإتمام المهام متعددة الخطوات. بالإضافة إلى ذلك، نقوم بإنشاء مجموعة بيانات ScreenAgent، التي تجمع لقطات شاشة وتسلسلات إجراءات عند إكمال مهام الكمبيوتر اليومية. أخيرًا، نقوم بتدريب نموذج، ScreenAgent، الذي يحقق قدرات تحكم حاسوبي مشابهة لـ GPT-4V وأظهر قدرات أكثر دقة في تحديد واجهة المستخدم. يمكن أن تلهم محاولاتنا مزيدًا من البحث حول بناء وكيل LLM عام. الشيفرة والمزيد من المعلومات التفصيلية متاحة على https://github.com/niuzaisheng/ScreenAgent.
نظر نيو وآخرون (2024) في هذا السؤال.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: