Key points are not available for this paper at this time.
Modelos de Linguagem de Grande Escala (LLM) podem invocar uma variedade de ferramentas e APIs para completar tarefas complexas. O computador, como a ferramenta mais poderosa e universal, poderia potencialmente ser controlado por um agente LLM treinado. Alimentados pelo computador, podemos construir um agente mais generalizado para ajudar os humanos em várias atividades digitais diárias. Neste artigo, construímos um ambiente para um agente de Modelo de Linguagem Visual (VLM) interagir com uma tela de computador real. Dentro deste ambiente, o agente pode observar capturas de tela e manipular a Interface Gráfica do Usuário (GUI) através da execução de ações de mouse e teclado. Também projetamos um pipeline de controle automatizado que inclui fases de planejamento, ação e reflexão, orientando o agente a interagir continuamente com o ambiente e completar tarefas de múltiplos passos. Além disso, construímos o Conjunto de Dados ScreenAgent, que coleta capturas de tela e sequências de ações ao completar tarefas diárias no computador. Finalmente, treinamos um modelo, ScreenAgent, que alcança capacidades de controle de computador comparáveis ao GPT-4V e demonstrou capacidades de posicionamento de UI mais precisas. Nossas tentativas podem inspirar pesquisas futuras sobre a construção de um agente LLM generalista. O código e mais informações detalhadas estão em https://github.com/niuzaisheng/ScreenAgent.
Niu et al. (2024) estudaram essa questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: