Key points are not available for this paper at this time.
Recentemente, a utilização de modelos de linguagem grandes (LLMs) ou modelos de linguagem multimodais grandes (MLLMs) para compreensão de documentos mostrou-se muito promissora. No entanto, trabalhos anteriores que empregam LLMs/MLLMs para compreensão de documentos não exploraram e utilizaram totalmente as informações de layout do documento, que são vitais para uma compreensão precisa. Neste artigo, propomos o LayoutLLM, um método baseado em LLM/MLLM para compreensão de documentos. O núcleo do LayoutLLM é uma estratégia de ajuste de instrução de layout, que foi especialmente projetada para melhorar a compreensão e utilização dos layouts de documentos. A estratégia proposta de ajuste de instrução de layout consiste em dois componentes: Pré-treinamento consciente de layout e Ajuste fino supervisionado consciente de layout. Para capturar as características do layout do documento no Pré-treinamento consciente de layout, introduzimos três grupos de tarefas de pré-treinamento, correspondentes às informações em nível de documento, em nível de região e em nível de segmento. Além disso, um novo módulo chamado cadeia de pensamento de layout (LayoutCoT) foi desenvolvido para permitir que o LayoutLLM se concentre em regiões relevantes à pergunta e gere respostas precisas. O LayoutCoT é eficaz para aumentar o desempenho da compreensão de documentos. Enquanto isso, traz um certo grau de interpretabilidade, o que pode facilitar a inspeção e correção manual. Experimentos em benchmarks padrão mostram que o LayoutLLM proposto supera significativamente os métodos existentes que adotam LLMs/MLLMs de código aberto 7B para compreensão de documentos. Os dados de treinamento do LayoutLLM estão disponíveis publicamente em https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/DocumentUnderstanding/LayoutLLM
Luo et al. (Mon,) estudaram esta questão.