Uma parte significativa dos dados do mundo real é inerentemente representada como gráficos textuais, e integrar esses gráficos em grandes modelos de linguagem (LLMs) promete habilitar respostas a perguntas complexas baseadas em gráficos. No entanto, um desafio chave nos sistemas de QA textual baseados em LLMs reside na recuperação de gráficos, ou seja, como recuperar conteúdo relevante de grandes gráficos que seja suficientemente informativo enquanto permanece compacto para o contexto do LLM. Recuperadores existentes sofrem de desempenho fraco, pois dependem de similaridade superficial de embeddings ou empregam políticas de recuperação interativas que demandam rotulagem de dados excessiva e custo de treinamento. Para resolver esses problemas, apresentamos o Graph-S³, uma estrutura de raciocínio de gráfico textual agentivo que emprega um recuperador baseado em LLM treinado com supervisão sintética passo a passo. Em vez de recompensar o agente com base nas respostas finais, que podem levar a sinais de treinamento escassos e instáveis, propomos avaliar de perto cada etapa do recuperador com base em subgrafos dourados extraídos offline. Nossas principais técnicas incluem um pipeline de síntese de dados para extrair os subgrafos dourados para geração de recompensas e um esquema de treinamento em duas etapas para aprender a política de exploração interativa de gráficos com base nas recompensas sintetizadas. Com base em extensos experimentos em três conjuntos de dados comuns em comparação com sete bases sólidas, nossa abordagem alcança uma melhoria média de 8,1% na precisão e 9,7% na pontuação F₁. A vantagem é ainda maior em tarefas de raciocínio mais complicadas de múltiplas etapas. Nosso código será de código aberto.
Ge et al. (Quarta-feira,) estudaram esta questão.