Construir corporações de conteúdo especializadas a partir de vastas fontes da web não estruturadas para aplicações específicas de domínio apresenta desafios substanciais de curadoria de dados. Neste artigo, introduzimos uma abordagem simplificada para gerar corporações de alta qualidade e específicas de domínio, adquirindo, filtrando, estruturando e limpando dados baseados na web de forma eficiente. Mostramos como Modelos de Linguagem Grande (LLMs) podem ser aproveitados para abordar a curadoria complexa de dados em escala e propomos uma estrutura estratégica incorporando técnicas aprimoradas por LLMs para extração de conteúdo estruturado e deduplicação semântica. Validamos nossa abordagem no domínio da educação comportamental através de sua integração no 30 Day Me, um aplicativo de formação de hábitos. Nossa linha de dados, chamada 30DayGen, possibilitou a extração e síntese de 3.531 desafios únicos de 30 dias de mais de 15 mil páginas da web. Uma pesquisa com usuários reporta uma pontuação de satisfação de 4,3 em 5, com 91% dos entrevistados indicando disposição para usar o conteúdo curado para seus objetivos de formação de hábitos.
Zhang et al. (Sex,) estudaram esta questão.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: