Los puntos clave no están disponibles para este artículo en este momento.
Aprender de manera efectiva a partir de datos secuenciales es un objetivo de larga data de la Inteligencia Artificial, especialmente en el caso de secuencias largas. Desde el inicio del Aprendizaje Automático, varios investigadores se han dedicado a buscar algoritmos y arquitecturas capaces de procesar secuencias de patrones, reteniendo información sobre las entradas pasadas mientras aprovechan los datos venideros, sin perder valiosas dependencias y correlaciones a largo plazo. Si bien este objetivo final está inspirado en la característica humana del procesamiento continuo en tiempo real de la información sensorial, varias soluciones simplificaron el paradigma de aprendizaje al limitar artificialmente el contexto procesado o al tratar con secuencias de longitud limitada, dadas de antemano. Estas soluciones fueron enfatizadas por la gran ubicuidad de los Transformadores, que inicialmente oscurecieron el papel de las Redes Neuronales Recurrentes. Sin embargo, las redes recurrentes están enfrentando un fuerte renacimiento reciente debido a la creciente popularidad de los modelos (profundos) en Espacio de Estados y nuevas instancias de Transformadores de gran contexto, que se basan tanto en cálculos recurrentes para superar varios límites de las tecnologías actualmente ubicuas. De hecho, el rápido desarrollo de Modelos de Lenguaje Grande aumentó el interés en soluciones eficientes para procesar datos a lo largo del tiempo. Esta encuesta proporciona un resumen detallado de los últimos enfoques que se basan en modelos recurrentes para el procesamiento de datos secuenciales. Se informa y discute una taxonomía completa sobre las últimas tendencias en soluciones arquitectónicas y algorítmicas, guiando a los investigadores en este atractivo campo de investigación. La imagen emergente sugiere que hay espacio para pensar en nuevas rutas, constituidas por algoritmos de aprendizaje que se apartan de la retropropagación estándar a través del tiempo, hacia un escenario más realista donde los patrones se procesan efectivamente en línea, aprovechando cálculos locales hacia adelante, abriendo a más investigaciones sobre este tema.
Tiezzi et al. (2024) estudiaron esta cuestión.