Google describe MIRAS y Titans, un posible camino hacia el aprendizaje continuo de la IA

resumen
Resumen

Un año después de publicar su artículo Titans, Google detalló formalmente la arquitectura en su blog de investigación y la combinó con un nuevo marco llamado MIRAS. Ambos proyectos apuntan a una frontera importante en IA: modelos que continúan aprendiendo durante el uso y retienen la memoria funcional a largo plazo en lugar de permanecer estáticos después del entrenamiento previo.

Google enmarca la motivación en términos familiares. Los transformadores tradicionales luchan con entradas muy largas, como libros, secuencias genómicas o vídeos extendidos, porque su coste computacional crece cuadráticamente con la longitud del contexto. Las alternativas más rápidas, como los RNN modernos o los modelos de espacio de estados, se escalan mejor, pero comprimen todo el contexto en un único estado interno, perdiendo detalles importantes. Titans está diseñado para cerrar esa brecha combinando una memoria precisa a corto plazo a través de atención en ventanas con una memoria a largo plazo entrenable separada que puede actualizarse durante la inferencia y retener selectivamente información sorprendente o inesperada.

La compañía también está presentando MIRAS, un marco teórico descrito por primera vez en abril en el artículo. «Todo está conectado: un viaje a través de la memorización en el momento del examen, el sesgo de atención, la retención y la optimización en línea». Los investigadores sostienen que muchos de los nuevos modelos de secuencia lanzados en los últimos años (desde variantes de Transformer hasta RetNet, Mamba, DeltaNet y RWKV) pueden verse como diferentes implementaciones de la misma idea subyacente: un sistema de búsqueda interna que combina entradas (claves) con salidas (valores).

MIRAS divide este sistema en cuatro preguntas de diseño. ¿Cómo es la estructura de búsqueda: un vector, una matriz o una red pequeña o profunda? ¿Qué regla de puntuación interna determina qué se almacena bien? ¿Con qué rapidez la nueva información reemplaza las entradas antiguas? ¿Y qué regla de actualización rige cómo cambian esas entradas con el tiempo? Desde este punto de vista, Google trae nuevos modelos que llaman la atención, como Moneta, Yaad y Memora, que exploran deliberadamente estos espacios de diseño y, en pruebas con contextos extremadamente largos, a veces superan a Mamba2 y a los Transformers estándar.

Anuncio

Titans y MIRAS reflejan los límites de las arquitecturas Transformer dominantes en la actualidad y pueden representar parte del cambio hacia lo que Ilya Sutskever describió recientemente como una nueva era de investigación en IA. En una entrevista con Dwarkesh Patel, el ex científico jefe de OpenAI argumentó que simplemente escalar datos y computación está generando rendimientos decrecientes, y describió la visión de su startup SSI de una superinteligencia que aprende en el trabajo más como un joven talentoso que como un AGI completamente formado abandonado de un grupo de entrenamiento.

El enfoque de Google es diferente del de Sutskever, pero apunta a la misma brecha: ir más allá de los modelos estáticos previamente entrenados hacia sistemas que expanden sus capacidades con el tiempo, ya sea a través de módulos de memoria explícitos como Titans o mediante nuevos paradigmas de aprendizaje que aún están esperando ser descubiertos.

Artículo original del 17 de enero de 2025.

Los investigadores de Google han desarrollado un nuevo tipo de modelo Transformer que proporciona a los patrones del lenguaje algo parecido a la memoria a largo plazo. El sistema puede manejar secuencias de información mucho más largas que los modelos actuales, lo que permite un mejor rendimiento en diversas tareas.

La nueva arquitectura «Titans» se inspira en cómo funciona la memoria humana. Al combinar la memoria artificial corta y larga a través de bloques de atención y MLP de memoria, el sistema puede trabajar con largas secuencias de información.

Recomendación

El próximo salto en IA depende de agentes que aprendan haciendo, no solo leyendo lo que los humanos han escrito

El próximo salto en IA depende de agentes que aprendan haciendo, no solo leyendo lo que los humanos han escrito

Una de las características inteligentes del sistema es cómo decide qué recordar. Titans utiliza la «sorpresa» como métrica clave: cuanto más inesperada es una información, es más probable que se almacene en la memoria a largo plazo. El sistema también sabe cuándo olvida cosas, lo que le ayuda a utilizar el espacio de la memoria de manera eficiente.

El equipo creó tres versiones diferentes de Titans, cada una de las cuales se ocupa de la memoria a largo plazo de una manera diferente:
– Memoria como contexto (MAC)
– La memoria como puerta (MAG)
– Memoria como capa (MAL)

Si bien cada versión tiene sus puntos fuertes, la variante MAC funciona especialmente bien con secuencias muy largas.

Imagen: Google

Mejor rendimiento en tareas de contexto largo

En pruebas exhaustivas, Titans superó a modelos tradicionales como el clásico Transformer y a modelos híbridos más nuevos como Mamba2, particularmente cuando se trata de textos muy largos. El equipo dice que puede manejar ventanas de contexto de más de 2 millones de tokens de manera más efectiva, estableciendo nuevos récords tanto para el modelado de lenguaje como para la predicción de series temporales con contextos largos.

El sistema también destacó en la prueba «Aguja en el pajar», en la que necesita encontrar información específica en textos muy largos. Titans logró más del 95% de precisión incluso con textos de 16.000 tokens. Si bien algunos modelos de OpenAI, Anthropic y Google funcionan mejor, son mucho más grandes: la versión más grande de Titans tiene solo 760 millones de parámetros.

Los modelos Titans también superan a los modelos lingüísticos mucho más grandes en tareas que requieren la comprensión de contextos más amplios. | Imagen: Google

Titans realmente mostró su fuerza en el punto de referencia BABILong, una larga prueba de comprensión en la que los modelos deben combinar los hechos distribuidos en documentos muy extensos. El sistema superó a modelos más grandes como GPT-4, RecurrentGemma-9B y Llama3.1-70B. Incluso venció a Llama3 con generación de recuperación aumentada (RAG), aunque algunos modelos de recuperación especializados aún funcionan mejor.

El equipo espera que el código esté disponible públicamente en un futuro próximo. Si bien Titans y arquitecturas similares pueden conducir a modelos de lenguaje que manejan contextos más largos y hacen mejores inferencias, los beneficios pueden ir más allá del simple procesamiento de texto. Las primeras pruebas del equipo con modelado de ADN sugieren que la tecnología también podría mejorar otras aplicaciones, incluido el modelado de vídeo, suponiendo que los prometedores resultados de referencia se mantengan en el uso en el mundo real.

Isabel Vertiz

Acerca de Isabel Vertiz

Soy Isabel Vertiz y potenciamos la tecnología de vanguardia en todas las escuelas e institutos donde el estado no llega, queremos que el estado ayude a muchos con tecnología de punta.

Ver todas las entradas de Isabel Vertiz →

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *