Descripción
Inspirado por los avances en el modelado de lenguaje a gran escala, Google DeepMind ha desarrollado Gato, un único agente generalista diseñado para operar más allá de los límites de las salidas basadas en texto. Gato funciona como una política generalista multimodal, multitarea y multi-embodiment. La misma red neuronal, utilizando pesos idénticos, puede participar en diversas actividades como jugar juegos de Atari, generar subtítulos para imágenes, participar en conversaciones y manipular objetos con un brazo robótico real. Su proceso de toma de decisiones se adapta dinámicamente en función del contexto proporcionado, determinando si debe generar texto, torques articulares, pulsaciones de botones u otras formas de tokens.
Durante su fase de entrenamiento, Gato procesa datos de diversas tareas y modalidades serializándolos en una secuencia plana de tokens. Esta secuencia se agrupa y se procesa mediante una red neuronal transformer, análoga a las utilizadas en los grandes modelos de lenguaje. La pérdida de entrenamiento se enmascara para asegurar que Gato se centre en predecir objetivos de acción y texto. Al desplegar Gato, se forma una secuencia inicial tokenizando un prompt, que podría ser una demostración. El entorno luego proporciona la primera observación, que también se tokeniza y se añade a esta secuencia. Gato muestrea autorregresivamente el vector de acción, un token a la vez. Una vez que se muestrean todos los tokens que constituyen el vector de acción, según lo dictado por la especificación de acción del entorno, la acción se decodifica y se envía al entorno. El entorno avanza, produciendo una nueva observación, y el proceso se repite. Crucialmente, el modelo siempre tiene acceso a todas las observaciones y acciones precedentes dentro de su ventana de contexto de 1024 tokens.
Gato se entrena con una extensa colección de conjuntos de datos que abarcan experiencias de agentes tanto de entornos simulados como del mundo real, junto con una variedad de conjuntos de datos de lenguaje natural e imágenes. El rendimiento del modelo Gato pre-entrenado, medido por su capacidad para superar un porcentaje de puntuaciones expertas en numerosas tareas, se categoriza por dominio. Las visualizaciones demuestran la capacidad de Gato para realizar subtítulos de imágenes, participar en diálogos interactivos y controlar un brazo robótico, entre muchas otras tareas, todo con el mismo conjunto de pesos.
Aspectos destacados de Agente Generalista Gato
Capacidades multimodales
Rendimiento multitarea
Control multi-embodiment
Arquitectura de red neuronal transformer
Muestreo autorregresivo de acciones
Ventana de contexto de 1024 tokens
Entrenado con datos diversos
Agente de política generalista
Primeros pasos con Agente Generalista Gato
Acceder al modelo: Obtener acceso al agente generalista Gato.
Autenticar: Configurar las credenciales de autenticación necesarias.
Configurar entorno: Configurar el entorno de destino para la interacción.
Integrar vía API: Utilizar los puntos finales de la API proporcionados para la ejecución de tareas.
Proporcionar prompt: Introducir un prompt tokenizado o una demostración.
Recibir observación: Procesar las observaciones del entorno.
Muestrear acción: Muestrear autorregresivamente tokens de acción.
Decodificar y ejecutar: Decodificar los tokens muestreados en acciones ejecutables.
Casos de uso de Agente Generalista Gato
- Control de robótica
- Subtítulos de imágenes
- Diálogo interactivo
- Juego
- Comprensión multimodal
- Investigación general de IA








