Description
Inspiré par les avancées dans la modélisation de langage à grande échelle, Google DeepMind a développé Gato, un agent généraliste unique conçu pour opérer au-delà des limites des sorties textuelles. Gato fonctionne comme une politique généraliste multimodale, multitâche et multi-incarnation. Le même réseau neuronal, utilisant des poids identiques, peut s'engager dans des activités diverses telles que jouer à des jeux Atari, générer des légendes pour des images, participer à des conversations et manipuler des objets avec un bras robotique réel. Son processus de prise de décision s'adapte dynamiquement en fonction du contexte fourni, déterminant s'il faut produire du texte, des couples de rotation articulaires, des pressions de boutons ou d'autres formes de tokens.
Lors de sa phase d'entraînement, Gato traite des données provenant de diverses tâches et modalités en les sérialisant en une séquence plate de tokens. Cette séquence est ensuite traitée par lots et traitée par un réseau neuronal Transformer, analogue à ceux utilisés dans les grands modèles de langage. La perte d'entraînement est masquée pour garantir que Gato se concentre sur la prédiction des cibles d'action et de texte. Lors du déploiement de Gato, une séquence initiale est formée en tokenisant une invite, qui peut être une démonstration. L'environnement fournit ensuite la première observation, qui est également tokenisée et ajoutée à cette séquence. Gato échantillonne de manière autorégressive le vecteur d'action, un token à la fois. Une fois que tous les tokens constituant le vecteur d'action sont échantillonnés, comme dicté par la spécification d'action de l'environnement, l'action est décodée et envoyée à l'environnement. L'environnement progresse, produisant une nouvelle observation, et le processus se répète. De manière cruciale, le modèle a toujours accès à toutes les observations et actions précédentes dans sa fenêtre de contexte de 1024 tokens.
Gato est entraîné sur une vaste collection de jeux de données qui englobent des expériences d'agents provenant d'environnements simulés et réels, ainsi qu'une variété de jeux de données d'images et de langage naturel. Les performances du modèle Gato pré-entraîné, mesurées par sa capacité à dépasser un pourcentage de scores d'experts sur de nombreuses tâches, sont catégorisées par domaine. Des visualisations démontrent la capacité de Gato à effectuer la légende d'images, à engager un dialogue interactif et à contrôler un bras robotique, parmi de nombreuses autres tâches, le tout avec le même ensemble de poids.
Points forts de Agent Généraliste Gato
Capacités multimodales
Performance multitâche
Contrôle multi-incarnation
Architecture de réseau neuronal Transformer
Échantillonnage d'action autorégressif
Fenêtre de contexte de 1024 tokens
Entraîné sur des jeux de données diversifiés
Agent de politique généraliste
Premiers pas avec Agent Généraliste Gato
Accès au modèle : Obtenir l'accès à l'agent généraliste Gato.
Authentification : Configurer les identifiants d'authentification nécessaires.
Configuration de l'environnement : Configurer l'environnement cible pour l'interaction.
Intégration via API : Utiliser les points d'accès API fournis pour l'exécution des tâches.
Fournir une invite : Entrer une invite tokenisée ou une démonstration.
Recevoir une observation : Traiter les observations de l'environnement.
Échantillonner une action : Échantillonner de manière autorégressive les tokens d'action.
Décoder et exécuter : Décoder les tokens échantillonnés en actions exécutables.
Cas d'utilisation de Agent Généraliste Gato
- Contrôle robotique
- Légende d'images
- Dialogue interactif
- Jeu
- Compréhension multimodale
- Recherche générale en IA








