Descrição
Inspirada pelos avanços em modelagem de linguagem em larga escala, a Google DeepMind desenvolveu o Gato, um único agente generalista projetado para operar além dos limites das saídas baseadas em texto. O Gato funciona como uma política generalista multimodal, multitarefa e multi-embodiment. A mesma rede neural, utilizando pesos idênticos, pode se envolver em diversas atividades, como jogar jogos Atari, gerar legendas para imagens, participar de conversas e manipular objetos com um braço robótico real. Seu processo de tomada de decisão se adapta dinamicamente com base no contexto fornecido, determinando se deve gerar texto, torques de junta, pressionamentos de botão ou outras formas de tokens.
Durante sua fase de treinamento, o Gato processa dados de várias tarefas e modalidades, serializando-os em uma sequência plana de tokens. Essa sequência é então agrupada e processada por uma rede neural transformer, análoga às usadas em grandes modelos de linguagem. A perda de treinamento é mascarada para garantir que o Gato se concentre na previsão de alvos de ação e texto. Ao implantar o Gato, uma sequência inicial é formada tokenizando um prompt, que pode ser uma demonstração. O ambiente então fornece a primeira observação, que também é tokenizada e anexada a essa sequência. O Gato amostra autorregressivamente o vetor de ação, um token por vez. Uma vez que todos os tokens que compõem o vetor de ação são amostrados, conforme ditado pela especificação de ação do ambiente, a ação é decodificada e enviada ao ambiente. O ambiente avança, gerando uma nova observação, e o processo se repete. Crucialmente, o modelo sempre tem acesso a todas as observações e ações precedentes dentro de sua janela de contexto de 1024 tokens.
O Gato é treinado em uma extensa coleção de conjuntos de dados que abrangem experiências de agentes de ambientes simulados e do mundo real, juntamente com uma variedade de conjuntos de dados de linguagem natural e imagens. O desempenho do modelo Gato pré-treinado, medido por sua capacidade de exceder uma porcentagem de pontuações de especialistas em inúmeras tarefas, é categorizado por domínio. Visualizações demonstram a capacidade do Gato de realizar legendagem de imagens, engajar-se em diálogo interativo e controlar um braço robótico, entre muitas outras tarefas, tudo com o mesmo conjunto de pesos.
Destaques de Agente Generalista Gato
Capacidades multimodais
Desempenho multitarefa
Controle multi-embodiment
Arquitetura de rede neural transformer
Amostragem de ação autorregressiva
Janela de contexto de 1024 tokens
Treinado em diversos conjuntos de dados
Agente de política generalista
Primeiros passos com Agente Generalista Gato
Acessar modelo: Obter acesso ao agente generalista Gato.
Autenticar: Configurar credenciais de autenticação necessárias.
Configurar ambiente: Configurar o ambiente de destino para interação.
Integrar via API: Utilizar os endpoints de API fornecidos para execução de tarefas.
Fornecer prompt: Inserir um prompt tokenizado ou demonstração.
Receber observação: Processar observações do ambiente.
Amostrar ação: Amostrar autorregressivamente tokens de ação.
Decodificar e executar: Decodificar tokens amostrados em ações executáveis.
Casos de uso de Agente Generalista Gato
- Controle de robótica
- Legenda de imagens
- Diálogo interativo
- Jogos
- Compreensão multimodal
- Pesquisa geral em IA








