Descrição
PaLM-E representa um avanço significativo em inteligência artificial ao introduzir um modelo de linguagem multimodal incorporado, projetado para preencher a lacuna entre a compreensão abstrata da linguagem e a interação física no mundo real. Modelos de linguagem grandes tradicionais se destacam em tarefas textuais complexas, mas lutam para fundamentar seu conhecimento em dados de sensores contínuos do mundo real, um requisito crítico para aplicações como robótica. PaLM-E aborda esse desafio incorporando diretamente modalidades como entrada visual e estimativas de estado no pipeline de processamento do modelo de linguagem.
A inovação arquitetural central do PaLM-E reside em seu método de injeção de observações contínuas e incorporadas no espaço de incorporação de linguagem de um modelo de linguagem pré-treinado. Isso é alcançado codificando dados de sensores em uma sequência de vetores que compartilham a mesma dimensionalidade que as incorporações de tokens do modelo de linguagem. Isso permite que o modelo processe e raciocine sobre entradas multimodais, incluindo texto, imagens e estimativas de estado contínuas, de maneira unificada. PaLM-E é construído sobre uma arquitetura de modelo de linguagem grande apenas com decodificador, especificamente PaLM, e estende suas capacidades para lidar com tarefas incorporadas.
PaLM-E demonstrou desempenho notável em uma variedade de tarefas de raciocínio incorporado. Avaliações mostram sua capacidade de realizar planejamento sequencial de manipulação robótica, resposta a perguntas visuais e legendagem. Um único e grande modelo multimodal incorporado, PaLM-E, pode lidar com diversos desafios de raciocínio em diferentes modalidades de observação e múltiplas incorporações robóticas. Notavelmente, ele exibe transferência positiva, o que significa que seu desempenho se beneficia do treinamento conjunto em extensos dados de linguagem, visão e linguagem visual em escala da internet. A maior variante, PaLM-E-562B, não só se destaca em robótica, mas também funciona como um modelo generalista de visão-linguagem, alcançando resultados de ponta em benchmarks como OK-VQA, ao mesmo tempo em que retém suas capacidades de linguagem generalista à medida que sua escala aumenta.
As aplicações práticas do modelo são ilustradas por meio de exemplos de tarefas robóticas de longo alcance. PaLM-E pode interpretar instruções como "traga-me os salgadinhos de arroz da gaveta" ou "traga-me uma estrela verde", incorporando feedback visual da câmera de um robô para executar planos de várias etapas. Ele também pode controlar robôs para organizar blocos por cor ou realizar tarefas de empurrar, sequenciando comandos passo a passo para políticas de baixo nível. Além disso, PaLM-E exibe impressionantes capacidades de generalização, executando com sucesso tarefas como "empurre blocos vermelhos para a xícara de café" ou "empurre blocos verdes para a tartaruga", mesmo quando esses objetos ou cenários específicos não faziam parte de seus dados de treinamento diretos. Essa adaptabilidade destaca sua compreensão robusta e habilidades de raciocínio em situações novas.
Destaques de PaLM-E
Modelo de linguagem multimodal incorporado
Integra modalidades de sensores visuais e de estado contínuo
Fundamenta a linguagem na percepção do mundo real
Permite planejamento de manipulação robótica
Suporta resposta a perguntas visuais
Capaz de legendagem de imagens
Demonstra aprendizado de transferência positiva entre domínios
Lida com diversas incorporações robóticas
Alcança desempenho de ponta no OK-VQA
Retém capacidades de linguagem generalista
Processa sentenças multimodais
Gera autônomamente completações textuais
Primeiros passos com PaLM-E
Acesso ao modelo: Utilize o modelo PaLM-E para tarefas de IA incorporada.
Entrada de dados: Forneça sentenças multimodais incluindo codificações visuais, de estimativa de estado e textuais.
Treinamento do modelo: Treine codificações de ponta a ponta com um modelo de linguagem grande pré-treinado.
Execução de tarefas: Implante para planejamento sequencial de manipulação robótica.
Realização de raciocínio: Aplique para resposta a perguntas visuais e legendagem.
Avaliação de desempenho: Avalie as capacidades em várias tarefas de raciocínio incorporado.
Integração com robótica: Use para controle e planejamento robótico no mundo real.
Casos de uso de PaLM-E
- Manipulação Robótica
- Resposta a Perguntas Visuais
- Legendagem de Imagens
- Raciocínio Incorporado
- IA Generalista
- Planejamento de Robótica
- Aprendizado Interdomínio








