説明
PaLM-Eは、抽象的な言語理解と実世界の物理的相互作用との間のギャップを埋めるために設計された、具現化されたマルチモーダル言語モデルを導入することにより、人工知能における重要な進歩を表しています。従来の巨大言語モデルは複雑なテキストタスクに優れていますが、ロボット工学のようなアプリケーションに不可欠な、連続的な実世界のセンサーデータに知識を根付かせることに苦労しています。PaLM-Eは、視覚入力や状態推定などのモダリティを言語モデルの処理パイプラインに直接組み込むことで、この課題に対処します。
PaLM-Eのコアアーキテクチャの革新は、事前学習済み言語モデルの言語埋め込み空間に連続的な具現化された観測を注入する方法にあります。これは、センサーデータを、言語モデルのトークン埋め込みと同じ次元を共有するベクトルのシーケンスにエンコードすることによって達成されます。これにより、モデルはテキスト、画像、連続的な状態推定を含むマルチモーダル入力を統一された方法で処理し、推論することができます。PaLM-Eは、特にPaLMであるデコーダーオンリーの巨大言語モデルアーキテクチャに基づいており、その機能を具現化されたタスクを処理するように拡張しています。
PaLM-Eは、さまざまな具現化された推論タスクで顕著なパフォーマンスを示しています。評価では、逐次的なロボット操作計画、視覚的質問応答、キャプション生成を実行する能力が示されています。単一の巨大な具現化されたマルチモーダルモデルであるPaLM-Eは、さまざまな観測モダリティと複数のロボット具現化にわたる多様な推論課題に取り組むことができます。特に、ポジティブな転移を示しており、これは、広範なインターネットスケールの言語、視覚、および視覚言語データセット全体での共同トレーニングからパフォーマンスが向上することを意味します。最大のバリアントであるPaLM-E-562Bは、ロボット工学に優れているだけでなく、汎用的な視覚言語モデルとしても機能し、OK-VQAのようなベンチマークで最先端の結果を達成しながら、スケールが増加するにつれて汎用的な言語能力を維持しています。
モデルの実用的なアプリケーションは、長期間のロボットタスクの例を通じて示されています。PaLM-Eは、「引き出しからライスクラッカーを持ってきて」や「緑色の星を持ってきて」といった指示を解釈し、ロボットのカメラからの視覚フィードバックを組み込んで多段階の計画を実行できます。また、ブロックを色で並べたり、プッシュタスクを実行したりするためにロボットを制御し、低レベルポリシーにステップバイステップのコマンドをシーケンス化することもできます。さらに、PaLM-Eは印象的な汎化能力を示し、「赤いブロックをコーヒーカップにプッシュ」や「緑色のブロックを亀にプッシュ」といったタスクを、これらの特定のオブジェクトやシナリオが直接のトレーニングデータに含まれていなかった場合でも、正常に実行します。この適応性は、新しい状況におけるその堅牢な理解と推論能力を強調しています。
PaLM-Eのハイライト
具現化されたマルチモーダル言語モデル
視覚および連続状態センサーモダリティを統合
言語を実世界の知覚に根付かせる
ロボット操作計画を可能にする
視覚的質問応答をサポート
画像キャプション生成が可能
ドメインを横断するポジティブな転移学習を示す
多様なロボット具現化を処理する
OK-VQAで最先端のパフォーマンスを達成
汎用的な言語能力を維持
マルチモーダル文を処理する
テキスト補完を自己回帰的に生成する
PaLM-Eをはじめる
モデルへのアクセス: 具現化されたAIタスクにPaLM-Eモデルを利用します。
入力データ: 視覚、状態推定、およびテキストエンコーディングを含むマルチモーダル文を提供します。
モデルのトレーニング: 事前学習済み巨大言語モデルでエンコーディングをエンドツーエンドでトレーニングします。
タスクの実行: 逐次的なロボット操作計画にデプロイします。
推論の実行: 視覚的質問応答およびキャプション生成に適用します。
パフォーマンスの評価: さまざまな具現化された推論タスクで能力を評価します。
ロボット工学との統合: 実世界のロボット制御および計画に使用します。
PaLM-Eの使用例
- ロボット操作
- 視覚的質問応答
- 画像キャプション生成
- 具現化された推論
- 汎用AI
- ロボット工学計画
- クロスドメイン学習








