メインコンテンツへスキップ
ToolPotion

PaLM-E

PaLM-Eは、実世界の連続的なセンサーデータをテキストと統合する、具現化されたマルチモーダル言語モデルです。これにより、ロボットは言語を知覚に結びつけることで複雑なタスクを実行できるようになり、高度な推論と計画のために多様なトレーニングドメインと具現化にわたるポジティブな転移を示します。

URLを訪問

説明

PaLM-Eは、抽象的な言語理解と実世界の物理的相互作用との間のギャップを埋めるために設計された、具現化されたマルチモーダル言語モデルを導入することにより、人工知能における重要な進歩を表しています。従来の巨大言語モデルは複雑なテキストタスクに優れていますが、ロボット工学のようなアプリケーションに不可欠な、連続的な実世界のセンサーデータに知識を根付かせることに苦労しています。PaLM-Eは、視覚入力や状態推定などのモダリティを言語モデルの処理パイプラインに直接組み込むことで、この課題に対処します。

PaLM-Eのコアアーキテクチャの革新は、事前学習済み言語モデルの言語埋め込み空間に連続的な具現化された観測を注入する方法にあります。これは、センサーデータを、言語モデルのトークン埋め込みと同じ次元を共有するベクトルのシーケンスにエンコードすることによって達成されます。これにより、モデルはテキスト、画像、連続的な状態推定を含むマルチモーダル入力を統一された方法で処理し、推論することができます。PaLM-Eは、特にPaLMであるデコーダーオンリーの巨大言語モデルアーキテクチャに基づいており、その機能を具現化されたタスクを処理するように拡張しています。

PaLM-Eは、さまざまな具現化された推論タスクで顕著なパフォーマンスを示しています。評価では、逐次的なロボット操作計画、視覚的質問応答、キャプション生成を実行する能力が示されています。単一の巨大な具現化されたマルチモーダルモデルであるPaLM-Eは、さまざまな観測モダリティと複数のロボット具現化にわたる多様な推論課題に取り組むことができます。特に、ポジティブな転移を示しており、これは、広範なインターネットスケールの言語、視覚、および視覚言語データセット全体での共同トレーニングからパフォーマンスが向上することを意味します。最大のバリアントであるPaLM-E-562Bは、ロボット工学に優れているだけでなく、汎用的な視覚言語モデルとしても機能し、OK-VQAのようなベンチマークで最先端の結果を達成しながら、スケールが増加するにつれて汎用的な言語能力を維持しています。

モデルの実用的なアプリケーションは、長期間のロボットタスクの例を通じて示されています。PaLM-Eは、「引き出しからライスクラッカーを持ってきて」や「緑色の星を持ってきて」といった指示を解釈し、ロボットのカメラからの視覚フィードバックを組み込んで多段階の計画を実行できます。また、ブロックを色で並べたり、プッシュタスクを実行したりするためにロボットを制御し、低レベルポリシーにステップバイステップのコマンドをシーケンス化することもできます。さらに、PaLM-Eは印象的な汎化能力を示し、「赤いブロックをコーヒーカップにプッシュ」や「緑色のブロックを亀にプッシュ」といったタスクを、これらの特定のオブジェクトやシナリオが直接のトレーニングデータに含まれていなかった場合でも、正常に実行します。この適応性は、新しい状況におけるその堅牢な理解と推論能力を強調しています。

PaLM-Eのハイライト

  • 具現化されたマルチモーダル言語モデル

  • 視覚および連続状態センサーモダリティを統合

  • 言語を実世界の知覚に根付かせる

  • ロボット操作計画を可能にする

  • 視覚的質問応答をサポート

  • 画像キャプション生成が可能

  • ドメインを横断するポジティブな転移学習を示す

  • 多様なロボット具現化を処理する

  • OK-VQAで最先端のパフォーマンスを達成

  • 汎用的な言語能力を維持

  • マルチモーダル文を処理する

  • テキスト補完を自己回帰的に生成する

PaLM-Eをはじめる

  1. モデルへのアクセス: 具現化されたAIタスクにPaLM-Eモデルを利用します。

  2. 入力データ: 視覚、状態推定、およびテキストエンコーディングを含むマルチモーダル文を提供します。

  3. モデルのトレーニング: 事前学習済み巨大言語モデルでエンコーディングをエンドツーエンドでトレーニングします。

  4. タスクの実行: 逐次的なロボット操作計画にデプロイします。

  5. 推論の実行: 視覚的質問応答およびキャプション生成に適用します。

  6. パフォーマンスの評価: さまざまな具現化された推論タスクで能力を評価します。

  7. ロボット工学との統合: 実世界のロボット制御および計画に使用します。

PaLM-Eの使用例

  • ロボット操作
  • 視覚的質問応答
  • 画像キャプション生成
  • 具現化された推論
  • 汎用AI
  • ロボット工学計画
  • クロスドメイン学習

PaLM-EのFAQ

PaLM-E のレビュー

読み込み中...

PaLM-E に似た人気のAIツール

ImageBindは、Meta AIが開発したマルチモーダルAIモデルであり、画像、動画、音声、テキスト、深度、熱の6つのモダリティからのデータを結合します。明示的な教師なしで単一の埋め込み空間を学習し、AIシステムにおける高度なクロスモーダル理解と生成を可能にします。

AIモデルとLLM

Phi-4-reasoning-vision-15Bは、Microsoftによって開発されたマルチモーダルAIモデルで、視覚と言語の理解および推論能力を必要とするタスクに設計されています。科学的推論やコンピュータ使用エージェントタスクに優れており、さまざまなアプリケーションに適しています。

注目AIモデルとLLM

Command A+ は、複雑な推論、視覚、48 言語にわたる多言語タスクのために設計された、25B のアクティブパラメータと 218B の総パラメータを持つ専門家の混合モデルです。企業向けに効率的で正確なソリューションを提供します。

注目AIモデルとLLM

Flamingoは、Google DeepMindが開発した単一のビジュアル言語モデル(VLM)であり、多様なマルチモーダルタスクにおける少数の例からの学習(few-shot learning)に優れています。画像、動画、テキストが混在した入力を処理し、関連する言語出力を生成します。追加のトレーニングなしで、タスク固有の例を最小限で済ませることができます。

AIモデルとLLM

NVIDIA Nemotron 3 Ultraは、複雑な推論と多言語タスクのために設計された強力なAIモデルです。5500億のパラメータを持ち、長文コンテキスト分析とツール使用に優れており、さまざまな業界での高リスクアプリケーションに最適です。

注目AIモデルとLLM

Gemini 3.1 Proは、複雑なタスクと深い推論のために設計された高度なAIモデルです。マルチモーダル理解に優れ、スマートで簡潔な応答を提供し、学習、計画、革新的なアプリケーションの構築に最適です。

注目AIモデルとLLM

AI モデル

UniLMは、Microsoftが開発した大規模な自己教師あり事前学習フレームワークです。テキスト、画像、音声を含む多様なタスク、言語、モダリティを横断してモデルが学習できるようにします。このプロジェクトは、高度なAI研究開発のための基盤モデルとツールキットを提供します。

AIモデルとLLM

AI モデル

LLaVAは、汎用的な視覚と言語の理解のために、ビジョンエンコーダーと言語モデルを組み合わせた大規模マルチモーダルモデルです。マルチモーダルチャット機能に優れ、GPT-4を模倣し、視覚的指示チューニングを通じてScience QAのようなベンチマークで最先端の精度を達成しています。

AIモデルとLLM