説明
大規模言語モデリングの進歩に触発され、Google DeepMindは、テキストベースの出力の枠を超えて動作するように設計された単一の汎用エージェントであるGatoを開発しました。Gatoは、マルチモーダル、マルチタスク、マルチエンボディメントの汎用ポリシーとして機能します。同じニューラルネットワークが、同じ重みを使用して、Atariゲームのプレイ、画像へのキャプション生成、会話への参加、実際のロボットアームでのオブジェクト操作など、多様なアクティビティに従事できます。その意思決定プロセスは、提供されたコンテキストに基づいて動的に適応し、テキスト、ジョイントトルク、ボタンプレス、またはその他のトークン形式のいずれを出力するかを決定します。
トレーニング段階で、Gatoはさまざまなタスクやモダリティからのデータを、それらをフラットなトークンシーケンスにシリアライズすることによって処理します。このシーケンスはバッチ処理され、大規模言語モデルで使用されるものと同様のTransformerニューラルネットワークによって処理されます。トレーニング損失はマスクされ、Gatoがアクションとテキストターゲットの予測に集中するようにします。Gatoを展開する際には、プロンプト(デモンストレーションである可能性のあるもの)をトークン化することによって初期シーケンスが形成されます。次に、環境が最初の観測を提供し、これもトークン化されてこのシーケンスに追加されます。Gatoは、アクションベクトルを一度に1トークンずつ自己回帰的にサンプリングします。環境のアクション仕様によって決定されるアクションベクトルを構成するすべてのトークンがサンプリングされると、アクションはデコードされて環境に送信されます。環境はステップを実行し、新しい観測を生成し、プロセスが繰り返されます。重要なのは、モデルは常にコンテキストウィンドウ1024トークン内のすべての先行する観測とアクションにアクセスできることです。
Gatoは、シミュレーション環境と実世界の環境の両方からのエージェントエクスペリエンス、およびさまざまな自然言語と画像データセットを含む広範なデータセットコレクションでトレーニングされています。多数のタスクにわたって専門家のスコアのパーセンテージを超える能力によって測定される、事前トレーニングされたGatoモデルのパフォーマンスは、ドメインごとに分類されます。視覚化は、Gatoが画像キャプションを実行し、対話型ダイアログに従事し、ロボットアームを制御する能力を、すべて同じ重みセットで示しています。
Gato Generalist Agentのハイライト
マルチモーダル機能
マルチタスクパフォーマンス
マルチエンボディメント制御
Transformerニューラルネットワークアーキテクチャ
自己回帰アクションサンプリング
1024トークンのコンテキストウィンドウ
多様なデータセットでトレーニング済み
汎用ポリシーエージェント
Gato Generalist Agentをはじめる
モデルへのアクセス: Gato汎用エージェントへのアクセスを取得します。
認証: 必要な認証資格情報を設定します。
環境の設定: インタラクションのためのターゲット環境を構成します。
API経由での統合: 提供されたAPIエンドポイントを使用してタスクを実行します。
プロンプトの提供: トークン化されたプロンプトまたはデモンストレーションを入力します。
観測の受信: 環境の観測を処理します。
アクションのサンプリング: アクショントークンを自己回帰的にサンプリングします。
デコードと実行: サンプリングされたトークンを実行可能なアクションにデコードします。
Gato Generalist Agentの使用例
- ロボット制御
- 画像キャプション付け
- 対話型ダイアログ
- ゲームプレイ
- マルチモーダル理解
- 汎用AI研究








