説明
Windows Agent Arena (WAA) は、実際のWindowsオペレーティングシステム内で推論、計画、実行が可能なAIエージェントの評価と開発における課題に対処するために設計された、革新的なオープンソースフレームワークです。従来のベンチマークは、しばしば限定的なモダリティやドメインに焦点を当てており、タスクの逐次的な性質から完全な評価に数日を要するため、時間のかかるものでした。WAAは、AIエージェントが幅広いアプリケーション、ツール、Webブラウザと対話できる、再現可能で現実的なWindows OS環境を提供し、人間のユーザーエクスペリエンスを模倣します。
このフレームワークは、Azure MLクラウドインフラストラクチャを活用して並列実行を可能にし、エージェントのスケーラブルなデプロイメントをサポートします。これにより、数日ではなく数分で数百のタスクをベンチマークできます。WAAには、ドキュメント編集(LibreOffice Calc/Writer)、インターネットブラウジング(Microsoft Edge、Google Chrome)、システムタスク(ファイルエクスプローラー、設定)、コーディング(Visual Studio Code)、メディア再生(VLC Player)、ユーティリティ機能(メモ帳、時計、ペイント)など、一般的なWindowsワークロードにまたがる154以上の多様なタスクが含まれています。タスク評価は決定的であり、カスタムスクリプトが各エピソードの終わりに報酬を生成します。
WAAのコアには、Windows 11 VMをホストするDockerコンテナが使用されています。Python Flaskサーバーが仲介役として機能し、VM内でコマンドを実行して観測値を返します。スケーラブルなクラウド並列化のために、Azure Machine Learningジョブが使用され、タスクをコンピューティングインスタンス間で均等に分散し、結果を集計します。このインフラストラクチャは、プロトタイピング中の柔軟なローカル実行と、堅牢なクラウドベースのベンチマーキングをサポートします。
WAAの機能を実証するために、Naviエージェントが導入されました。Naviは、連鎖思考プロンプティングを使用して、コンピューターの状態、過去のアクションを推論し、次のステップを決定します。その入力には、フォアグラウンドウィンドウのタイトル、開いているすべてのウィンドウ/タブのタイトル、およびUIAツリー解析、DOMツリー解析、OCR、アイコン/画像検出、OmniParserなどのさまざまな方法で処理された画面表現が含まれます。初期の結果は、現在のモデルは人間よりも低いパフォーマンスを達成していますが、画面表現の品質がエージェントの成功に大きく影響することを示しており、UIAツリー解析とOmniParserのアイコンキャプションがパフォーマンスの向上を示しています。
WAAは、AIエージェントの分野、特に複雑なデスクトップ環境で動作するエージェントの進歩を目指す研究者や開発者にとって貴重なリソースです。厳密なテスト、エージェントアーキテクチャの比較分析、および将来のエージェント開発のための洞察の生成を促進します。
Windows Agent Arenaの主要機能
AIエージェントのためのスケーラブルなWindows OS環境
多様なアプリケーションによる現実的なデスクトップインタラクション
マルチモーダルAIエージェントをサポート
エージェントワークフローのベンチマーキング
Azure MLによる並列実行
154の多様なWindowsタスク
決定的タスク評価
エージェントのための連鎖思考プロンプティング
複数の画面表現方法(UIA、DOM、OCR、アイコン検出、OmniParser)
オープンソースフレームワーク
再現可能な研究環境
Windows Agent Arenaの使い方は?
Windows 11 VMを備えたDockerコンテナをセットアップする
タスクスケジューリングとエージェントデプロイメントを設定する
エージェントの入力と画面解析方法を定義する
ローカルまたはAzure MLでベンチマーク評価を実行する
エージェントのパフォーマンスメトリクスとログを分析する
Windows Agent Arenaの使用例
- AIエージェントのベンチマーキング
- デスクトップ自動化研究
- マルチモーダルエージェント開発
- 再現可能なAI研究
- 人間とAIのインタラクション研究






