描述
Windows Agent Arena (WAA) 是一个新颖的开源框架,旨在应对在真实的 Windows 操作系统中评估和开发能够进行推理、规划和行动的 AI 代理所面临的挑战。传统的基准测试通常侧重于有限的模态或领域,并且耗时,由于任务的顺序性,完全评估需要数天时间。WAA 提供了一个可重现且逼真的 Windows 操作系统环境,AI 代理可以在其中与各种应用程序、工具和 Web 浏览器进行交互,从而模拟人类用户体验。
该框架支持大规模部署代理,利用 Azure ML 云基础设施进行并行执行。这使得数百个任务可以在几分钟而不是几天内完成基准测试。WAA 包含超过 154 个多样化的任务,涵盖常见的 Windows 工作负载,例如文档编辑(LibreOffice Calc/Writer)、互联网浏览(Microsoft Edge、Google Chrome)、系统任务(文件资源管理器、设置)、编码(Visual Studio Code)、媒体播放(VLC Player)以及实用程序功能(记事本、时钟、画图)。任务评估是确定性的,自定义脚本在每个回合结束时生成奖励。
核心上,WAA 使用一个托管 Windows 11 VM 的 Docker 容器。Python Flask 服务器充当中介,在 VM 中执行命令并返回观察结果。为了实现可扩展的云并行化,采用了 Azure 机器学习作业,将任务均匀分配给计算实例并聚合结果。此基础设施支持原型设计期间灵活的本地执行以及强大的基于云的基准测试。
为了展示 WAA 的能力,引入了 Navi 代理。Navi 使用思维链提示来推理计算机的状态、过去的动作并决定下一步。其输入包括前景窗口标题、所有打开窗口/标签页的标题以及通过 UIA 树解析、DOM 树解析、OCR、图标/图像检测和 OmniParser 等各种方法处理的屏幕表示。初步结果表明,虽然当前模型的性能低于人类,但屏幕表示的质量对代理的成功有显著影响,UIA 树解析和 OmniParser 的图标字幕显示了性能提升。
WAA 是旨在推进 AI 代理领域的研究人员和开发人员的宝贵资源,特别是那些在复杂桌面环境中运行的 AI 代理。它促进了严格的测试、代理架构的比较分析以及为未来代理开发提供见解。
Windows Agent Arena的核心功能
AI 代理的可扩展 Windows OS 环境
与各种应用程序进行逼真的桌面交互
支持多模态 AI 代理
代理工作流的基准测试
通过 Azure ML 进行并行执行
154 个多样化的 Windows 任务
确定性的任务评估
代理的思维链提示
多种屏幕表示方法(UIA、DOM、OCR、图标检测、OmniParser)
开源框架
可重现的研究环境
如何使用 Windows Agent Arena?
设置包含 Windows 11 VM 的 Docker 容器
配置任务调度和代理部署
定义代理输入和屏幕解析方法
在本地或 Azure ML 上运行基准测试评估
分析代理性能指标和日志
Windows Agent Arena的使用案例
- AI 代理基准测试
- 桌面自动化研究
- 多模态代理开发
- 可重现的 AI 研究
- 人机交互研究






