描述
OmniParser 是一种旨在将用户界面截图解析为结构化元素(特别是针对 AI 代理)的综合方法。它解决了现有视觉语言模型(如 GPT-4V)在跨不同应用程序和操作系统准确地与用户界面交互方面的局限性。OmniParser 的核心功能围绕两个关键方面展开:可靠地识别用户界面中的可交互图标,以及理解截图中的各种元素的语义,以便准确地将动作与屏幕区域关联起来。
为了实现这一点,OmniParser 采用了双管齐下的方法。首先,它使用检测模型来解析屏幕上的可交互区域。该模型使用从流行网页的 DOM 树中提取的可交互图标检测的精选数据集进行微调。其次,一个字幕模型提取检测到的元素的功能语义。该模型在图标描述数据集上进行训练。这两个模型的结合使 OmniParser 能够提供有关 UI 的结构化信息,包括可交互图标的边界框及其功能的描述。
OmniParser 显著提高了视觉语言模型在 ScreenSpot、Mind2Web 和 AITW 等基准测试中的性能。事实证明,即使仅使用截图输入,它也优于 GPT-4V 基线。此外,OmniParser 被设计为插件,使其与其他视觉语言模型(如 Phi-3.5-V 和 Llama-3.2-V)兼容。这种插件功能允许轻松集成和增强现有模型。
OmniParser 的价值主张在于它能够增强在用户界面上运行的 AI 代理的功能。通过提供强大的屏幕解析技术,OmniParser 使这些代理能够更有效地与各种应用程序和操作系统交互。这提高了基准测试的性能,并为自动化和与数字界面交互开辟了新的可能性。目标受众包括从事 AI 代理、视觉语言模型和 UI 自动化研究和开发的的研究人员和开发人员。
OmniParser:基于视觉的 GUI 代理的核心功能
将 UI 截图解析为结构化元素
识别可交互图标
理解 UI 元素的语义
提高 GPT-4V 性能
在基准测试中优于 GPT-4V 基线
可作为其他视觉语言模型的插件
使用可交互区域检测模型
采用图标功能描述
支持 Phi-3.5-V 和 Llama-3.2-V
使用精选的训练数据集
生成边界框和数字 ID
提取文本和图标描述
如何使用 OmniParser:基于视觉的 GUI 代理?
理解问题:认识到现有视觉语言模型在 UI 交互方面的局限性。
使用输入:提供用户任务和 UI 截图作为输入。
处理输入:OmniParser 分析截图。
接收输出:获取带有边界框和局部语义的已解析截图。
与模型集成:将 OmniParser 用作视觉语言模型(如 GPT-4V、Phi-3.5-V 或 Llama-3.2-V)的插件。
评估性能:评估在 ScreenSpot、Mind2Web 和 AITW 等基准测试中改进的性能。
优化和改进:针对特定应用程序或 UI 类型微调模型。
OmniParser:基于视觉的 GUI 代理的使用案例
- UI 自动化
- AI 代理开发
- 视觉语言模型增强
- 截图分析
- 基准测试改进
- 跨平台交互
- 图标检测







