설명
OmniParser는 AI 에이전트를 위해 사용자 인터페이스 스크린샷을 구조화된 요소로 구문 분석하도록 설계된 포괄적인 방법입니다. 다양한 애플리케이션 및 운영 체제에서 사용자 인터페이스와 정확하게 상호 작용하는 데 있어 GPT-4V와 같은 기존 시각 언어 모델의 한계를 해결합니다. OmniParser의 핵심 기능은 두 가지 주요 측면을 중심으로 합니다. 즉, 사용자 인터페이스 내에서 상호 작용 가능한 아이콘을 안정적으로 식별하고 스크린샷의 다양한 요소 의미를 이해하여 화면 영역과 작업을 정확하게 연결하는 것입니다.
이를 위해 OmniParser는 두 가지 접근 방식을 사용합니다. 먼저, 감지 모델을 사용하여 화면에서 상호 작용 가능한 영역을 구문 분석합니다. 이 모델은 인기 있는 웹 페이지의 DOM 트리에서 파생된 상호 작용 가능한 아이콘 감지 데이터 세트를 사용하여 fine-tuning됩니다. 둘째, 캡션 모델은 감지된 요소의 기능적 의미를 추출합니다. 이 모델은 아이콘 설명 데이터 세트에서 훈련됩니다. 이 두 모델의 조합을 통해 OmniParser는 상호 작용 가능한 아이콘의 경계 상자 및 기능 설명 등 UI에 대한 구조화된 정보를 제공할 수 있습니다.
OmniParser는 ScreenSpot, Mind2Web 및 AITW와 같은 벤치마크에서 시각 언어 모델의 성능을 크게 향상시킵니다. 스크린샷 입력만 사용하더라도 GPT-4V 기본 모델보다 성능이 뛰어난 것으로 나타났습니다. 또한 OmniParser는 플러그인으로 설계되어 Phi-3.5-V 및 Llama-3.2-V와 같은 다른 시각 언어 모델과 호환됩니다. 이 플러그인 기능을 통해 기존 모델을 쉽게 통합하고 향상시킬 수 있습니다.
OmniParser의 가치 제안은 사용자 인터페이스에서 작동하는 AI 에이전트의 기능을 향상시키는 능력에 있습니다. OmniParser는 강력한 화면 구문 분석 기술을 제공하여 이러한 에이전트가 다양한 애플리케이션 및 운영 체제와 보다 효과적으로 상호 작용할 수 있도록 합니다. 이는 벤치마크에서 성능 향상으로 이어지며 디지털 인터페이스와의 자동화 및 상호 작용에 대한 새로운 가능성을 열어줍니다. 대상 사용자는 AI 에이전트, 시각 언어 모델 및 UI 자동화 작업을 하는 연구원 및 개발자를 포함합니다.
OmniParser: 시각 기반 GUI 에이전트의 핵심 기능
UI 스크린샷을 구조화된 요소로 구문 분석
상호 작용 가능한 아이콘 식별
UI 요소의 의미 이해
GPT-4V 성능 향상
벤치마크에서 GPT-4V 기본 모델보다 성능 우수
다른 시각 언어 모델을 위한 플러그인 준비
상호 작용 가능한 영역 감지 모델 사용
아이콘 기능 설명 사용
Phi-3.5-V 및 Llama-3.2-V 지원
큐레이션된 데이터 세트 사용
경계 상자 및 숫자 ID 생성
텍스트 및 아이콘 설명 추출
OmniParser: 시각 기반 GUI 에이전트 사용 방법은?
문제 이해: UI 상호 작용에서 기존 시각 언어 모델의 한계를 인식합니다.
입력 사용: 사용자 작업과 UI 스크린샷을 입력으로 제공합니다.
입력 처리: OmniParser가 스크린샷을 분석합니다.
출력 수신: 경계 상자 및 로컬 의미가 있는 구문 분석된 스크린샷을 얻습니다.
모델 통합: GPT-4V, Phi-3.5-V 또는 Llama-3.2-V와 같은 시각 언어 모델의 플러그인으로 OmniParser를 사용합니다.
성능 평가: ScreenSpot, Mind2Web 및 AITW와 같은 벤치마크에서 향상된 성능을 평가합니다.
개선 및 최적화: 특정 애플리케이션 또는 UI 유형에 맞게 모델을 fine-tuning합니다.
OmniParser: 시각 기반 GUI 에이전트의 사용 사례
- UI 자동화
- AI 에이전트 개발
- 시각 언어 모델 향상
- 스크린샷 분석
- 벤치마크 개선
- 교차 플랫폼 상호 작용
- 아이콘 감지







