설명
Large Language-and-Vision Assistant의 약자인 LLaVA는 포괄적인 시각 및 언어 이해를 위해 설계된 새로운 종단 간(end-to-end) 학습 대규모 멀티모달 모델입니다. 간단한 투영 행렬을 통해 비전 인코더와 강력한 언어 모델인 Vicuna를 통합합니다. 이 아키텍처를 통해 LLaVA는 시각 및 텍스트 정보를 모두 처리하고 해석할 수 있어, 멀티모달 GPT-4의 기능을 모방하는 인상적인 채팅 기능을 제공합니다.
LLaVA의 개발에는 2단계 명령어 튜닝 절차가 포함되었습니다. 첫 번째 단계는 특징 정렬을 위한 사전 학습에 중점을 두며, 이 단계에서는 CC3M 데이터의 하위 집합을 사용하여 투영 행렬만 업데이트됩니다. 두 번째 단계는 종단 간 미세 조정을 포함하며, 투영 행렬과 LLM을 모두 업데이트합니다. 이 미세 조정은 두 가지 별도의 사용 사례에 맞춰집니다. 일반 사용자 지향 애플리케이션을 위한 Visual Chat과 과학 분야의 멀티모달 추론 데이터셋인 Science QA입니다.
LLaVA의 핵심 혁신은 멀티모달 명령어 따르기 데이터의 생성입니다. 이 데이터는 언어 전용 GPT-4를 사용하여 생성되었으며, 약 158,000개의 고유한 언어-이미지 명령어 따르기 샘플을 생성했습니다. 이 샘플들은 대화, 상세 설명 및 복잡한 추론 작업을 포함합니다. LLaVA는 놀라운 성능을 보여주었으며, 합성 멀티모달 명령어 따르기 데이터셋에서 GPT-4 대비 85.1%의 상대 점수를 달성했고, GPT-4와 시너지를 이룰 때 Science QA에서 92.53%의 새로운 최첨단 정확도를 기록했습니다.
이 프로젝트는 오픈 소스 접근성을 강조하며, GPT-4로 생성된 시각적 명령어 튜닝 데이터, 모델 및 코드베이스를 연구 목적으로 공개적으로 사용할 수 있도록 합니다. 개선된 버전인 LLaVA-1.5는 최소한의 수정으로 11개 벤치마크에서 최첨단 결과를 달성하고, 공개 데이터를 활용하며 효율적으로 훈련을 완료합니다. 이미지를 기반으로 한 명령어 이해 및 응답 능력은 멀티모달 AI 연구에서 중요한 발전으로 자리매김하고 있습니다.
LLaVA 하이라이트
종단 간 학습 대규모 멀티모달 모델
비전 인코더와 LLM (Vicuna) 결합
범용적인 시각 및 언어 이해
인상적인 멀티모달 채팅 기능
멀티모달 GPT-4 동작 모방
Science QA에서 최첨단 정확도 달성
시각적 명령어 튜닝 활용
GPT-4를 이용한 멀티모달 명령어 따르기 데이터 생성
오픈 소스 데이터, 모델 및 코드베이스
LLaVA-1.5, 11개 벤치마크에서 SoTA 달성
단일 8-A100 노드에서 효율적인 훈련
시각 채팅 및 과학 QA 미세 조정 지원
LLaVA 시작하기
모델 액세스: LLaVA 모델 체크포인트 및 코드 확보.
환경 설정: 필요한 라이브러리 및 종속성 구성.
API 통합: 모델 및 구성 요소 로드.
입력 제공: 이미지 및 텍스트 프롬프트를 모델에 전달.
출력 처리: 모델이 생성한 텍스트 응답 해석.
모델 미세 조정: Visual Chat 또는 Science QA와 같은 특정 작업에 LLaVA 조정.
LLaVA의 사용 사례
- 시각 채팅봇
- 멀티모달 추론
- 이미지 설명
- 시각 질의응답
- 과학 교육
- 콘텐츠 분석







