설명
IDEFICS(Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attention)는 AI의 투명성과 민주화를 발전시키기 위해 개발된 오픈 액세스 비주얼 언어 모델입니다. 공개적으로 출시되지 않은 DeepMind의 최첨단 비주얼 언어 모델인 Flamingo를 오픈 소스로 재현한 것입니다. GPT-4와 같은 모델과 유사하게 IDEFICS는 임의의 이미지 및 텍스트 시퀀스를 처리하여 일관된 텍스트 출력을 생성할 수 있습니다.
LLaMA v1 및 OpenCLIP을 포함한 공개적으로 사용 가능한 데이터와 모델만을 사용하여 구축된 IDEFICS는 기본 버전과 지시 버전의 두 가지 변형으로 제공됩니다. 각 변형은 90억 개 및 800억 개의 두 가지 매개변수 크기로 제공됩니다. 이 프로젝트는 공개 데이터만을 사용하고, 학습 데이터셋을 탐색할 수 있는 도구를 제공하며, 기술적인 학습 내용을 공유하고, 출시 전에 적대적 프롬프팅(레드팀)을 통한 내부 윤리 평가를 수행함으로써 투명성을 강조합니다.
IDEFICS는 이미지에 대한 질문 답변, 시각적 콘텐츠 설명, 여러 이미지에 기반한 스토리 생성과 같은 작업에 탁월합니다. 다양한 이미지-텍스트 이해 벤치마크에서 원래의 폐쇄 소스 Flamingo 모델과 비교할 수 있는 성능을 보여줍니다. 이 모델은 Wikipedia, Public Multimodal Dataset, LAION과 같은 공개적으로 사용 가능한 데이터셋과 함께, 1억 4,100만 개의 인터리브된 이미지-텍스트 웹 문서로 구성된 새로 생성된 115B 토큰 데이터셋인 OBELICS를 혼합하여 학습되었습니다.
개발팀은 멀티모달 AI 시스템의 개방형 연구를 육성하기 위해 노력하고 있습니다. IDEFICS는 OpenFlamingo와 같은 다른 오픈 소스 재현을 보완하며 AI 커뮤니티를 위한 강력한 기반 역할을 하는 것을 목표로 합니다. 프로젝트의 윤리 강령은 자기 비판, 투명성, 공정성을 우선시하는 결정을 안내했습니다. 사용자는 데모, 모델 카드, 데이터셋 카드를 탐색하고 피드백을 제공하여 이러한 모델의 지속적인 개선과 대규모 멀티모달 AI의 접근성을 돕도록 권장됩니다.
IDEFICS 비주얼 언어 모델 하이라이트
오픈 액세스 비주얼 언어 모델
최첨단 기능 재현
인터리브된 이미지 및 텍스트 입력 수용
텍스트 출력 생성
독점 모델과 비교 가능한 성능
9B 및 80B 매개변수 크기로 제공
기본 및 지시 버전 제공
공개적으로 사용 가능한 데이터 및 모델로 학습
멀티모달 AI 연구 지원
레드팀을 통한 윤리적 평가 포함
학습 데이터셋의 대화형 시각화 가능
IDEFICS 비주얼 언어 모델 시작하기
모델 액세스: Hugging Face Hub에서 IDEFICS 모델을 찾으세요.
환경 설정: 최신 transformers 버전을 설치했는지 확인하세요.
모델 및 프로세서 로드: 필요한 클래스를 가져오고 원하는 IDEFICS 체크포인트를 로드하세요.
입력 준비: 인터리브된 텍스트 문자열과 이미지 URL 또는 PIL 이미지를 사용하여 프롬프트를 생성하세요.
API를 통한 통합: 준비된 입력 및 생성 인수를 사용하여 `generate` 메서드를 사용하세요.
출력 디코딩: 생성된 ID를 처리하여 사람이 읽을 수 있는 텍스트를 얻으세요.
추론 실행: 멀티모달 입력을 기반으로 텍스트를 생성하기 위해 코드를 실행하세요.
IDEFICS 비주얼 언어 모델의 사용 사례
- 이미지 질문 답변
- 시각적 콘텐츠 설명
- 멀티모달 스토리텔링
- 오픈 연구 기반
- AI 투명성
- AI 민주화







