Descripción
IDEFICS (Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attention) es un modelo de lenguaje visual de acceso abierto desarrollado para avanzar en la transparencia y la democratización en la IA. Es una reproducción abierta de Flamingo de DeepMind, un modelo de lenguaje visual de vanguardia que no ha sido publicado públicamente. Similar a modelos como GPT-4, IDEFICS puede procesar secuencias arbitrarias de imágenes y texto, generando salidas de texto coherentes.
Construido exclusivamente sobre datos y modelos disponibles públicamente, incluyendo LLaMA v1 y OpenCLIP, IDEFICS está disponible en dos variantes: una versión base y una versión instruida. Cada variante viene en dos tamaños de parámetros: 9 mil millones y 80 mil millones. El proyecto enfatiza la transparencia utilizando solo datos públicos, proporcionando herramientas para explorar conjuntos de datos de entrenamiento, compartiendo lecciones técnicas aprendidas y realizando evaluaciones éticas internas a través de prompting adversario (red teaming) antes de su lanzamiento.
IDEFICS sobresale en tareas como responder preguntas sobre imágenes, describir contenido visual y crear historias basadas en múltiples imágenes. Su rendimiento es comparable al modelo original de código cerrado Flamingo en varios benchmarks de comprensión de imagen-texto. El modelo fue entrenado en una mezcla de conjuntos de datos disponibles abiertamente como Wikipedia, Public Multimodal Dataset y LAION, junto con un conjunto de datos de 115B tokens recién creado llamado OBELICS, que comprende 141 millones de documentos web de imagen-texto intercalados.
El equipo de desarrollo está comprometido a fomentar la investigación abierta en sistemas de IA multimodales. IDEFICS tiene como objetivo servir como una base sólida para la comunidad de IA, complementando otras reproducciones abiertas como OpenFlamingo. La carta ética del proyecto guió las decisiones, priorizando la autocrítica, la transparencia y la equidad. Se anima a los usuarios a explorar la demo, las tarjetas de modelo y la tarjeta de conjunto de datos, y a proporcionar comentarios para ayudar en la mejora continua de estos modelos y la accesibilidad de la IA multimodal a gran escala.
Aspectos destacados de IDEFICS Visual Language Model
Modelo de lenguaje visual de acceso abierto
Reproduce capacidades de vanguardia
Acepta entradas de imágenes y texto intercaladas
Genera salidas de texto
Rendimiento comparable a modelos propietarios
Disponible en tamaños de 9B y 80B parámetros
Se ofrecen versiones base e instruida
Entrenado con datos y modelos disponibles públicamente
Soporta investigación en IA multimodal
Incluye evaluación ética a través de red teaming
Visualización interactiva del conjunto de datos de entrenamiento disponible
Primeros pasos con IDEFICS Visual Language Model
Acceder al modelo: Encuentre los modelos IDEFICS en Hugging Face Hub.
Configurar entorno: Asegúrese de tener instalada la última versión de transformers.
Cargar modelo y procesador: Importe las clases necesarias y cargue el checkpoint IDEFICS deseado.
Preparar entradas: Cree prompts con cadenas de texto intercaladas y URLs de imágenes o imágenes PIL.
Integrar vía API: Utilice el método `generate` con las entradas preparadas y los argumentos de generación.
Decodificar salida: Procese los IDs generados para obtener texto legible por humanos.
Ejecutar inferencia: Ejecute el código para generar texto basado en entradas multimodales.
Casos de uso de IDEFICS Visual Language Model
- Respuesta a Preguntas sobre Imágenes
- Descripción de Contenido Visual
- Narración Multimodal
- Base para Investigación Abierta
- Transparencia en IA
- Democratización de la IA







