Saltar al contenido principal
ToolPotion

Código de Investigación UNITER

UNITER es un repositorio de código de investigación para el artículo de ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'. Proporciona código para el ajuste fino y la inferencia en diversas tareas de visión y lenguaje, incluyendo VQA, VCR y recuperación de imágenes-texto. Hay puntos de control pre-entrenados disponibles para UNITER-base y UNITER-large.

Visitar URL

Descripción

El repositorio de código de investigación UNITER, presentado en el artículo de ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning', ofrece un conjunto completo de herramientas para la investigación de IA multimodal. Este repositorio facilita el ajuste fino y la inferencia para una variedad de tareas de visión y lenguaje, incluyendo Respuesta Visual a Preguntas (VQA), Razonamiento de Sentido Común Visual (VCR), SNLI-VE (Implicación Visual), Recuperación de Imágenes-Texto para conjuntos de datos como COCO y Flickr30k, y Comprensión de Expresiones Referenciales (RefCOCO, RefCOCO+, RefCOCO-g).

UNITER se basa en un marco de aprendizaje de representación universal de imágenes y texto. El código soporta puntos de control pre-entrenados tanto de UNITER-base como de UNITER-large, con opciones para pre-entrenamiento en dominio específico. El repositorio incluye scripts para preprocesamiento de datos, entrenamiento de modelos e inferencia. Aprovecha bibliotecas externas como PyTorch, HuggingFace Transformers, OpenNMT y DeepLearningExamples de Nvidia, con características de imagen extraídas utilizando BUTD.

Para facilitar la reproducibilidad, se proporciona una imagen Docker, que requiere versiones específicas de controladores NVIDIA y Docker. La configuración implica montar directorios de código fuente y datos en el contenedor. El repositorio detalla guías de inicio rápido para tareas como NLVR2, demostrando la descarga de datos, el lanzamiento del contenedor Docker, el ajuste fino y los procedimientos de inferencia/evaluación. La personalización se soporta a través de argumentos de línea de comandos y archivos de configuración JSON, con opciones para entrenamiento multi-GPU utilizando Horovod.

El proyecto también describe los pasos para tareas posteriores como VQA, VCR (incluida una opción de pre-entrenamiento de segunda etapa), Implicación Visual, Recuperación de Imágenes-Texto (tanto zero-shot como ajuste fino con negativos duros para Flickr30k y COCO), Expresiones Referenciales y pre-entrenamiento en dominio específico. Se guía a los usuarios sobre la descarga de conjuntos de datos específicos y la ejecución de los scripts de entrenamiento e inferencia correspondientes. El repositorio tiene licencia bajo la licencia MIT.

Aspectos destacados de Código de Investigación UNITER

  • Código de investigación oficial para el artículo de ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'

  • Soporta ajuste fino para NLVR2, VQA, VCR, SNLI-VE, Recuperación de Imágenes-Texto y Expresiones Referenciales

  • Proporciona puntos de control pre-entrenados para los modelos UNITER-base y UNITER-large

  • Incluye scripts para preprocesamiento de datos, entrenamiento de modelos e inferencia

  • Ofrece una imagen Docker para una reproducción y configuración de entorno simplificadas

  • Soporta entrenamiento multi-GPU a través de Horovod

  • Incluye código para tareas de Recuperación de Imágenes-Texto zero-shot y de ajuste fino

  • Facilita el pre-entrenamiento en dominio específico y el pre-entrenamiento de segunda etapa para VCR

Primeros pasos con Código de Investigación UNITER

  1. Descargue los puntos de control pre-entrenados y los datos específicos de la tarea utilizando los scripts bash proporcionados.

  2. Lance el contenedor Docker para un entorno consistente y reproducible.

  3. Integre el entrenamiento del modelo ejecutando scripts de ajuste fino con configuraciones personalizadas.

  4. Realice inferencias en tareas posteriores utilizando scripts de inferencia dedicados.

  5. Evalúe el rendimiento del modelo utilizando los scripts de evaluación proporcionados o enviando resultados a las tablas de clasificación.

  6. Personalice las opciones de entrenamiento a través de argumentos de línea de comandos o archivos de configuración JSON.

Casos de uso de Código de Investigación UNITER

  • Respuesta Visual a Preguntas
  • Razonamiento de Sentido Común Visual
  • Recuperación de Imágenes-Texto
  • Comprensión de Expresiones Referenciales
  • Implicación Visual
  • Pre-entrenamiento Multimodal

Preguntas frecuentes de Código de Investigación UNITER

Reseñas de Código de Investigación UNITER

Cargando...

Herramientas de IA populares como Código de Investigación UNITER

Phi-4-reasoning-vision-15B es un modelo de IA multimodal desarrollado por Microsoft, diseñado para tareas que requieren comprensión del lenguaje visual y capacidades de…

DestacadaModelos de IA y LLM

Modelos de IA

Oscar y VinVL son modelos avanzados de IA para tareas de visión-lenguaje. Oscar utiliza pre-entrenamiento de alineación objeto-semántica, logrando resultados de vanguardia. VinVL…

Modelos de IA y LLM

Modelos de IA

MiniGPT-4 es un modelo de IA que mejora la comprensión visión-lenguaje al alinear un codificador visual fijo con un modelo de lenguaje grande. Puede generar descripciones…

Modelos de IA y LLM

Modelos de IA

LLaVA es un modelo multimodal grande que combina un codificador de visión con un modelo de lenguaje para la comprensión visual y del lenguaje de propósito general. Sobresale en…

Modelos de IA y LLM

LLaVA es un modelo de ajuste de instrucciones visuales que combina capacidades de lenguaje y visión a gran escala. Su objetivo es alcanzar un rendimiento a nivel de GPT-4V,…

Modelos de IA y LLM

Flamingo es un modelo de lenguaje visual (VLM) único de Google DeepMind que destaca en el aprendizaje few-shot en diversas tareas multimodales. Procesa imágenes, videos y texto…

Modelos de IA y LLM

Gemini 3.1 Pro es un modelo de IA avanzado diseñado para tareas complejas y razonamiento profundo. Destaca en la comprensión multimodal, proporcionando respuestas inteligentes y…

DestacadaModelos de IA y LLM