Descripción
El repositorio de código de investigación UNITER, presentado en el artículo de ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning', ofrece un conjunto completo de herramientas para la investigación de IA multimodal. Este repositorio facilita el ajuste fino y la inferencia para una variedad de tareas de visión y lenguaje, incluyendo Respuesta Visual a Preguntas (VQA), Razonamiento de Sentido Común Visual (VCR), SNLI-VE (Implicación Visual), Recuperación de Imágenes-Texto para conjuntos de datos como COCO y Flickr30k, y Comprensión de Expresiones Referenciales (RefCOCO, RefCOCO+, RefCOCO-g).
UNITER se basa en un marco de aprendizaje de representación universal de imágenes y texto. El código soporta puntos de control pre-entrenados tanto de UNITER-base como de UNITER-large, con opciones para pre-entrenamiento en dominio específico. El repositorio incluye scripts para preprocesamiento de datos, entrenamiento de modelos e inferencia. Aprovecha bibliotecas externas como PyTorch, HuggingFace Transformers, OpenNMT y DeepLearningExamples de Nvidia, con características de imagen extraídas utilizando BUTD.
Para facilitar la reproducibilidad, se proporciona una imagen Docker, que requiere versiones específicas de controladores NVIDIA y Docker. La configuración implica montar directorios de código fuente y datos en el contenedor. El repositorio detalla guías de inicio rápido para tareas como NLVR2, demostrando la descarga de datos, el lanzamiento del contenedor Docker, el ajuste fino y los procedimientos de inferencia/evaluación. La personalización se soporta a través de argumentos de línea de comandos y archivos de configuración JSON, con opciones para entrenamiento multi-GPU utilizando Horovod.
El proyecto también describe los pasos para tareas posteriores como VQA, VCR (incluida una opción de pre-entrenamiento de segunda etapa), Implicación Visual, Recuperación de Imágenes-Texto (tanto zero-shot como ajuste fino con negativos duros para Flickr30k y COCO), Expresiones Referenciales y pre-entrenamiento en dominio específico. Se guía a los usuarios sobre la descarga de conjuntos de datos específicos y la ejecución de los scripts de entrenamiento e inferencia correspondientes. El repositorio tiene licencia bajo la licencia MIT.
Aspectos destacados de Código de Investigación UNITER
Código de investigación oficial para el artículo de ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'
Soporta ajuste fino para NLVR2, VQA, VCR, SNLI-VE, Recuperación de Imágenes-Texto y Expresiones Referenciales
Proporciona puntos de control pre-entrenados para los modelos UNITER-base y UNITER-large
Incluye scripts para preprocesamiento de datos, entrenamiento de modelos e inferencia
Ofrece una imagen Docker para una reproducción y configuración de entorno simplificadas
Soporta entrenamiento multi-GPU a través de Horovod
Incluye código para tareas de Recuperación de Imágenes-Texto zero-shot y de ajuste fino
Facilita el pre-entrenamiento en dominio específico y el pre-entrenamiento de segunda etapa para VCR
Primeros pasos con Código de Investigación UNITER
Descargue los puntos de control pre-entrenados y los datos específicos de la tarea utilizando los scripts bash proporcionados.
Lance el contenedor Docker para un entorno consistente y reproducible.
Integre el entrenamiento del modelo ejecutando scripts de ajuste fino con configuraciones personalizadas.
Realice inferencias en tareas posteriores utilizando scripts de inferencia dedicados.
Evalúe el rendimiento del modelo utilizando los scripts de evaluación proporcionados o enviando resultados a las tablas de clasificación.
Personalice las opciones de entrenamiento a través de argumentos de línea de comandos o archivos de configuración JSON.
Casos de uso de Código de Investigación UNITER
- Respuesta Visual a Preguntas
- Razonamiento de Sentido Común Visual
- Recuperación de Imágenes-Texto
- Comprensión de Expresiones Referenciales
- Implicación Visual
- Pre-entrenamiento Multimodal







