Descrição
O repositório de código de pesquisa UNITER, apresentado no artigo ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning', oferece um conjunto abrangente de ferramentas para pesquisa em IA multimodal. Este repositório facilita o finetuning e a inferência para uma série de tarefas de visão e linguagem, incluindo Visual Question Answering (VQA), Visual Commonsense Reasoning (VCR), SNLI-VE (Visual Entailment), Image-Text Retrieval para conjuntos de dados como COCO e Flickr30k, e Referring Expression Comprehensions (RefCOCO, RefCOCO+, RefCOCO-g).
UNITER é construído sobre um framework universal de aprendizado de representação de imagem-texto. O código suporta checkpoints pré-treinados UNITER-base e UNITER-large, com opções para pré-treinamento in-domain. O repositório inclui scripts para pré-processamento de dados, treinamento de modelos e inferência. Ele utiliza bibliotecas externas como PyTorch, HuggingFace Transformers, OpenNMT e Nvidia's DeepLearningExamples, com features de imagem extraídas usando BUTD.
Para facilitar a reprodução, uma imagem Docker é fornecida, exigindo versões específicas do driver NVIDIA e do Docker. A configuração envolve montar diretórios de código fonte e dados no container. O repositório detalha guias de início rápido para tarefas como NLVR2, demonstrando download de dados, lançamento do container Docker, finetuning e procedimentos de inferência/avaliação. A personalização é suportada através de argumentos de linha de comando e arquivos de configuração JSON, com opções para treinamento multi-GPU usando Horovod.
O projeto também descreve etapas para tarefas downstream como VQA, VCR (incluindo uma opção de pré-treinamento de segundo estágio), Visual Entailment, Image-Text Retrieval (tanto zero-shot quanto finetuning com hard negatives para Flickr30k e COCO), Referring Expressions e pré-treinamento in-domain. Os usuários são guiados no download de conjuntos de dados específicos e na execução dos scripts de treinamento e inferência correspondentes. O repositório é licenciado sob a licença MIT.
Destaques de Código de Pesquisa UNITER
Código de pesquisa oficial para o artigo ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'
Suporta finetuning para NLVR2, VQA, VCR, SNLI-VE, Image-Text Retrieval e Referring Expressions
Fornece checkpoints pré-treinados para os modelos UNITER-base e UNITER-large
Inclui scripts para pré-processamento de dados, treinamento de modelos e inferência
Oferece uma imagem Docker para reprodução simplificada e configuração de ambiente
Suporta treinamento multi-GPU via Horovod
Inclui código para finetuning e zero-shot de tarefas de Image-Text Retrieval
Facilita o pré-treinamento in-domain e o pré-treinamento de segundo estágio para VCR
Primeiros passos com Código de Pesquisa UNITER
Baixe checkpoints pré-treinados e dados específicos da tarefa usando os scripts bash fornecidos.
Inicie o container Docker para um ambiente consistente e reproduzível.
Integre o treinamento do modelo executando scripts de finetuning com configurações personalizadas.
Realize inferência em tarefas downstream usando scripts de inferência dedicados.
Avalie o desempenho do modelo usando scripts de avaliação fornecidos ou enviando resultados para leaderboards.
Personalize opções de treinamento via argumentos de linha de comando ou arquivos de configuração JSON.
Casos de uso de Código de Pesquisa UNITER
- Visual Question Answering
- Visual Commonsense Reasoning
- Image-Text Retrieval
- Referring Expression Comprehension
- Visual Entailment
- Multimodal Pre-training







