Pular para o conteúdo principal
ToolPotion

Código de Pesquisa UNITER

UNITER é um repositório de código de pesquisa para o artigo ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'. Ele fornece código para finetuning e inferência em várias tarefas de visão e linguagem, incluindo VQA, VCR e recuperação de imagem-texto. Checkpoints pré-treinados estão disponíveis para UNITER-base e UNITER-large.

Visitar URL

Descrição

O repositório de código de pesquisa UNITER, apresentado no artigo ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning', oferece um conjunto abrangente de ferramentas para pesquisa em IA multimodal. Este repositório facilita o finetuning e a inferência para uma série de tarefas de visão e linguagem, incluindo Visual Question Answering (VQA), Visual Commonsense Reasoning (VCR), SNLI-VE (Visual Entailment), Image-Text Retrieval para conjuntos de dados como COCO e Flickr30k, e Referring Expression Comprehensions (RefCOCO, RefCOCO+, RefCOCO-g).

UNITER é construído sobre um framework universal de aprendizado de representação de imagem-texto. O código suporta checkpoints pré-treinados UNITER-base e UNITER-large, com opções para pré-treinamento in-domain. O repositório inclui scripts para pré-processamento de dados, treinamento de modelos e inferência. Ele utiliza bibliotecas externas como PyTorch, HuggingFace Transformers, OpenNMT e Nvidia's DeepLearningExamples, com features de imagem extraídas usando BUTD.

Para facilitar a reprodução, uma imagem Docker é fornecida, exigindo versões específicas do driver NVIDIA e do Docker. A configuração envolve montar diretórios de código fonte e dados no container. O repositório detalha guias de início rápido para tarefas como NLVR2, demonstrando download de dados, lançamento do container Docker, finetuning e procedimentos de inferência/avaliação. A personalização é suportada através de argumentos de linha de comando e arquivos de configuração JSON, com opções para treinamento multi-GPU usando Horovod.

O projeto também descreve etapas para tarefas downstream como VQA, VCR (incluindo uma opção de pré-treinamento de segundo estágio), Visual Entailment, Image-Text Retrieval (tanto zero-shot quanto finetuning com hard negatives para Flickr30k e COCO), Referring Expressions e pré-treinamento in-domain. Os usuários são guiados no download de conjuntos de dados específicos e na execução dos scripts de treinamento e inferência correspondentes. O repositório é licenciado sob a licença MIT.

Destaques de Código de Pesquisa UNITER

  • Código de pesquisa oficial para o artigo ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'

  • Suporta finetuning para NLVR2, VQA, VCR, SNLI-VE, Image-Text Retrieval e Referring Expressions

  • Fornece checkpoints pré-treinados para os modelos UNITER-base e UNITER-large

  • Inclui scripts para pré-processamento de dados, treinamento de modelos e inferência

  • Oferece uma imagem Docker para reprodução simplificada e configuração de ambiente

  • Suporta treinamento multi-GPU via Horovod

  • Inclui código para finetuning e zero-shot de tarefas de Image-Text Retrieval

  • Facilita o pré-treinamento in-domain e o pré-treinamento de segundo estágio para VCR

Primeiros passos com Código de Pesquisa UNITER

  1. Baixe checkpoints pré-treinados e dados específicos da tarefa usando os scripts bash fornecidos.

  2. Inicie o container Docker para um ambiente consistente e reproduzível.

  3. Integre o treinamento do modelo executando scripts de finetuning com configurações personalizadas.

  4. Realize inferência em tarefas downstream usando scripts de inferência dedicados.

  5. Avalie o desempenho do modelo usando scripts de avaliação fornecidos ou enviando resultados para leaderboards.

  6. Personalize opções de treinamento via argumentos de linha de comando ou arquivos de configuração JSON.

Casos de uso de Código de Pesquisa UNITER

  • Visual Question Answering
  • Visual Commonsense Reasoning
  • Image-Text Retrieval
  • Referring Expression Comprehension
  • Visual Entailment
  • Multimodal Pre-training

Perguntas frequentes de Código de Pesquisa UNITER

Avaliações de Código de Pesquisa UNITER

Carregando...

Ferramentas de IA populares como Código de Pesquisa UNITER

Phi-4-reasoning-vision-15B é um modelo de IA multimodal desenvolvido pela Microsoft, projetado para tarefas que requerem compreensão de linguagem-visual e capacidades de…

DestaqueModelos de IA e LLMs

Modelos de IA

Oscar e VinVL são modelos avançados de IA para tarefas de visão-linguagem. Oscar utiliza pré-treinamento com alinhamento objeto-semântica, alcançando resultados de ponta. VinVL…

Modelos de IA e LLMs

Modelos de IA

MiniGPT-4 é um modelo de IA que aprimora a compreensão visão-linguagem ao alinhar um codificador visual congelado com um modelo de linguagem grande. Ele pode gerar descrições…

Modelos de IA e LLMs

Modelos de IA

LLaVA é um modelo multimodal grande que combina um codificador de visão com um modelo de linguagem para compreensão visual e de linguagem de propósito geral. Ele se destaca em…

Modelos de IA e LLMs

Repositórios de IA no GitHub

LLaVA é um modelo de ajuste de instruções visuais que combina capacidades de linguagem e visão de grande escala. Seu objetivo é atingir desempenho de nível GPT-4V, permitindo…

Modelos de IA e LLMs

Flamingo é um único modelo de linguagem visual (VLM) do Google DeepMind que se destaca no aprendizado few-shot em diversas tarefas multimodais. Ele processa imagens, vídeos e…

Modelos de IA e LLMs

Gemini 3.1 Pro é um modelo de IA avançado projetado para tarefas complexas e raciocínio profundo. Ele se destaca na compreensão multimodal, fornecendo respostas inteligentes e…

DestaqueModelos de IA e LLMs