Перейти к основному содержимому
ToolPotion

UNITER Research Code

UNITER — это репозиторий исследовательского кода для статьи ECCV 2020 «UNITER: UNiversal Image-TExt Representation Learning». Он предоставляет код для дообучения и инференса в различных задачах, связанных с изображениями и текстом, включая VQA, VCR и поиск изображений по тексту. Доступны предварительно обученные чекпоинты для UNITER-base и UNITER-large.

Посетить URL

Описание

Репозиторий исследовательского кода UNITER, представленный в статье ECCV 2020 «UNITER: UNiversal Image-TExt Representation Learning», предлагает комплексный набор инструментов для мультимодальных исследований в области ИИ. Этот репозиторий облегчает дообучение и инференс для ряда задач, связанных с изображениями и текстом, включая визуальный ответ на вопросы (VQA), рассуждения на основе здравого смысла для изображений (VCR), визуальное логическое следование (SNLI-VE), поиск изображений по тексту для таких наборов данных, как COCO и Flickr30k, а также понимание референциальных выражений (RefCOCO, RefCOCO+, RefCOCO-g).

UNITER основан на универсальной системе обучения представлений изображений и текста. Код поддерживает предварительно обученные чекпоинты как UNITER-base, так и UNITER-large, с возможностью предварительного обучения в рамках конкретной предметной области. Репозиторий включает скрипты для предварительной обработки данных, обучения моделей и инференса. Он использует внешние библиотеки, такие как PyTorch, HuggingFace Transformers, OpenNMT и Nvidia's DeepLearningExamples, при этом признаки изображений извлекаются с помощью BUTD.

Для упрощения воспроизводимости предоставляется образ Docker, требующий определенных версий драйвера NVIDIA и Docker. Настройка включает монтирование каталогов с исходным кодом и данными в контейнер. Репозиторий содержит краткие руководства для таких задач, как NLVR2, демонстрирующие загрузку данных, запуск контейнера Docker, дообучение и процедуры инференса/оценки. Настройка поддерживается с помощью аргументов командной строки и конфигурационных файлов JSON, с опциями для многопроцессорного обучения с использованием Horovod.

Проект также описывает шаги для последующих задач, таких как VQA, VCR (включая опцию предварительного обучения на втором этапе), визуальное логическое следование, поиск изображений по тексту (как zero-shot, так и дообучение с использованием hard negatives для Flickr30k и COCO), референциальные выражения и предварительное обучение в рамках предметной области. Пользователям предоставляются инструкции по загрузке конкретных наборов данных и запуску соответствующих скриптов обучения и инференса. Репозиторий распространяется под лицензией MIT.

Главное о UNITER Research Code

  • Официальный исследовательский код для статьи ECCV 2020 «UNITER: UNiversal Image-TExt Representation Learning»

  • Поддерживает дообучение для NLVR2, VQA, VCR, SNLI-VE, поиска изображений по тексту и референциальных выражений

  • Предоставляет предварительно обученные чекпоинты для моделей UNITER-base и UNITER-large

  • Включает скрипты для предварительной обработки данных, обучения моделей и инференса

  • Предлагает образ Docker для упрощения воспроизводимости и настройки среды

  • Поддерживает многопроцессорное обучение через Horovod

  • Включает код для zero-shot и дообучения задач поиска изображений по тексту

  • Облегчает предварительное обучение в рамках предметной области и предварительное обучение VCR на втором этапе

Начало работы с UNITER Research Code

  1. Загрузите предварительно обученные чекпоинты и данные для конкретных задач с помощью предоставленных bash-скриптов.

  2. Запустите контейнер Docker для согласованной и воспроизводимой среды.

  3. Интегрируйте обучение модели, запуская скрипты дообучения с пользовательскими конфигурациями.

  4. Выполните инференс для последующих задач, используя специализированные скрипты инференса.

  5. Оцените производительность модели с помощью предоставленных скриптов оценки или путем отправки результатов в таблицы лидеров.

  6. Настройте параметры обучения через аргументы командной строки или конфигурационные файлы JSON.

Варианты использования UNITER Research Code

  • Визуальный ответ на вопросы
  • Рассуждения на основе здравого смысла для изображений
  • Поиск изображений по тексту
  • Понимание референциальных выражений
  • Визуальное логическое следование
  • Мультимодальное предварительное обучение

Часто задаваемые вопросы UNITER Research Code

Отзывы о UNITER Research Code

Загрузка...

Популярные ИИ-инструменты, похожие на UNITER Research Code

Phi-4-reasoning-vision-15B — это мультимодальная модель ИИ, разработанная Microsoft, предназначенная для задач, требующих понимания языка и визуального восприятия, а также…

РекомендованоИИ-модели и LLM

AI-модели

Oscar и VinVL — это передовые модели ИИ для задач обработки изображений и текста. Oscar использует предварительное обучение на основе выравнивания объектной семантики, достигая…

ИИ-модели и LLM

AI-модели

MiniGPT-4 — это ИИ-модель, которая улучшает понимание визуальных данных и текста, выравнивая замороженный визуальный энкодер с большой языковой моделью. Она может генерировать…

ИИ-модели и LLM

AI-модели

LLaVA — это большая мультимодальная модель, объединяющая визуальный энкодер с языковой моделью для общего понимания визуальной и текстовой информации. Она превосходно справляется…

ИИ-модели и LLM

LLaVA — это модель визуальной настройки инструкций, которая объединяет возможности больших языковых моделей и обработки изображений. Она нацелена на достижение производительности…

ИИ-модели и LLM

Flamingo — это единая визуальная языковая модель (VLM) от Google DeepMind, которая превосходно справляется с обучением на малом количестве примеров (few-shot learning) для…

ИИ-модели и LLM

Gemini 3.1 Pro — это продвинутая модель ИИ, разработанная для сложных задач и глубокого рассуждения. Она превосходно справляется с мультимодальным пониманием, предоставляя умные и…

РекомендованоИИ-модели и LLM