Описание
Репозиторий исследовательского кода UNITER, представленный в статье ECCV 2020 «UNITER: UNiversal Image-TExt Representation Learning», предлагает комплексный набор инструментов для мультимодальных исследований в области ИИ. Этот репозиторий облегчает дообучение и инференс для ряда задач, связанных с изображениями и текстом, включая визуальный ответ на вопросы (VQA), рассуждения на основе здравого смысла для изображений (VCR), визуальное логическое следование (SNLI-VE), поиск изображений по тексту для таких наборов данных, как COCO и Flickr30k, а также понимание референциальных выражений (RefCOCO, RefCOCO+, RefCOCO-g).
UNITER основан на универсальной системе обучения представлений изображений и текста. Код поддерживает предварительно обученные чекпоинты как UNITER-base, так и UNITER-large, с возможностью предварительного обучения в рамках конкретной предметной области. Репозиторий включает скрипты для предварительной обработки данных, обучения моделей и инференса. Он использует внешние библиотеки, такие как PyTorch, HuggingFace Transformers, OpenNMT и Nvidia's DeepLearningExamples, при этом признаки изображений извлекаются с помощью BUTD.
Для упрощения воспроизводимости предоставляется образ Docker, требующий определенных версий драйвера NVIDIA и Docker. Настройка включает монтирование каталогов с исходным кодом и данными в контейнер. Репозиторий содержит краткие руководства для таких задач, как NLVR2, демонстрирующие загрузку данных, запуск контейнера Docker, дообучение и процедуры инференса/оценки. Настройка поддерживается с помощью аргументов командной строки и конфигурационных файлов JSON, с опциями для многопроцессорного обучения с использованием Horovod.
Проект также описывает шаги для последующих задач, таких как VQA, VCR (включая опцию предварительного обучения на втором этапе), визуальное логическое следование, поиск изображений по тексту (как zero-shot, так и дообучение с использованием hard negatives для Flickr30k и COCO), референциальные выражения и предварительное обучение в рамках предметной области. Пользователям предоставляются инструкции по загрузке конкретных наборов данных и запуску соответствующих скриптов обучения и инференса. Репозиторий распространяется под лицензией MIT.
Главное о UNITER Research Code
Официальный исследовательский код для статьи ECCV 2020 «UNITER: UNiversal Image-TExt Representation Learning»
Поддерживает дообучение для NLVR2, VQA, VCR, SNLI-VE, поиска изображений по тексту и референциальных выражений
Предоставляет предварительно обученные чекпоинты для моделей UNITER-base и UNITER-large
Включает скрипты для предварительной обработки данных, обучения моделей и инференса
Предлагает образ Docker для упрощения воспроизводимости и настройки среды
Поддерживает многопроцессорное обучение через Horovod
Включает код для zero-shot и дообучения задач поиска изображений по тексту
Облегчает предварительное обучение в рамках предметной области и предварительное обучение VCR на втором этапе
Начало работы с UNITER Research Code
Загрузите предварительно обученные чекпоинты и данные для конкретных задач с помощью предоставленных bash-скриптов.
Запустите контейнер Docker для согласованной и воспроизводимой среды.
Интегрируйте обучение модели, запуская скрипты дообучения с пользовательскими конфигурациями.
Выполните инференс для последующих задач, используя специализированные скрипты инференса.
Оцените производительность модели с помощью предоставленных скриптов оценки или путем отправки результатов в таблицы лидеров.
Настройте параметры обучения через аргументы командной строки или конфигурационные файлы JSON.
Варианты использования UNITER Research Code
- Визуальный ответ на вопросы
- Рассуждения на основе здравого смысла для изображений
- Поиск изображений по тексту
- Понимание референциальных выражений
- Визуальное логическое следование
- Мультимодальное предварительное обучение







