Langsung ke konten utama
ToolPotion

Kode Riset UNITER

UNITER adalah repositori kode riset untuk makalah ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'. Ini menyediakan kode untuk penyempurnaan (finetuning) dan inferensi di berbagai tugas visual-dan-bahasa, termasuk VQA, VCR, dan pengambilan gambar-teks. Checkpoint yang telah dilatih sebelumnya tersedia untuk UNITER-base dan UNITER-large.

Kunjungi URL

Deskripsi

Repositori kode riset UNITER, yang disajikan dalam makalah ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning', menawarkan seperangkat alat yang komprehensif untuk riset AI multimodal. Repositori ini memfasilitasi penyempurnaan dan inferensi untuk berbagai tugas visual-dan-bahasa, termasuk Visual Question Answering (VQA), Visual Commonsense Reasoning (VCR), SNLI-VE (Visual Entailment), Image-Text Retrieval untuk dataset seperti COCO dan Flickr30k, dan Referring Expression Comprehensions (RefCOCO, RefCOCO+, RefCOCO-g).

UNITER dibangun di atas kerangka kerja pembelajaran representasi gambar-teks universal. Kode ini mendukung checkpoint yang telah dilatih sebelumnya untuk UNITER-base dan UNITER-large, dengan opsi untuk pra-pelatihan dalam domain. Repositori ini mencakup skrip untuk pra-pemrosesan data, pelatihan model, dan inferensi. Ini memanfaatkan pustaka eksternal seperti PyTorch, HuggingFace Transformers, OpenNMT, dan Nvidia's DeepLearningExamples, dengan fitur gambar diekstraksi menggunakan BUTD.

Untuk kemudahan reproduksi, gambar Docker disediakan, yang memerlukan versi driver NVIDIA dan Docker tertentu. Pengaturan melibatkan pemasangan direktori kode sumber dan data ke dalam kontainer. Repositori merinci panduan memulai cepat untuk tugas-tugas seperti NLVR2, mendemonstrasikan unduhan data, peluncuran kontainer Docker, penyempurnaan, dan prosedur inferensi/evaluasi. Kustomisasi didukung melalui argumen baris perintah dan file konfigurasi JSON, dengan opsi untuk pelatihan multi-GPU menggunakan Horovod.

Proyek ini juga menguraikan langkah-langkah untuk tugas hilir seperti VQA, VCR (termasuk opsi pra-pelatihan tahap kedua), Visual Entailment, Image-Text Retrieval (baik zero-shot maupun penyempurnaan dengan hard negative untuk Flickr30k dan COCO), Referring Expressions, dan pra-pelatihan dalam domain. Pengguna dipandu tentang cara mengunduh dataset tertentu dan menjalankan skrip pelatihan dan inferensi yang sesuai. Repositori ini dilisensikan di bawah lisensi MIT.

Sorotan Kode Riset UNITER

  • Kode riset resmi untuk makalah ECCV 2020 'UNITER: UNiversal Image-TExt Representation Learning'

  • Mendukung penyempurnaan untuk NLVR2, VQA, VCR, SNLI-VE, Image-Text Retrieval, dan Referring Expressions

  • Menyediakan checkpoint yang telah dilatih sebelumnya untuk model UNITER-base dan UNITER-large

  • Mencakup skrip untuk pra-pemrosesan data, pelatihan model, dan inferensi

  • Menawarkan gambar Docker untuk reproduksi dan pengaturan lingkungan yang disederhanakan

  • Mendukung pelatihan multi-GPU melalui Horovod

  • Mencakup kode untuk penyempurnaan zero-shot dan Image-Text Retrieval

  • Memfasilitasi pra-pelatihan dalam domain dan pra-pelatihan tahap kedua VCR

Memulai dengan Kode Riset UNITER

  1. Unduh checkpoint yang telah dilatih sebelumnya dan data spesifik tugas menggunakan skrip bash yang disediakan.

  2. Luncurkan kontainer Docker untuk lingkungan yang konsisten dan dapat direproduksi.

  3. Integrasikan pelatihan model dengan menjalankan skrip penyempurnaan dengan konfigurasi kustom.

  4. Lakukan inferensi pada tugas hilir menggunakan skrip inferensi khusus.

  5. Evaluasi kinerja model menggunakan skrip evaluasi yang disediakan atau dengan mengirimkan hasil ke papan peringkat.

  6. Sesuaikan opsi pelatihan melalui argumen baris perintah atau file konfigurasi JSON.

Kasus Penggunaan Kode Riset UNITER

  • Visual Question Answering
  • Visual Commonsense Reasoning
  • Image-Text Retrieval
  • Referring Expression Comprehension
  • Visual Entailment
  • Multimodal Pre-training

FAQ dari Kode Riset UNITER

Ulasan Kode Riset UNITER

Memuat...

Alat AI Populer Seperti Kode Riset UNITER

Phi-4-reasoning-vision-15B adalah model AI multimodal yang dikembangkan oleh Microsoft, dirancang untuk tugas yang memerlukan pemahaman bahasa-visual dan kemampuan penalaran.…

UnggulanModel AI & LLM

Oscar dan VinVL adalah model AI canggih untuk tugas visi-bahasa. Oscar menggunakan penyelarasan objek-semantik untuk pra-pelatihan, mencapai hasil mutakhir. VinVL meningkatkan…

Model AI & LLM

Model AI

MiniGPT-4 adalah model AI yang meningkatkan pemahaman visi-bahasa dengan menyelaraskan pengkode visual yang dibekukan dengan model bahasa besar. Model ini dapat menghasilkan…

Model AI & LLM

Model AI

LLaVA adalah model multimodal besar yang menggabungkan vision encoder dengan language model untuk pemahaman visual dan bahasa tujuan umum. Model ini unggul dalam kemampuan chat…

Model AI & LLM

LLaVA adalah model penyesuaian instruksi visual yang menggabungkan kemampuan bahasa dan visi skala besar. Tujuannya adalah untuk mencapai kinerja setingkat GPT-4V, memungkinkan…

Model AI & LLM

Flamingo adalah model bahasa visual (VLM) tunggal dari Google DeepMind yang unggul dalam pembelajaran *few-shot* di berbagai tugas multimodal. Model ini memproses gambar, video,…

Model AI & LLM

Gemini 3.1 Pro adalah model AI canggih yang dirancang untuk tugas kompleks dan penalaran mendalam. Model ini unggul dalam pemahaman multimodal, memberikan respons yang cerdas dan…

UnggulanModel AI & LLM