Deskripsi
MASS, singkatan dari Masked Sequence to Sequence Pre-training, adalah pendekatan baru yang dikembangkan oleh Microsoft untuk tugas generasi bahasa. Metode ini beroperasi dengan secara strategis menutupi sebagian kalimat di dalam encoder dan kemudian menugaskan decoder untuk memprediksi segmen yang ditutupi tersebut. Mekanisme inti ini memungkinkan MASS diterapkan secara efektif pada berbagai masalah sequence-to-sequence.
Fleksibilitas MASS ditunjukkan melalui aplikasinya yang sukses dalam tugas lintas-bahasa, seperti Neural Machine Translation (NMT), dan tugas monolingual seperti peringkasan teks. Proyek ini menyediakan basis kode yang kuat, yang terutama dibangun di atas kerangka kerja Fairseq, yang memfasilitasi implementasi dan eksperimen dengan berbagai aplikasi generasi bahasa ini.
Kemampuan utama meliputi NMT tanpa pengawasan, di mana model dilatih hanya menggunakan data monolingual, dan NMT dengan pengawasan, yang memanfaatkan data bilingual untuk terjemahan yang ditingkatkan. Kerangka kerja ini juga mendukung peringkasan teks dan generasi respons percakapan. Proyek ini menawarkan model yang telah dilatih sebelumnya dan disesuaikan untuk berbagai pasangan bahasa, bersama dengan instruksi terperinci untuk persiapan data, pra-pelatihan, dan proses penyesuaian.
Target audiens untuk MASS mencakup peneliti dan pengembang yang bekerja pada pemrosesan bahasa alami, terutama yang berfokus pada pemodelan sequence-to-sequence. Proposisi nilai terletak pada strategi pra-pelatihan yang efektif yang secara signifikan meningkatkan kinerja pada tugas generasi bahasa hilir, menawarkan dasar yang kuat untuk membangun sistem NLP tingkat lanjut. Sifat open-source proyek di GitHub lebih lanjut mempromosikan kolaborasi dan inovasi di bidang ini.
Sorotan MASS Language Generation
Pra-pelatihan Masked Sequence to Sequence untuk Generasi Bahasa
Mendukung Neural Machine Translation (NMT) Tanpa Pengawasan
Mendukung Neural Machine Translation (NMT) dengan Pengawasan
Mendukung Peringkasan Teks
Mendukung Generasi Respons Percakapan
Dibangun di atas kerangka kerja Fairseq
Menyediakan model yang telah dilatih sebelumnya dan disesuaikan
Termasuk kode untuk pemrosesan data, pra-pelatihan, dan penyesuaian
Menawarkan implementasi untuk tugas lintas-bahasa dan monolingual
Menutupi fragmen kalimat di encoder untuk prediksi decoder
Memulai dengan MASS Language Generation
Akses Model: Kloning repositori MASS dari GitHub.
Siapkan Lingkungan: Instal dependensi yang diperlukan termasuk Python, NumPy, PyTorch, fastBPE, Moses, dan Apex.
Siapkan Data: Unduh dan proses dataset sesuai dengan skrip yang disediakan untuk tugas tertentu seperti NMT atau peringkasan.
Pra-latih Model: Jalankan skrip pra-pelatihan menggunakan data yang disiapkan dan hyperparameter yang ditentukan.
Sesuaikan Model: Adaptasi model yang telah dilatih sebelumnya ke tugas hilir menggunakan data spesifik tugas dan skrip penyesuaian.
Inferensi: Gunakan model yang telah disesuaikan untuk menghasilkan keluaran pada data baru.
Kasus Penggunaan MASS Language Generation
- Terjemahan Mesin
- Peringkasan Teks
- Generasi Respons
- Transfer Lintas-Bahasa
- NLP Sumber Daya Rendah








