الوصف
MASS، اختصار لـ Masked Sequence to Sequence Pre-training (التدريب المسبق للتسلسل إلى تسلسل المقنع)، هو نهج مبتكر طورته Microsoft لمهام توليد اللغة. تعمل هذه الطريقة عن طريق إخفاء جزء من الجملة بشكل استراتيجي داخل المشفر ثم تكليف المفكك بالتنبؤ بهذا الجزء المقنع. تسمح هذه الآلية الأساسية بتطبيق MASS بفعالية على مجموعة واسعة من مشاكل التسلسل إلى تسلسل.
تتجلى مرونة MASS من خلال تطبيقها الناجح في كل من المهام عبر اللغات، مثل الترجمة الآلية العصبية (NMT)، والمهام أحادية اللغة مثل تلخيص النصوص. يوفر المشروع قاعدة كود قوية، مبنية بشكل أساسي على إطار عمل Fairseq، مما يسهل تنفيذ هذه التطبيقات المتنوعة لتوليد اللغة والتجريب بها.
تشمل القدرات الرئيسية الترجمة الآلية العصبية غير الخاضعة للإشراف، حيث يتم تدريب النماذج باستخدام بيانات أحادية اللغة فقط، والترجمة الآلية العصبية الخاضعة للإشراف، والتي تستفيد من البيانات ثنائية اللغة لتحسين الترجمة. يدعم الإطار أيضًا تلخيص النصوص وتوليد الاستجابات الحوارية. يقدم المشروع نماذج مدربة مسبقًا ونماذج مضبوطة بدقة لمختلف أزواج اللغات، جنبًا إلى جنب مع تعليمات مفصلة لإعداد البيانات وعمليات التدريب المسبق والضبط الدقيق.
يشمل الجمهور المستهدف لـ MASS الباحثين والمطورين الذين يعملون في معالجة اللغات الطبيعية، وخاصة أولئك الذين يركزون على نمذجة التسلسل إلى تسلسل. تكمن القيمة المقترحة في استراتيجية التدريب المسبق الفعالة التي تحسن الأداء بشكل كبير في مهام توليد اللغة اللاحقة، مما يوفر أساسًا قويًا لبناء أنظمة معالجة اللغات الطبيعية المتقدمة. يعزز الطبيعة مفتوحة المصدر للمشروع على GitHub بشكل أكبر التعاون والابتكار في هذا المجال.
أبرز ملامح توليد اللغة الضخم (MASS)
التدريب المسبق للتسلسل إلى تسلسل المقنع لتوليد اللغة
يدعم الترجمة الآلية العصبية غير الخاضعة للإشراف (NMT)
يدعم الترجمة الآلية العصبية الخاضعة للإشراف (NMT)
يدعم تلخيص النصوص
يدعم توليد الاستجابات الحوارية
مبني على إطار عمل Fairseq
يوفر نماذج مدربة مسبقًا ومضبوطة بدقة
يتضمن كودًا لمعالجة البيانات والتدريب المسبق والضبط الدقيق
يقدم تطبيقات للمهام عبر اللغات وأحادية اللغة
يقوم بإخفاء أجزاء الجملة في المشفر للتنبؤ بها في المفكك
البدء مع توليد اللغة الضخم (MASS)
الوصول إلى النموذج: استنساخ مستودع MASS من GitHub.
إعداد البيئة: تثبيت التبعيات المطلوبة بما في ذلك Python و NumPy و PyTorch و fastBPE و Moses و Apex.
إعداد البيانات: تنزيل ومعالجة مجموعات البيانات وفقًا للنصوص البرمجية المقدمة لمهام محددة مثل NMT أو التلخيص.
التدريب المسبق للنموذج: تنفيذ نصوص التدريب المسبق باستخدام البيانات المعدة والمعلمات الفائقة المحددة.
ضبط النموذج: تكييف النموذج المدرب مسبقًا مع المهام اللاحقة باستخدام بيانات خاصة بالمهمة ونصوص الضبط الدقيق.
الاستدلال: استخدام النموذج المضبوط بدقة لتوليد المخرجات على بيانات جديدة.
حالات استخدام توليد اللغة الضخم (MASS)
- الترجمة الآلية
- تلخيص النصوص
- توليد الاستجابات
- النقل عبر اللغات
- معالجة اللغات الطبيعية منخفضة الموارد








