الوصف
LGM، اختصار لنموذج غاوسي كبير متعدد المشاهد، هو إطار عمل متقدم مصمم لإنشاء محتوى ثلاثي الأبعاد عالي الدقة. يقدم هذا المشروع، الذي تم تقديمه في ECCV 2024 كبحث شفوي، تطبيقًا قويًا لنموذج غاوسي جديد قادر على إنشاء أصول ثلاثية الأبعاد مفصلة من مشاهد إدخال متعددة. يكمن جوهر LGM في قدرته على الاستفادة من معلومات المشاهد المتعددة لإعادة بناء وعرض مشاهد ثلاثية الأبعاد معقدة بدقة رائعة.
يوفر المشروع مجموعة شاملة من الأدوات للباحثين والمطورين المهتمين بإنشاء المحتوى ثلاثي الأبعاد. يشمل ذلك مستودع الكود الرسمي، وأوزان النموذج المدربة مسبقًا المتاحة للتنزيل، وتعليمات واضحة للاستدلال. يدعم LGM خطوط أنابيب إنشاء النص إلى ثلاثي الأبعاد والصورة إلى ثلاثي الأبعاد، مما يجعله أداة متعددة الاستخدامات لمختلف التطبيقات الإبداعية والتقنية. يعتمد التطبيق على الأبحاث الحالية في تقنيات Gaussian splatting والتصيير العصبي، بهدف دفع حدود الجودة والدقة في التوليف ثلاثي الأبعاد.
تشمل القدرات الرئيسية لـ LGM مخرجاته عالية الدقة، مما يتيح إنشاء نماذج ومشاهد ثلاثية الأبعاد مفصلة. تم تحسين بنية النموذج لمدخلات المشاهد المتعددة، مما يسمح بإعادة بناء دقيقة للهندسة والمظهر. يوفر المشروع أيضًا واجهة مستخدم رسومية محلية لتصور ملفات PLY المحفوظة وسكربتات لتحويل الشبكات، مما يسهل التكامل مع سير العمل ثلاثي الأبعاد الحالي. في حين أن مجموعة بيانات التدريب تعتمد على AWS وليست قابلة للنقل مباشرة، يوفر المشروع إطار عمل كود التدريب ومجموعة فرعية مفلترة من مجموعة بيانات Objaverse للمستخدمين الذين يرغبون في تدريب نماذجهم الخاصة.
يعد LGM ذا صلة خاصة بالباحثين في مجال الرؤية الحاسوبية والرسومات، وفناني ثلاثي الأبعاد، ومطوري الألعاب، وأي شخص مشارك في إنشاء أو معالجة الأصول ثلاثية الأبعاد. تشجع الطبيعة مفتوحة المصدر للمشروع والتوثيق التفصيلي على مساهمات المجتمع والتطوير الإضافي. يؤكد التركيز على المخرجات عالية الدقة واتساق المشاهد المتعددة على أن LGM يمثل تقدمًا كبيرًا في مجال النمذجة التوليدية ثلاثية الأبعاد.
الميزات الأساسية لـ LGM: نموذج غاوسي كبير متعدد المشاهد
إنشاء محتوى ثلاثي الأبعاد عالي الدقة
تطبيق نموذج غاوسي كبير متعدد المشاهد
يدعم إنشاء النص إلى ثلاثي الأبعاد
يدعم إنشاء الصورة إلى ثلاثي الأبعاد
يوفر الكود الرسمي والأوزان المدربة مسبقًا
يشمل سكربتات الاستدلال
واجهة مستخدم رسومية محلية لتصور النماذج ثلاثية الأبعاد
أدوات تحويل الشبكات
مبني على تقنيات Gaussian Splatting
بحث شفوي في ECCV 2024
البدء مع LGM: نموذج غاوسي كبير متعدد المشاهد
استنساخ المستودع: احصل على كود LGM من GitHub.
تثبيت التبعيات: قم بإعداد حزم Python المطلوبة، بما في ذلك PyTorch و xformers.
تنزيل الأوزان: احصل على نقاط التحقق للنموذج المدرب مسبقًا من Hugging Face.
تكوين الاستدلال: حدد مسارات مساحة العمل والاختبار للتوليد.
تنفيذ الاستدلال: قم بتشغيل سكربت `infer.py` للتوليد ثلاثي الأبعاد.
تصور النتائج: استخدم `gui.py` لعرض ملفات PLY المولدة.
التحويل إلى شبكة: استخدم `convert.py` لاستخراج الشبكة.
حالات استخدام LGM: نموذج غاوسي كبير متعدد المشاهد
- إنشاء أصول ثلاثية الأبعاد عالية الدقة
- إنشاء محتوى من النص إلى ثلاثي الأبعاد
- إعادة بناء الصورة إلى ثلاثي الأبعاد
- محتوى ثلاثي الأبعاد لـ AR/VR
- أصول تطوير الألعاب
- البحث في التوليد ثلاثي الأبعاد






