الوصف
مشروع BigDL، وتحديداً مكون BigDL-LLM (الذي ينتقل حاليًا إلى IPEX-LLM)، هو مكتبة قوية مصممة لتحسين أداء نماذج اللغة الكبيرة (LLMs) عبر مجموعة من أجهزة Intel، بما في ذلك وحدات المعالجة المركزية ووحدات معالجة الرسومات. تتيح للمستخدمين تشغيل نماذج LLMs بزمن استجابة مخفض بشكل كبير من خلال الاستفادة من تقنيات التكميم المتقدمة مثل INT4 و FP4 و INT8 و FP8. هذا التحسين ضروري لنشر نماذج الذكاء الاصطناعي المعقدة بكفاءة على تكوينات أجهزة متنوعة.
بناءً على العمل الأساسي لمكتبات مثل llama.cpp و gptq و bitsandbytes و qlora، يوفر BigDL-LLM إطار عمل قوي لكل من الاستدلال والضبط الدقيق لنماذج LLMs المستندة إلى PyTorch. تسلط التحديثات الأخيرة الضوء على القدرات الموسعة، بما في ذلك التحميل المباشر للنماذج من ModelScope، ودعم INT2 الأولي لتشغيل النماذج الكبيرة على وحدات معالجة الرسومات ذات ذاكرة VRAM محدودة، والتكامل مع Text-Generation-WebUI لتجربة مستخدم رسومية. تقدم المكتبة أيضًا Self-Speculative Decoding، والذي يوفر تسريعًا عمليًا لزمن استجابة الاستدلال على وحدات معالجة الرسومات ووحدات المعالجة المركزية من Intel.
بالنسبة للمطورين والباحثين الذين يركزون على تخصيص النماذج، يوفر BigDL-LLM دعمًا شاملاً لطرق الضبط الدقيق المختلفة على وحدات معالجة الرسومات من Intel، بما في ذلك LoRA و QLoRA و DPO و QA-LoRA و ReLoRA. هذا يسمح بالتكيف الفعال للنماذج المدربة مسبقًا لمهام ومجموعات بيانات محددة. أظهر المشروع سرعات ضبط دقيق مثيرة للإعجاب، مثل تدريب LLaMA2-7B في أقل من 30 دقيقة على وحدات معالجة رسومات Intel متعددة. علاوة على ذلك، فإنه يدعم التحميل المباشر لتنسيقات النماذج الشائعة مثل GGUF و AWQ و GPTQ، ويتكامل مع vLLM للدفعة المستمرة و FastChat للتقديم.
يمتد نظام BigDL البيئي إلى ما وراء نماذج LLMs، ويشمل مكتبات لتحليلات البيانات الموزعة والذكاء الاصطناعي (Orca)، وتسريع شفاف لـ TensorFlow و PyTorch (Nano)، والتعلم العميق على Spark (DLlib)، وتحليل السلاسل الزمنية (Chronos)، وأنظمة التوصية (Friesian)، والذكاء الاصطناعي الآمن (PPML). يعد BigDL-LLM مكونًا رئيسيًا لأولئك الذين يتطلعون إلى الاستفادة من قوة نماذج LLMs على أجهزة Intel، مما يوفر حلاً مرنًا وعالي الأداء لمجموعة واسعة من تطبيقات الذكاء الاصطناعي.
الميزات الأساسية لـ BigDL LLM
استدلال LLM محسن على Intel XPU (CPU, GPU)
يدعم تكميم INT4, FP4, INT8, FP8
استدلال بزمن استجابة منخفض لنماذج PyTorch
مبني على llama.cpp, gptq, bitsandbytes, qlora
تحميل مباشر لنماذج GGUF, AWQ, GPTQ
ضبط دقيق شامل لـ LLM على Intel GPU (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)
Self-Speculative Decoding لتسريع بنسبة ~30%
يدعم الدفعة المستمرة لـ vLLM
تقديم FastChat على Intel CPU و GPU
تحميل مباشر من ModelScope
دعم INT2 الأولي لنماذج LLMs الكبيرة على وحدات معالجة الرسومات بذاكرة VRAM بسعة 16 جيجابايت
التكامل مع Text-Generation-WebUI
البدء مع BigDL LLM
تثبيت BigDL-LLM عبر pip: `pip install --pre --upgrade bigdl-llm[all]` لوحدة المعالجة المركزية أو `bigdl-llm[xpu]` لوحدة معالجة الرسومات.
تحميل نماذج Hugging Face Transformers مع تحسينات INT4 باستخدام `AutoModelForCausalLM.from_pretrained`.
تشغيل النماذج المحسنة على Intel CPU عن طريق تحديد مسار النموذج.
تشغيل النماذج المحسنة على Intel GPU عن طريق نقل النموذج وموترات الإدخال إلى جهاز 'xpu'.
تكوين معلمات الضبط الدقيق لـ LoRA أو QLoRA أو DPO أو QA-LoRA أو ReLoRA.
استخدام FastChat أو vLLM لتقديم نماذج LLMs المحسنة.
التكامل مع LangChain لتطوير تطبيقات LLM.
حالات استخدام BigDL LLM
- استدلال LLM بزمن استجابة منخفض
- ضبط دقيق لـ LLM
- نشر نماذج فعال
- تطوير تطبيقات الذكاء الاصطناعي
- تدريب نماذج كبيرة على ذاكرة VRAM محدودة
- توليد نص مسرع





