تخطَّ إلى المحتوى الرئيسي
ToolPotion

BigDL LLM

BigDL-LLM هي مكتبة مفتوحة المصدر لتشغيل نماذج اللغة الكبيرة (LLMs) على أجهزة Intel XPU، من أجهزة الكمبيوتر المحمولة إلى وحدات معالجة الرسومات السحابية. تدعم التكميم INT4/FP4/INT8/FP8 للاستدلال بزمن استجابة منخفض وتقدم إمكانيات ضبط دقيق شاملة لنماذج PyTorch.

زيارة الرابط

الوصف

مشروع BigDL، وتحديداً مكون BigDL-LLM (الذي ينتقل حاليًا إلى IPEX-LLM)، هو مكتبة قوية مصممة لتحسين أداء نماذج اللغة الكبيرة (LLMs) عبر مجموعة من أجهزة Intel، بما في ذلك وحدات المعالجة المركزية ووحدات معالجة الرسومات. تتيح للمستخدمين تشغيل نماذج LLMs بزمن استجابة مخفض بشكل كبير من خلال الاستفادة من تقنيات التكميم المتقدمة مثل INT4 و FP4 و INT8 و FP8. هذا التحسين ضروري لنشر نماذج الذكاء الاصطناعي المعقدة بكفاءة على تكوينات أجهزة متنوعة.

بناءً على العمل الأساسي لمكتبات مثل llama.cpp و gptq و bitsandbytes و qlora، يوفر BigDL-LLM إطار عمل قوي لكل من الاستدلال والضبط الدقيق لنماذج LLMs المستندة إلى PyTorch. تسلط التحديثات الأخيرة الضوء على القدرات الموسعة، بما في ذلك التحميل المباشر للنماذج من ModelScope، ودعم INT2 الأولي لتشغيل النماذج الكبيرة على وحدات معالجة الرسومات ذات ذاكرة VRAM محدودة، والتكامل مع Text-Generation-WebUI لتجربة مستخدم رسومية. تقدم المكتبة أيضًا Self-Speculative Decoding، والذي يوفر تسريعًا عمليًا لزمن استجابة الاستدلال على وحدات معالجة الرسومات ووحدات المعالجة المركزية من Intel.

بالنسبة للمطورين والباحثين الذين يركزون على تخصيص النماذج، يوفر BigDL-LLM دعمًا شاملاً لطرق الضبط الدقيق المختلفة على وحدات معالجة الرسومات من Intel، بما في ذلك LoRA و QLoRA و DPO و QA-LoRA و ReLoRA. هذا يسمح بالتكيف الفعال للنماذج المدربة مسبقًا لمهام ومجموعات بيانات محددة. أظهر المشروع سرعات ضبط دقيق مثيرة للإعجاب، مثل تدريب LLaMA2-7B في أقل من 30 دقيقة على وحدات معالجة رسومات Intel متعددة. علاوة على ذلك، فإنه يدعم التحميل المباشر لتنسيقات النماذج الشائعة مثل GGUF و AWQ و GPTQ، ويتكامل مع vLLM للدفعة المستمرة و FastChat للتقديم.

يمتد نظام BigDL البيئي إلى ما وراء نماذج LLMs، ويشمل مكتبات لتحليلات البيانات الموزعة والذكاء الاصطناعي (Orca)، وتسريع شفاف لـ TensorFlow و PyTorch (Nano)، والتعلم العميق على Spark (DLlib)، وتحليل السلاسل الزمنية (Chronos)، وأنظمة التوصية (Friesian)، والذكاء الاصطناعي الآمن (PPML). يعد BigDL-LLM مكونًا رئيسيًا لأولئك الذين يتطلعون إلى الاستفادة من قوة نماذج LLMs على أجهزة Intel، مما يوفر حلاً مرنًا وعالي الأداء لمجموعة واسعة من تطبيقات الذكاء الاصطناعي.

الميزات الأساسية لـ BigDL LLM

  • استدلال LLM محسن على Intel XPU (CPU, GPU)

  • يدعم تكميم INT4, FP4, INT8, FP8

  • استدلال بزمن استجابة منخفض لنماذج PyTorch

  • مبني على llama.cpp, gptq, bitsandbytes, qlora

  • تحميل مباشر لنماذج GGUF, AWQ, GPTQ

  • ضبط دقيق شامل لـ LLM على Intel GPU (LoRA, QLoRA, DPO, QA-LoRA, ReLoRA)

  • Self-Speculative Decoding لتسريع بنسبة ~30%

  • يدعم الدفعة المستمرة لـ vLLM

  • تقديم FastChat على Intel CPU و GPU

  • تحميل مباشر من ModelScope

  • دعم INT2 الأولي لنماذج LLMs الكبيرة على وحدات معالجة الرسومات بذاكرة VRAM بسعة 16 جيجابايت

  • التكامل مع Text-Generation-WebUI

البدء مع BigDL LLM

  1. تثبيت BigDL-LLM عبر pip: `pip install --pre --upgrade bigdl-llm[all]` لوحدة المعالجة المركزية أو `bigdl-llm[xpu]` لوحدة معالجة الرسومات.

  2. تحميل نماذج Hugging Face Transformers مع تحسينات INT4 باستخدام `AutoModelForCausalLM.from_pretrained`.

  3. تشغيل النماذج المحسنة على Intel CPU عن طريق تحديد مسار النموذج.

  4. تشغيل النماذج المحسنة على Intel GPU عن طريق نقل النموذج وموترات الإدخال إلى جهاز 'xpu'.

  5. تكوين معلمات الضبط الدقيق لـ LoRA أو QLoRA أو DPO أو QA-LoRA أو ReLoRA.

  6. استخدام FastChat أو vLLM لتقديم نماذج LLMs المحسنة.

  7. التكامل مع LangChain لتطوير تطبيقات LLM.

حالات استخدام BigDL LLM

  • استدلال LLM بزمن استجابة منخفض
  • ضبط دقيق لـ LLM
  • نشر نماذج فعال
  • تطوير تطبيقات الذكاء الاصطناعي
  • تدريب نماذج كبيرة على ذاكرة VRAM محدودة
  • توليد نص مسرع

الأسئلة الشائعة من BigDL LLM

تقييمات BigDL LLM

جاري التحميل...

أدوات ذكاء اصطناعي شائعة مثل BigDL LLM

أطر عمل الذكاء الاصطناعي

LiteRT هو إطار عمل التعلم الآلي عالي الأداء من Google للنشر على الأجهزة، مخصص لنشر نماذج GenAI والتعلم الآلي على منصات الحافة. يوفر تحويلًا وتشغيلًا وتحسينًا فعالًا، بناءً على…

MLOps ونشر النماذج

أطر عمل الذكاء الاصطناعي

Intel® Neural Compressor هي مكتبة Python مفتوحة المصدر تقدم تقنيات ضغط نماذج شائعة لـ PyTorch و TensorFlow و JAX. تدعم التكميم المتقدم لنماذج LLMs و VLMs، مما يحسن الأداء عبر…

منصّات تعلّم الآلة

تطبيقات الذكاء الاصطناعي

vLLM هو محرك استدلال وخدمة عالي الإنتاجية وفعال من حيث الذاكرة لنماذج اللغة الكبيرة (LLMs). يتيح نشر نماذج الذكاء الاصطناعي بشكل أسرع مع أداء متقدم، مما يجعل خدمة LLM سهلة وسريعة…

MLOps ونشر النماذج

أطر عمل الذكاء الاصطناعي

OpenVINO هو مجموعة أدوات مفتوحة المصدر لنشر حلول الذكاء الاصطناعي عالية الأداء عبر أجهزة متنوعة. يمكّن المطورين من تحويل وتحسين وتشغيل الاستدلال لكل من نماذج الذكاء الاصطناعي…

MLOps ونشر النماذج

منصات الذكاء الاصطناعي

منصة بنية تحتية للذكاء الاصطناعي للمطورين لنشر وتخصيص وتشغيل أكثر من 200 نموذج لغة كبير ونماذج متعددة الوسائط من خلال واجهة برمجة تطبيقات متوافقة مع OpenAI بأسعار الدفع حسب…

مميزةMLOps ونشر النماذج

مستودعات GitHub للذكاء الاصطناعي

vllm-project/vllm هو محرك استدلال وخدمة عالي الإنتاجية وفعال من حيث الذاكرة مصمم لنماذج اللغة الكبيرة (LLMs). يقوم بتحسين الأداء مع تقليل استخدام الموارد، مما يجعله مناسبًا…

مميزةMLOps ونشر النماذج

منصات الذكاء الاصطناعي

Bento هي منصة استدلال مصممة للسرعة والتحكم، مما يتيح لك نشر أي نموذج ذكاء اصطناعي في أي مكان. توفر تحسينًا مخصصًا، وتوسيعًا فعالًا، وعمليات مبسطة لفرق الذكاء الاصطناعي. بسّط…

مميزةMLOps ونشر النماذج

أطر عمل الذكاء الاصطناعي

ONNX Runtime هو إطار عمل متقدم لتعلم الآلة عبر الأنظمة الأساسية، يقوم بتحسين التدريب والاستدلال. يدعم مجموعة متنوعة من لغات البرمجة والمنصات، مما يسهل دمج قدرات الذكاء الاصطناعي…

مميزةمنصّات تعلّم الآلة