Models·
ترانسفورمرز من هاغينغ فيس تضيف دعم GGUF الأصلي للاستدلال المحلي بالنماذج اللغوية الكبيرة
أصبح بإمكان المطورين الآن تحميل نماذج GGUF المكممة من llama.cpp مباشرة عبر مكتبة ترانسفورمرز، مما يجلب الاستدلال المحلي الفعال إلى واجهات البرمجة المألوفة على شرائح آبل سيليكون.

أضافت هاغينغ فيس دعمًا أصليًا لنماذج تنسيق GGUF في مكتبة ترانسفورمرز، مما يتيح للمطورين تحميل نقاط تفتيش مكممة من llama.cpp مباشرة عبر from_pretrained() دون مغادرة نظام باي تورش المألوف. تعيد التكامل استخدام نواة ggml من خلال مكتبة kernels لمطابقة أداء llama.cpp، مستهدفةً في البداية أجهزة ماك العاملة بشرائح آبل سيليكون ومعمارية Qwen3.5.
لماذا هذا مهم للبنية التحتية للـ GPU والذكاء الاصطناعي
بالنسبة للفرق التي تشغل الاستدلال محليًا أو على الحافة، يقلل هذا التحديث من احتكاك نشر النماذج اللغوية الكبيرة المكممة. بدلاً من الحفاظ على حزم استدلال منفصلة — واحدة للتدريب (ترانسفورمرز) وأخرى للخدمة المحلية (llama.cpp/Ollama) — يمكن للمهندسين الآن توحيد سطح واجهة برمجة التطبيقات الوحيد. هذا يبسط مسارات التكامل والنشر المستمر، وإصدار النماذج، وتوفير الأجهزة، خاصة عندما تكون ذاكرة GPU محدودة وتصبح الكمية 4-بت (Q4_K_M) الخيار العملي الافتراضي.
يجمع تنسيق GGUF الأوزان، وبيانات تعريف المُرمز، وقوالب المحادثة الاختيارية في ملف واحد، مع متغيرات كمية تتراوح من BF16 (8.4 جيجابايت لـ Qwen3.5-4B) وصولًا إلى Q4_K_M (2.7 جيجابايت). يستضيف هاب هاغينغ فيس بالفعل ملايين التنزيلات لنماذج GGUF من ناشرين مثل Unsloth، ومجتمع LM Studio، وbartowski، مما يمنح الفرق وصولًا فوريًا إلى نقاط تفتيش مكممة جاهزة للإنتاج.
للبدء، يحتاج المطورون إلى ماك بشرائح آبل سيليكون، وبناء حديث لباي تورش، وأحدث إصدار من ترانسفورمرز من جيت هاب بجانب حزمة kernels. من المتوقع دعم أجهزة أوسع وإصدار مستقر على PyPI في الإصدار القادم من ترانسفورمرز.
- aigpu
- ai gpu
- ai gpu cloud
- aigpu dubai
- transformers
- gguf
- llama-cpp
- quantization
- local-inference
- apple-silicon
بقلم AiGpu Editorial · إعادة صياغة تحريرية استناداً إلى تقارير عامة (Hugging Face Blog)
→ كل المقالات