AiGpu

Research·

تحسين إزالة كتل المحولات باستخدام نماذج إيزينغ

يهدف نهج جديد يعتمد على التحسين الثنائي المقيد إلى تقييم كتل المحولات المتفاعلة كنظام واحد، مع الحفاظ على جودة نماذج اللغة الكبيرة عند مستويات ضغط مرتفعة.

مخطط لنموذج محوّل تُزال منه كتل مختارة، مع تمثيل قرارات الكتل الباقية كمتغيرات ثنائية لنظام إيزينغ

لماذا تُعد إزالة الكتل مشكلة على مستوى النظام

توفّر إزالة كتل المحولات بأكملها، أو ما يُعرف بضخ العمق، مكاسب واضحة في زمن الاستجابة والذاكرة، كما يمكن دمجها مع التكميم وطرق الضغط الأخرى. ومع ذلك، يبقى اختيار الكتل المناسبة للتعديل هو التحدي الرئيسي للحفاظ على جودة النموذج.

يُعرّف فريق MultiverseComputingCAI عملية الاختيار ضمن إطار التحسين الثنائي المقيد، ثم يحوّلها إلى نظام زجاج إيزينغ مقيد. يمثّل كل كتلة متغيرًا ثنائيًا، بينما يفرض القيد عدد الكتل المراد إزالتها. وتلعب اقترانات التفاعل بين القرارات دور المتغير المشترك، فيما تعمل طاقة النظام كمؤشر منخفض التكلفة للأداء في الاختبارات.

ويختلف هذا النهج عن الطرق التي تقيّم الكتل بشكل مستقل بحسب قيم مثل المقدار أو الحساسية أو الأثر. قد تفوّت تلك الاختصارات تأثير إزالة الكتل المتجاورة معًا، بينما يسمح البحث القائم على إيزينغ باستكشاف مجموعة أوسع من التوليفات باستخدام حلّلات كلاسيكية وأخرى مستوحاة من الحوسبة الكمومية.

أظهرت النتائج المنشورة أن الأسلوب حقّق فارقًا يقارب 23 نقطة مئوية في اختبار MMLU مقارنةً بأفضل طريقة منافسة لإزالة الكتل عند ضغط Llama 3.3 70B Instruct بنسبة 50%. ومع ذلك، تبقى التقييمات المستقلة على أحمال العمل المستهدفة ضرورية قبل النشر.

لماذا يهم هذا البنية التحتية للـ GPU والذكاء الاصطناعي؟ يمكن أن يؤدي الضغط الأكثر فعالية للعمق إلى تقليل العمليات الحسابية النشطة واحتياجات الذاكرة، ما قد يرفع إنتاجية الاستضافة أو يصغّر بنية نشر النماذج الكبيرة. وينبغي للجهات المشترية قياس المقايضة على عتادها وأكوامها الضمنية وإعدادات التكميم الخاصة بها.

  • aigpu
  • ai gpu
  • ai gpu cloud
  • aigpu dubai
  • llm pruning
  • transformer compression
  • ising optimization
  • gpu inference
  • deep compression
  • ai infrastructure

بقلم AiGpu Editorial · إعادة صياغة تحريرية استناداً إلى تقارير عامة (Hugging Face Blog)

→ كل المقالات