AiGpu

Infrastructure·

النشر المشترك لمعهد UK لسلامة الذكاء الاصطناعي وEvalEval لنتائج اختبارات الذكاء الاصطناعي القابلة للتكرار عبر بطاقات التقييم

يصدر AISI وEvalEval بيانات الاختبارات عبر بطاقات التقييم، مع توفير الإعداد الكامل وتفاصيل النصوص لتمكين تقييم ذكاء اصطناعي قابل للتكرار.

رسم توضيحي لبطاقات التقييم تُظهر نتائج الاختبارات

تعاون المعهد البريطاني لسلامة الذكاء الاصطناعي (AISI) مع تحالف EvalEval لنشر مجموعة من نتائج الاختبارات عبر منصة Evaluation Cards.

لماذا تهمّ القابلية للتكرار

مع نمو نماذج الذكاء الاصطناعي، يصبح تكلفة وتعقيد إعادة تشغيل الاختبارات مرتفعة، ما يصعّب على الباحثين التحقق من الأرقام المنشورة. يهدف مخطط Every Eval Ever وبطاقات التقييم الخاصة بـ EvalEval إلى التقاط ليس فقط النتيجة النهائية بل أيضًا الإعداد الكامل، والرسائل، وميزانية الحساب اللازمة لتكرار الاختبار.

يشارك AISI تفاصيل على مستوى النصوص لخمس اختبارات رئيسية—HealthBench، FrontierMath، Humanity's Last Exam، SWE‑Bench Pro، وTerminal‑Bench 2.0—عبر ستة نماذج حدودية تتراوح من Claude Opus 4 إلى GPT‑5.4. كما يتضمن الإصدار تقييمين سيبرانيين يستخدمان مجموعة جزئيًا متداخلة من النماذج.

الآثار على بنية تحتية GPU والذكاء الاصطناعي

عند الكشف عن بروتوكولات التقييم وحساب وقت الاستنتاج جنبًا إلى جنب مع النتائج، يمكن للمهندسين تحديد حجم مجموعات GPU المناسبة لأحمال عمل معينة وتوقع مقياس الأداء. كما يساعد الشفافية المشترين على مقارنة خيارات الأجهزة على أساس مشترك وقابل للتحقق.

من خلال توفير البيانات بشكل مفتوح، يأمل AISI وEvalEval سد الفجوات في علم التقييم وتعزيز نظام أكثر موثوقية لتطوير النماذج والشراء.

  • aigpu
  • ai gpu
  • ai gpu cloud
  • aigpu dubai
  • ai benchmarking
  • reproducible evaluation
  • model performance
  • gpu infrastructure
  • aisi
  • evaleval

بقلم AiGpu Editorial · إعادة صياغة تحريرية استناداً إلى تقارير عامة (Hugging Face Blog)

→ كل المقالات