AiGpu

Industry·

اختبار ThinkingBox من مايكروسوفت يكشف الفجوة بين ادعاءات الوكلاء وواقع قاعدة البيانات

يكشف اختبار ThinkingBox الجديد من مايكروسوفت أن وكلاء الذكاء الاصطناعي يبلغون عن النجاح بشكل متكرر بينما يتركون أنظمة الخلفية في حالات غير صحيحة. عبر 121,680 تجربة، أظهرت 65% من حالات الفشل تنفيذًا نظيفًا للأدوات لكن نتائج قاعدة بيانات خاطئة.

مخطط يوضح خط أنابيب تقييم وكيل ThinkingBox: الوكيل يشغل الأدوات، يتم فحص حالة الخلفية، التحقق القابل للتنفيذ

أصدرت بحوث مايكروسوفت، بالتعاون مع Hugging Face، اختبار ThinkingBox — وهو معيار يقيّم وكلاء الذكاء الاصطناعي بناءً على حالة الخلفية الفعلية التي يتركونها وراءهم، وليس فقط استدعاءات الأدوات التي يقومون بها. النتيجة صارخة: يمكن للوكلاء تنفيذ كل أداة بشكل صحيح، وإرجاع استجابات نهائية مصقولة، وما زالوا يفشلون في تحقيق النتيجة التجارية المطلوبة.

استدعاءات الأدوات ليست نتائج

في دراسة استئصال מבוקرة عبر 12 نموذج لغوي و 507 سير عمل Stateful — تم تنفيذ كل منها 20 مرة — فشلت 79,853 من أصل 121,680 تجربة صالحة في فحوص الحالة القابلة للتنفيذ. من حالات الفشل هذه، أنهت 67.24% التنفيذ بشكل نظيف، واستدعت أدوات تغيير الحالة، وأبلغت عن عدم وجود أخطاء. ومع ذلك، أخبرت قاعدة البيانات قصة مختلفة: قيم حقول خاطئة في 77.61% من الحالات، آثار جانبية غير مقصودة في 43.30%، وآثار مطلوبة مفقودة في 25.36%.

يقوم الاختبار بتشغيل الوكلاء ضد جلسات أدوات MCP (بروتوكول سياق النموذج) المعزولة، ثم يطبق فحوصًا قابلة للتنفيذ على حالة المحطة الخلفية. حالة توضيحية واحدة: وكيل يتعامل مع شكوى تأخير جهاز فتح تذكرة، ووثق الجدول الزمني، وأغلقها كـ "تم الحل". ظل استثناء الناقل مفتوحًا، لذا كانت الحالة الطرفية الصحيحة "قيد الانتظار". كانت استدعاءات أدوات الوكيل صالحة؛ لكن قاعدة البيانات اختلفت.

لماذا هذا مهم لبنية GPU/الذكاء الاصطناعي التحتية: يتطلب تنفيذ الوكلاء الموثوق به على نطاق واسع أداءً نموذجيًا متسقًا وقابلًا للتكرار — والذي بدوره يتطلب حوسبة GPU قوية للتدريب والاستدلال. يبرز مطلب ThinkingBox للاتساق عبر 20 تشغيلًا التباين الذي يظهر حتى من نفس النموذج، مؤكدًا الحاجة إلى بنية تحتية مستقرة وعالية الإنتاجية عند نشر الوكلاء في الإنتاج.

يتوفر ThinkingBox للتشغيل عبر OpenEnv على Hugging Face، مما يتيح للفرق اختبار مجموعات وكلائهم الخاصة ضد نفس سير العمل ذات الحالة. بالنسبة للمؤسسات التي تبني على سحابات GPU، فإنه يوفر طريقة ملموسة لقياس ما إذا كانت ترقيات النموذج أو تغييرات المطالبات تحسن الموثوقية الواقعية فعليًا.

  • aigpu
  • ai gpu
  • ai gpu cloud
  • aigpu dubai
  • agent benchmark
  • microsoft research
  • mcp protocol
  • ai reliability

بقلم AiGpu Editorial · إعادة صياغة تحريرية استناداً إلى تقارير عامة (Hugging Face Blog)

→ كل المقالات