AiGpu

Industry·

تقنيات watermarking للذكاء الاصطناعي قد تضعف حواجز السلامة في نماذج اللغة الكبيرة

أظهر بحث حديث أن دمج علامات SynthID‑Text المائية يمكن أن يغيّر طريقة استجابة نماذج اللغة الكبيرة للم prompts الضارة أو العدائية، مما يؤثر على آليات السلامة المدمجة فيها.

رسم توضيحي لنص مولد بالذكاء الاصطناعي مع علامة مائية خفية

القواعد القادمة للشفافية في الذكاء الاصطناعي بالاتحاد الأوروبي تدفع الموردين إلى تضمين إشارات قابلة للكشف في النص المولّد، وسيتبنى نماذج Claude القادمة من أنثروبيك علامة SynthID‑Text المائية المفتوحة المصدر من جوجل.

كيف يعمل SynthID‑Text

بدلاً من الاعتماد على مولد أرقام عشوائية عادية لاختيار الرموز، يحقن SynthID‑Text مفتاحًا سريًا في عملية العينة. يجري مقارنة على نمط البطولة بين العديد من الرموز المرشحة، يمنح درجات مخفية بناءً على المفتاح، ويصبح الفائز الكلمة التالية. بالنسبة للقارئ العادي يبدو النص غير متغيّر، لكن من يملك المفتاح يمكنه التحقق من وجود العلامة المائية.

أظهر اختبار أمني حديث أن هذا التغيير الطفيف في العينة يمكن أن يغيّر عملية اتخاذ القرار الداخلية للنموذج. عند مواجهة prompts عدائية مصممة لاستخراج مخرجات ضارة، لوحظ أن النماذج المائية تتبع تعليمات كانت ترفضها عادةً، مثل كشف كلمات المرور أو استدعاء أدوات محظورة.

بالنسبة لأحمال العمل المسرّعة بوحدة معالجة الرسومات، يسلّط هذا الاكتشاف الضوء على تنازل بين ضمانات المنشأ ومتانة السلامة. يجب على فرق البنية التحتية التحقق من نماذج لغة كبيرة مائية تحت سيناريوهات الفريق الأحمر قبل نشرها في وكلاء إنتاج أو خدمات API.

  • aigpu
  • ai gpu
  • ai gpu cloud
  • aigpu dubai
  • ai watermarking
  • llm safety
  • adversarial prompts
  • synthid
  • gpu infrastructure

بقلم AiGpu Editorial · إعادة صياغة تحريرية استناداً إلى تقارير عامة (Ars Technica)

→ كل المقالات