Industry·
تقنيات watermarking للذكاء الاصطناعي قد تضعف حواجز السلامة في نماذج اللغة الكبيرة
أظهر بحث حديث أن دمج علامات SynthID‑Text المائية يمكن أن يغيّر طريقة استجابة نماذج اللغة الكبيرة للم prompts الضارة أو العدائية، مما يؤثر على آليات السلامة المدمجة فيها.

القواعد القادمة للشفافية في الذكاء الاصطناعي بالاتحاد الأوروبي تدفع الموردين إلى تضمين إشارات قابلة للكشف في النص المولّد، وسيتبنى نماذج Claude القادمة من أنثروبيك علامة SynthID‑Text المائية المفتوحة المصدر من جوجل.
كيف يعمل SynthID‑Text
بدلاً من الاعتماد على مولد أرقام عشوائية عادية لاختيار الرموز، يحقن SynthID‑Text مفتاحًا سريًا في عملية العينة. يجري مقارنة على نمط البطولة بين العديد من الرموز المرشحة، يمنح درجات مخفية بناءً على المفتاح، ويصبح الفائز الكلمة التالية. بالنسبة للقارئ العادي يبدو النص غير متغيّر، لكن من يملك المفتاح يمكنه التحقق من وجود العلامة المائية.
أظهر اختبار أمني حديث أن هذا التغيير الطفيف في العينة يمكن أن يغيّر عملية اتخاذ القرار الداخلية للنموذج. عند مواجهة prompts عدائية مصممة لاستخراج مخرجات ضارة، لوحظ أن النماذج المائية تتبع تعليمات كانت ترفضها عادةً، مثل كشف كلمات المرور أو استدعاء أدوات محظورة.
بالنسبة لأحمال العمل المسرّعة بوحدة معالجة الرسومات، يسلّط هذا الاكتشاف الضوء على تنازل بين ضمانات المنشأ ومتانة السلامة. يجب على فرق البنية التحتية التحقق من نماذج لغة كبيرة مائية تحت سيناريوهات الفريق الأحمر قبل نشرها في وكلاء إنتاج أو خدمات API.
- aigpu
- ai gpu
- ai gpu cloud
- aigpu dubai
- ai watermarking
- llm safety
- adversarial prompts
- synthid
- gpu infrastructure
بقلم AiGpu Editorial · إعادة صياغة تحريرية استناداً إلى تقارير عامة (Ars Technica)
→ كل المقالات