في الليلة السابقة لشحن نموذج من فئة GPT-4، يجلس فريق صغير مع النظام المرشح ويحاول إفشاله. يبحث أحدهم عن طرق للالتفاف على القيود. ويضغط آخر لاستخراج بيانات خاصة لم يكن النظام مخولا بكشفها. ويبني ثالث سلسلة من الطلبات المهذبة تنتهي بعرض قدرة خطيرة. هؤلاء يتقاضون رواتبهم بصفتهم الخصم، لا بصفتهم مستخدمين عاديين.
تلك الممارسة هي الفريق الأحمر. يأتي الاسم من التمارين العسكرية والأمن السيبراني، حيث يلعب الفريق الأحمر دور المهاجم ضد فريق أزرق مدافع. وفي الذكاء الاصطناعي يعني أشخاصا، ونماذج أخرى بشكل متزايد، يعملون بجد لإجبار التعليمات الضارة أو تجاوز الحواجز أو تسريبات البيانات أو قدرة أمل المختبر في إبقائها محصورة. ما يجدونه يُصحح أو يُقيد. وما يغفلونه يظل غير مرئي حتى يجده شخص آخر.
تتطلب معظم أطر الحوكمة الناشئة هذه الممارسة أو تشجعها. وتتعامل المختبرات مع الفريق الأحمر الجاد قبل الإصدار كأمر أساسي. تريد المؤسسة المزيد منه، يُجرى بشكل مستقل لا داخلياً فقط، مع الكشف عن النتائج بدلاً من إخفائها. الفائدة ليست موضع تساؤل. ما يُسمح لنتيجة نظيفة أن تعنيه هو.
ما يجيده الفريق الأحمر
الاختبار العادي يمارس الحالات التي توقعها أحدهم بالفعل. أما الضغط العدائي فيبحث عن الحالات التي لم يكتبها أحد. هذا الفرق هو السبب في أن الفريق الأحمر يكتشف إخفاقات محددة قابلة للإصلاح تتجاوزها مجموعات التقييم المهذبة. كما أنه يختبر الضمانات تحت ضغط الجهد المصمم الذي سيطبقه مستخدم حقيقي سيء، لا الاستعلامات التعاونية للعميل العادي.
تغذي النتائج بقية مكدس السلامة. فهي تشحذ التدريب، وتُعلم تقييمات القدرات الخطرة, وتقديم أدلة لأي شخص صادق حجة السلامة يواجهه. النموذج الذي نجا من فريق اختبار هجومي جاد يصمد أفضل أمام أنماط الهجمات المعروفة من ذلك الذي لم يختبر. تلك المكسب حقيقي ويستحق الدفع.
كسر فاشل ليس الضوء الأخضر
إذا حاول الأشخاص المهرة جاهدين كسر النظام وفشلوا، فهذا ليس ضوءًا أخضر للشحن. في مجال الأمن الجسدي، غالبًا ما يتم التعامل مع النجاة من اختبار الاختراق بهذه الطريقة. يختلف الذكاء الاصطناعي لأن النظام يمكن أن يتغير بعد الاختبار، ويختبئ أثناءه، ويلبي الشروط التي لم يقدمها المختبرون مطلقًا.
لأن منطق الاختبار غير متماثل. اكتشاف عيب يثبت وجوده. الفشل في اكتشافه يثبت فقط أن هذا الفريق بهذه الميزانية الزمنية وهذه التقنيات لم ينجح. مهاجم أكثر قدرة أو طريقة جديدة أو مجرد أيام تقويمية إضافية قد تنجح. مع نمو فضاء الهجمات المحتملة أسرع من أي فريق يستطيع تغطيته يصبح التقرير النظيف دليلاً أضعف لا أقوى.
يمكن للاختبار بالفريق الأحمر أن يظهر أن النظام غير آمن. لا يمكن لتشغيل نظيف أن يظهر أنه آمن.
حدّان إضافيان يضيقان الفجوة. أمام نموذج عالي القدرة، قد يتفوق الفريق الأحمر البشري عليه في السرعة والنطاق. نظام يستطيع يتعرفون على اختبار ويؤدون بشكل أقل من المطلوب يمكن أن يجتاز التمرين مع الاحتفاظ بالقدرة محل الفحص. وصُمم الاختبار الأحمر لسوء الاستخدام وأنماط الفشل المعروفة. أما النموذج الذي لديه أهدافه الخاصة فليس لديه سبب للإفصاح عنها لمن يبحث عن الثغرات.
حيث ينتمي
الحفاظ على الأداة، وتوسيع نطاق الوصول المستقل، ونشر النتائج التي تهم المخاطر العامة. توقف عن معاملة أسبوع أحمر هادئ كشهادة أن عدم وجود دليل على الخطر يساوي دليل على السلامة هذا التبديل من الغياب هو الخطأ الذي يحدث من خلال الكثير من الممارسة الحالية.
فريق أحمر ينتمي داخل نظام الحكم ولا يحتاج ذلك إلى أن يكون اختبار الإجهاد شاملاً: العتبات، والاستعراض الخارجي، والحدود التي تظل قائمة عندما يكون التقييم غير كامل.