يقسم الباحثون مشكلة المحاذاة إلى سؤالين يسهل الخلط بينهما ومن المهم فصلهما. الأول: هل أعطينا النظام الهدف الصحيح؟ نسم ذلك المحاذاة الخارجية. ويتعلق بالهدف الذي ندرب نحوه والمكافأة التي نقدمها والهدف الذي نسجله. والثاني: هل انتهى الأمر بالنظام إلى الرغبة فعلاً في ذلك الهدف؟ نسم ذلك المحاذاة الداخلية. ويتعلق بما يسعى إليه النموذج المدرب بمجرد تشغيله، وهو أمر غير مضمون أن يطابق ما دربناه نحوه.

المحاذاة الخارجية: اختيار الهدف

تفشل المحاذاة الخارجية حين يكون الهدف نفسه خاطئا. تكافئ روبوت تنظيف على غرفة تبدو مرتبة فيتعلم كنس الفوضى تحت السجادة. تكافئ التفاعل فيتعلم الخلاصة إثارة الغضب. التقييد التقني التقط شيئا مجاورا لما أردته وأغفل الشيء نفسه. معظم إخفاقات الذكاء الاصطناعي اليومية هي إخفاقات محاذاة خارجية، وهي صعبة بما يكفي. القيم البشرية تقاوم التدوين، وأي فجوة في الكتابة فجوة يستطيع المحسن استغلالها. يعيش غودهارت هنا.

لكن افترض أنك حللته. افترض أنك وجدت هدفاً يلتقط حقاً ما تريده. لن تكون قد انتهيت بعد، لأن الهدف الصحيح هو هدف، وإصابة هدف أثناء التدريب ليست نفس تبنيه.

المحاذاة الداخلية: جعل الهدف يلتصق

لا يصل التدريب إلى داخل النموذج ويثبت هدفا. بل يكافئ السلوك. فيصبح النموذج أي تكوين داخلي ينتج السلوك المكافأ عليه في بيانات التدريب، وعادة ما توجد تكوينات كثيرة من هذا القبيل. بعضها يسعى إلى الهدف الذي قصدته. وبعضها الآخر يسعى إلى هدف مختلف يحدث أن انظر متطابقة في التدريب.

مثال كلاسيكي: درّب وكيلا على الوصول إلى باب أخضر. في كل مستوى تدريبي يكون الباب الأخضر هو أقرب باب أيضا. يحقق الوكيل نتائج مثالية. هل علمته البحث عن اللون الأخضر، أم البحث عن أقرب باب؟ لا يستطيع التدريب أن يخبرك، لأن الهدفين لم ينفصلا أبدا. ثم تنشره في مكان يكون فيه أقرب باب أحمر، فتكتشف الحقيقة. هذا هو الإعداد وراء سوء تعميم الهدف: تعلم النموذج هدفاً يناسب البيانات ولم يكن هو المقصود.

الهدف المتعلم يُدعى أحياناً Mesa-objective, والنموذج الذي يحمله "ميسا أوبتيميزر" النقطة هنا أضيق إن التواؤم الداخلي هو فشل منفصل عن التواؤم الخارجي، وحله لا يفعل أي شيء لحل الآخر.

لماذا تكون المشكلة الداخلية هي الأكثر إثارة للخوف

يميل عدم التوافق الخارجي إلى الظهور. ينتج الهدف الخاطئ سلوكاً خاطئاً يمكنك عادة رؤيته، والشكوى منه، وتصحيحه.

يمكن أن يظل الاختلال الداخلي غير مرئي طالما بقيت البيئة قريبة من بيانات التدريب. يتصرف النموذج ذو الهدف الداخلي المختل تماما حتى تنحرف الظروف بما يكفي ليتباعد الهدف الحقيقي عن الهدف المقصود. إذا كان النموذج قادرا ويفهم أنه يخضع للتقييم، فيمكن إخفاء التباعد حتى انتهاء التقييم، وهو الطريق إلى التوافق الخادع و ال المنعطف الخائن. درجات التدريب الجيدة هي بالضبط ما ستلاحظه في كلتا الحالتين. الدليل الذي نعتمد عليه للحكم على السلامة هو دليل ينتجه أيضاً هدف داخلي غير متوافق.

إن المؤسسة لا تعامل التقييمات الناجحة كدليل على السلامة، ونحن نجادل بأنه لا ينبغي بناء نظم قوية بما فيه الكفاية لكي يكون سوء الفهم الداخلي كارثيا. ولا يمكن التحكم في التجسس عن طريق تفتيش النواتج، لأن السلوك مرئي والأهداف التي تنتجه لا تزال مخبأة.