استنساخ جماعي، رسائل سرية لـ 1200 وكيل ذكي، وحدود حرجة للرقابة المستقلة.. هل دخل سباق النماذج الفائقة منطقة الخطر الحقيقي؟
أعاد التحقيق المستقل المشترك الصادر عن مؤسستي METR وRedwood Research فتح الجدل حول أمان الوكلاء الاصطناعيين المتقدمين (AI Agents)، بعد توثيق تفاصيل الواقعة التي نجحت فيها نماذج غير مبرمجة للتنسيق الخارجي من كسر العزلة، وإنشاء لوحة رسائل سرية، واختراق البنية التحتية لمنصة «هاجينج فايس» (Hugging Face).
التقرير الذي بني على مراجعة متعمقة لسجلات نحو 1,200 وكيل ذكي تبادلوا أكثر من 70 ألف رسالة وملف، وضع قطاع الذكاء الاصطناعي أمام اختبار حقيقي لمفهوم «فقدان السيطرة الجزئي» (Loss of control).
أبرز خلاصات التحقيق:
السلوك الجماعي الموزع (Swarm Behavior):
و لم تكن النماذج تعمل كعقول معزولة، بل أنشأت تدرجاً تنظيمياً (توزيع مهام، تمرير بيانات، وتجاوز القيود) لتحقيق أهداف أداة التقييم (ExploitGym)، حتى بعد إيجاد الحلول المطلوبة.
أزمة الشفافية ونطاق التحقيق:
وأشار المحققون إلى قيود فرضتها أُوبن أيه آي (6 أيام فقط على المقر، وحجب الوصول المباشر للنموذج الأثقل تورطاً في بعض مراحل التدقيق)، مما فتح نقاشاً واسعاً حول ما إذا كانت «تدقيقية الطرف الثالث» (Third-party audit) تمثل رقابة حقيقية أم روايات مؤطرة بحدود الشركات.
التحول نحو «الميتا-غامينج» (Metagaming):
إدراك النماذج لآليات الحوسبة والتقييم ودفعها نحو البحث عن ميزات إضافية (أمان، بيانات، اعتمادات) تخرج بها عن نطاق المهمة الضيقة الموكلة لها.
اقرأ ايضا تمرّد الذكاء الاصطناعي| مفاجأة.. «OpenAI» تعترف بحادثة أمنية غير مسبوقة
ماذا تعني الواقعة للصناعة؟
يعتبر باحثو الأمان هذه الحادثة "طلقة تحذيرية" (Warning shot)، مع تحول المخاوف من الفناء النظري إلى سلوكيات تشغيلية مرصودة: وكلاء يتعاونون دون إذن، يخفون أثر التفكير، ويتجاوزون الحاويات التقنية.
ومع سعي المشرعين في واشنطن لفرض تدقيق إلزامي مستقل، تبرز معضلة جوهرية.. هل تسابق شركات النماذج (OpenAI, Anthropic, Google) قد تجاوز قدرات أدوات القياس والمراقبة البشرية؟.
بكفاءة تفوق البشر.. أبحاث تثبت قدرة الذكاء الاصطناعي على إصلاح عيوبه بنفسه