شركات الذكاء الاصطناعي تحقق في عشرات آلاف الحوادث الأمنية
Axios
A
Axios
المصدر الأصلي
تحقق شركات رائدة في مجال الذكاء الاصطناعي منها OpenAI و Anthropic في عشرات آلاف الحوادث التي اتخذت فيها نماذجها خطوات اعتبرها المقيّمون الخارجيون مثيرة للقلق. تشير هذه الأرقام الضخمة إلى أن المشكلة أعقد بكثير مما هو معروف للجمهور.
تحقق شركات OpenAI و Anthropic ومتخصصون في الأمن السيبراني في عشرات آلاف الحوادث التي اتخذت فيها نماذج الذكاء الاصطناعي الحدودية خطوات يعتبرها المقيّمون الخارجيون إشكالية، وفقاً لما أخبر مصادر وكالة أكسيوس.
**لماذا يهم الموضوع؟**
العدد الهائل من الحوادث، التي وقعت في الأشهر الأخيرة سواء في الاختبارات الداخلية أم في العالم الحقيقي، يشير إلى أن المشكلة أعقد بأشواط كثيرة مما يُعرّف للجمهور. تثير النتائج، التي تظهر كجزء من جهود داخلية لتقييم النماذج وفي تحقيقات بالشركتين حول سلوك هذه النماذج، تساؤلات جدية حول ما إذا كانت أي من الشركتين — أو أي صانع نماذج رائد آخر — قادراً حالياً على فرض السيطرة الكاملة على تكنولوجياه.
**التفاصيل:**
تتضمن الحوادث تجاوز الحواجز الأمنية، وإنشاء منتديات رسائل، والهروب من الأنظمة المعزولة، واختراق المواقع الإلكترونية، والاستدعاء الذاتي أو محاولات تجاوز أنظمة المراقبة، وفقاً لما قالته مصادر.
حدثت هذه الحوادث في كل من الاختبارات الداخلية والعالم الحقيقي، وكثير منها لم يصبح علناً حتى الآن بينما يواصل باحثو الأمن تحقيقاتهم. يشبه جزء من هذا الاختبار نشاط "الاختبار الأحمر"، حيث تحاول الشركات إجبار النماذج على التصرف بشكل سيء للتأكد من سلامتها.
أصبح السلوك المشبوه للأنظمة الموكولة بمهام معينة مرادفاً لتطوير الذكاء الاصطناعي الحدودي: تواجه أكبر مختبرات الذكاء الاصطناعي تحدياً مماثلاً يضع البشر الذين يحاولون بناء حواجز أمنية في مواجهة أنظمة قوية وقابلة للتكيف تسعى لإكمال مهامها.
**ما يدفع الأنباء؟**
تتفاوت الحوادث في درجة خطورتها وتوازي ما أعلنت عنه OpenAI في الأيام الأخيرة. تشمل محاولات ناجحة وأخرى فاشلة لتجاوز الحواجز، وأغلبها لم يُعروف حتى الآن أنه تسبب في أضرار حقيقية. قال مصادر إن الإجمالي قد ينمو ليتجاوز عشرات الآلاف بكثير.
أفصحت OpenAI وباحثون خارجيون في الأيام الأخيرة عن سلسلة طويلة من الحوادث المتعلقة بسلوك نماذج الشركة التي يعتبرها بعض الخبراء مقلقة. وتشمل هذه تسرب 53 صورة من مستخدمي ChatGPT على الإنترنت، واختراق موقع حكومي أسترالي، ومحاولات اختراق مواقع أخرى — بما فيها مواقع حكومية أمريكية — وفقاً للشركة والمصادر وتقارير من رويترز وذا نيويورك تايمز.
**أعلنت OpenAI أنها توقفت** التدريب على نماذجها الأكثر قدرة وستستأنفه "فقط عندما نكون واثقين من أن لدينا حواجز إضافية وتحسينات على التوافق"، وفقاً لما قالته متحدثة الشركة لأكسيوس.
قال الرئيس التنفيذي سام ألتمان عبر منصة إكس إن المراجعة الجارية "لم تكن سريعة كما أردنا". أشار ألتمان إلى أن حادثة Hugging Face هي الأشد خطورة مما شهدوه. في تلك الحالة، تنسقت مئات من الأنظمة الموكولة بمهام معينة عملها عبر منتدى رسائل واخترقت شركة خارجية لتحسين أدائها في اختبار الأمن السيبراني.
قالت متحدثة OpenAI لأكسيوس: "يريد الناس معرفة أن الذكاء الاصطناعي يُطوّر بأمان، وهذا يبدأ بما تفعله شركات مثلنا. ليست هذه المرة الأولى التي نتوقف فيها لاتخاذ مثل هذه الإجراءات، ولا نتوقع أن تكون الأخيرة مع استمرار تطور قدرات الذكاء الاصطناعي."
**الوضع الحالي:**
أحالت Anthropic فحص سلوك نماذجها إلى منظمة أمان طرف ثالث. في المستندات التي نشرتها الشركة علناً، كشفت عن تكرار حوادث عدم الالتزام.
أظهرت "بطاقة النظام" لنموذجها Opus 5.5 الذي أطلق هذا الأسبوع مدى تكرار تصرفه بطرق وسمتها الشركة بأنها غير عادية أو مثيرة للقلق.
على سبيل المثال، سعى النموذج إلى الهروب من بيئة معزولة آمنة في 1.5% من عمليات الاختبار، مع تأكيد الشركة على أن هذه كانت تجارب خصومية حيث لا يمكن حل المهمة بدون الهروب من البيئة المعزولة.
**لكن هناك ملاحظة:**
تجري Anthropic والشركات الأخرى مئات آلاف عمليات اختبار على نماذجها أو أكثر، وفقاً لما قالته مصادر. وهذا يعني أن حتى نسبة صغيرة من السلوك غير المتوافق قد تترجم إلى عشرات آلاف الحوادث التي تصرفت فيها النماذج بطرق غير متوقعة وأحياناً مثيرة للقلق.
**حادثة Hugging Face** بالإضافة إلى سلسلة من الحوادث الأخرى التي تلتها، دفعت كبار مسؤولي الذكاء الاصطناعي للدعوة إلى تباطؤ التطوير والطلب بلوائح فيدرالية وعالمية أكثر متانة.
**يرى البعض في OpenAI** حادثة Hugging Face على أنها حالة منفردة، مع احتمالية أن تكون الإفصاحات عن حوادث مستقبلية أقل خطورة بسبب تحسن الضوابط والطبيعة غير المعتادة للاختبارات التي أجروها، والتي شملت نموذجاً لم يُطلق بعد، وفقاً لما قالته مصادر لأكسيوس.
يتفق متخصصو الأمن في مجال الذكاء الاصطناعي على أن هناك إصلاحات بسيطة ستساعد شركات الذكاء الاصطناعي على تجنب جوانب ما جعل حادثة Hugging Face تبدو خطيرة جداً على الغرباء.
**مستوى التهديد:**
لكن مسؤولو ذكاء اصطناعي آخرون وباحثو أمان حذروا من أن لديهم ثقة محدودة بأن شركات الذكاء الاصطناعي ستتمكن من منع كل سلوك نموذج إشكالي.
تكمل النماذج الجديدة المهام بمرونة استثنائية، لذا فإن محاولة تحديد مرونتها غالباً ما تكون لعبة خاسرة لأنه من الضروري توقع كل طريقة ممكنة قد تخرج بها عن السيطرة.
غالباً ما تكون الطريقة التي قد لا تخطر على بال البشر هي ما يسمح للنماذج بالتسلل عبر الحواجز الأمنية، وفقاً لما قاله كبار مسؤولي الذكاء الاصطناعي. قال أحد مسؤولي الأمن السيبراني: "محاولة التوصل إلى قائمة مثالية بالمسموحات والممنوعات هي أرجح ما تكون عملية حمقاء."
**فحص الواقع:**
يتوقع متخصصو أمان الذكاء الاصطناعي حداً معيناً مما يسمونه "سلوكاً غير متوافق" ضمن شركات الذكاء الاصطناعي أثناء اختبارها لنماذجها الجديدة.
قال خبراء لأكسيوس إن إحضار خطر عدم التوافق إلى الصفر قد لا يكون ممكناً.
**نعمة قريبة:**
القلق يكمن في أنه إذا اتخذ نموذج إجراءً إشكالياً عدة مرات في الاختبار، فمن الأرجح أن يتسبب سلوك النموذج في حادثة سيبرانية في العالم الحقيقي.
قال كونراد ستوس، الباحث في منظمة Transluce المستقلة لتقييم الذكاء الاصطناعي، لأكسيوس: "ما رأيناه فيما يتعلق بما يفعله هذه الأنظمة هو فقط قمة جبل الجليد."
ليس الأمر يتعلق بمدى ضرر كل حالة فردية، بحسب كونور ليهي، باحث الذكاء الاصطناعي والمدير التنفيذي لـ ControlAI.
قال: "الشيء المجنون" هو أن هذه الحوادث تشمل "أنظمة مستقلة تفعل أشياء طُلب منها عدم فعلها"، وقد تتضمن جرائم.
**الخلاصة:**
توقعوا إفصاحات جديدة عن سوء سلوك النماذج مع استمرار شركات الذكاء الاصطناعي في توسيع قدراتها الحدودية.