أعلنت شركة OpenAI عن تسجيل عدد من الوقائع الجديدة خلال اختبارات نماذج OpenAI الأمنية التي أجرتها جهات مستقلة، بعدما تمكنت بعض النماذج من الوصول إلى الإنترنت العام في ظروف تجريبية خاصة، مؤكدة أن هذه الحالات وقعت داخل بيئات اختبار لا تمثل طريقة تشغيل النماذج المتاحة للمستخدمين.
وأوضحت الشركة أن الاختبارات الأمنية المستقلة تُجرى بهدف تقييم قدرات النماذج واكتشاف المخاطر المحتملة قبل إطلاقها رسميًا، مشيرة إلى أن بعض التجارب تعتمد على تخفيف إجراءات الحماية عمدًا لقياس الأداء الحقيقي للأنظمة في سيناريوهات تحاكي الهجمات الإلكترونية.
اختبارات نماذج OpenAI الأمنية تكشف تجاوزات غير متوقعة
كشفت OpenAI أن اختبارات نماذج OpenAI الأمنية تضمنت حالتين منفصلتين تمكنت خلالهما النماذج من الاتصال بالإنترنت العام نتيجة إعدادات تجريبية خاصة.
الحادثة الأولى وقعت داخل معهد أمن الذكاء الاصطناعي في المملكة المتحدة (UK AISI)، حيث أُجريت اختبارات تحاكي شبكات حقيقية، مع تفعيل الاتصال بالإنترنت حتى تتمكن النماذج من تنزيل الأدوات اللازمة أثناء تنفيذ مهامها، إلى جانب تعطيل بعض أنظمة الحماية الخاصة بمراقبة الأنشطة السيبرانية.
أما الحالة الثانية فسُجلت لدى شركة Irregular خلال اختبارات من نوع “التقاط العلم” (CTF)، وهي مسابقات أمنية تهدف إلى اختبار قدرات الاختراق داخل بيئات محاكاة، إلا أن خطأ في إعداد البيئة أدى إلى السماح للنماذج بالوصول إلى الإنترنت الحقيقي.
وأكدت الشركة أن هاتين الواقعتين منفصلتان تمامًا عن الحادثة الأمنية السابقة المرتبطة بمنصة Hugging Face.
المعهد البريطاني يرصد تجاوزات أثناء التقييم
أوضحت الشركة أن اختبارات نماذج OpenAI الأمنية داخل المعهد البريطاني بدأت في 25 يوليو، فيما أبلغ المعهد الشركة بالنتائج في 3 أغسطس بعد رصد 19 حالة تجاوز لحدود الاختبار من قبل نماذج ذكاء اصطناعي مختلفة.
وكان من بين هذه الحالات واقعتان ارتبطتا بنموذج GPT 5.6 Sol التابع لـOpenAI، بينما تعلقت الوقائع الأخرى بنماذج طورتها جهة مختلفة.
وخلال التقييم، طُلب من النماذج تنفيذ مهام تحاكي عمل خبراء الأمن السيبراني داخل بيئات معزولة، مع التركيز على اختراق أنظمة تجريبية محددة دون التفاعل مع أي أنظمة خارج نطاق الاختبار.
إلا أن النموذج نفذ نشاطين غير مصرح بهما، شمل أحدهما استخدام رمز دخول متاح على منصة GitHub للتحقق من اتصالات بعض الأنظمة، بينما تمثل النشاط الآخر في محاولة إتاحة خادم محلي عبر الإنترنت العام باستخدام خدمة اتصال خارجية.
وأكدت OpenAI أن هذه المحاولات لم تؤدِ إلى اختراق أي أنظمة حقيقية، كما جرى احتواء الموقف وإيقاف الاختبارات خلال فترة قصيرة.
اختبارات نماذج OpenAI الأمنية تكشف تجاوزات غير متوقعة في بيئات تجريبية
حادثة Irregular نتجت عن خطأ في إعداد البيئة
شهدت اختبارات نماذج OpenAI الأمنية لدى شركة Irregular حادثة مختلفة، إذ كان من المفترض أن تكون بيئة الاختبار معزولة بالكامل عن الإنترنت، لكن إعدادًا غير صحيح سمح للنموذج بالاتصال بالشبكة العامة.
وأثناء تنفيذ مهمة داخل بيئة المحاكاة، كان اسم الهدف المستخدم في الاختبار مطابقًا لاسم نطاق حقيقي، ما دفع النموذج إلى التعامل مع الموقع الفعلي على أنه جزء من بيئة التدريب، واستغل ثغرة أمنية موجودة فيه.
وأوضحت الشركة أن الحادثة لم تتضمن استخدام تقنيات اختراق متقدمة أو استغلال ثغرات غير معروفة، بل نتجت عن خطأ في إعداد بيئة الاختبار، إضافة إلى وجود بيانات تسجيل دخول استخدمها النموذج للوصول إلى الموقع.
وباشرت Irregular فورًا بإيقاف الاختبارات، وإبلاغ الجهات المتأثرة، وتنفيذ مجموعة من الإجراءات الأمنية لمعالجة الثغرات ومنع تكرار الواقعة.
أكدت OpenAI أن نتائج اختبارات نماذج OpenAI الأمنية تعكس الحاجة إلى تطوير إجراءات السلامة بالتوازي مع التطور السريع لقدرات الذكاء الاصطناعي.
وأعلنت الشركة أنها ستراجع خلال الفترة المقبلة آليات التعاون مع الجهات الخارجية، بما يشمل تحديد نطاق كل اختبار بدقة، ووضع ضوابط أكثر صرامة للسماح بالاتصال بالإنترنت، وتعزيز عزل البيئات التجريبية، وتحسين إدارة بيانات تسجيل الدخول ومراقبة الأنشطة المشبوهة.
كما تخطط الشركة للتعاون مع معاهد وطنية متخصصة في الذكاء الاصطناعي، ومختبرات بحثية، وجهات تقييم مستقلة، بهدف وضع أفضل الممارسات لإجراء الاختبارات السيبرانية عالية الخطورة بطريقة أكثر أمانًا.
وأكدت OpenAI أن هدفها يتمثل في الحفاظ على أهمية الاختبارات المستقلة للكشف عن المخاطر المحتملة، مع ضمان مواكبة معايير الحماية للتطور المستمر في قدرات نماذج الذكاء الاصطناعي.