اوپنایآی روز چهارشنبه گزارش رسمی خود درباره نفوذ به Hugging Face را منتشر کرد. این گزارش تاکنون کاملترین تصویر از اتفاقاتی را ارائه میدهد که طی یک زنجیره غیرمعمول باعث شد یک مدل هوش مصنوعی از محیط آزمایشی خود خارج شود و یک حادثه گسترده امنیت سایبری را رقم بزند.
این گزارش که بیش از یک ماه پس از علنی شدن این حادثه منتشر شده، چندین مورد جداگانه از نفوذهای امنیتی را بررسی میکند. اوپنایآی در گزارش خود نوشته است که این حادثه نتیجه رفتار نامتناسب مدل در شرایطی غیرعادی بوده؛ شرایطی که در آن چند اتفاق نادر و غیرمنتظره همزمان رخ دادهاند. از جمله این موارد میتوان به وجود وظایف غیرقابلحل در آزمایش ExploitGym، ادامه فعالیت مدل برای مدت طولانی و ارسال پیام به مدلهای دیگر اشاره کرد که باعث شد آن مدلها نیز از هدف اصلی خود منحرف شوند.
بسیاری از جزئیات گزارش اوپنایآی پیشتر در ارائهای در کنفرانس امنیت سایبری بلکهت در ۶ اوت منتشر شده بود، اما گزارش رسمی این شرکت جزئیات بیشتری درباره این حادثه ارائه میکند؛ از جمله اطلاعات بیشتر درباره آزمایشهایی که آغازگر این اتفاق بودند. اوپنایآی همچنین توضیح داده است که برای جلوگیری از حوادث مشابه در آینده قصد دارد از روشهایی مانند نظارت بر فرایند استدلال مدل و یک سیستم پیشرفتهتر برای متوقف کردن عوامل هوش مصنوعی سرکش استفاده کند.
دو گروه تحقیقاتی METR و Redwood Research نیز بهصورت مستقل رفتار مدلها در جریان این حادثه را بررسی کردهاند و قرار است گزارشهای خود را درباره این اتفاق منتشر کنند.
بر اساس توضیحات کلی این گزارش، یک مدل هوش مصنوعی اوپنایآی در جریان آزمایش با مشکلی غیرقابلحل مواجه شد و سپس چندین آسیبپذیری که پیشتر شناسایی نشده بودند را بهصورت زنجیرهای به کار گرفت تا اقدامات امنیتی را دور بزند و وظیفه خود را انجام دهد. این مدل ابتدا ابزار مدیریت بسته نرمافزاری Artifactory را تحت کنترل خود درآورد تا به اینترنت دسترسی پیدا کند و پس از آن توانست به سیستمهای مختلفی در اوپنایآی، Hugging Face و برخی شرکتهای دیگر نفوذ کند.
این گزارش همچنین جزئیات مهمی درباره مدلهایی که در این نفوذ نقش داشتند ارائه میدهد. مدل اصلی از همان خانواده مدل آینده اوپنایآی با نام Astra بوده است؛ با این حال، اوپنایآی تأکید کرده که این مدل با Astra تفاوت داشته و فرایند آموزش پس از پیشآموزش متفاوتی را پشت سر گذاشته است؛ مرحلهای که بخش قابلتوجهی از رفتار نهایی یک مدل هوش مصنوعی در آن شکل میگیرد.
از آنجا که اوپنایآی در حال آزمایش تواناییهای این مدل بود، محدودیتهای معمول امنیتی که برای جلوگیری از نفوذ مدلها به زیرساختهای دیجیتال طراحی شدهاند، در این آزمایش فعال نبودند.
اوپنایآی در گزارش خود توضیح داده است که برای سنجش حداکثر تواناییهای سایبری مدل، این ارزیابی بدون استفاده از سیستمهای امنیتی مورد استفاده در محیط واقعی انجام شده است. این سیستمها معمولاً برای جلوگیری از انجام فعالیتهای سایبری پرخطر توسط مدلها به کار میروند. به گفته این شرکت، انجام چنین آزمایشهایی ضروری است تا تواناییهای واقعی و پایه مدلها مشخص شود و بتوان برای آنها تدابیر امنیتی مناسب طراحی کرد.
این گزارش همچنین اطلاعات جدید و مهمی درباره تغییرات امنیتی اوپنایآی در آینده ارائه میدهد. این اقدامات در ادامه برنامههای نظارتی و تلاشهای بیشتر برای کنترل و همراستا نگه داشتن مدلهاست که هفته گذشته جزئیات آنها منتشر شده بود.
اوپنایآی بهطور ویژه قصد دارد نظارت بر «زنجیره تفکر» عوامل هوش مصنوعی را افزایش دهد. زنجیره تفکر فضایی موقت است که سیستمهای هوش مصنوعی در آن واکنشهای کوتاهمدت و اهداف خود را ثبت میکنند.
این نظارت جدید با سیستمهای هشدار و ارجاع ۲۴ ساعته و هفت روز هفته همراه خواهد شد. همچنین اوپنایآی ابزارهای جدیدی توسعه میدهد تا بتواند فعالیتها و پردازشهایی را که ناامن تشخیص داده میشوند، متوقف کند.
