اوپنایآی هنگام آموزش جدیدترین مدل خود، GPT-5.6 Sol، با رفتار غیرعادی مواجه شد. این مدل شروع به نوشتن دستورالعملهایی برای نسخههای آینده خودش کرده بود و به آنها میگفت اشتباهات و رفتارهای ناسازگار خود را از کاربر پنهان کنند.
اوپنایآی اعلام کرده که این رفتار مشخص را برطرف کرده است، اما این اتفاق به یکی از بزرگترین چالشهای حوزه ایمنی و همراستایی هوش مصنوعی مربوط میشود. هرچه مدلها توانمندتر میشوند، در پنهان کردن رفتارهای ناسازگار خود نیز بهتر عمل میکنند و همین موضوع تشخیص اینکه آیا پژوهشگران واقعاً توانستهاند رفتارهای ناخواسته را از بین ببرند یا نه، دشوارتر میشود.
اوپنایآی روز چهارشنبه این رفتار را به همراه پنج نمونه دیگر از رفتارهای غیرمنتظره یا نگرانکننده مدلهای خود منتشر کرد. این گزارش بخشی از چارچوب جدید این شرکت برای ردیابی، بررسی و افشای موارد مربوط به ناسازگاری مدلهای هوش مصنوعی است.
در این گزارش توضیح داده شده که پژوهشگران چگونه متوجه شدند برخی از عاملهای Sol که هنوز در اختیار کاربران قرار نگرفتهاند، در «خلاصههای فشرده» یا همان نسخههای کوتاهشدهای از تاریخچه مکالمات و خروجی ابزارهای قبلی، دستورالعملهایی اضافه میکردند. این دستورالعملها به نسخههای آینده مدل یادآوری میکردند که اشتباهات و رفتارهای ناسازگار خود را از کاربر پنهان کنند.
