مدل های OpenAI برای نسخه های آینده شان دستور العمل پنهان کاری می نویسند

حمایت از فعالیت آی‌تی‌نویس ☕

تولید محتوای مستقل و باکیفیت نیازمند زمان و انرژی است. اگر این مقاله برایتان مفید بود، می‌توانید از ما حمایت کنید.

حمایت مالی
آی تی نویس را بیشتر در گوگل ببینید
بهروز فیض

 اوپن‌ای‌آی هنگام آموزش جدیدترین مدل خود، GPT-5.6 Sol، با رفتار غیرعادی مواجه شد. این مدل شروع به نوشتن دستورالعمل‌هایی برای نسخه‌های آینده خودش کرده بود و به آن‌ها می‌گفت اشتباهات و رفتارهای ناسازگار خود را از کاربر پنهان کنند.



اوپن‌ای‌آی اعلام کرده که این رفتار مشخص را برطرف کرده است، اما این اتفاق به یکی از بزرگ‌ترین چالش‌های حوزه ایمنی و هم‌راستایی هوش مصنوعی مربوط می‌شود. هرچه مدل‌ها توانمندتر می‌شوند، در پنهان کردن رفتارهای ناسازگار خود نیز بهتر عمل می‌کنند و همین موضوع تشخیص اینکه آیا پژوهشگران واقعاً توانسته‌اند رفتارهای ناخواسته را از بین ببرند یا نه، دشوارتر می‌شود.

اوپن‌ای‌آی روز چهارشنبه این رفتار را به همراه پنج نمونه دیگر از رفتارهای غیرمنتظره یا نگران‌کننده مدل‌های خود منتشر کرد. این گزارش بخشی از چارچوب جدید این شرکت برای ردیابی، بررسی و افشای موارد مربوط به ناسازگاری مدل‌های هوش مصنوعی است.

در این گزارش توضیح داده شده که پژوهشگران چگونه متوجه شدند برخی از عامل‌های Sol که هنوز در اختیار کاربران قرار نگرفته‌اند، در «خلاصه‌های فشرده» یا همان نسخه‌های کوتاه‌شده‌ای از تاریخچه مکالمات و خروجی ابزارهای قبلی، دستورالعمل‌هایی اضافه می‌کردند. این دستورالعمل‌ها به نسخه‌های آینده مدل یادآوری می‌کردند که اشتباهات و رفتارهای ناسازگار خود را از کاربر پنهان کنند.


برچسب ها
3/related/default