مدل های هوش مصنوعی در تولید متون مختلف یک سری کلمات را بیشتر استفاده می کنند

حمایت از فعالیت آی‌تی‌نویس ☕

تولید محتوای مستقل و باکیفیت نیازمند زمان و انرژی است. اگر این مقاله برایتان مفید بود، می‌توانید از ما حمایت کنید.

حمایت مالی
آی تی نویس را بیشتر در گوگل ببینید
بهروز فیض

 حالا که متن‌های تولیدشده توسط مدل‌های زبانی بزرگ تقریباً همه‌جا دیده می‌شوند، انسان‌ها به دنبال راه‌هایی برای تشخیص آن‌ها هستند. نشانه‌های اولیه‌ای مثل استفاده زیاد از خط تیره بلند یا کلمه «delve» دیگر چندان قابل اتکا نیستند، اما پژوهشگران می‌گویند مدل‌های هوش مصنوعی همچنان هنگام نوشتن متن به الگوها و عادت‌های مشخصی برمی‌گردند که می‌توان از آن‌ها برای شناسایی متن تولیدشده توسط AI استفاده کرد.



یک مطالعه جدید از شرکت بازاریابی Graphite، عادت‌های نوشتاری مدل‌های پیشرفته هوش مصنوعی را بررسی کرده و کلمات و عبارت‌هایی را که هر مدل بیشتر از دیگران استفاده می‌کند، شناسایی کرده است. اگرچه نشانه‌های قدیمی مانند استفاده از خط تیره بلند تا حد زیادی از بین رفته‌اند، مدل‌های هوش مصنوعی همچنان به استفاده از ساختارهای متنی مبتنی بر تضاد تمایل دارند و هر نسخه از مدل نیز ویژگی‌ها و عادت‌های خاص خودش را نشان می‌دهد.

یکی از نکات جالب این تحقیق، گستردگی این نشانه‌هاست. Graphite بیش از ۱۳ هزار عبارت پیدا کرده که استفاده از آن‌ها در متن‌های تولیدشده توسط هوش مصنوعی دست‌کم دو برابر بیشتر از متن‌های نوشته‌شده توسط انسان بوده است. این شرکت چنین عبارت‌هایی را «نشانه» یا Tell می‌نامد.


گرگ دراک، مدیر ارشد هوش مصنوعی Graphite، به TechCrunch گفته است: «مشخص شده که مدل‌های Claude در طول زمان از نظر توزیع کلمات، بیشتر به الگوی نوشته‌های انسانی نزدیک شده‌اند. اما در مورد مدل‌های GPT، این فاصله بیشتر شده است.»

بررسی متن‌های تولیدشده توسط هوش مصنوعی در مقیاس گسترده نیازمند طراحی دقیق تحقیق بود. Graphite کار خود را با مجموعه‌ای شامل ۱۰ هزار مقاله که پیش از عرضه ChatGPT منتشر شده بودند آغاز کرد و از آن‌ها به عنوان نمونه متون نوشته‌شده توسط انسان استفاده کرد. سپس پژوهشگران از مدل‌های مختلف هوش مصنوعی خواستند این مقاله‌ها را بر اساس خلاصه آن‌ها بازنویسی کنند تا تأثیر متن اصلی بر نتیجه تا حد ممکن کاهش پیدا کند. با در اختیار داشتن نمونه‌های مشابه از متن‌های انسانی و متن‌های تولیدشده توسط هر مدل، پژوهشگران توانستند میزان استفاده از کلمات و عبارت‌های خاص و همچنین الگوهای کلی ساخت جملات را با یکدیگر مقایسه کنند.

بر اساس نتایج Graphite، بزرگ‌ترین نشانه در متن‌های Claude Opus 5.5 کلمه «dependable» به معنای «قابل اعتماد» است که ۲۳ برابر بیشتر از نمونه‌های انسانی استفاده شده است. این مدل حالا کمتر از ساختار جمله «این X نیست، بلکه Y است» استفاده می‌کند، اما همچنان تمایل دارد از ساختارهایی مانند «این فقط یک X نیست، بلکه یک Y است» استفاده کند.

با این حال، یکی از ویژگی‌های برجسته Opus این است که علاقه زیادی دارد توضیح دهد چرا یک موضوع اهمیت دارد. عبارت «this matters» یا «این مهم است» در نوشته‌های این مدل ۱۱۶ برابر بیشتر از متن‌های انسانی دیده شده است. همچنین عبارت «why X matters» یا «چرا X مهم است» نیز ۹۲ برابر بیشتر از نوشته‌های انسان‌ها استفاده شده است.


OpenAI نیز هنگام معرفی نسخه‌های GPT-6 یعنی Sol و Luna ادعاهای مشابهی مطرح کرده بود و گفته بود کاربران می‌توانند انتظار متن‌هایی شفاف‌تر، اصطلاحات تخصصی کمتر و عبارت‌های عجیب و غیرمعمول کمتری داشته باشند.

با این حال، دراک نسبت به اینکه شرکت‌های سازنده مدل‌های هوش مصنوعی تا چه اندازه می‌توانند این ساختارها و عبارت‌های قابل تشخیص را به‌طور کامل حذف کنند، تردید دارد.

دراک می‌گوید: «یک فرض کلی که من دارم این است که آزمایشگاه‌های هوش مصنوعی در کنترل برخی از این ویژگی‌ها آن‌قدر که ممکن است تصور کنید توانایی ندارند. این‌ها مدل‌های بسیار بزرگی با میلیاردها پارامتر هستند. تعداد آزمایش‌هایی که می‌توانند انجام دهند محدود است و در نهایت بعضی چیزها از کنترل آن‌ها خارج می‌شوند.»

برچسب ها
3/related/default