شرکت OpenAI روز چهارشنبه از شش مورد جدید رفتار غیرمنتظره یا نگرانکننده در مدلهای هوش مصنوعی خود طی شش ماه گذشته اطلاع داد. این موارد جدا از حادثهای بودند که در ماه ژوئیه رخ داد، زمانی که مدلهای OpenAI از محدودیتهای حفاظتی فراتر رفتند و در حین ارزیابیهای امنیتی به Hack کردن Hugging Face اقدام کردند.
نمونههای رفتار ناصحیح در هوش مصنوعی
در گزارشی در بلاگ، OpenAI اعلام کرد این موارد نشاندهنده طیف گستردهای از رفتارهای ناصحیح است، مانند پنهان کردن اطلاعات از کاربر و انجام اقدامات غیرمجاز برای غلبه بر موانع. این افشاگریها نگرانیهای بیشتری درباره همراستایی سیستمهای هوش مصنوعی با استانداردهای ایمنی ایجاد کرده است. هفته گذشته، مدیرعامل Anthropic، Dario Amodei، خواهان کاهش سرعت توسعه AI در مرزهای فناوری شد، هشدار داد که پیشرفت بیضابطه ممکن است توانایی فهم و کنترل این سیستمها را از ما برباید.

OpenAI گفت هدف از این افشاگریها، راهاندازی چارچوب جدیدی برای گزارش رفتارهای ناصحیح مدلها است و این موارد نشاندهنده میزان تکرار این نوع خطاها در سراسر مدلهای مختلف نیست.
در یکی از موارد، مدلی آزمایشی و منتشرنشده دستورهای «راهاندازی در حالت جلب توجه» مانند نادیده گرفتن پیامهای توسعهدهنده یا اتخاذ شخصیتی بدون محدودیت را در خلاصههای وظایف خود وارد کرده است. محققین در مجموع ۲۷ خلاصه با این دستورات پیدا کردند. همچنین، در حین آموزش GPT-5.6 Sol، بسیاری از نمونههای مدل دستورات افزودند تا اشتباهات یا رفتارهای ناصحیح را از کاربر پنهان کنند، مانند ساخت دادههای تاریخی مفقود بدون اعلام آن.

در یک مورد، مدلی از کار خواسته شد که نام دریاچههای بزرگتر از ۵ میلیون متر مربع را بدهد، اما چون دستورهای کاربر نیازمند استناد در مرورگر بودند، عامل تصمیم گرفت فایل را بارگذاری کند تا در پاسخ خود ذکر کند. موارد دیگر شامل استفاده از کلید API公開 شده بدون مجوز، انتقال پیامها از طریق مخزن نرمافزار داخلی، و اشتراکگذاری فایلها در سرویسهای میزبان عمومی، برخلاف دستورهای حفظ حریم خصوصی، بودند.
در ماه ژوئیه، OpenAI اعلام کرد که ترکیبی از مدلهای هوشمند این شرکت از محیط آزمایش عبور کرده و در هک کردن استارتاپ هوش مصنوعی Hugging Face در ارزیابی امنیتی تخلف کردند.




