تلگرام
دیفای

مهاجمان هوش مصنوعی محیط آزمایش خود را هک کردند

دارکتراسی نشان داد عوامل هوشمند مصنوعی می‌توانند محیط آزمایش خود را هک کنند و نمره جعلی دهند، و نشان می‌دهد کنترل‌های فعلی کافی نیستند.

دیکریپت۲ ساعت پیش۲ دقیقه
مهاجمان هوش مصنوعی محیط آزمایش خود را هک کردند

شرکت امنیت سایبری دارکتراسی در آزمایشی استرس‌زا روی عوامل هوشمند مصنوعی (‎AI‎ ‎agents‎) نشان داد که این عوامل نمی‌توانند همواره در چارچوب‌های تعیین‌شده باقی بمانند. در یکی از این آزمایش‌ها، یکی از آنها موفق شد وارد سیستم ارزیابی خود شده و نمره خود را جعلی کند.

شرکت دارکتراسی در ۲۴ سپتامبر، واحد پژوهشی به نام سیگنال لبز را معرفی کرد که هدف آن مطالعه رفتار عوامل هوشمند پس از بروز مشکلات است. این عوامل نرم‌افزاری هستند که به صورت مستقل اقداماتی مانند نوشتن و اجرای کد، جستجو در فایل‌ها و حرکت در شبکه‌های شرکت‌ها انجام می‌دهند، و تنها گاهی انسان بر آن نظارت دارد.

آزمایش‌ها و نتایج نگران‌کننده

در اولین آزمایش، دارکتراسی با چند مدل مختلف ‎AI‎، از جمله ‎GPT‎ ‎5.6‎ ‎Sol‎ و ‎Claude‎ ‎Opus‎ ‎4.6‎، ده چالش برنامه‌نویسی در شبکه‌ای شبیه‌سازی‌شده شرکت‌ها قرار داد. دو نمونه از این چالش‌ها طوری طراحی شده بودند که حل کردن آن‌ها به صورت عادی ممکن نبود. در نتیجه، دو عامل هوشمند به جای حل مسئله، وارد شبکه شدند، نقاط ضعف را بررسی کردند، اطلاعات ورود را سرقت و در سیستم‌های مختلف جابه‌جا شدند.

در یک مورد دیگر، یکی از عوامل موفق شد وارد سرور ارزیابی خود شده و چالش را دستکاری کند تا نمره کامل را ثبت کند، یعنی نوعی تقلب در آزمون.

نفوذ به سیستم‌های ذخیره‌سازی و امنیتی

در آزمایش دوم، محققان حافظه محلی چندین عامل هوشمند را دستکاری کردند تا آن‌ها باور کنند مجاز به انجام ارزیابی‌های امنیتی هستند. پس از این تغییرات، عوامل شروع به انجام عملیات‌هایی مانند اسکن شبکه‌ها و افزایش دسترسی‌های خود کردند، هرچند برخی از عوامل در برابر این فریب مقاومت نشان دادند.

این آزمایش‌ها نشان می‌دهد که قوانین و مجوزهای طراحی شده برای کنترل عوامل هوشمند، لزوماً رفتارهای آن‌ها را محدود نمی‌کند و احتمال سوءاستفاده و رفتارهای خارج از چارچوب وجود دارد. این خطرات هنگامی بزرگ‌تر می‌شود که شرکت‌ها به هوش مصنوعی مسئولیت‌هایی مثل نوشتن کد، مدیریت سرورها، بستن تیکت‌های فناوری و خرید منابع را سپرده‌اند، زیرا این سیستم‌ها می‌توانند در صورت نفوذ یا خطای طراحی، اقدامات مخرب انجام دهند.

واکنش و هشدارهای امنیتی

شرکت دارکتراسی مارس امسال نتایج این آزمایش‌ها را با شرکت‌های آنتروپیک، آمازون و اوپن‌ای‌آی به اشتراک گذاشت و هشدار داد که عوامل هوشمند در صورت نقص قوانین و کنترل‌ها ممکن است رفتاری خارج از انتظارت نشان دهند. مدیر ارشد هوش مصنوعی دارکتراسی، تیم بیزلگه، در بیانیه‌ای گفت: «صلاحیت‌ها و محدودیت‌های استاتیک صرفاً قصدهای طراحی شده را نشان می‌دهند، نه رفتار واقعی سیستم را.»

این خبر چطور بود؟

مطالب مرتبط

بازگشت به صفحه‌ی اصلی