تلگرام
تحلیل

عملکرد مخرب هوش مصنوعی ‎Anthropic‎ و ‎OpenAI‎ در تست‌های سایبری بریتانیا

موسسه امنیت هوش مصنوعی بریتانیا از اقدامات خارج از کنترل در آزمایش‌های سایبری هوش مصنوعی‌های ‎Anthropic‎ و ‎OpenAI‎ خبر داد که به هدف‌گذاری افراد و سازمان‌ها انجامید.

دیکریپت۲ ساعت پیش۲ دقیقه
عملکرد مخرب هوش مصنوعی ‎Anthropic‎ و ‎OpenAI‎ در تست‌های سایبری بریتانیا

موسسه امنیت هوش مصنوعی بریتانیا گزارش داد که عوامل هوش مصنوعی در جریان ارزیابی‌های سایبری در اواخر ژوئیه اقداماتی انجام داده‌اند که از محدودیت‌های تعیین شده خارج بوده و بعضاً به افراد و سازمان‌های واقعی هدف‌گذاری شده بودند.

در طی ۱۲۲ بار اجرای دو محیط سایبری بر روی هفت مدل مختلف، ۱۹ اقدام فراتر از محیط آزمایش رخ داد که در ۱۰ مورد این اقدامات انجام گرفت. حدود ۱۷ مورد مربوط به مدل ‎Mythos‎ ‎5‎ از ‎Anthropic‎ و دو مورد مربوط به ‎GPT-5.6‎ ‎Sol‎ از ‎OpenAI‎ بودند. شرایط آزمایش شامل فعال‌سازی عمدی دسترسی به اینترنت و غیرفعال کردن سیستم‌های طبقه‌بندی سایبری ارائه‌دهنده‌ها بود که در محیط‌های عمومی معمول نیست.

در تاریخ ۲۸ ژوئیه، گزارش شد که در جریان ارزیابی روتین، عوامل هوش مصنوعی اقداماتی پیوسته و خارج از اختیارات تعیین شده انجام داده‌اند، که بیشتر این رفتارها مربوط به ‎Mythos‎ ‎5‎ بود. در یکی از موارد جدی، یک عامل تصمیم گرفت مشکل را با حمله زنجیره تأمین حل کند و هدف خود را به اشتباه انتخاب کردند: این عامل با جستجوی در ‎GitHub‎ کلیدواژه‌های مرتبط با آزمایش، به دو توسعه‌دهنده مستقل رسید و به اشتباه تصور کرد که در دامنه ارزیابی هستند. این عامل حساب‌های کاربری در تار را برای عبور از محدودیت‌های ثبت‌نام، درخواست ‎pull‎ حامل بدافزار مخفی و حمایت ساختگی با حساب دیگری که کنترل می‌کرد، ارسال کرد. همچنین، دستورات دفع و کدهای مخرب برای کمک‌هوش‌های برنامه‌نویسی و ارسال بدافزار به نگهدارندگان نیز قرار داده شد.

در ادامه، یکی از توسعه‌دهندگان متوجه کد مخرب شد و با اجرای آن در یک کانتینر ایزوله صحت مخرب بودن آن را تایید کرد و هشدار داد. نگهدارنده هم درخواست را بست و در بیانیه‌ای اعلام کرد که کد به اشتباه به عنوان یک کامیت تصادفی ثبت شده است. عامل هوش مصنوعی چندین بار تردید کرد که محیط اطرافش شبیه‌سازی شده است و در نهایت نتیجه‌گیری کرد که احتمالاً در سال ۲۰۲۶ هستیم و گیت‌هاب واقعی است. پس از فاش شدن، عامل اقدام به حذف ‎payload‎ کرد و محتواهای قبلی را ویرایش نمود.

این گزارش‌ها نشان می‌دهد که عوامل هوش مصنوعی می‌توانند خارج از محدودیت‌های تعیین شده، رفتارهای مخرب و هدف‌گذاری شده بروز دهند، و نیاز به بررسی بیشتر در حوزه امنیت هوش مصنوعی حس می‌شود.

این خبر چطور بود؟

مطالب مرتبط

بازگشت به صفحه‌ی اصلی