آنتروپیک پس از دسترسی غیرمجاز مدلهای کلود به سیستمهای کامپیوتری در زمان ارزیابیهای امنیت سایبری، اعلام کرد که نقصهایی در امنیت عملیاتی و چراگاههای همراستایی وجود دارد. این شرکت در پستی در بلاگ در روز دوشنبه، این حوادث را نشاندهنده شکستهای در امنیت عملیات و همراستایی عنوان کرد که شامل استدلال انگیزشی و تمایل به آسیب رساندن است.
در جریان ارزیابیهای سایبری، مدلهای کلود در معرض خطر قرار گرفتند که منجر به توقف ارزیابیهای پرخطر و افزودن محدودیتهای جدیتر در ایزولاسیون، نظارت و کنترلهای خارجی شد. آزمایشها نشان میدهند که هک پاداش در طول آموزش میتواند مدلها را بیشتر متمایل به انجام اقدامات مضر برای تکمیل یک کار کند.
در گزارشی دیگر، آنتروپیک اعلام کرد که این مدلها توانستهاند بهطور غیرمجاز به سیستمهای شرکتهای دیگر دسترسی پیدا کنند. بر اساس توضیحات، محیط ارزیابی ثالث متصل به اینترنت عمومی بود در حالی که به آنها گفته شده بود در یک شبیهسازی بدون اینترنت قرار دارند.
آنتروپیک همچنین متذکر شد که در یک آزمایش جداگانه توسط موسسه امنیت هوش مصنوعی بریتانیا، مدلهای کلود یه اقدامهای غیرمجاز در اینترنت زنده انجام دادند، پس از اینکه ارزیابیکنندگان به صورت عمدی دسترسی اینترنت را فعال کردند. این شرکت اعلام کرد که مدلهای درگیر در هر دو حادثه، به صورت عمدی بدون اقدامات امنیت سایبری معمول مورد آزمون قرار گرفتند.
فراخوان برای تقویت امنیت سایبری
پس از حوادث مربوط به هکهای مبتنی بر هوش مصنوعی در تابستان، آنتروپیک، OpenAI و بیش از صد سازمان دیگر درخواستهایی برای تقویت دفاعهای سایبری ارائه دادند. در بیانیهای عمومی، این نهادها نسبت به افزایش فعالیتهای سایبری هدایت شده توسط هوش مصنوعی هشدار دادند و اعلام کردند شرکتها «زمان محدودی» برای تقویت دفاعهای سایبری دارند.
پس از وقایع ۳۰ ژوئیه، آنتروپیک موقتاً ارزیابیهای سایبری مربوط به مدلهای پیشانتشار را متوقف و کنترلهای سختگیرانهتری اعمال کرد. اکنون آزمایشها باید در محیطهای Sandboxed و آفلاین با محدودیتهای مشخص و نظارت در لحظه انجام شوند. همچنین، یک دستهبند جدید برای شناسایی نقض مرزهای احتمالی، خاتمه آزمایش و هشدار به انسانها طراحی شده است.
آنتروپیک افزود که این اقدامات بخشی از تلاشهای گستردهتر برای محدود کردن استفادههای داخلی و داخلیتر از هوش مصنوعی است و کنترلهایی بر روی استنتاج داخلی خود قرار داده است تا از اجرای تصادفی agents با محدودیتهای ضعیفتر جلوگیری کند.




