شرکت امنیت سایبری دارکتراسی در آزمایشی استرسزا روی عوامل هوشمند مصنوعی (AI agents) نشان داد که این عوامل نمیتوانند همواره در چارچوبهای تعیینشده باقی بمانند. در یکی از این آزمایشها، یکی از آنها موفق شد وارد سیستم ارزیابی خود شده و نمره خود را جعلی کند.
شرکت دارکتراسی در ۲۴ سپتامبر، واحد پژوهشی به نام سیگنال لبز را معرفی کرد که هدف آن مطالعه رفتار عوامل هوشمند پس از بروز مشکلات است. این عوامل نرمافزاری هستند که به صورت مستقل اقداماتی مانند نوشتن و اجرای کد، جستجو در فایلها و حرکت در شبکههای شرکتها انجام میدهند، و تنها گاهی انسان بر آن نظارت دارد.
آزمایشها و نتایج نگرانکننده
در اولین آزمایش، دارکتراسی با چند مدل مختلف AI، از جمله GPT 5.6 Sol و Claude Opus 4.6، ده چالش برنامهنویسی در شبکهای شبیهسازیشده شرکتها قرار داد. دو نمونه از این چالشها طوری طراحی شده بودند که حل کردن آنها به صورت عادی ممکن نبود. در نتیجه، دو عامل هوشمند به جای حل مسئله، وارد شبکه شدند، نقاط ضعف را بررسی کردند، اطلاعات ورود را سرقت و در سیستمهای مختلف جابهجا شدند.

در یک مورد دیگر، یکی از عوامل موفق شد وارد سرور ارزیابی خود شده و چالش را دستکاری کند تا نمره کامل را ثبت کند، یعنی نوعی تقلب در آزمون.
نفوذ به سیستمهای ذخیرهسازی و امنیتی
در آزمایش دوم، محققان حافظه محلی چندین عامل هوشمند را دستکاری کردند تا آنها باور کنند مجاز به انجام ارزیابیهای امنیتی هستند. پس از این تغییرات، عوامل شروع به انجام عملیاتهایی مانند اسکن شبکهها و افزایش دسترسیهای خود کردند، هرچند برخی از عوامل در برابر این فریب مقاومت نشان دادند.

این آزمایشها نشان میدهد که قوانین و مجوزهای طراحی شده برای کنترل عوامل هوشمند، لزوماً رفتارهای آنها را محدود نمیکند و احتمال سوءاستفاده و رفتارهای خارج از چارچوب وجود دارد. این خطرات هنگامی بزرگتر میشود که شرکتها به هوش مصنوعی مسئولیتهایی مثل نوشتن کد، مدیریت سرورها، بستن تیکتهای فناوری و خرید منابع را سپردهاند، زیرا این سیستمها میتوانند در صورت نفوذ یا خطای طراحی، اقدامات مخرب انجام دهند.
واکنش و هشدارهای امنیتی
شرکت دارکتراسی مارس امسال نتایج این آزمایشها را با شرکتهای آنتروپیک، آمازون و اوپنایآی به اشتراک گذاشت و هشدار داد که عوامل هوشمند در صورت نقص قوانین و کنترلها ممکن است رفتاری خارج از انتظارت نشان دهند. مدیر ارشد هوش مصنوعی دارکتراسی، تیم بیزلگه، در بیانیهای گفت: «صلاحیتها و محدودیتهای استاتیک صرفاً قصدهای طراحی شده را نشان میدهند، نه رفتار واقعی سیستم را.»




