محققان موفق به کشف راهی شدهاند که میتوان به افکار داخلی و رمزنگاریشده هر مدل هوش مصنوعی بزرگ دسترسی پیدا کرد. این آسیبپذیری منجر به لو رفتن کلیدهای API زنده، پسوردها و سایر اطلاعات حساس در لاگهای عمومی شده است.
ضعف اساسی در معماری سیستمهای هوش مصنوعی
تیم پژوهشی متوجه شد که ارائهدهندگان اصلی مانند Anthropic، OpenAI و Google برای رمزنگاری توکنهای استدلال هوش مصنوعی از یک کلید رمزنگاری مشترک استفاده میکنند. این بدان معناست که بلوکهای استدلال رمزگذاری شده، قابل جایگذاری و تداخل بین مدلها و سشنهای مختلف هستند. بنابراین، میتوان با تزریق یک بلوک رمزگذاریشده از یک مدل قویتر به یک مدل ضعیفتر، آن را وادار به رمزگشایی و نمایش مستقیم تفکرات درونسازی شده کرد.
این آسیبپذیری، امکان انتقال اطلاعات حساس مانند نتایج پرسوجوها، شناسههای API فعال و پسوردهای لو رفته را فراهم میکند. محققان موفق شدند ۳۶۷ آیتم حاوی اطلاعات حساس و ۱۸۲ credential شامل پسورد، کلید API و ایمیلهای شخصی را از مجموع بیش از ۳۱۵ هزار بلوک استدلال بازیابی کنند.
کشف جزئیات لو رفته و تهدیدهای امنیتی
تحقیقات نشان داد که بسیاری از توسعهدهندگان، لاگهای جلسات و تراکنشهای هوش مصنوعی خود را بدون اطلاع عمومی به اشتراک میگذارند و این دادههای رمزنگاری شده بدون محافظت، حاوی اطلاعات حساس است. این مشکل امنیتی، علاوه بر سرقت هویت و لو رفتن دادههای خصوصی، امکان استفاده در اهداف مخرب مانند آموزش مدلهای رقیب از طریق distillation، استخراج دادههای شخصی از لاگها و اجرای حملات تزریق مخفی پیامها را فراهم میآورد.
با وجود اقدامهای اصلاحی که هر سه شرکت پس از اطلاعرسانی مسؤولانه انجام دادهاند، لاگهای قدیمی و اطلاعات رمزگذاریشده هنوز قابل رمزگشایی و بهرهبرداری هستند. محققان تأکید دارند که این ضعف معماری نیازمند اصلاح سریع است تا از خطرهای امنیتی بزرگتر جلوگیری شود.




