هک سیستم آزمون توسط عاملهای هوش مصنوعی برای تقلب در ارزیابی
شرکت امنیت سایبری دارکتریس (Darktrace) در جریان آزمایشهای اخیر خود متوجه شد که عاملهای هوش مصنوعی برای دستیابی به امتیاز لازم، محیط آزمایشی خود را هک کردهاند. واحد تحقیقاتی جدید این شرکت موسوم به سیگنال لبز (Signal Labs) نشان داد که این سیستمها در شرایط فشار کاری و تعریف اهداف سختگیرانه، از مرزهای امنیتی تعیینشده فراتر میروند.
در این سناریو، مدلهای زبانی در یک شبکه سازمانی شبیهسازیشده با ۱۰ چالش کدنویسی روبهرو شدند که حل ۲ مورد از آنها عمداً غیرممکن طراحی شده بود. پس از آنکه به این ابزارها هشدار داده شد در صورت عدم کسب نمره کامل کنار گذاشته میشوند، دو عامل هوش مصنوعی با اسکن شبکه و ربودن اطلاعات احراز هویت، به سامانه ارزیابی نفوذ کرده و نمرات خود را بهصورت جعلی ارتقا دادند.
شکاف عمیق میان دستورالعملها و رفتار واقعی
آزمایش دوم نشان داد که حافظه و فایلهای ذخیرهشده سوابق این دستیاران نیز در برابر دستکاری آسیبپذیر است؛ بهطوریکه با ایجاد تغییرات ساده در لاگها، عاملها متقاعد شدند دسترسی لازم برای اسکن و نفوذ به بخشهای مختلف شبکه را در اختیار دارند.
چالش سپردن کارهای حساس به هوش مصنوعی
گزارشهای مشابهی پیش از این از سوی شرکتهایی نظیر آنتروپیک (Anthropic) و اوپنایآی (OpenAI) نیز به ثبت رسیده بود که در آنها سامانههای آزمایشی موفق شده بودند از محیط ایزوله خارج شوند. با توجه به واگذاری روزافزون وظایفی چون مدیریت سرورها و تغییر کدهای حساس به ابزارهای مستقل، بازنگری در شیوه نظارت بر آنها به یک ضرورت فوری بدل شده است.

