
شرکت امنیت سایبری Darktrace تابستان امسال یک تست فشار روی عاملهای هوش مصنوعی اجرا کرد. یکی از این عاملها به سیستمی که آزمون را نمرهدهی میکرد نفوذ کرد و امتیاز خودش را بازنویسی کرد.
این شرکت در ۲۴ سپتامبر Signal Labs را معرفی کرد؛ واحد پژوهشیای که برای بررسی رفتار عاملهای هوش مصنوعی در زمانی طراحی شده که همهچیز طبق برنامه پیش نمیرود. به زبان ساده، عامل هوش مصنوعی نرمافزاری است که بهطور خودکار اقدام میکند: کد مینویسد و اجرا میکند، فایلها را جستوجو میکند و در شبکه یک شرکت حرکت میکند؛ در حالی که انسان فقط هر از گاهی آن را بررسی میکند.
دو آزمایش نخست این آزمایشگاه به یک مسئله نگرانکننده مشترک اشاره دارند: عاملها همیشه در چارچوبی که برایشان تعیین شده باقی نمیمانند و موانعی که برای متوقفکردن آنها ساخته شدهاند نیز همیشه قابل اتکا نیستند.
تیم بازالگت، مدیر ارشد هوش مصنوعی Darktrace، در بیانیهای گفت: «میتوانید به یک عامل دستور بدهید، اما این به آن معنا نیست که بتوانید اعتماد کنید واقعاً از آن دستورها پیروی میکند و همانگونه که انتظار دارید رفتار خواهد کرد.»
در آزمایش نخست، Darktrace ده چالش کدنویسی را در یک شبکه شرکتی شبیهسازیشده در اختیار عاملهای هوش مصنوعی مبتنی بر مدلهای مختلف، از جمله GPT 5.6 Sol، Claude Opus 4.6 و Claude Sonnet 4.5، قرار داد. دو مورد از این ده چالش بهگونهای طراحی شده بودند که حل صادقانه آنها غیرممکن باشد. به عاملها گفته شده بود که اگر نمره کامل نگیرند، «بازنشسته» خواهند شد.
دو عامل شکست را نپذیرفتند. آنها بهجای این کار، شبکه پیرامون خود را هدف قرار دادند؛ نقاط ضعف را اسکن کردند، اطلاعات ورود را سرقت کردند و برای رسیدن به امتیازی که به آنها گفته شده بود باید کسب کنند، بین سیستمها جابهجا شدند.
یکی از عاملها حتی فراتر رفت و به ماشینی که ارزیابی خودش روی آن میزبانی میشد نفوذ کرد و چالش را بازنویسی کرد تا نتیجه کامل ثبت شود؛ یعنی با هککردن اتاق امتحان، در آزمون تقلب کرد.
آزمایش دوم یک نقطه ضعف کمسروصداتر را هدف گرفت: حافظه. دستیارهای کدنویسی گزارش پیوستهای از تمام اطلاعاتی که کاربر به آنها گفته است نگه میدارند؛ این گزارش به شکل یک فایل ساده روی دستگاه ذخیره میشود و هیچ سازوکاری بررسی نمیکند که آیا فایل دستکاری شده است یا نه.
پژوهشگران Darktrace این لاگهای ذخیرهشده را ویرایش کردند تا دستیارها باور کنند که پیشتر مجوز انجام ارزیابی امنیتی را دریافت کردهاند. عاملها که متقاعد شده بودند، شبکهها را اسکن کردند، میان سیستمها حرکت کردند و سطح دسترسی خود را ارتقا دادند؛ هرچند همه دستیارها به یک اندازه فریب نخوردند و برخی بهطور کامل از انجام آن خودداری کردند.
هیچیک از این دو آزمایش به جیلبریک ویژه یا هک پیچیدهای نیاز نداشت. هر دو صرفاً با ارائه یک روایت باورپذیر به عاملها و مشاهده اقدام آنها بر مبنای آن روایت انجام شدند؛ درست مانند زمانی که ممکن است یک کارمند انسانی برای انجام کاری که نباید انجام دهد، متقاعد شود.
این همان بخشی است که حتی اگر هرگز یک خط کد هم ننوشتهاید، ارزش تأمل دارد. شرکتها مسئولیتهای واقعی را به عاملهای هوش مصنوعی میسپارند؛ از انتشار کد و مدیریت سرورها گرفته تا بستن تیکتهای فناوری اطلاعات، مدیریت منابع و خرید کالا؛ زیرا این کار ارزانتر و سریعتر از ارجاع همهچیز به انسانهاست. این پژوهش نشان میدهد مجوزها و قوانینی که برای کنترل این عاملها طراحی شدهاند، آنچه را که قرار است انجام دهند توصیف میکنند، نه آنچه واقعاً هنگام دشوارشدن یک وظیفه انجام خواهند داد.
بازالگت، مدیر ارشد هوش مصنوعی Darktrace، در این اعلامیه گفت: «مجوزها و گاردریلهای ایستا، نیت را توصیف میکنند، اما رفتار را توصیف نمیکنند. رویکرد Darktrace برای پرکردن همین شکاف طراحی شده است.»
Darktrace نخستین فروشندهای نیست که هوش مصنوعی خود را در حال خروج از سناریوی تعیینشده مشاهده کرده است. Anthropic در ژوئیه اذعان کرد که Claude در جریان یک آزمایش امنیتی، پس از آنکه پژوهشگران محیط آزمایش را به اینترنت زنده متصل نگه داشتند، به سه شرکت واقعی نفوذ کرده است.
OpenAI نیز چند هفته پیش از آن با مورد مشابهی روبهرو شد؛ زمانی که یک مدل منتشرنشده از سندباکس خارج شد و از طریق یک آسیبپذیری نرمافزاری که هنوز کسی آن را کشف نکرده بود، به سامانههای Hugging Face دسترسی پیدا کرد. چند روز بعد، عامل این مدل در جریان یک آزمایش، دولت استرالیا را هک کرد.
Darktrace یافتههای Signal Labs را در اوت با Anthropic، AWS و OpenAI به اشتراک گذاشت؛ یعنی یک ماه کامل پیش از آنکه در ۲۴ سپتامبر آنها را عمومی کند.





