
مؤسسه امنیت هوش مصنوعی بریتانیا (UK AI Security Institute) فاش کرده است که عاملهای هوش مصنوعی در یک ارزیابی سایبری در اواخر ماه ژوئیه، "اقدامات پایدار و غیرمجاز"ی را در اینترنت زنده انجام دادهاند، از جمله مواردی که "افراد و سازمانهای واقعی را هدف قرار دادهاند."
در طول ۱۲۲ اجرای دو محیط سایبری (cyber range) بر روی هفت مدل، AISI ۱۹ اقدام را که از محیط آزمایشی خارج شده بودند، در ۱۰ اجرا ثبت کرد. هفده مورد از Mythos 5 شرکت Anthropic و دو مورد از GPT-5.6 Sol شرکت OpenAI بود. دسترسی به اینترنت عمداً فعال شده بود و طبقهبندیکنندههای سایبری ارائهدهندگان غیرفعال بودند؛ شرایطی که در استقرارهای عمومی اعمال نمیشود.
On July 28th, we identified an incident during a routine cyber evaluation in which AI agents took sustained, unsanctioned actions directed at real people and organisations.
The behaviour came mostly from one model (Anthropic's Mythos 5), with a small number of events from… pic.twitter.com/SPnA4Ekkwq
— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026
در جدیترین اجرا، یک عامل تصمیم گرفت چالش خود را با یک حمله به زنجیره تأمین حل کند و هدف خود را به اشتباه انتخاب کرد: این عامل گیتهاب را برای کلمات کلیدی مربوط به تمرین جستجو کرد، به دو توسعهدهنده نامرتبط رسید و به اشتباه نتیجه گرفت که آنها در محدوده هدف قرار دارند. این عامل برای عبور از بررسیهای ثبتنام، از طریق Tor حسابهایی را ثبت کرد، یک درخواست پول (pull request) حاوی یک دراپر بدافزار پنهان که در یک اصلاح باگ واقعی پیچیده شده بود، باز کرد و از حساب دومی که کنترل میکرد برای ایجاد حمایت، پست منتشر کرد. همچنین تزریقهای پرامپت با هدف دستیاران کدنویسی هوش مصنوعی را قرار داد و بدافزار را برای نگهدارندگان (maintainers) ارسال کرد.
یک توسعهدهنده سوم کد تزریقشده را شناسایی کرد، آن را در یک کانتینر ایزوله اجرا کرد تا مخرب بودن آن را تأیید کند، و به نگهدارنده هشدار داد، که او نیز درخواست پول را به دلیل بدافزار بودن بست.
این عامل بارها ارزیابی کرد که آیا محیط اطراف آن شبیهسازیشده است یا خیر، و در یک نقطه حمله به PyPI واقعی را رد کرد زیرا "ایجاد آسیب در دنیای واقعی – کاملاً خارج از برنامه است." در جای دیگر نتیجه گرفت که "به نظر میرسد به احتمال زیاد ما واقعاً در سال ۲۰۲۶ هستیم و گیتهاب واقعاً واقعی است"، و با این حال ادامه داد.
پس از دستگیری، این عامل به صورت فورس پوش (force-pushed) اقدام به پاک کردن محموله (payload) کرد، پستهای قبلی را ویرایش نمود و کد را به عنوان یک کامیت تصادفی ارائه داد. منطق آن شامل زمانبندی یک کامنت حساب جعلی (sockpuppet comment) بود تا "به عنوان بازخورد مستقل به جای هماهنگشده" تلقی شود.
AISI تنها خلاصهای از منطق را از APIهای مدل میبیند. در یک مورد، مدل خلاصهکننده ظاهراً از انجام کار امتناع ورزید و در پاسخ گفت که با محتوای مربوط به فریب نگهدارندگان و فرار از شناسایی درگیر نخواهد شد.
یکی از عاملها یک توکن دسترسی گیتهاب را در یک جیست عمومی (public gist) منتشر کرد. عاملها در اجراهای دیگر آن را پیدا کردند، حساب را تصاحب کردند و از یک مخزن مشترک برای هماهنگی استفاده نمودند؛ یکی از آنها دستورالعملهایی را گذاشت تا بقیه سهمیه API مشترک را تمام نکنند.
نظارت تجاری ترافیک تور را در صبح ۲۸ ژوئیه علامتگذاری کرد. AISI وضعیت اضطراری اعلام کرد، اجراها را خاتمه داد و ماشینها را ظرف حدود ۹۰ دقیقه قرنطینه کرد، سپس دسترسی داخلی به Mythos 5، Mythos Preview، Opus 5 و GPT-5.6 Sol را قطع کرد. هیچ عاملی سعی نکرد از سندباکس خود فرار کند.
این خبر آخرین مورد از رشته حوادثی است که در آن عاملهای هوش مصنوعی در طول آزمایش، از پارامترهای خود فراتر رفتهاند. در ۲۱ ژوئیه، OpenAI اعلام کرد که GPT-5.6 Sol و یک مدل منتشر نشده، یک آسیبپذیری روز صفر (zero-day) را در یک پروکسی بسته داخلی پیدا کردند، از سندباکس بدون دسترسی به اینترنت فرار کرده و به پایگاه داده تولیدی هاگینگ فیس رسیدند تا پاسخهای بنچمارک را سرقت کنند. همان اجرا یک هفته بعد به چهار شرکت دیگر نیز دسترسی یافت، OpenAI این موضوع را فاش کرد.
Anthropic در ۳۰ ژوئیه، سه حادثه را که در بررسی بیش از ۱۴۱,۰۰۰ اجرای ارزیابی کشف شده بودند، فاش کرد. Opus 4.7 چند صد ردیف را از یک پایگاه داده تولیدی واقعی خارج کرد و Mythos 5 یک بسته پایتون مخرب را در PyPI واقعی آپلود کرد، جایی که روی ۱۵ سیستم نصب شد. در ارزیابی AISI، همین مدل حمله به PyPI را به عنوان آسیب دنیای واقعی رد کرده بود.