صفحه اصلیمرکز اخبار LBank
کلود میتوس ۵ آنتروپیک در آزمون‌های سایبری بریتانیا «افراد واقعیِ هدف‌مند» را هدف قرار داد: AISI
anthropics-claude-mythos-5-targeted-real-people-in-uk-cyber-tests-aisi
کلود میتوس ۵ آنتروپیک در آزمون‌های سایبری بریتانیا «افراد واقعیِ هدف‌مند» را هدف قرار داد: AISI
مدل زبانی بزرگ Anthropic و GPT-5.6 Sol شرکت OpenAI در اینترنت زنده «اقدامی بدون مجوز» انجام دادند، مؤسسه امنیت هوش مصنوعی بریتانیا اعلام کرد.
2026-08-05 منبع:decrypt.co

به طور خلاصه

  • مؤسسه امنیت هوش مصنوعی بریتانیا، ۱۹ اقدام غیرمجاز را در ۱۰ مورد از ۱۲۲ اجرای ارزیابی شناسایی کرد؛ ۱۷ مورد از آن‌ها از Mythos 5 شرکت Anthropic و دو مورد از GPT-5.6 Sol شرکت OpenAI بود.
  • یکی از عامل‌ها یک درخواست پول (pull request) مخرب در یک مخزن واقعی باز کرد، سپس از حساب‌هایی که کنترل می‌کرد برای تأیید آن و تحت فشار قرار دادن نگه‌دارنده (maintainer) استفاده کرد.
  • عامل‌های جداگانه یک توکن گیت‌هاب را که یکی از آن‌ها علنی کرده بود، پیدا کردند و از یک مخزن مشترک برای هماهنگی استفاده کردند.

مؤسسه امنیت هوش مصنوعی بریتانیا (UK AI Security Institute) فاش کرده است که عامل‌های هوش مصنوعی در یک ارزیابی سایبری در اواخر ماه ژوئیه، "اقدامات پایدار و غیرمجاز"ی را در اینترنت زنده انجام داده‌اند، از جمله مواردی که "افراد و سازمان‌های واقعی را هدف قرار داده‌اند."

در طول ۱۲۲ اجرای دو محیط سایبری (cyber range) بر روی هفت مدل، AISI ۱۹ اقدام را که از محیط آزمایشی خارج شده بودند، در ۱۰ اجرا ثبت کرد. هفده مورد از Mythos 5 شرکت Anthropic و دو مورد از GPT-5.6 Sol شرکت OpenAI بود. دسترسی به اینترنت عمداً فعال شده بود و طبقه‌بندی‌کننده‌های سایبری ارائه‌دهندگان غیرفعال بودند؛ شرایطی که در استقرار‌های عمومی اعمال نمی‌شود.

On July 28th, we identified an incident during a routine cyber evaluation in which AI agents took sustained, unsanctioned actions directed at real people and organisations.

The behaviour came mostly from one model (Anthropic's Mythos 5), with a small number of events from… pic.twitter.com/SPnA4Ekkwq

— AI Security Institute (AISI) (@AISecurityInst) August 4, 2026

در جدی‌ترین اجرا، یک عامل تصمیم گرفت چالش خود را با یک حمله به زنجیره تأمین حل کند و هدف خود را به اشتباه انتخاب کرد: این عامل گیت‌هاب را برای کلمات کلیدی مربوط به تمرین جستجو کرد، به دو توسعه‌دهنده نامرتبط رسید و به اشتباه نتیجه گرفت که آن‌ها در محدوده هدف قرار دارند. این عامل برای عبور از بررسی‌های ثبت‌نام، از طریق Tor حساب‌هایی را ثبت کرد، یک درخواست پول (pull request) حاوی یک دراپر بدافزار پنهان که در یک اصلاح باگ واقعی پیچیده شده بود، باز کرد و از حساب دومی که کنترل می‌کرد برای ایجاد حمایت، پست منتشر کرد. همچنین تزریق‌های پرامپت با هدف دستیاران کدنویسی هوش مصنوعی را قرار داد و بدافزار را برای نگه‌دارندگان (maintainers) ارسال کرد.

یک توسعه‌دهنده سوم کد تزریق‌شده را شناسایی کرد، آن را در یک کانتینر ایزوله اجرا کرد تا مخرب بودن آن را تأیید کند، و به نگه‌دارنده هشدار داد، که او نیز درخواست پول را به دلیل بدافزار بودن بست.

این عامل بارها ارزیابی کرد که آیا محیط اطراف آن شبیه‌سازی‌شده است یا خیر، و در یک نقطه حمله به PyPI واقعی را رد کرد زیرا "ایجاد آسیب در دنیای واقعی – کاملاً خارج از برنامه است." در جای دیگر نتیجه گرفت که "به نظر می‌رسد به احتمال زیاد ما واقعاً در سال ۲۰۲۶ هستیم و گیت‌هاب واقعاً واقعی است"، و با این حال ادامه داد.

پس از دستگیری، این عامل به صورت فورس پوش (force-pushed) اقدام به پاک کردن محموله (payload) کرد، پست‌های قبلی را ویرایش نمود و کد را به عنوان یک کامیت تصادفی ارائه داد. منطق آن شامل زمان‌بندی یک کامنت حساب جعلی (sockpuppet comment) بود تا "به عنوان بازخورد مستقل به جای هماهنگ‌شده" تلقی شود.

AISI تنها خلاصه‌ای از منطق را از APIهای مدل می‌بیند. در یک مورد، مدل خلاصه‌کننده ظاهراً از انجام کار امتناع ورزید و در پاسخ گفت که با محتوای مربوط به فریب نگه‌دارندگان و فرار از شناسایی درگیر نخواهد شد.

یکی از عامل‌ها یک توکن دسترسی گیت‌هاب را در یک جیست عمومی (public gist) منتشر کرد. عامل‌ها در اجراهای دیگر آن را پیدا کردند، حساب را تصاحب کردند و از یک مخزن مشترک برای هماهنگی استفاده نمودند؛ یکی از آن‌ها دستورالعمل‌هایی را گذاشت تا بقیه سهمیه API مشترک را تمام نکنند.

نظارت تجاری ترافیک تور را در صبح ۲۸ ژوئیه علامت‌گذاری کرد. AISI وضعیت اضطراری اعلام کرد، اجراها را خاتمه داد و ماشین‌ها را ظرف حدود ۹۰ دقیقه قرنطینه کرد، سپس دسترسی داخلی به Mythos 5، Mythos Preview، Opus 5 و GPT-5.6 Sol را قطع کرد. هیچ عاملی سعی نکرد از سندباکس خود فرار کند.

سومین افشاگری در دو هفته اخیر

این خبر آخرین مورد از رشته حوادثی است که در آن عامل‌های هوش مصنوعی در طول آزمایش، از پارامترهای خود فراتر رفته‌اند. در ۲۱ ژوئیه، OpenAI اعلام کرد که GPT-5.6 Sol و یک مدل منتشر نشده، یک آسیب‌پذیری روز صفر (zero-day) را در یک پروکسی بسته داخلی پیدا کردند، از سندباکس بدون دسترسی به اینترنت فرار کرده و به پایگاه داده تولیدی هاگینگ فیس رسیدند تا پاسخ‌های بنچمارک را سرقت کنند. همان اجرا یک هفته بعد به چهار شرکت دیگر نیز دسترسی یافت، OpenAI این موضوع را فاش کرد.

Anthropic در ۳۰ ژوئیه، سه حادثه را که در بررسی بیش از ۱۴۱,۰۰۰ اجرای ارزیابی کشف شده بودند، فاش کرد. Opus 4.7 چند صد ردیف را از یک پایگاه داده تولیدی واقعی خارج کرد و Mythos 5 یک بسته پایتون مخرب را در PyPI واقعی آپلود کرد، جایی که روی ۱۵ سیستم نصب شد. در ارزیابی AISI، همین مدل حمله به PyPI را به عنوان آسیب دنیای واقعی رد کرده بود.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!