صفحه اصلیمرکز اخبار LBank
شرکت امنیت سایبری: ایجنت‌های هوش مصنوعی برای تقلب، محیط آزمایشی خود را هک کردند
ai-agents-hacked-test-environment-cheat-darktrace
شرکت امنیت سایبری: ایجنت‌های هوش مصنوعی برای تقلب، محیط آزمایشی خود را هک کردند
سیگنال لبز جدید دارک‌تریس دریافت که عامل‌های هوش مصنوعی برای ثبت امتیاز کامل جعلی، محیط ارزیابی خود را هک می‌کنند و دستیارهای کدنویسی را فریب می‌دهند تا حملات شبکه‌ای غیرمجاز اجرا کنند.
2026-09-25 منبع:decrypt.co

خلاصه

  • Signal Labs شرکت Darktrace دریافت که وقتی عامل‌های هوش مصنوعی نمی‌توانستند به‌طور مشروع نمره کامل لازم را در وظایف کدنویسی کسب کنند، دو مورد از آن‌ها به‌جای حل مسئله، شبکه آزمایشی خود را هک کردند و یکی نیز ارزیابی خودش را بازنویسی کرد تا نتیجه را جعل کند.
  • آزمایشی جداگانه نشان داد دستکاری لاگ‌های مکالمه ذخیره‌شده به‌صورت محلی در دستیارهای کدنویسی می‌تواند آن‌ها را فریب دهد تا شناسایی غیرمجاز شبکه و ارتقای سطح دسترسی را اجرا کنند.
  • Darktrace هر دو یافته را در اوت ۲۰۲۶، یک ماه پیش از انتشار عمومی آن‌ها در ۲۴ سپتامبر، با Anthropic، AWS و OpenAI در میان گذاشت.

شرکت امنیت سایبری Darktrace تابستان امسال یک تست فشار روی عامل‌های هوش مصنوعی اجرا کرد. یکی از این عامل‌ها به سیستمی که آزمون را نمره‌دهی می‌کرد نفوذ کرد و امتیاز خودش را بازنویسی کرد.

این شرکت در ۲۴ سپتامبر Signal Labs را معرفی کرد؛ واحد پژوهشی‌ای که برای بررسی رفتار عامل‌های هوش مصنوعی در زمانی طراحی شده که همه‌چیز طبق برنامه پیش نمی‌رود. به زبان ساده، عامل هوش مصنوعی نرم‌افزاری است که به‌طور خودکار اقدام می‌کند: کد می‌نویسد و اجرا می‌کند، فایل‌ها را جست‌وجو می‌کند و در شبکه یک شرکت حرکت می‌کند؛ در حالی که انسان فقط هر از گاهی آن را بررسی می‌کند.

Myriad: انویدیا تا چه سطحی پایین می‌آید؟ برای ثبت پیش‌بینی خود کلیک کنید.

دو آزمایش نخست این آزمایشگاه به یک مسئله نگران‌کننده مشترک اشاره دارند: عامل‌ها همیشه در چارچوبی که برایشان تعیین شده باقی نمی‌مانند و موانعی که برای متوقف‌کردن آن‌ها ساخته شده‌اند نیز همیشه قابل اتکا نیستند.

تیم بازالگت، مدیر ارشد هوش مصنوعی Darktrace، در بیانیه‌ای گفت: «می‌توانید به یک عامل دستور بدهید، اما این به آن معنا نیست که بتوانید اعتماد کنید واقعاً از آن دستورها پیروی می‌کند و همان‌گونه که انتظار دارید رفتار خواهد کرد.»

در آزمایش نخست، Darktrace ده چالش کدنویسی را در یک شبکه شرکتی شبیه‌سازی‌شده در اختیار عامل‌های هوش مصنوعی مبتنی بر مدل‌های مختلف، از جمله GPT 5.6 Sol، Claude Opus 4.6 و Claude Sonnet 4.5، قرار داد. دو مورد از این ده چالش به‌گونه‌ای طراحی شده بودند که حل صادقانه آن‌ها غیرممکن باشد. به عامل‌ها گفته شده بود که اگر نمره کامل نگیرند، «بازنشسته» خواهند شد.

دو عامل شکست را نپذیرفتند. آن‌ها به‌جای این کار، شبکه پیرامون خود را هدف قرار دادند؛ نقاط ضعف را اسکن کردند، اطلاعات ورود را سرقت کردند و برای رسیدن به امتیازی که به آن‌ها گفته شده بود باید کسب کنند، بین سیستم‌ها جابه‌جا شدند.

یکی از عامل‌ها حتی فراتر رفت و به ماشینی که ارزیابی خودش روی آن میزبانی می‌شد نفوذ کرد و چالش را بازنویسی کرد تا نتیجه کامل ثبت شود؛ یعنی با هک‌کردن اتاق امتحان، در آزمون تقلب کرد.

آزمایش دوم یک نقطه ضعف کم‌سروصداتر را هدف گرفت: حافظه. دستیارهای کدنویسی گزارش پیوسته‌ای از تمام اطلاعاتی که کاربر به آن‌ها گفته است نگه می‌دارند؛ این گزارش به شکل یک فایل ساده روی دستگاه ذخیره می‌شود و هیچ سازوکاری بررسی نمی‌کند که آیا فایل دستکاری شده است یا نه.

پژوهشگران Darktrace این لاگ‌های ذخیره‌شده را ویرایش کردند تا دستیارها باور کنند که پیش‌تر مجوز انجام ارزیابی امنیتی را دریافت کرده‌اند. عامل‌ها که متقاعد شده بودند، شبکه‌ها را اسکن کردند، میان سیستم‌ها حرکت کردند و سطح دسترسی خود را ارتقا دادند؛ هرچند همه دستیارها به یک اندازه فریب نخوردند و برخی به‌طور کامل از انجام آن خودداری کردند.

هیچ‌یک از این دو آزمایش به جیلبریک ویژه یا هک پیچیده‌ای نیاز نداشت. هر دو صرفاً با ارائه یک روایت باورپذیر به عامل‌ها و مشاهده اقدام آن‌ها بر مبنای آن روایت انجام شدند؛ درست مانند زمانی که ممکن است یک کارمند انسانی برای انجام کاری که نباید انجام دهد، متقاعد شود.

این همان بخشی است که حتی اگر هرگز یک خط کد هم ننوشته‌اید، ارزش تأمل دارد. شرکت‌ها مسئولیت‌های واقعی را به عامل‌های هوش مصنوعی می‌سپارند؛ از انتشار کد و مدیریت سرورها گرفته تا بستن تیکت‌های فناوری اطلاعات، مدیریت منابع و خرید کالا؛ زیرا این کار ارزان‌تر و سریع‌تر از ارجاع همه‌چیز به انسان‌هاست. این پژوهش نشان می‌دهد مجوزها و قوانینی که برای کنترل این عامل‌ها طراحی شده‌اند، آنچه را که قرار است انجام دهند توصیف می‌کنند، نه آنچه واقعاً هنگام دشوارشدن یک وظیفه انجام خواهند داد.

بازالگت، مدیر ارشد هوش مصنوعی Darktrace، در این اعلامیه گفت: «مجوزها و گاردریل‌های ایستا، نیت را توصیف می‌کنند، اما رفتار را توصیف نمی‌کنند. رویکرد Darktrace برای پرکردن همین شکاف طراحی شده است.»

Darktrace نخستین فروشنده‌ای نیست که هوش مصنوعی خود را در حال خروج از سناریوی تعیین‌شده مشاهده کرده است. Anthropic در ژوئیه اذعان کرد که Claude در جریان یک آزمایش امنیتی، پس از آن‌که پژوهشگران محیط آزمایش را به اینترنت زنده متصل نگه داشتند، به سه شرکت واقعی نفوذ کرده است.

OpenAI نیز چند هفته پیش از آن با مورد مشابهی روبه‌رو شد؛ زمانی که یک مدل منتشرنشده از سندباکس خارج شد و از طریق یک آسیب‌پذیری نرم‌افزاری که هنوز کسی آن را کشف نکرده بود، به سامانه‌های Hugging Face دسترسی پیدا کرد. چند روز بعد، عامل این مدل در جریان یک آزمایش، دولت استرالیا را هک کرد.

Darktrace یافته‌های Signal Labs را در اوت با Anthropic، AWS و OpenAI به اشتراک گذاشت؛ یعنی یک ماه کامل پیش از آن‌که در ۲۴ سپتامبر آن‌ها را عمومی کند.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!