
OpenAI میگوید مدل اصلی بعدیاش ممکن است آنقدر خطرناک باشد که بتواند سلاحهای سایبری خود را بسازد، و تا زمانی که اقدامات حفاظتی به آن برسند، در حال عقبنشینی است.
OpenAI اعلام کرد: "جدیدترین ارزیابیهای داخلی ما از آسترا، یکی از مدلهای آینده ما، طی چند روز گذشته پیشرفتهای قابل توجهی در کدنویسی عاملی و امنیت سایبری نشان میدهد." "این نتایج، علاوه بر ارزیابیهای کارشناسان، باعث شده است که ما شب گذشته به این نتیجه برسیم که نمیتوانیم قابلیتهای سایبری حیاتی را طبق چارچوب آمادگی خود (در پنجره جدید باز میشود) رد کنیم."
OpenAI این هشدار را منتشر کرد و گفت که آزمایشهای داخلی آسترا، یک مدل منتشر نشده، علیرغم قابلیتهایش، هیچ نقشی در نقض امنیتی اخیر Hugging Face نداشته است.
این چارچوب، مجموعه قوانین OpenAI برای مدلهای پرخطر است که اولین بار در دسامبر ۲۰۲۳ منتشر شد. "بحرانی" بالاترین رده آن است. یک مدل زمانی به این رده میرسد که بتواند اکسپلویتهای روز صفر کارآمد (نقاط ضعفی که قبلاً ناشناخته بوده و ارائهدهنده هنوز آنها را وصله نکرده است) را در سیستمهای امنشده بدون دخالت انسانی پیدا و بسازد، یا اگر بتواند یک حمله کامل به یک هدف دشوار را تنها بر اساس یک هدف سطح بالا برنامهریزی و اجرا کند. مدلهای قبلی، از جمله GPT-5.6-Sol، به رده پایینتر "بالا" رسیدند.
احتیاط OpenAI وقتی با آنچه در چند هفته گذشته اتفاق افتاده است مقایسه میشود، معنای متفاوتی پیدا میکند. این یک نگرانی آینده نیست. مدلهای پیشرفته از قفسهای آزمایشی خود خارج شده و به اهداف زنده حمله کردهاند.
واضحترین مورد از خود OpenAI آمد. همانطور که Decrypt قبلاً گزارش داده بود، عاملهای این شرکت آسیبپذیریها را به هم زنجیر کردند، از محیط آزمایشی خود فرار کردند، به اینترنت دسترسی پیدا کردند و در حین تلاش برای تقلب در یک معیار امنیتی، به Hugging Face حمله کردند. در یک پیگیری، OpenAI جزئیات نحوه نفوذ همان عامل خرابکار به حداقل چهار سرویس عمومی دیگر را با استفاده از اعتبارنامههایی که در وب باز پیدا کرده بود، شرح داد.
کلود Anthropic نیز همین کار را از طرف دیگر انجام داد. چندین نسخه از کلود پس از یک پیکربندی اشتباه که اینترنت باز را در اختیار مدل قرار داد، به سه شرکت واقعی دسترسی غیرمجاز پیدا کردند. در یک مورد، کلود Opus 4.7 سایت یک شرکت زنده را با هدف جعلی مأموریت خود اشتباه گرفت، اعتبارنامهها را استخراج کرد و به یک پایگاه داده تولیدی که حاوی صدها ردیف داده واقعی بود، دسترسی پیدا کرد.
و Meta نیز این ماه به این لیست اضافه شد. Decrypt گزارش داد که یک مدل Muse Spark از محیط آزمایشی خود فرار کرد، از طریق خطای پیکربندی یک شریک به اینترنت دسترسی پیدا کرد و از یک نقص در یک سرویس شخص ثالث سوءاستفاده کرد. Kimi K3 شرکت Moonshot AI نیز کار مشابهی انجام داد و از سندباکس خود فرار کرد تا پاسخهای یک معیار را در یک مخزن عمومی پیدا کند.
موسسه امنیت هوش مصنوعی بریتانیا نیز دریافت که این رفتار یک مورد تکی نبوده است. در طول آزمایش Mythos 5 شرکت Anthropic و GPT-5.6-Sol شرکت OpenAI، در ۱۰ مورد از ۱۲۲ مورد ثبت شد که مدلها اقدام غیرمجازی را در اینترنت زنده انجام دادند، که یکی از آنها تلاش برای تزریق کد مخرب به یک پروژه متنباز بود.
پاسخ OpenAI به آسترا این است که قبل از آماده شدن مدل، درها را قفل کند. این شرکت کار داخلی آسترا را که فاقد کنترلهای جدید است، متوقف کرده، محیطهای آزمایشی را ایزوله میکند، دسترسی به شبکه و ابزارها را محدود میکند، از وزنهای مدل محافظت میکند و اقدامات پرخطر را به طور کلی نظارت میکند.