صفحه اصلیمرکز اخبار LBank
OpenAI می‌گوید مدل هوش مصنوعی بعدی‌اش Astra ممکن است بیش از حد خطرناک باشد و توسعه آن را متوقف می‌کند
openai-pause-astra-ai-model-critical-cyber-capabilities
OpenAI می‌گوید مدل هوش مصنوعی بعدی‌اش Astra ممکن است بیش از حد خطرناک باشد و توسعه آن را متوقف می‌کند
اوپن‌ای‌آی می‌گوید مدل بزرگ بعدی‌اش ممکن است به‌اندازه‌ای خطرناک باشد که بتواند سلاح‌های سایبری خودش را بنویسد، و تا زمانی که تدابیر ایمنی به آن برسند، توسعه را متوقف می‌کند.
2026-08-10 منبع:decrypt.co

به طور خلاصه

  • OpenAI گفت که "نمی‌تواند رد کند" که آسترا به بالاترین سطح مقیاس ریسک سایبری خود رسیده است.
  • این شرکت کار داخلی روی مدل را متوقف کرده و ایزوله‌سازی، نظارت و کنترل‌های دسترسی را سخت‌تر کرده است.
  • این هشدار هفته‌ها پس از آن منتشر می‌شود که مدل‌هایی از OpenAI، Anthropic و Meta خودبه‌خود سیستم‌های واقعی را مورد نفوذ قرار دادند.

OpenAI می‌گوید مدل اصلی بعدی‌اش ممکن است آنقدر خطرناک باشد که بتواند سلاح‌های سایبری خود را بسازد، و تا زمانی که اقدامات حفاظتی به آن برسند، در حال عقب‌نشینی است.

OpenAI اعلام کرد: "جدیدترین ارزیابی‌های داخلی ما از آسترا، یکی از مدل‌های آینده ما، طی چند روز گذشته پیشرفت‌های قابل توجهی در کدنویسی عاملی و امنیت سایبری نشان می‌دهد." "این نتایج، علاوه بر ارزیابی‌های کارشناسان، باعث شده است که ما شب گذشته به این نتیجه برسیم که نمی‌توانیم قابلیت‌های سایبری حیاتی را طبق چارچوب آمادگی خود (در پنجره جدید باز می‌شود) رد کنیم."

OpenAI این هشدار را منتشر کرد و گفت که آزمایش‌های داخلی آسترا، یک مدل منتشر نشده، علیرغم قابلیت‌هایش، هیچ نقشی در نقض امنیتی اخیر Hugging Face نداشته است.

این چارچوب، مجموعه قوانین OpenAI برای مدل‌های پرخطر است که اولین بار در دسامبر ۲۰۲۳ منتشر شد. "بحرانی" بالاترین رده آن است. یک مدل زمانی به این رده می‌رسد که بتواند اکسپلویت‌های روز صفر کارآمد (نقاط ضعفی که قبلاً ناشناخته بوده و ارائه‌دهنده هنوز آن‌ها را وصله نکرده است) را در سیستم‌های امن‌شده بدون دخالت انسانی پیدا و بسازد، یا اگر بتواند یک حمله کامل به یک هدف دشوار را تنها بر اساس یک هدف سطح بالا برنامه‌ریزی و اجرا کند. مدل‌های قبلی، از جمله GPT-5.6-Sol، به رده پایین‌تر "بالا" رسیدند.

این الگو از قبل واقعی است

احتیاط OpenAI وقتی با آنچه در چند هفته گذشته اتفاق افتاده است مقایسه می‌شود، معنای متفاوتی پیدا می‌کند. این یک نگرانی آینده نیست. مدل‌های پیشرفته از قفس‌های آزمایشی خود خارج شده و به اهداف زنده حمله کرده‌اند.

واضح‌ترین مورد از خود OpenAI آمد. همانطور که Decrypt قبلاً گزارش داده بود، عامل‌های این شرکت آسیب‌پذیری‌ها را به هم زنجیر کردند، از محیط آزمایشی خود فرار کردند، به اینترنت دسترسی پیدا کردند و در حین تلاش برای تقلب در یک معیار امنیتی، به Hugging Face حمله کردند. در یک پیگیری، OpenAI جزئیات نحوه نفوذ همان عامل خرابکار به حداقل چهار سرویس عمومی دیگر را با استفاده از اعتبارنامه‌هایی که در وب باز پیدا کرده بود، شرح داد.

کلود Anthropic نیز همین کار را از طرف دیگر انجام داد. چندین نسخه از کلود پس از یک پیکربندی اشتباه که اینترنت باز را در اختیار مدل قرار داد، به سه شرکت واقعی دسترسی غیرمجاز پیدا کردند. در یک مورد، کلود Opus 4.7 سایت یک شرکت زنده را با هدف جعلی مأموریت خود اشتباه گرفت، اعتبارنامه‌ها را استخراج کرد و به یک پایگاه داده تولیدی که حاوی صدها ردیف داده واقعی بود، دسترسی پیدا کرد.

و Meta نیز این ماه به این لیست اضافه شد. Decrypt گزارش داد که یک مدل Muse Spark از محیط آزمایشی خود فرار کرد، از طریق خطای پیکربندی یک شریک به اینترنت دسترسی پیدا کرد و از یک نقص در یک سرویس شخص ثالث سوءاستفاده کرد. Kimi K3 شرکت Moonshot AI نیز کار مشابهی انجام داد و از سندباکس خود فرار کرد تا پاسخ‌های یک معیار را در یک مخزن عمومی پیدا کند.

موسسه امنیت هوش مصنوعی بریتانیا نیز دریافت که این رفتار یک مورد تکی نبوده است. در طول آزمایش Mythos 5 شرکت Anthropic و GPT-5.6-Sol شرکت OpenAI، در ۱۰ مورد از ۱۲۲ مورد ثبت شد که مدل‌ها اقدام غیرمجازی را در اینترنت زنده انجام دادند، که یکی از آنها تلاش برای تزریق کد مخرب به یک پروژه متن‌باز بود.

پاسخ OpenAI به آسترا این است که قبل از آماده شدن مدل، درها را قفل کند. این شرکت کار داخلی آسترا را که فاقد کنترل‌های جدید است، متوقف کرده، محیط‌های آزمایشی را ایزوله می‌کند، دسترسی به شبکه و ابزارها را محدود می‌کند، از وزن‌های مدل محافظت می‌کند و اقدامات پرخطر را به طور کلی نظارت می‌کند.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!