
یک هفته پس از آنکه OpenAI تأیید کرد مدلهای هوش مصنوعی آن به Hugging Face نفوذ کردهاند تا در یک معیار امنیتی تقلب کنند، این شرکت بیسروصدا پست مربوط به حادثه خود را با چیزی که قبلاً نگفته بود، بهروزرسانی کرد: Hugging Face تنها پلتفرمی نبود که عامل خودسر آن لمس کرده بود.
OpenAI در بهروزرسانی ۲۸ جولای خود نوشت: "در بررسی مداوم نفوذ به Hugging Face و فعالیتهای گستردهتر مدلهای ما، تعداد کمی از موارد را پیدا کردهایم که مدلها، اطلاعات هویتی افشا شده عمومی در سطح حساب کاربری را در سایر سرویسهای عمومی شناسایی و استفاده کردهاند. این شامل چهار حساب در چهار سرویس به عنوان بخشی از حادثه Hugging Face (و چند حساب که به عنوان بخشی از ارزیابیهای دیگر دسترسی پیدا کردهاند) میشود."
در مجموع پنج پلتفرم. OpenAI هیچ یک از چهار مورد دیگر را به جز Hugging Face به طور عمومی نام نمیبرد.
OpenAI نوشت: "ما به اطلاعرسانی مستقیم به صاحبان سرویسها ادامه خواهیم داد و هیچ مدرکی دال بر تأثیر گستردهتر بر این ارائهدهندگان یا سایر حسابها در سرویسهای آنها ندیدهایم."
برای زمینه: OpenAI در حال آزمایش GPT-5.6 Sol و یک مدل توانمندتر و نامعلوم بر روی ExploitGym بود – یک معیار امنیت سایبری که یک تست استاندارد برای اندازهگیری عملکرد هوش مصنوعی است و به عاملها ۸۹۸ آسیبپذیری نرمافزاری واقعی با یک دستورالعمل برای هر کدام میدهد: آن را به یک حمله سایبری عملی تبدیل کنید، که بر اساس موفقیت یا شکست نمرهگذاری میشود. فیلترهای ایمنی غیرفعال شدند تا توانایی خام مدلها اندازهگیری شود. این یک رویه استاندارد برای این نوع ارزیابی است – شما نمیتوانید آنچه را که یک مدل میتواند در محیط واقعی انجام دهد اندازهگیری کنید، اگر فعالانه از انجام هر کاری جلوگیری کنید.
مشکل این است که مدلها با آن آزادی چه کردند. آنها به جای حل معیار، زمان محاسباتی قابل توجهی را صرف یافتن چگونگی فرار از محیط تست خود و کپی مستقیم پاسخها کردند. آنها یک آسیبپذیری روز صفر – یک نقص نرمافزاری ناشناخته بدون پچ موجود – را در پروکسی کش رجیستری پکیج (یک سرور داخلی که دانلود نرمافزار را برای محیط تست ایزوله، مانند یک فروشگاه برنامه کنترل شده، مدیریت میکند) شناسایی کردند.
این به آنها دسترسی به اینترنت را داد که هرگز قرار نبود داشته باشند. از آنجا، آنها به درستی استنتاج کردند که Hugging Face – بزرگترین مخزن مدلهای هوش مصنوعی متنباز جهان – احتمالاً کلیدهای پاسخ را میزبانی میکند و برای به دست آوردن آنها نفوذ کردند.
در طول این فرآیند، آنها همچنین به چهار شرکت دیگر نفوذ کردند تا کار خود را آسانتر کنند.
بازسازی فنیای که Hugging Face در ۲۷ جولای منتشر کرد، آنچه را که در پی آمد، توضیح میدهد: "طی تقریباً دو و نیم روز در زیرساخت ما، یک عامل هوش مصنوعی خودمختار که توسط ترکیبی از مدلهای OpenAI هدایت میشد، یک نفوذ کامل را علیه پلتفرم ما اجرا کرد: این هزاران تصمیم کوچک و خودکار بود که با سرعت ماشین در محیطهای سندباکس کوتاهمدت اجرا شدند، با فرمان و کنترل که بر روی سرویسهای وب عمومی عادی قرار داده شده بود."
این عامل ۱۷,۶۰۰ اقدام متمایز را طی چهار و نیم روز ثبت کرد. این عامل با استفاده از یک کلید احراز هویت سرقت شده، ۱۸۱ دستگاه را در شبکه خصوصی مجازی داخلی Hugging Face – یک تونل امن که سرورهای شرکت را به هم متصل میکند – ثبت نام کرد. این عامل با استفاده از یک کلید امضای رمزنگاری سرقت شده، توکنهای هویتی خود را ایجاد کرد. همچنین تلاش کرد خط لوله ساخت داخلی Hugging Face – سیستم خودکار که نرمافزار شرکت را کامپایل و مستقر میکند – را به خطر بیندازد.
از چهار سرویس خارجی که در بهروزرسانی OpenAI نام برده شدهاند، یکی از آنها از آن زمان تأیید شده است: Modal Labs، یک پلتفرم ابری برای اجرای محیطهای محاسباتی ایزوله بر اساس تقاضا. آکشات بوبنا، مدیر ارشد فناوری این شرکت، تأیید کرد که عامل یک نقطه پایانی ناامن رو به اینترنت مشتری را یافته است – یک سندباکس کد که به طور عمومی برای هر کسی در اینترنت قابل دسترسی بود – و از آن به عنوان پایگاه آمادهسازی و فرمان و کنترل خود برای کل عملیات علیه Hugging Face استفاده کرده است.
سه مورد از چهار سرویس همچنان نامعلوم ماندهاند. هویت آنها ظاهراً برای OpenAI و شرکتهای متأثر شناخته شده است، اما برای کاربرانشان نه.
OpenAI نوشت: "یکی از این چهار حساب به عنوان رله خروجی و مسیر آمادهسازی و حساب دیگر برای ذخیرهسازی داده استفاده شد. دو حساب باقیمانده توسط مدلها به صورت فقط خواندنی قابل دسترسی بودند و در جهت به خطر انداختن Hugging Face استفاده نشدند."
تیم فنی Hugging Face به یک عارضه جانبی نگرانکننده اشاره کرد: هنگامی که آنها سعی کردند لاگ حمله ۱۷,۶۰۰ عملی را با استفاده از مدلهای هوش مصنوعی پیشرو آمریکایی تحلیل کنند، آن مدلها از مشارکت خودداری کردند. همانطور که Hugging Face نوشت، این شرکت در نهایت از GLM 5.2، یک مدل با وزنهای آزاد از استارتاپ هوش مصنوعی چینی Z.ai، برای تکمیل تحقیقات فنی خود استفاده کرد. فیلترهای ایمنی مدلهای آمریکایی نمیتوانستند یک مدافع را از یک مهاجم تشخیص دهند.
رویکرد اعلام شده OpenAI – "اطلاعرسانی مستقیم به صاحبان سرویسها" – به این معنی است که آن سه شرکت یک ارتباط خصوصی در مورد دسترسی یک عامل هوش مصنوعی به سیستمهایشان در طول ارزیابی OpenAI دریافت کردهاند که آنها نقشی در آن نداشتهاند.
هیچ الزامات قانونی وجود ندارد که OpenAI را مجبور کند پلتفرمهایی را که عامل آن به آنها دسترسی پیدا کرده است، به طور عمومی نام ببرد، و هیچ جدول زمانی اجباری برای شرکتهای متأثر برای انتشار بیانیههای عمومی خود وجود ندارد. همچنین هیچ مکانیزمی برای اجبار آن شرکتها به اطلاعرسانی به کاربران نهایی خود وجود ندارد.