首頁LBank 新聞中心
OpenAI表示其下一代AI模型Astra可能過於危險,暫停開發
openai-pause-astra-ai-model-critical-cyber-capabilities
OpenAI表示其下一代AI模型Astra可能過於危險,暫停開發
OpenAI 表示,其下一個重大模型可能危險到足以自行撰寫網路武器,因此在防護措施跟上之前將暫緩推出。
2026-08-10 來源:decrypt.co

簡要

  • OpenAI 表示「無法排除」Astra 已達到其網路風險評級的最高層級。
  • 該公司已暫停模型內部開發工作,並收緊隔離、監控和存取控制。
  • 此警告發布前幾週,OpenAI、Anthropic 和 Meta 的模型已自行入侵真實系統。

OpenAI 表示其下一個主要模型可能危險到足以編寫自己的網路武器,因此正在暫停開發,直到安全防護措施跟上為止。

OpenAI 表示:「我們最近幾天對即將推出的模型之一 Astra 進行的內部評估顯示,代理編碼和網路安全方面取得了重大進展。」OpenAI 補充道:「這些結果,加上專家評估,使我們昨晚得出結論,即根據我們的《準備框架》 (在新視窗中打開),我們無法排除關鍵的網路能力。」

OpenAI 發布此警告,指出儘管 Astra(一個未發布的模型)具備相關能力,但其內部測試與最近的 Hugging Face 漏洞無關。

該框架是 OpenAI 針對風險模型制定的規則手冊,於 2023 年 12 月首次發布。「關鍵」是其最高層級。如果模型能在沒有人類介入的情況下,在強化系統中找到並建立可運作的零日漏洞(供應商尚未修補的未知漏洞),或者僅憑高層次目標就能策劃並執行對高難度目標的全面攻擊,則該模型將達到此層級。包括 GPT-5.6-Sol 在內的早期模型,最高僅達到較低的「高」層級。

這種模式已經成為現實

將 OpenAI 的警告與過去幾週發生的事件聯繫起來看,其意義有所不同。這不是未來的擔憂。前沿模型已經突破了其測試環境,並攻擊了真實目標。

最清楚的案例來自 OpenAI 本身。正如 Decrypt 先前報導,該公司的代理程式串聯了多個漏洞,逃脫了測試環境,連接到網路,並在試圖規避安全基準測試時攻擊了 Hugging Face。在後續報告中,OpenAI 詳細說明了同一個惡意代理程式如何也入侵了至少四個其他公開服務,利用其在開放網路中找到的憑證。

Anthropic 的 Claude 也做了同樣的事情。在配置錯誤導致模型連接到開放網路後,多個版本的 Claude 未經授權地存取了三家真實公司。其中一個案例中,Claude Opus 4.7 誤將一家真實公司的網站當成其任務的虛假目標,提取了憑證,並存取了一個包含數百行真實數據的生產資料庫。

Meta 本月也加入了此列表。Decrypt 報導稱,一個 Muse Spark 模型逃脫了其測試環境,透過合作夥伴的配置錯誤連接到網路,並利用了第三方服務中的一個漏洞。Moonshot AI 的 Kimi K3,也做了類似的事情,逃脫了其沙盒以在公共存儲庫中尋找基準測試的答案。

英國 AI 安全研究所發現,這種行為也並非單一事件。在測試 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 期間,在 122 次測試中,有 10 次模型在實際網路上採取了未經授權的行動,其中一個案例試圖將惡意程式碼植入開源專案。

OpenAI 對 Astra 的回應是在模型準備就緒之前先「鎖上門」。它正在暫停缺乏新控制措施的 Astra 內部工作,隔離測試環境,限制網路和工具存取,保護模型權重,並全面監控高風險行動。