
資安研究人員發現了一種方法,可以讀取所有主要 AI 推理模型的加密「內在思維」——並在開發人員在線公開分享的會話日誌中發現了 62 個即時 API 金鑰和 33 個密碼,而這些開發人員並不知道日誌中包含了什麼。
研究人員寫道:「透過解碼從公共儲存庫中抓取的 315,320 個推理區塊,我們恢復了 367 個個人身份資訊 (PII) 和 182 個憑證。」
這篇論文由 MATS Research、圖賓根 ELLIS 研究所、馬克斯普朗克智慧系統研究所和資安公司 Snyk 的一個團隊於 8 月 10 日提交,其目標是一種特定類型的 AI:推理模型。這些模型不僅僅是立即回答,而是首先啟動一個內部思考鏈(AI 在展示答案之前逐步解決問題的草稿),然後給出最終回應。
Anthropic、OpenAI 和 Google 都會加密這個隱藏的草稿。加密——將資料打亂成無法讀取的代碼的過程——旨在保護公司的智慧財產權,並防止敏感的中間推理結果被使用者看到。每個後續訊息都會將加密區塊傳回提供商的伺服器,從而維持對話,而無需在公司端儲存任何內容。
這個缺陷是架構上的。這三家提供商都沒有將每個加密推理區塊綁定到特定的使用者、會話或模型,而是使用單一的、提供商範圍內的加密金鑰貫穿其整個生態系統。研究人員寫道:「這些加密區塊在不同會話、使用者甚至提供商生態系統內的模型之間完全相容和可互換。」
這意味著,來自 Anthropic 旗艦模型 Claude Opus 4.8 的加密推理區塊可以被注入到更便宜、防護較弱的兄弟模型 Claude Haiku 4.5 中,而不會違反 Anthropic 的規則。Haiku 缺乏 Opus 所擁有的反蒸餾對齊(專門設計用於阻止模型按指令轉錄其自身推理的安全訓練)。
讓 Haiku 逐字讀出加密區塊,它就會照做。論文指出:「透過將給定模型的加密推理痕跡注入到同一提供商的較弱、防護較少的模型中,我們迫使它逐字解碼並輸出明文痕跡,而無需直接越獄功能更強大的模型。」
首席研究員 Alexander Panfilov 在 X 上寫道:「跨模型可移植性意味著 Haiku 4.5 可以讀取 Opus 4.8 的思維。」OpenAI 的 GPT-5.6 系列和 Google 的 Gemini 模型系列也重現了同樣的攻擊。不需要特殊權限——標準 API 存取(開發人員用於在 AI 模型之上構建應用程式的連接)足以執行此操作。
We can finally talk about it:
We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company.
We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7
— Alexander Panfilov (@kotekjedi_ml) August 11, 2026
為了展示實際損害,該團隊爬取了 6,708 份公開分享的 AI 代理轉錄稿——開發人員為協作或偵錯而例行發布到 GitHub 和 Hugging Face 的自動化會話日誌。他們從這些日誌中解碼了 315,320 個推理區塊。
論文指出:「開發人員經常在線上公開分享他們的會話日誌和加密思考痕跡,完全不知道加密區塊中隱藏的敏感資料。」這些秘密大多數從未出現在可見的 AI 輸出中——它們只存在於加密的推理中,對任何沒有執行過攻擊的人來說都是不可見的。
除了簡單的憑證竊取之外,此漏洞還開闢了四種攻擊途徑:透過蒸餾(當較小的 AI 透過研究其輸出模仿較大的 AI 時)竊取 AI 公司的專有推理模式來訓練競爭模型;從共享日誌中提取私人資料;執行不可見的提示注入,其中惡意指令隱藏在安全監控工具從未看到的加密推理區塊中;以及透過其防護較少的兄弟模型越獄功能強大的模型。
Anthropic、OpenAI 和 Google 都在團隊遵循負責任的揭露程序後部署了伺服器端緩解措施。正如 Decrypt 先前報導,Anthropic 今年一直是資安研究人員關注的焦點,尤其是在其最新模型在此過程中消耗大量代幣的情況下。
補丁已上線。從公共網路抓取的 6,708 份包含解碼推理區塊的會話轉錄稿不會消失。