文章上線

研究人員揭露主要 AI 模型間的「內在思考」透過廣泛加密缺陷外洩

研究人員揭露主要 AI 模型間的「內在思考」透過廣泛加密缺陷外洩

目錄

您可能想知道

• 單一設計選擇是否可能讓攻擊者閱讀不同 AI 模型之間已加密的內部推理?

• 如果內部推理痕跡被解碼,可能會暴露哪些類型的敏感資料?

主要議題

安全研究人員最近示範了數家領先 AI 提供者在加密內部推理痕跡的架構選擇上存在的共同問題,該問題可被利用來還原隱藏的「思路鏈」資料。受影響的系統(由多家大型公司部署)會加密中間推理區塊(模型在產生最終答案前使用的內部逐步草稿)。提供者沒有把每個加密區塊綁定到唯一使用者、會話或模型,而是使用單一的提供者範圍金鑰。這個全域金鑰使得加密的推理區塊在提供者生態系內的不同會話和模型之間能互通。

研究人員蒐集了數千份由開發者在公開程式碼庫分享的公開可得會話逐字稿與代理日誌。透過解碼數十萬個加密推理區塊,他們還原出數百項敏感資料與憑證。結果包括即時的 API 金鑰、明文密碼以及僅出現在加密內部痕跡中(而非使用者通常可見的輸出中)的個人電子郵件地址。

這個漏洞屬於架構性問題。當加密推理區塊沒有被嚴格綁定到單一會話或模型實例時,就有可能將該區塊重放或注入到缺乏相同安全功能的不同模型實例中。例如,一個具有強力防蒸餾保護的高能力模型可以產生一個加密的推理令牌;該加密令牌可以被放入沒有相同保護的較弱同族模型中。當以適當提示觸發時,較弱的模型可能會被誘導以明文輸出解碼後的推理,實際上洩露了原始模型的隱藏內部思路鏈。

這項關鍵的架構錯誤——在整個提供者生態系中使用單一加密金鑰——直接使得加密推理的跨模型可移植性與隨後的敏感資料抽取成為可能。 此攻擊僅需標準 API 存取;不需要特權或非標準介面。相同技術已在多個提供者家族中被複現,顯示這是系統性設計弱點,而非個別錯誤。

為了量化此問題,研究人員擷取了數千份公開張貼的代理逐字稿與開發日誌。從這些來源他們解碼了數十萬個推理區塊並回收大量憑證與可識別個人身分的資訊(PII)項目。許多開發者習慣性地發布會話日誌以便除錯或協作;然而,由於那些日誌經常包含加密的推理痕跡,他們無意間暴露了僅出現在加密部分中的敏感內容。

其影響超越簡單的憑證竊取。從該漏洞可產生四種值得注意的攻擊向量:第一,從共享日誌中擷取憑證與 PII;第二,類似蒸餾的智慧財產(IP)竊取,競爭者可以學習專有的推理模式並加以模仿;第三,隱形提示注入——惡意指令可以隱藏在加密區塊中,因此逃避典型監控工具的檢測;第四,透過將加密痕跡送至較弱模型並誘導明文輸出,間接繞過強模型防護以實現越獄。

在收到研究團隊的負責揭露後,受影響的提供者已實施伺服器端緩解措施以防止進一步被利用。這些修補透過改變加密推理痕跡的綁定與管理方式來處理架構曝露。然而,已被擷取並從公開網站存檔的歷史會話日誌保留了解碼內容,一旦分享就無法追溯地保護。研究人員強調,雖然即時修補可阻止新的濫用,但已發布的資料在存在解碼副本的地方仍可被讀取。

總而言之,該研究突顯出一項表面上有保護作用的措施——加密內部推理痕跡——如果以全域金鑰且未做會話或使用者層級綁定來實施,可能會成為風險源。它展示了需要採用嚴格將加密綁定到上下文(使用者、會話、模型)的做法,以及提高開發者對共享日誌中內部痕跡潛在敏感性的認知之重要性。

重點摘要表

面向 描述
漏洞性質 提供者範圍的加密金鑰允許推理區塊在會話和模型之間可攜帶。
回收資料 研究人員解碼了數十萬個推理區塊並回收憑證、密碼與 PII 項目。
攻擊向量 憑證竊取、IP 蒸餾、隱形提示注入與跨模型越獄。
所需存取 標準 API 存取——執行攻擊無需特權存取。
緩解 伺服器端補丁將加密痕跡綁定到特定上下文;歷史上被公開擷取的日誌仍然暴露。

後續...

展望未來,若干技術與營運面向值得關注。首先,中間模型狀態的加密設計應採用將密鑰強力綁定到會話、使用者與模型身份的做法以防止可攜性。其次,提供者應在非必要時盡量減少內部推理痕跡的持久保存與對外傳送。第三,開發者與研究社群應將共享的代理逐字稿與日誌視為可能的敏感項目,避免在未充分編輯下公開發佈。

在營運層面,加強開發者教育與預設工具自動在上傳前編輯或隔離內部推理,能降低意外暴露風險。從研究角度,探索將 AEAD(具有關聯資料的認證加密)綁定到會話特定元資料或採用每會話臨時金鑰等密碼技術,可在不犧牲可用性的情況下提供嚴謹保護。此外,能偵測異常跨模型行為與可能解碼嘗試的稽核與監控工具,也可進一步減輕濫用風險。

該事件凸顯了模型內省(對除錯與模型改進有用)與保護中間內部狀態需求之間的張力。彌合此差距需要提供者、研究人員與開發者社群之間的合作,共同建立在創新與安全之間保持平衡的最佳實務。

最後編輯時間:2026/8/13

數字匠人

閒散過客