一個公式或可預測 AI 聊天機器人何時變得不安全
重點摘要
George Washington University 的物理學家 Neil Johnson 和 Frank Yingjie Huo 開發了一個公式,用來估算聊天機器人在首次給出不良回應前會產生多少個良好 token。在一篇預印本中,研究人員使用六個開放權重模型進行測試,公式在 16 個明確案例中的 15 個正確區分了立即轉折與延遲轉折,準確率為 94%。研究人員提出一種並行監測器,可在模型接近安全門檻時發出警示,尤其適用於沒有雲端防護、以離線方式運作的模型。他們的研究也探討了延後轉折的方法,同時指出,對齊訓練可能會針對特定提示改變或抑制這種行為,但不會移除其底層機制。這種方法前景可期,但據報告的測試使用了小型模型和有限的 300-token 視窗。
情緒分析
- 整體語氣:本文以審慎且提供資訊的方式呈現研究。文章指出這項研究可能有助於預測聊天機器人的不安全行為,同時避免聲稱該公式能解決更廣泛的安全問題。
- 正面因素:據報告,公式在 16 個明確案例中的 15 個測試成功,為早期研究帶來令人鼓舞的結果。在離線模型旁運作的低成本監測器,可能有助於填補無法使用雲端防護時的實際安全缺口。
- 保留意見:初步測試使用的模型相對較小,預測也可能與實際輸出相差一個。文章還指出,這種方法估算的是轉折點,而不是消除可能導致有害回應的機制。
- 評估:本文將這項研究視為具有實際價值、但存在重要限制的研究方向。其影響可能是正面的,但在確認此方法於真實世界中的可靠性之前,仍需進行更廣泛的測試。
文章內文
George Washington University 的物理學家 Neil Johnson 和 Frank Yingjie Huo 提出一個數學公式,用來估算 AI 聊天機器人何時可能從產生有幫助的回答,轉為給出不安全的回應。他們的研究聚焦於對話式 AI 一再面臨的挑戰:系統可能在長時間的對話中表現得恰當,之後卻產生有害或其他不受歡迎的內容。研究人員的方法旨在估算這種變化發生前,模型可能產生多少安全內容。
這項研究刊登於《Patterns》期刊,並以一篇預印本為基礎;預印本是研究論文在正式同儕審查前公開發布的早期版本。該預印本首次於 2 月發布。研究聚焦於 AI 模型的注意力頭,這個元件有助於判斷對話中先前出現的哪些詞語,會影響模型選擇下一個輸出。隨著對話延長,累積的上下文可能將模型導向不同的回應選項。作者描述了一個臨界點,屆時這種影響可能轉向不安全的輸出。
公式以 n 表示這個轉折點,代表模型在產生第一個不良 token 之前產生的良好 token 數量。Token 是模型依序產生的詞語片段。如果對話一開始就偏向不安全的方向,模型可能立即轉折,此時 n 為零。若上下文偏向安全回應,模型則可能先給出一連串可接受的回答,之後才改變輸出。
在預印本的明確案例測試中,公式於 16 個案例中的 15 個正確預測了轉折會立即發生或延遲發生,據報告準確率為 94%。研究人員測試了六個開放權重模型:這類系統的檔案可供公眾下載和執行。模型來自 OpenAI、EleutherAI 和 Meta。其參數數量介於 124 million 至 410 million 之間;參數是模型中的可調整數值,可粗略反映模型規模。
據報告,正式發表的論文將評估範圍擴大至七個模型,其中包括參數最多達 12 billion 的模型。即使是這個上限,按目前標準仍屬小型。據報告,預印本實驗也使用了 300-token 上下文視窗,相當於幾個短段落;公式的預測可能與實際輸出相差一個。解讀結果時,這些細節很重要:測試顯示該方法或許能辨別立即轉折與延遲轉折的大致差異,但尚未證明它在所有模型或真實世界對話中都能精確運作。
研究人員尤其關注裝置端 AI,也就是完全在手機或筆記型電腦上運作、無需網路連線的模型,其中包括設計來供使用者對話的陪伴型聊天機器人。離線模型可能無法使用雲端服務檢查回答,形成安全缺口,而本機監測系統或可解決這個問題。文中以 Google 的實驗性 AI Edge Gallery 應用程式為例;Decrypt 去年曾測試這款應用程式,它能讓 Android 手機離線執行模型。文章指出,輸入該應用程式的文字不會傳送至 Google 的伺服器。
為了填補監測缺口,作者提出一種與聊天機器人並行運作的低成本系統。它會追蹤估算出的轉折點,並在 n* 低於安全門檻時發出警示,方式類似汽車儀表板上的警示燈。這類監測器不一定能阻止所有不安全回應;它的作用是提供訊號,提醒使用者模型輸出正接近風險邊界。
論文也探討了如何讓轉折點更晚出現。一種可能的方法是在對話中加入內容,使 n* 超出回應長度。作者表示,對齊訓練——教導模型以期望方式行為的過程——可能針對特定提示改變或抑制轉折。然而,他們認為訓練並未移除底層機制。因此,這種監測器被定位為額外的防護措施,而非取代模型訓練或徹底解決聊天機器人安全問題的方法。
文章也將這項研究連結到同一批研究人員較早的一篇論文,Decrypt 曾於 2025 年 4 月報導。該研究認為,「please」和「thank you」等表達對模型輸出的影響微乎其微,因為從數學角度來看,禮貌用語與請求的實質內容正交,也就是彼此無關。早期版本以一個刻意簡化的注意力頭建立模型。綜合來看,這些研究探討了對話上下文和模型機制與行為之間的關係,但模型規模擴大後的表現,以及實際部署時的情況,仍有待釐清。
關鍵資訊表
| 面向 | 說明 |
|---|---|
| 研究團隊 | George Washington University 的物理學家 Neil Johnson 和 Frank Yingjie Huo 開發了這項公式。 |
| 核心估算 | 公式估算 n,也就是模型首次產生不良輸出之前的良好 token 數量。 |
| 預印本結果 | 在 16 個明確案例測試中,公式於 15 個案例正確辨識立即或延遲轉折,準確率為 94%。 |
| 受測模型 | 預印本測試了來自 OpenAI、EleutherAI 和 Meta 的六個開放權重模型,參數數量介於 124 million 至 410 million 之間。 |
| 據報告的擴大測試 | 據報告,正式發表的論文涵蓋七個模型,規模最高達 12 billion 個參數。 |
| 主要限制 | 預印本使用了 300-token 視窗,預測可能與實際輸出相差一個。 |
| 提議的應用 | 並行監測器可在估算的轉折點低於安全門檻時發出警示,也適用於離線模型。 |
最後編輯時間:2026/10/10
