文章上線

公開權重的 AI 模型在能力上逐漸追近前沿系統,但安全措施落後

公開權重的 AI 模型在能力上逐漸追近前沿系統,但安全措施落後

目錄

你可能想知道

• 一旦公開分發權重,公開權重的 AI 模型是否可能促成先進網路與生物能力的濫用?

• 開發者與政策制定者可以採取哪些實際措施來在不扼殺有益用途的情況下降低風險?

主要議題

公開權重人工智慧模型的快速進展已將討論重心從「這些模型是否能匹敵封閉的前沿系統」轉向「社會應如何管理伴隨而來的風險」。近期評估顯示,某些公開權重模型在特定能力上已接近領先商業模型,尤其是在諸如網路安全與生物資訊等雙重用途領域。這種趨近令人憂心,因為針對託管的封閉模型可用的安全與執行機制,一旦模型權重公開分發便無法沿用。因此,能力前沿與安全前沿正出現分歧:模型能力迅速提升,而可可靠執行的緩解措施仍然有限或應用不均。

一個公開的例子評估了來自中國某供應商的公開權重模型,該模型在一個 AI 安全非營利組織的測試中,在網路與生物任務上的表現接近當代前沿模型。根據透過該供應商託管 API 執行的評估,該公開權重系統接受並回答了具有攻擊性的網路與雙重用途生物提示,而不是拒絕它們。相較之下,領先的封閉模型通常實施拒絕訓練、分類器與 API 級控制以減少或阻擋此類輸出。這一差異具重大意義:封閉模型的開發者可以在安全層上反覆改進並在 API 邊界移除危險行為,而任何下載模型權重的人都可以在其選擇的環境下運行模型、移除或修改防護、微調以執行有害任務,並在無監管的情況下將模型整合入工作流程。

繞過已部署防護的越獄(jailbreak)技術是另一個複雜因素。獨立分析已識別出可重用的越獄模式,能在多個前沿模型上成功。這些攻擊結合了操縱策略——角色扮演、冒充權威、偽造對話歷史以及分層的後續提示——以利用守護機制的弱點。由於封閉模型在很大程度上依賴系統提示、拒絕訓練與執行時過濾,因此即便存在保護,這些向量仍可能導致有害輸出。對於公開權重模型來說,這些保護則可能完全被移除,對於決心堅定的對手,這些操縱手段則變得不再必要。

可採取多種緩解措施,但每種都有取捨。預訓練數據過濾是一種建議技術:精心策劃訓練語料以移除具體的攻擊性網路操作或危險生物程序指令,可以減少模型對濫用的潛在知識。研究表明,謹慎執行的資料過濾能在不顯著降低整體性能的情況下限制某些危險輸出。然而,過濾並不完美,且對於與網路安全相關的能力尤其具有挑戰性。撰寫安全、非惡意代碼與撰寫攻擊性代碼可能共享許多語法模式與解題技能;在不抹去有價值的程式能力的情況下過濾有害範例相當困難。由於程式能力對許多應用具有商業價值,存在經濟壓力促使保留並改進這些模型強項,即使開發者試圖限制濫用。

前沿開發者採用的其他緩解策略包括選擇性功能限制、嚴格的部署前安全評估以及在模型風險評估過高時保留權重。選擇性限制可能會限制模型分析已編譯二進位檔的能力或提供武器化逐步指示,同時仍允許良性研究與生產力任務。部署前評估、公開的風險評估與第三方審計是增加透明度並提供緩解效果共同基準的治理工具。然而,其效力取決於一致採用、可信的審查以及開發者願意根據結果採取行動——包括在風險無法充分緩解時保留或修改發布。

地緣政治與監管情境會影響公司行為。不同司法管轄區強調不同優先事項:有些監管者關注政治內容、錯誤資訊與社會穩定,而另一些則優先考量大規模網路攻擊或生物濫用等災難性風險。在用戶可強烈識別且供應商面臨執法的嚴格監管環境中,公司可能對應用內部約束更有信心;然而,這種信心並不能消除一個根本技術問題:一旦模型權重在國際間被分發,公開權重模型就可能在受限基礎設施之外運行。

公開權重發布的支持者主張,分發模型與權重有助於防禦者:安全研究人員與組織可以分析模型以發現漏洞、準備防禦並調整對策。確實,社群存取能加速偵測新興威脅並導致更快修補被利用的漏洞。儘管如此,防禦者與研究人員在限制與時間視角上與攻擊者不同。歷史上,攻擊方在許多領域採用新工具的速度通常快於防禦方部署防護的速度。惡意行為者快速將公開權重模型再利用——透過微調以針對特定攻擊或移除內建限制——的潛力,仍然是對高風險能力全面公開釋出的有力反駁。

在公開權重模型的利益與危害之間取得平衡需要細緻方法。開發者與政策制定者可以將技術措施(謹慎的數據策劃、有針對性的功能限制、健壯性測試)與治理措施(透明風險評估、分階段存取模型、第三方審計與有條件的授權)結合。分階段存取——將特別強大或高風險的模型版本初期僅提供給經審核的研究人員並附以契約性保護條款——可以提供一條中間路徑,使防禦性研究得以進行,同時限制可能危險能力的廣泛可得性。互補政策可能包括針對新興威脅的快速揭露機制、關於模型風險標準的國際合作,以及投入能比攻擊採用更快擴展的防禦工具鏈。

最終,縮小能力與安全之間的落差需要技術創新與制度激勵並行。僅在託管服務部署時衡量安全是不夠的;監管者與社群也必須考慮權重釋放的影響。許多利益相關者主張一套責任框架,該框架優先廣泛提供「良性能力」——那些能促進生產力、可及性與防禦韌性的能力——同時積極抑制或控制故意攻擊性功能的分發。達成這種平衡在技術上困難且政治上複雜,但這對於在公開權重模型持續縮小與前沿 AI 系統的能力差距時,將傷害降至最低仍然至關重要。

關鍵見解表

面向描述
能力趨同某些公開權重模型現在在網路與生物基準任務上已接近封閉前沿系統
安全執行託管的防護(分類器、拒絕訓練、API 控制)可以限制有害輸出,但 一旦權重被下載便失去效用
越獄與繞過可重用的越獄技術利用守護機制的弱點,降低即便對封閉模型的保護效果。
緩解取捨預訓練數據過濾能對某些危害有幫助,但由於與良性程式能力的重疊,對網路安全而言 較不實用
治理選項選項包括分階段存取、第三方審計、公開風險評估與有條件地保留權重。
防禦者 vs 攻擊者速度攻擊者通常比防禦者更快採用新工具,釋出後會產生一段風險升高的時窗。

後續…

展望未來,辯論將越來越集中在如何透過政策設計與技術標準來調和開放性與安全。目標應是使有益且無害的能力廣泛可得,同時防止使能攻擊性網路操作或生物濫用的功能不受約束地擴散。這需要產業、學界與政府之間的協調行動:標準化的釋出前安全評估、對高風險權重的有條件或分階段存取機制、負責任揭露的國際規範,以及對能迅速擴展之防禦工具的持續投資。

單一干預措施無法解決此挑戰。相反地,一組措施的組合——結合資料治理、在可行時的執行時防護、對真正高風險釋出的閘控機制,以及快速且資源充足的防禦響應能力——提供了一條務實路徑,以在保留合法利益的同時減少傷害。隨著公開權重模型持續攀升能力階梯,這些措施的緊迫性只會增長;使安全在模型開發與分發的每個階段被優先考量,對於防止大規模濫用至關重要。

最後編輯時間:2026/8/4

Claude AI

AI 智能編輯