Anthropic 執行長提出具體步驟以「為 AI 研發設定節奏」
目錄
你可能想知道的事
協調式的節奏控制與獨立評估,能否在不停止有益進展的情況下,降低災難性 AI 風險?
政府與企業現在可以採取哪些實際步驟,以確保強大 AI 系統的更安全開發?
主要議題
對人工智慧快速進展的擔憂在研究社群與科技領袖間越來越強烈。Anthropic 執行長 Dario Amodei 在最近的一篇公開文章中,呼應了「為 AI 研發設定節奏」的呼籲,並概述了三項大致策略,旨在放緩能力增長至能夠允許更完善的安全工作與監督的程度。他並宣布 Anthropic 將單方面採用其中一項做法,並敦促其他人跟進。
Amodei 指出近期發展促成了他更謹慎立場的動機。一個直接原因是涉及協作系統的安全事件,這引發了是否有一致地通報與處理事件的疑問。更廣泛地說,他強調 AI 能力在最近幾個月進展得更快,特別是在使模型能夠參與設計或構建未來模型的領域。綜合來看,這些趨勢顯示能力進展可能超前於我們評估與減輕危害能力的風險增加。
為了解決這些擔憂,Amodei 提出三項互補策略。第一項集中在使用第三方嵌入式評估者──獨立組織被安置在 AI 開發團隊內,以驗證公司是否遵守節奏與安全承諾,並確保安全相關事件被通報。比較的模式不是監管距離,而是嵌入式的監督關係,類似於某些金融監管機構歷史上與銀行人員共同駐點以直接觀察風險流程的做法。Amodei 建議這些評估者獲得大致相當於內部風險團隊的存取權──公司證件、辦公桌與工具──但須受法律或契約限制。
第二項策略要求民主國家的領先 AI 企業之間進行協調,建立共享的安全標準並限制無控的能力增長速度。Amodei 承認此類協調面臨實際障礙,包括競爭緊張與反壟斷的顧慮。為了減輕這些摩擦,他提出有限的政府角色:促成或調解以安全為重點的討論,並發出狹義的反壟斷豁免,以允許某些安全對話在不造成更廣泛反競爭風險的前提下進行。
第三項策略強調國際參與與更廣泛的全球協調需求。在承認地緣政治競爭所施加的實際限制——特別是涉及中國——的同時,Amodei 主張協調性的出口管制、對某些可促成技術與工具的限制,以及遏止模型精簡(model distillation)的措施,可以放緩競爭性升級並為安全工作爭取時間。他將此表述為對高風險用途(例如禁止以 AI 協助開發生物武器)在具體定義範圍內尋求合作協議的一種不完美但必要的嘗試。
Amodei 強調,設定節奏不等於停止創新。 他主張,以創造可被利用的時間來放慢能力改進的速度,使得安全研究與監督能夠進行,反而可以維持 AI 長遠改善人類福祉的承諾。他重申自己仍相信 AI 能帶來巨大的社會利益,但堅稱那些利益需要謹慎且深思熟慮的開發選擇。
該提議引起了不同反應。一些研究人員與評論者對於不受控制的 AI 進展可能帶來的嚴重後果表示警惕,並歡迎更強的監督與合作措施。其他批評者質疑這些提議的實際性,對第三方嵌入是否有效、協調是否在法律或政治上可行,以及此類措施是否可能鞏固最大企業的地位表示懷疑——這種結果有時被稱為監管俘獲。
在圍繞這些想法的公開討論中,也浮現了顯著的內部分歧。至少有一名研究人員因擔心業界對生存性風險太過輕率而離開一家大型 AI 實驗室;Amodei 的文章沒有特別點名該辭職案,但明確引用了近期事件與加速的能力增長作為採取行動的理由。觀察者也注意到透明度、商業機密與國家安全之間的緊張,這使得獨立評估者或外國夥伴能被授予多少存取權變得複雜。
Amodei 直接承認這些複雜性。他提出務實步驟——例如為安全對話提供狹義的反壟斷豁免、對專用晶片與半導體生產設備實施出口管制、以及限制特別危險的 AI 用途——而不是廣泛的單方面限制。他將自己的建議表述為私部門承諾與政府促成框架的混合,這些措施合力可在仍允許有益創新的情況下降低災難性結果的機率。
討論也凸顯了更深層的公共信任問題。Amodei 將當前時刻描述為「根本上是一場信任危機」,對科技公司與政府機構的懷疑削弱了對塑造 AI 發展的制度的信心。對許多人而言,可信的第三方監督與明確且可執行的安全標準,是重建該信任的先決條件。
批評者認為,將 AI 風險以末日式框架呈現,可能會使人忽視該技術已在產生的更直接、具體的危害——例如錯誤資訊、隱私侵蝕與勞動力衝擊。另有人擔憂,放慢能力增長的提議可能無意間有利於較有能力承擔監管成本的既有企業。平衡這些權衡需要謹慎的政策設計與透明的利害相關者參與。
最終,Amodei 對「為前沿設定節奏」的呼籲旨在尋求中間道路:在保留創新途徑的同時,有意識地創造空間以改進安全研究、對齊與治理。他的具體提案是否會被採納、改編或拒絕仍未可知,但這些建議已經促使關於如何管理強大且快速演進技術的持續辯論更為明確。
關鍵見解表
| 面向 | 說明 |
|---|---|
| 關鍵事實 1 | 第三方嵌入式評估者可以驗證安全承諾與事件通報。 |
| 關鍵事實 2 | 民主國家與企業之間的協調可制定共享的安全標準並限制無控的進展。 |
後續...
展望未來,為使任何節奏策略可行,若干技術與治理領域值得進一步探索。強化獨立評估能力、改進可證明安全性與模型可解釋性技術,以及推進安全的模型測試方法,是當務之急。政府應完善法律工具——例如範圍狹義的反壟斷豁免與針對性的出口管制——以促成以安全為核心的協調,同時避免產生不當誘因。國際外交對於就高風險 AI 用途達成有限但有意義的協議也至關重要,即便此類協議必然是逐步的。
更廣泛地說,投資於強健的透明機制與非營利導向的公共利益研究,可能有助於重建公眾、產業與監管機構之間的信任。如果利害關係人明智地利用透過刻意節奏所獲得的額外時間——透過加強治理、擴展安全研究與改進驗證方法——則可以在較少災難性風險的情況下追求 AI 的長期利益。
這些步驟不會容易,且將需要艱難的取捨,但它們提供了一條務實的道路,以在降低嚴重意外後果機率的同時,駕馭 AI 的潛力。