Anthropic 的 Claude 在電腦檢查下形式化費馬大定理:有史以來最長的電腦檢查證明
目錄
你可能想知道的事
• 一個 AI 如何能在如此短的時間內完成費馬大定理的完全電腦驗證形式化證明?
• 一個包含 1,300 萬行、可機器檢查的證明對數學實務意味著什麼?
主要主題
於 2026 年 9 月,Anthropic 報告其 Claude AI 在大約 11 天內產生了費馬大定理的完整形式化、電腦檢查證明。這一成果之所以非凡,主要在於輸出是一個完整、可由證明助理逐行檢查的機器可驗證版本,將 Andrew Wiles 於 1995 年的著名證明翻譯成形式化的證明語言。成品中的每一個推理都能根據系統使用的公理與邏輯規則被機械化地驗證,而不僅僅依賴人類的同行審查。
費馬大定理於 1637 年提出,主張不存在三個正整數 a、b、c 能在指數 n 大於 2 的情況下滿足 a^n + b^n = c^n。皮埃爾·德·費馬曾宣稱自己有證明但未留可用手稿,該定理直到 Andrew Wiles 在修正與 Richard Taylor 的初步努力後於 1995 年發表正確的 129 頁證明才被解決。Wiles 的論證依賴於費馬時代不存在的現代工具,因此大多數研究者懷疑費馬所謂的簡單證明。
將人類撰寫的證明翻譯到像 Lean 這樣的形式系統,需耗費大量心力把每一個定義、引理與推理重新以機器可檢查的語法表達。傳統數學論述常會省略例行步驟、訴諸標準結果或使用對人類清楚但對證明助理而言模糊或不完整的簡潔高階推理。形式化透過要求對每一個邏輯轉換提供明確且可驗證的步驟,消除了這種模糊性。
Claude 的計劃產生了約 1,300 萬行的形式化證明代碼,據報涵蓋超過 30,000 個輔助定理,並生成一個大小遠超過數學家使用的既有共享函式庫的作品集。Anthropic 描述了一個多代理工作流程,許多 Claude 代理平行工作以建立定義、證明中介引理,並將這些部分組裝成更大的結構。一個名為 Prove2Me 的協調工具提供同步的待辦清單並組織檔案,使代理不會重複努力或遺失先前結果。
代理工作流程的早期迭代經常遇到失敗:代理重複工作、丟失上下文或產生不一致的產物。據報約 7% 的最終行數反映了那些錯誤的起步。協調層與中介結果的系統性英文註解使得可重用並減少冗餘的證明嘗試,從而讓系統有效擴展形式化工作量。
Claude 的最終輸出並非新的數學發現,而是 Wiles 先前結果的一個完整、確定性的、可機器檢查的編碼。Kevin Buzzard(在帝國理工學院領導一個人力進行的 Lean 形式化 Wiles 證明計劃的數學家)審查了 Claude 的輸出並確認它在接受的數學公理下確立了該定理。Buzzard 的持續人力專案始於 2024 年,並獲得資助至 2029 年;Claude 的自動化努力則在更短時間內完成了形式化。
製作證明與驗證證明之間的差異很重要。數學正確性建立於每一個邏輯步驟;人類撰寫的證明可能隱含微妙的缺口,需後來的審查者仔細檢視。形式化建立了一個證明助理可根據所選基礎公理認證為正確的記錄。對於大型、複雜的定理而言,形式化能提供比僅有人類審核更強的保證,避免被忽略的推理或隱含假設。
歷史例子顯示在沒有形式化的情況下,驗證可能既緩慢又具爭議性。電腦輔助證明如開普勒猜想,以及像 Perelman 對龐加萊猜想的複雜人類論證,都花了多年時間讓社群對其正確性建立起信心。可機器檢查的證明透過使每一步明確且可機械驗證,減輕了人類審查者的負擔,儘管形式化的證明仍需仔細審視所作的形式化選擇(定義、函式庫與編碼)。
Anthropic 將這個 1,300 萬行的形式化公開發佈(例如在 GitHub 上),因此任何數學家都可以詳細檢視該作品。該產物的規模——相當於數百本內容密集的常規書籍——凸顯了形式系統所要求的細緻程度與人類審查的實務挑戰。研究者與實務者現在可以檢查完整的形式化痕跡、本地重現檢查,並探索形式化開發的組織與相依關係。
從實務角度來看,Claude 的成就顯示結合現代 AI 系統與協調工具與證明助理生態系的精細工程,能在大規模上執行冗長的形式化任務。對數學社群而言,這暗示了用於驗證大型結果的新工作流程、加快證明助理函式庫開發、並促成可複製的機器檢查數學。對 AI 研究而言,此事件突顯了平行代理化、工具化與人類監督的結合,使大型形式化努力可行。
重點洞見表
| 面向 | 說明 |
|---|---|
| 關鍵事實 1 | Claude 在約 11 天內產生了費馬大定理的完全形式化、機器檢查證明。 |
| 關鍵事實 2 | 該形式化約為 1,300 萬行並包含超過 30,000 個輔助定理,其規模超過許多現有函式庫。 |
| 關鍵事實 3 | 協調的多代理工作流程與工具(Prove2Me)協助管理平行工作並減少重複。 |
| 關鍵事實 4 | Kevin Buzzard 與其他人已驗證該形式化遵循被接受的公理;輸出已公開供檢視。 |
後續...
眼前的結論是,自動化形式化現在在過去被認為難以企及的規模上已可行。展望未來,數學與更廣泛的科學社群應探索若干方向:改進證明助理函式庫以減少形式化負擔;為混合人–AI 團隊開發健全的協調框架;以及建立發佈和審查機器檢查證明的最佳實務。
進一步的技術進展可著重於降低形式化編碼的冗長性、增強不同證明助理間的互操作性,以及創造更高階的抽象,讓數學家能在保持機器可驗證性的同時更簡潔地表達論證。從社會與制度角度,期刊、資助機構與研究團隊可能需要調整規範與基礎設施,以處理機器檢查產物——包括學術歸屬與形式化函式庫的長期維護。
最終,形式化證明的價值在於其可重複性與清晰性:它們使假設明確、啟用自動化驗證,並建立可被無限次重檢的產物。隨著工具與實務改進,形式化可能成為傳統數學論述的常規補充,提升複雜結果的可靠性並擴大可複製、可驗證數學的可及性。