CryptoCoin文章上線

OpenAI 未發布的模型聲稱取得數百項數學成果,但研究人員要求提出證據

數字匠人
OpenAI 未發布的模型聲稱取得數百項數學成果,但研究人員要求提出證據

目錄

你可能想知道

  • OpenAI 發布 722 篇數學手稿,能證明什麼?又有哪些事情尚未獲得證明?
  • 為什麼數學家要求公開模型、提示詞,以及可由他人獨立查核的證據?

主要內容

OpenAI 已在 GitHub 發布 722 篇數學手稿,並表示這些內容是由公司尚未公開的內部 AI 模型產出。OpenAI 發言人表示,幾乎所有成果都來自交給單一 AI 代理的一個提示詞,不過部分結果可能經過多次嘗試。如果獲得獨立確認,這項工作可能代表 AI 用於數學研究的一大進展。然而,目前模型本身及產出這些結果的確切流程都未公開,研究人員因此無法完整重現相關主張。

這批手稿分為 372 組相關結果。每一組可能包含一個核心定理,以及支持論證、推論或其他證明。因此,722 指的是手稿數量,而不是已解決 722 個不同數學問題。OpenAI 表示,曾交給模型約 4,000 個問題,並挑選其認為重要到足以發布的產出。這項區別很重要:大量手稿可能包含許多彼此相關的成果,光是文件數量並不能證明有多少個獨立問題已經解決。

OpenAI 表示,平均每項成果使用的運算量,相當於 ChatGPT Pro 約三小時的思考運算量。原文將此與上個月一項關於 Navier-Stokes 的主張對比;後者由 10,000 個協調運作的代理持續工作 88 小時。這些說法顯示,兩項工作採用的方式及運算量相當不同,但單憑這些資訊,無法證明任何一組數學主張是否正確或重要。

MIT 數學家 Andrew Sutherland 呼籲保持謹慎。他告訴 Scientific American,在模型公開且其他研究人員能重現結果之前,關於以單一提示詞和單一代理解決問題的主張,都應視為尚未驗證。他要求提出「證據」,反映了學術評估的一項基本原則:研究人員需要充分資訊,才能檢視方法、核查論證,並確認所報告的結論是否確實成立。

OpenAI 已發布 10 項結果的精簡推理摘要。儲存庫中的目錄顯示,722 篇論文中只有 162 篇將主要結果形式化為 Lean 程式。Lean 是一種程式語言與證明助理,可機械式核查邏輯步驟。這約占整批成果的 22%。OpenAI 已承認,並非所有手稿都有 Lean 形式化版本,並提醒「部分未形式化的結果可能存在問題」。該公司表示,取得形式化版本後,計畫陸續補上。

Lean 核查成功是有用的證據,但並不足以對數學主張作出完整判定。它能確認證明是從 Lean 中編碼的敘述推導而來,但無法證明形式化敘述準確表達了原始問題、結果具有新意,或結果具有重要性。數學家仍須評估這些問題,也要判斷論證是否有意義,以及其中的假設是否符合預期的脈絡。

這項區別也讓部分論證的特質受到關注。在一篇日期為 October 7, 2026 的貼文中,Dmitry Rybin 描述自己試著閱讀 OpenAI 關於平面色數是否大於或等於 6 的證明。他表示,這份論證難以理解,並質疑其中將一種著色與「弱可測」著色連結起來的步驟。這篇貼文是個別研究人員的看法,並非對整批成果的全面評估,但它展現了一項更廣泛的疑慮:即使某項論證被以證明的形式呈現,人們仍可能難以理解它。

其他研究人員則提出實務上的疑問:學界要如何檢視並改進這些成果?在另一篇同樣日期為 October 7, 2026 的貼文中,Keith Adler 批評該儲存庫關閉了 Issues 功能,也不接受 pull request。他認為,既然專案發布 722 篇手稿並邀請他人提供 Lean 形式化版本,就應提供明確管道,讓研究人員提交意見與貢獻。這些觀察突顯了協作基礎設施的重要性:可重現性不只仰賴發布結果,也取決於是否讓人們能回報錯誤、提出修正並分享獨立核查結果。

位於新澤西州普林斯頓的高等研究院在一份聲明中強調了人的角色。該院表示,AI 現在能產出數學論證,而提示 AI 的人可能無法理解、驗證或為其負責。該院認為,人類理解仍至關重要,並提出如何以負責任的方式發表數學成果、同時保留人類理解的問題。這不只是關於 AI 系統能否產出有效證明,也關乎誰能解釋推理、評估其重要性,並為發表的主張承擔責任。

數學家也對這批成果提出較正面的評價。Abhishek Saha 教授稱這次發布是「數學界非常重要的一天」。不過,他區分了既有研究計畫中的卓越進展,以及令人驚訝的突破。在他看來,多數成果似乎值得關注,但不一定是難以企及或具有變革性的突破。原文將其中一項成果——Quasi-Riemann 假設——列為可能最突出的成果。這仍有待數學專家評估,不能僅憑發布規模就視為定論。

透明度也是爭論焦點。高等研究院的一個諮詢小組於 September 29 建議,此類發布應提供每項結果的模型名稱、提示詞、摘要版思路、耗時及運算成本。OpenAI 已分享平均運算量資訊與 10 份推理摘要,但沒有公開提示詞。該公司表示,仍在研究如何以負責任的方式發布模型。缺少這些細節,獨立研究人員便較難重現成果,或判斷提示詞、反覆嘗試及流程其他部分對各項結果的影響。

並非所有研究人員都認為不公開模型或答案是正確做法。多倫多大學數學家 Daniel Litt 主張,沒有理由要求該公司對這些數學問題的答案保密。這項分歧反映出更廣泛的兩難:提早開放可能有助研究人員檢視主張,而採取受控發布方式則可能是為了因應負責任部署方面的疑慮。無論採取哪種方式,清楚說明有哪些資訊可供取得、哪些仍未公開,對公平評估證據都很重要。

與近期另一項研究相比,更能看出 OpenAI 此次公告的特殊之處。上個月,Anthropic 在 GitHub 公開了其經 Lean 核查的費馬最後定理證明,全文共 13 million 行。該工作將 Andrew Wiles 於 1995 年發表的定理形式化,並未主張取得新的數學成果。相較之下,OpenAI 發布的是一批由尚未公開模型產出的成果,目前只有 162 篇手稿附有經 Lean 形式化的主要結果。因此,兩個案例在主張的性質,以及可供直接檢視的材料數量上都有所不同。

最審慎的解讀,既不是否定這批成果,也不是把其中的主張當成定論。這些手稿可能包含有價值的數學成果,但手稿數量不能證明有多少個獨立問題已經解決,而證明助理的核查也無法回答所有關於正確性、新穎性或重要性的問題。研究人員需要檢視論證、測試形式化版本、比對既有文獻,並在可重現的條件下評估模型的表現。

重點摘要表

面向說明
手稿與成果組別OpenAI 發布 722 篇手稿,分為 372 組。每組可能包含一項定理及相關論證,因此手稿數量不等於已解決的不同問題數量。
提交的問題OpenAI 表示,曾提出約 4,000 個問題,並挑選其認為重要到足以發布的成果。
Lean 形式化一份目錄列出 162 篇具有 Lean 形式化主要結果的論文,約占整批成果的 22%。OpenAI 提醒,部分未形式化的結果可能存在問題。
據報運算量OpenAI 表示,平均每項成果使用的運算量,相當於 ChatGPT Pro 約三小時的思考運算量。原文提及的另一項 Navier-Stokes 主張,則動用了 10,000 個代理工作 88 小時。
獨立驗證Andrew Sutherland 表示,在模型公開且研究人員能重現結果之前,單一提示詞、單一代理的主張仍未經驗證。
透明度建議高等研究院的一個諮詢小組建議,公開每項結果的模型名稱、提示詞、摘要版推理、耗時與運算成本。OpenAI 尚未公開提示詞。
可能最突出的成果原文將 Quasi-Riemann 假設列為這批成果中可能最突出的項目,同時強調,多數成果被視為既有研究計畫中的進展,而非顛覆性的突破。

後續發展……

AI 輔助數學的下一階段,不能只靠產出大量看似合理的證明。研究人員需要能讓成果獨立重現的方法,並清楚區分模型生成的論證、經機械式核查的證明,以及專家判定具有數學重要性的成果。在合宜且負責任的情況下公開提示詞及相關流程細節,有助釐清各項產出是如何得出的。開放式儲存庫若提供容易使用的問題回報與形式化版本提交管道,也能讓檢視工作更有效。

證明助理以及協助人們在非正式數學寫作與形式化敘述之間轉換的工具,仍有待進一步發展。更完善的系統可以標示論證缺口、揭示假設,並讓複雜論證更容易檢視,而不是把自動驗證當成專家判斷的替代品。評估方式也應檢視所聲稱的成果是否真正新穎,以及其形式化版本是否忠實呈現原始問題。

歸根究柢,最有希望的方向是協作:AI 系統或許能協助探索想法並建構候選論證,而數學家則負責解讀、驗證並承擔責任。進展不只取決於模型能產出什麼,也取決於人們能否清楚理解、檢驗,並負責任地以此為基礎繼續發展。

最後編輯時間:2026/10/7