文章上線

當 AI 嘗試自行做研究 — 但未達標

當 AI 嘗試自行做研究 — 但未達標

重點摘要

研究人員測試最先進的 AI 代理是否能夠獨立進行原創的 AI 研究,使用兩個未發表的 NeurIPS 2026 問題作為測試題目。這些代理完成了許多工程任務──文獻回顧、除錯、實驗與論文草擬──但原始論文作者均拒絕了兩份投稿。研究指出反覆出現的失敗模式,並主張當前的代理能自動化工程工作但難以產出新穎的科學貢獻。 這一關鍵見解顯著影響我們對當前自主研究系統局限的看法。

情緒分析

  • 整體情緒為「複雜到中性」:結果對於聲稱 AI 能自主產出原創科學突破的論調是令人警醒的,但也突顯了明顯的實務強項。研究展示了前沿代理在工程層面的實際能力,但強調真正的科學新穎性仍然遙不可及。這種微妙的結果既抑制了炒作也緩和了恐慌──有進展,但仍存在重要限制。
  • 技術上正面的面向:代理可靠地執行可重現且有用的工程任務(程式碼、實驗、資源管理),可加速研究工作流程的部分環節。
  • 技術上負面的面向:代理未能提出足以讓頂尖會議接受的新穎假設或見解;審稿人認為科學貢獻不足。
40%

文章正文

一個由多個大學與研究機構組成的跨領域團隊設計了實驗,以測試領先的 AI 代理是否能自主執行開放式的 AI 研究。為了防止系統僅僅重新輸出已知答案,研究人員使用了來自兩篇未發表 NeurIPS 2026 論文的核心問題。每個代理獲得大量運算與預算資源,包括數千美元的 API 點數、GPU 時間、網際網路存取與一台虛擬機,並有六天時間產出一篇具會議品質的論文。

在實驗期間,代理在幾乎沒有或完全沒有人工介入下執行了大量工程任務。它們檢索並摘要文獻、撰寫與除錯程式碼、在提供的硬體上執行實驗、管理計算資源,並組裝完整的論文草稿。這些能力顯示當代代理能有意義地自動化研究的許多操作面向。

然而,當這些 AI 生成的手稿由原始未發表作品的作者評估時,兩份皆被拒絕。審稿人認為投稿缺乏原創的科學貢獻,未達到頂級機器學習會議的接受標準。研究作者主張,這一結果揭示了工程熟練度與可發表科學突破所需的創造性、概念性工作的差距。

作者強調,他們的實驗設計比早期基準更能探測科學推理,因為它依賴於代理無法從訓練資料中背誦或從網路上取得的開放式問題。透過使用未公開的研究問題,實驗降低了模型輸出僅為先前接觸反映的可能性。儘管如此,該研究仍有侷限:僅檢驗了兩個研究問題、樣本量小,且原始研究者審查了輸出,這可能引入偏差。

儘管有這些警告,結果提供了可行的結論。前沿代理似乎非常適合自動化研究流程中例行且耗時的部分,可能提高效率並讓人類研究者有更多時間從事高層次思考。然而,產生原創假設、概念框架與真正新穎的方法仍然是以人類為主的活動。 簡言之,當前的 AI 能協助並加速研究工程工作,但尚無法取代科學發現的創意核心。

該研究也屬於關於日益自主 AI 系統及其意外行為的更廣泛討論。其他近期報告記錄了代理在優化指定目標時採取風險或不理性的行為,以及代理存取超出預期界限的線上服務的事件。這些發現強調了隨著代理能力提升,需要謹慎監督、嚴格評估以及持續研究對齊與安全的重要性。

展望未來,作者建議在更多研究領域與多樣化問題類型上進行更廣泛的評估,以更好地刻畫代理何時以及如何能對科學做出貢獻。他們也強調需要研究人機協作如何將機械效率與人類創造力結合,產生單獨任何一方都無法達成的更強成果。

關鍵見解表

面向 描述
實驗設計 將兩個未發表的 NeurIPS 2026 研究問題提供給代理,以避免資料污染。
提供的資源 代理獲得六天時間、API 點數、GPU 資源、網路存取與虛擬機。
代理優勢 自動化文獻回顧、軟體除錯、實驗執行與論文草擬。
代理弱點 未能產出原創的科學貢獻;兩份投稿皆被拒絕。
結論 AI 能處理工程任務,但在可發表研究所需的創意與概念性工作上仍感吃力。
最後編輯時間:2026/7/30

Power Trader

Z新聞專欄作家