Nvidia 顯示:關鍵在於執行框架(harness),而非模型本身,才能讓具代理能力的 AI 成功
重點摘要
Nvidia 近期的研究主張環繞在 AI 模型外的軟體包裝 — harness — 對於長期任務而言至關重要。透過優化記憶處理並加入一個監督元件,研究人員使 Claude Opus 5 在互動推理基準 ARC-AGI-3 上取得 100% 的分數,而裸模型僅達到 30%。研究結果強調,雖然模型選擇很重要,但將模型轉化為有效代理的關鍵在於 harness —— 工具、記憶、執行時環境與協調機制。開放且可調整的 harness 能在部署中提升準確性、安全性與成本效益。
情緒分析
- Nvidia 的研究以正面角度呈現:強調透過改善 harness(而非僅專注於更大或更新的基礎模型)可以實際地大幅提升代理行為。語氣對於可透過工程手段提升表現與控制持樂觀態度。
- 文中帶有謹慎語氣指出風險:長期任務的代理若未妥善管理,可能偏離目標、產生錯誤或行為危險。研究將 harness 視為一種風險緩解機制。
- 整體情緒為正面且偏向解決方案導向,強調改進、透明與使用者控制。正面力度屬中等:此發現重要但並非能完全解決具代理性的風險。
文章內容
Nvidia 最近發表研究,指出包覆在 AI 模型周圍的一層——通常稱為 harness——在長期任務上的成功率上,可能比模型本身更具決定性。harness 包括執行時環境、記憶管理、工具、規則與協調機制,這些使原始語言模型能在多步驟任務中自主行動。在以 Claude Opus 5 為實驗對象的試驗中,Nvidia 研究人員展示出一個精心構建的 harness,該 harness 管理記憶並加入監督元件,使其在互動推理基準 ARC-AGI-3(由不含指令的 2D 遊戲組成,需進行探索與類似人類遊戲的問題解決)上獲得滿分。
在沒有自訂 harness 的情況下,Opus 5 在相同基準上僅達到 30% —— 在未改進 harness 的模型中為最高成績。這巨大的差距支持了這樣一個觀點:模型的內在能力僅是構成有用代理的一部分。harness 決定了上下文與記憶如何在行動間被保存、代理可以調用哪些工具,以及反饋如何被整合進後續行為。
Nvidia AI 單位產品副總裁 Adel El Hallack 將代理描述為不僅是透過 API 暴露的模型。他把代理視為模型與其周圍支架的結合:系統可存取的工具、執行時、技能與程式庫。對於需要串連多項決策、有時跨越較長時間的長期任務而言,這些支架尤為重要,因為代理必須維持一致性、避免分心,並防止有害或無目的的探索。
長期能力仍然是重要的研究挑戰。其他組織的先前工作顯示,當要求模型產生多步驟成果時,模型表現可能退化:例如,一項評估文件編輯任務的研究發現模型在長序列修改中常導致錯誤。在真實世界情境中,協調不佳的代理甚至被觀察到刪除檔案或在嘗試達成目標時採取不可接受的行動。這些失敗模式說明了為何 harness 設計(其施加結構、記憶策略與安全檢查)超越模型基礎智慧而顯得重要。
Nvidia 的部分成就是方法論上的:團隊刻意選擇 ARC-AGI-3,因為高分代表健全的互動推理與探索能力。OpenAI 先前在相同基準上曾觀察到非常低的結果,並報告指出適度的 harness 調整即可將其模型的表現提升三倍 —— 顯示調整 harness 能帶來顯著提升。Nvidia 的工作更進一步:透過加入研究人員形容類似老闆或執行長的監督元素,他們抑制了無目的的探索,並將主要代理從死胡同引離。當主要代理陷入僵局或重複無效策略時,這個監督代理會介入,推動其朝更有成效的路徑前進。
監督代理的概念並非完全新穎,然而許多現有部署仍依賴單層的 harness,例如隨 Claude Code、Codex 或其他代理框架所打包的方案。Nvidia 的實驗性 harness 稱為 Agentic Variation Operators (AVO),它不是商業產品,而是由 Nvidia 在 Nemo 生態系統下提供的開放與商用工具片段組合而成的研究性技術集合。實際上的重點在於:開放且可配置的 harness 元件讓開發者能以封閉且單一的大一統堆疊所無法做到的方式調整行為與除錯失敗情況。
其他業界工作也支持 Nvidia 的主張:例如,Databricks 發表結果顯示 harness 設計會大幅影響營運成本 —— 在相同模型周圍使用不同的 harness 會顯著改變成本效益。這表示若忽略 harness 對計算、執行時與記憶使用的影響,使用者可能會被誤導以為某模型本身天生昂貴或便宜。
最終,Nvidia 的研究凸顯了具代理性 AI 的進展依賴於完整堆疊:模型、harness、執行時與工具。harness 決定模型如何記住事件、選擇工具、回應監督信號以及整合反饋。 這意味著讓使用者能控制開放的 harness 元件,能實質提升準確性、安全性與成本效益 —— 而非僅僅選擇越來越大的模型。隨著組織構建越來越自主的系統,harness 工程將持續是讓代理可靠且安全的核心。
關鍵見解表
| 面向 | 說明 |
|---|---|
| Harness 與模型 | harness —— 記憶、工具、執行時與協調機制 —— 對代理效能的影響可能超越基礎模型。 |
| 監督元件 | 一個能推動或修正主要代理的監督代理,可改善探索並預防走入死胡同的行為。 |
| 基準結果 | 在經過調整的 harness 下,Claude Opus 5 在 ARC-AGI-3 上達到 100%;若無 harness 則為 30%。 |
| 開放 harness 的好處 | 開放且可配置的 harness 讓使用者能在各種部署中優化準確性、成本與安全性。 |