OpenAI 正在打造可管理一切的 AI 代理 — 整個工作團隊會接受它們嗎?
目錄
你可能想知道的事
1. 專業人士願意讓大型語言模型直接存取電子郵件、聊天、行事曆及其他敏感工具的程度如何?
2. 具代理能力的 AI 是否能在不大幅改變可用性、安全性和經濟性的情況下,從開發者優先的工作流程擴展到主流的知識型工作?
主要議題
當前這波具代理能力的 AI 產品核心上的張力很直接:為了釋放最高的效用,大型語言模型(LLM)常常需要對人們每天使用的數位工具有深入的實際存取權。那意味著要授權模型閱讀並對電子郵件、聊天記錄、行事曆、雲端硬碟和第三方 SaaS 平台採取行動。對於 AI 實驗室內的愛好者和工程師而言,交出這些鑰匙是學習代理在真實情境中表現的必要步驟。對許多潛在使用者,特別是重視隱私或避免承擔責任的人來說,這感覺既風險高又沒有必要。
OpenAI 為了彌合這個差距,致力於把改變軟體工程的那類代理能力帶入主流的知識型工作。歷史上,像 Codex 這樣的工具透過讓模型接觸開發者中心的環境和命令列工作流程,改變了工程師編寫和部署程式碼的方式。新一代產品,以 ChatGPT Work 和其他具代理性的產品為代表,試圖把這種效用複製到非工程任務:跨系統擷取資料、生成定期報表、填寫行事曆或彙整研究摘要。
這些具代理性的體驗要運作良好需要兩個層面。首先,需要一個強大的底層模型,能夠就情境進行推理、產出連貫的結果並執行多步驟計畫。其次,需要一個套件:由軟體與規則構成的包裝,決定模型可以存取哪些資料、可以調用哪些工具,以及如何向使用者呈現結果。這個套件負責權限、外掛整合、使用者控制以及讓複雜工作流程可被發現與管理的互動設計。
在實務上,模型能力與套件設計之間的平衡顯示出重要的取捨。一方面,更通用、更強大的模型可以減少對複雜套件邏輯的依賴:它只需要基本的上下文來執行任務,並能更靈活地適應使用者工作流程的變化。另一方面,主流使用者通常需要明確的可用性提示與漸進回饋 — 顯式按鈕、可預期的提示和逐步確認 — 以建立信任並避免代理在處理私人或具重大影響的資料時造成災難性錯誤。
OpenAI 的內部經驗說明了這種差異。當工具針對工程情境進行調整時,公司內的工程師與早期採用者迅速接受了具代理性的工具。然而在實驗室外,採用率落後:許多訂閱者要麼沒有代理功能的需求,要麼覺得使用者體驗與權限設定令人困惑。這個採用差距突顯了產品團隊面臨的兩個基本挑戰:可被發現性與設定的認知成本。如果使用者無法輕易理解代理能做什麼以及如何安全地提供存取,他們就不會使用它,不管模型多強大。
另一個面向是商業性的:具代理性的工作流程在處理延長任務與頻繁的後端呼叫時會消耗更多運算與 token。這提出了單位經濟與定價的問題。如果某一訂閱等級必須補貼大量代理使用,供應商就需要要麼大幅提升推理效率,要麼找到能將成本與價值對齊的定價模式。早期使用模式顯示少數高活動使用者可能會產生不成比例的大量 token 支出,若無後端優化,簡單的訂閱定價可能無法維持。
競爭與垂直化專精進一步使情形複雜。雖然通用實驗室旨在提供廣泛的代理功能,垂直型的業者 — 專注於法律、銷售或其他特定領域工作流程的新創公司 — 採取與模型無關的方法,為其用例拼接出最佳可得的模型。這些新創公司以領域專業、整合能力與法規符合性來競爭。對於開源專案與替代套件而言,極簡主義有時是一種美德:有團隊顯示,輕量的套件加上強大的模型在特定技術任務上可以勝過功能繁重的堆疊。
實驗室內的產品設計辯論反映出不同的哲學。一些團隊優先考量人機協作流程,呈現中間選項並要求使用者選擇路徑。其他團隊則強調「魔盒」體驗:給模型上下文,讓它自動執行。每種方法各有優點。迭代且需要確認的工作流程可降低風險並提高透明度,但要求使用者更積極參與。自動化方法降低摩擦,對於信任系統並且對其安全控制有信心的人,能帶來更高的生產力增益。
實際測試產生了有希望的例子:自動化重複的行事曆條目、從不規則電子郵件擷取並重新格式化資料,以及從分散記錄生成資料儀表板。這些確實為目前花許多時間處理例行任務的知識工作者節省時間。然而當前的權限與整合狀態仍不完美 — 使用者會遇到令人困惑的設定流程、不同平台(網頁與行動)之間不一致的功能差異,以及不透明的成本訊號。這些摩擦點解釋了為何早期使用者常常需要堅持與技術能力才能獲得全部價值。
最後,具代理性 AI 的長期成功取決於制度性的信任、透明的安全防護欄及可衡量的投資報酬率。組織會越來越要求可稽核的行為、可預測的成本與可控的存取層級。套件系統的開發者必須為可解釋性、權限的易於撤銷以及讓使用者能夠細緻調整自主程度的控制設計。沒有這些,採用將侷限於早期使用者與信任的群體,而無法普及。
總之,具代理性的 AI 能把語言模型的應用從臨時問答擴展到積極參與知識型工作。但要廣泛採用,產品層面必須關注可被發現性、權限使用者體驗、成本效率與建立信任的功能。模型進步與套件設計的相互作用,將決定具代理性 AI 是否能成為多數專業人士的日常助理,或只是那些願意為了配置其能力而在隱私與時間上做出交換的人所使用的專門工具。
關鍵事實: 當套件與內部工作流程匹配時,公司內部的採用可以接近全面,而公開採用通常滯後;具代理性的任務消耗更多 token,因此帶來成本效益問題;使用者信任取決於明確的權限設定以及稽核或撤銷代理存取的能力。
關鍵洞見表
| 面向 | 描述 |
|---|---|
| 採用差距 | 內部工程團隊快速採用具代理性的工具;由於可被發現性與信任障礙,較廣泛的使用者群體採用率較低。 |
| 權限與安全 | 讓模型存取電子郵件、聊天與雲端硬碟能提升效用,但需要強健的權限使用者體驗與稽核以建立信心。 |
| 套件 vs. 模型 | 更好的通用模型可以降低套件複雜度,但實務產品仍需為主流使用者提供介面、整合與回饋機制。 |
| 經濟影響 | 具代理性的工作流程使用更多 token 與運算;為了可持續的大規模部署,需在定價與效率上改進。 |
| 競爭 | 垂直型新創與開源套件提供專門化方法,在特定領域工作流程上可能勝過通用產品。 |
後續…
展望未來,具代理性的 AI 可能沿著兩條互補的軸線演進:更先進的基礎模型與更聰明的套件。模型進步會在較少編排下讓代理更可靠,而更好的套件會為非技術使用者簡化入門、權限設定與透明度。兩條軸線都是必要的;沒有可用介面的強大模型將仍屬小眾,而沒有能幹模型的精緻介面其影響也將有限。
評估具代理性工具的組織應該在高量、低風險的任務上進行試點,以衡量生產力提升、token 支出與使用者信任。投入明確權限模型、稽核記錄與成本效率的供應商將較有機會從早期採用者拓展到主流使用者。如果這些條件達成,具代理性的 AI 可望重塑例行的知識型工作 — 自動化重複性雜務、浮現相關洞見,並讓專業人士專注於更高價值的活動。若未達成,這些系統可能淪為昂貴的稀奇物,僅被愛好者與具技術能力的團隊使用。
最終,是否每個人都使用具代理性的 AI 取決於信任、經濟與設計:人們只有在好處明顯、風險可控且體驗足夠容易讓一般工作者採用時,才會交出控制權。