為何機器人需要一個 ChatGPT 時刻,以及 Nvidia 的 Les Karpas 如何看待前進之路
目錄
你可能想知道
• 到底是什麼具體障礙,使得機器人無法達到像 ChatGPT 那樣的突破?
• 哪些技術與生態系變化,能實際加速普及的機器人革命?
主要議題
ChatGPT 在 2022 年 11 月的推出,標誌著人工智慧的一個關鍵時刻:大型語言模型的對話式介面將學術新奇轉變為實用的日常工具。那次明顯的飛躍提供了突破應有的參照點——快速採用、廣泛的文化影響,以及大量新公司和投資的湧入。儘管機器人在過去數十年有研究、工程進步與穩定的商業部署,但尚未出現類似的轉折點。原因是多方面的、務實的,且深植於數位語言理解與具身物理互動之間的差異。
在 2026 年 TechCrunch Disrupt 上,Nvidia Inception 的 Global Head of Physical AI Les Karpas 簡潔地指出了核心限制:缺乏一個對物理互動具有網際網路規模的資料集。語言模型受益於豐富的文本資料:書籍、網站、論壇與其他文本來源,共同形成了大型且多樣的語料庫。相較之下,物理世界呈現出環境、感測器與任務拼湊的局面。沒有單一統一的資料庫可以捕捉物體形狀、表面、人類行為、操作方式以及機器人必須面對的安全關鍵情境的多樣性。這種具身任務的資料稀缺性是主要瓶頸。
要理解為何這是如此困難的問題,請考慮資料需求的性質。要讓家用機器人具有廣泛實用性,它必須能在不同光照下辨識物體、操作各種材質、適應多樣的家庭格局,同時在有人與寵物周圍保持安全。要收集足量且多樣的真實世界資料——涵蓋邊緣情況、罕見事件與長尾場景——需要多年在多個部署地點的實地運作,或是一個龐大協調的努力以大規模錄製與標註物理互動。像 Waymo 這類公司透過累積里程來建立駕駛資料集,逐步擴展市場與場景的覆蓋。但這種做法既昂貴又緩慢,且通常侷限於能由大型車隊與法規框架支持系統性資料收集的特定領域(例如駕駛)。
基於這些限制,越來越多的新創公司與研究團隊正在尋求替代策略,以近似或替代網際網路規模的物理資料集。主要做法包括高擬真模擬、合成資料生成,以及在多種機器人形態上訓練的基礎模型。模擬環境可以產生實質上無限的有標註訓練資料,使得跨多種場景與配置的訓練成為可能。然而,模擬必須彌合現實差距:模擬物理、感測雜訊與真實世界不可預測的豐富性之間的差異。合成資料有所助益,但其效用取決於對變異性與不完美的精心建模;否則模型在部署時可能無法有效遷移。
另一個有前景的策略是多機器人、多任務的基礎模型,學習在不同硬體平台與任務族群之間共享表徵。透過在多種機器人類型——操作手臂、移動底盤、空中平台——上收集的資料進行訓練,這些基礎模型旨在更好地泛化到新任務與新形體。這個概念類似語言與視覺領域的遷移學習趨勢,大型預訓練網路提供一個基礎,可用更少的標註資料適配下游問題。關鍵問題在於這類基礎模型能否穩健地編碼真實世界的物理與語義,達到足以支持安全且可靠行動的程度。
TechCrunch 設立了 Real World AI Stage,正是為了探討模擬、合成資料與真實世界驗證的交叉。在 Disrupt 上,Karpas 與來自 Shield AI、Colossal Biosciences、FieldAI 和 Foxglove 的創辦人小組探討了他們的公司如何面對資料缺口,並努力使模擬訓練對物理結果進行驗證。這些討論凸顯一個反覆出現的主題:進展將來自整合多種策略,而非單一靈丹妙藥。產業合作、共享基準資料集與標準化驗證協議,能透過減少重複工作並釐清跨應用的表現期待來加速採用。
Karpas 的角色讓他處於這個生態系的核心。作為 Nvidia Inception 的 Physical AI 全球負責人,他與機器人、汽車、製造、流動性與智慧城市等領域的新創公司互動。這個視角帶來兩個優勢:能廣泛看到正在嘗試的技術方法,以及對哪些產品與商業模式可能擴展具有務實的判斷。他的背景——涵蓋 Stanley Black & Decker、Intellectual Ventures、Herman Miller、iRobot、Cirque du Soleil 等職務——展示了機器人領域所需的跨領域技能:設計、製造、系統工程與新創領導。當解決方案必須橋接硬體、韌體、感知與雲端學習系統時,這些能力至關重要。
從投資與創新角度來看,含意很清楚。理解資料問題並採取混合解決方案的組織與創業者——結合模擬、群眾外包或車隊收集的真實世界痕跡、嚴謹的領域隨機化與基礎模型方法——將具備優勢。同等重要的是能透過嚴格測試與透明指標來展示安全性與穩健性。對於許多潛在採用者,特別是物流、醫療與公共移動等受規管領域,安全與可靠性的證明將決定商業成功。
最後,像 Disrupt 這類活動的社群建立作用也很重要。將工程師、創辦人、投資人與最終使用者聚集在一起,能促成知識傳遞與夥伴關係的形成。舞台上分享的洞見可以激發新的研究方向、投資論點或產品調整。雖然沒有簡單配方可以在機器人領域複製 ChatGPT 的文化時刻,但產業、學界與風投間的協調努力可以縮短時間表。如 Karpas 所強調,進展將是漸進的,既需要技術突破,也需要實際可行的途徑以大規模收集並驗證資料。
重點洞見一覽表
| 面向 | 描述 |
|---|---|
| 核心瓶頸 | 沒有類似文本語料庫的針對物理互動的網際網路規模資料集。 |
| 模擬的角色 | 產生可擴展的有標註訓練資料,但需要彌合現實差距。 |
| 基礎模型 | 在多種機器人類型上訓練以促進遷移並減少每項任務所需的資料量。 |
| 安全與驗證 | 嚴謹的測試與透明的指標對於實際部署與採用至關重要。 |
| 生態系優勢 | 新創公司、產業與研究者之間的合作可以加速資料集成長與基準制定。 |
之後…
展望未來,走向一個機器人領域等同於 ChatGPT 的時刻,可能是漸進而非瞬間的。進展取決於協調努力以建立共享的資料資源、提高模擬真實性,以及能在不同形體間泛化的成功遷移學習策略。促進安全測試與資料共享的政策框架,結合驗證經濟價值的商業試點,也將是關鍵。雖然技術障礙仍然龐大,但隨著投資增加、跨領域合作加強與更聰明的訓練範式,機器人領域出現變革性時刻的可能性正在提高。
對於從業者、投資人與研究人員來說,可行的結論是務實的:專注於可衡量的進展——更好的模擬器、更豐富的合成資料、標準化基準與漸進的真實世界驗證。這些步驟將縮小模擬能力與部署可靠性之間的差距,使產業更接近 AI 與 ChatGPT 所達成的那種廣泛影響。