Hark 發表使用瀏覽器自動執行任務的 Handoff 代理
目錄
你可能想知道
1. Hark 的 Handoff 代理如何可靠地與沒有公開 API 的網站互動?
2. 現在使用後訓練(post-trained)模型、之後再做預訓練(pre-training)會帶來哪些取捨?
主要議題
Hark,一家在五月獲得 7 億美元 A 輪資金 的新創公司,推出了一款名為 Hark Handoff 的新代理,旨在使用網頁瀏覽器執行各類由使用者指示的任務。該代理的核心能力是直接與網站介面互動——即便那些網站沒有官方的應用程式介面——它會分析結構化標記和視覺線索來判斷適當的動作,例如點擊、輸入或導覽頁面。
公司將 Handoff 描述為一個檢查頁面佈局與呈現以推斷使用者層級互動應該長什麼樣子的代理。這表示它會檢視文件物件模型(DOM)、按鈕位置、標籤與螢幕上的文字,以及渲染後的視覺呈現,以決定是否按下某個控制項或填寫表單欄位。實務上,這使代理得以在零售商與服務網站上嘗試任務,例如 Target、Walmart、OpenTable 與 LinkedIn,在這些地方官方的程式化存取可能有限或不存在。
在概念上,Handoff 遵循其他嵌入瀏覽器代理熟悉的模式:使用者發出指令,代理執行所需的一連串網路互動。典型範例包括訂購雜貨或咖啡、購買必需品、預訂旅遊或餐廳座位、處理報稅等行政事務,或透過諮詢多個線上來源來進行研究。這些都是端到端工作流程,要求代理規劃、執行,並在遇到中間失敗(如模態彈窗或類似驗證碼的中斷)時有時能夠恢復。
Hark 在示範中展示了 Handoff,影片中 CEO Brett Adcock 指示助理組合一束花,包含特定花材選擇以及允許花店自行搭配的彈性——以「花店自行搭配的一些花材」表達。該影片突顯代理解讀模糊指示並將其與具體選擇結合的能力。然而,示範僅顯示互動的片段,因此觀察者在更廣泛且獨立的測試出現之前,應保留對系統穩健性的評斷。
在技術面,Hark 解釋此次初始釋出依賴於一個 後訓練模型,計劃在今年晚些時候轉向預訓練模式。這兩者的區別很重要:後訓練通常指在基礎模型存在後在目標資料集上持續訓練或微調;而預訓練則是從頭或在非常大型的語料上訓練一個基礎模型再進行專門化。Hark 主張先從後訓練開始,可以更快迭代資料管線、訓練基礎設施與技術開發——讓團隊在投入更大規模的預訓練前,先優化訊號與安全控管。
Hark 也將其模型定位為不同於標準的下個詞元語言模型。公司表示其架構被優化為預測 下一個動作——一個離散互動,例如在特定位置的滑鼠點擊或鍵盤輸入。這種框架與瀏覽器自動化的需求一致,在 GUI 環境中主要輸出是動作原語,而非自然語言的延續。
控制軟體與瀏覽器的代理市場競爭激烈。主要研究機構與公司如 Google、OpenAI 與 Anthropic 都在開發可使用電腦的代理,而一波由風投支持的新創公司——例如 Browser Use、Polar、Strawberry 與 Aside——專注於使用瀏覽器自動化與具代理性的介面來自動化網路任務。Hark 聲稱在速度與成本上具有競爭優勢;該新創表示 Handoff 的運作速度比可比的解決方案更快,且其運行成本遠低於像 GPT-5.5 與 Opus 4.8 這類重量級模型,儘管公告中並未提供獨立的基準測試數據。
從產品與安全角度來看,瀏覽器代理必須處理各種挑戰。網站佈局會隨時間變化,速率限制與機器人偵測系統可能中斷自動化,而使用者意圖可能不明或需要情境判斷。要應對這些情況,需要健全的觀察與恢復策略:推斷何時流程失敗、重試替代路徑、向使用者請求澄清,或安全地中止以避免意外購買或資料外洩。Hark 的訊息顯示其強調將此類可靠性內建於其流程中,但公開資訊尚未詳細說明完整的錯誤處理、隱私或安全措施。
在實作面,整合能代表使用者執行操作的代理會引出驗證與憑證管理相關的問題。許多任務——預訂、購物或帳戶更新——需要登入第三方網站並處理敏感的使用者資訊。憑證的安全儲存、多重驗證(MFA)流程的使用,以及敏感資料暴露的最小化都是必要的。雖然 Hark 的公告突顯功能性能力與效能宣稱,但如何保護使用者帳戶、權杖或會話資料的具體做法在發布中並不突出,這將是潛在使用者評估平台時的重要考量。
另一個實務考量是泛化能力:代理處理新的、未見過的網站或罕見邊緣案例的表現如何。構建一個預測動作而非文字的模型可能有助於集中於具體互動原語,但網路上介面模式的多樣性仍然是核心挑戰。解決方案通常會將基於模型的決策與基於規則的備援結合,並使用帶有儀表化的瀏覽器來擷取豐富的遙測,以協助偵測並適應意外狀態。
最後,Hark 已為 Handoff 平台開放候補名單,並表示打算在夏末前推出該服務。對於開發者、企業與早期採用者來說,候補名單可能是取得試用存取、回饋循環與功能優先排序的途徑。之後轉向預訓練可能表明一條朝向更大規模與更廣泛能力的路線圖,一旦公司驗證產品市場適配並精煉其資料與訓練策略。
重點摘要表
| 面向 | 描述 |
|---|---|
| 募資 | 在 A 輪募得 7 億美元。 |
| 核心能力 | 由瀏覽器驅動的代理,分析頁面結構與視覺來執行動作。 |
| 使用情境 | 訂購、購物、預訂、研究與在無 API 網站上的行政工作流程。 |
| 模型方法 | 最初使用後訓練;計劃於年內晚些時候改為預訓練。 |
| 動作 vs 文字 | 模型預測 下一個動作(點擊/輸入),而非下個詞元。 |
| 競爭宣稱 | 據 Hark 稱,較某些替代方案(例如 GPT-5.5、Opus 4.8)更快且成本更低。 |
| 可用性 | 候補名單已開放;計劃於夏末前釋出。 |
之後…
展望未來,Hark 的 Handoff 反映了朝向能代表使用者控制真實應用程式的代理之更廣泛趨勢。持續進展將取決於對動態網頁介面的穩健處理、針對驗證與敏感資料的安全與隱私防護,以及透明的基準來比較競爭者之間的可靠性與成本。如果 Hark 按計劃進行預訓練並擴展其基礎設施,該代理有可能成為瀏覽器自動化與任務完成領域的重要參與者——但採用將取決於對安全性、準確性以及對企業和消費者投資報酬率的獨立評估。