Smallest.ai 獲得 1300 萬美元 A 輪融資,打造超快且聽起來像人的即時語音 AI
目錄
你可能想知道的
1. 精簡且專門化的語音模型是否真能消除在語音交流中暴露 AI 身份的可感知停頓?
2. 將小型即時語音模型與大型離線語言模型結合,將如何改變客戶支援的未來?
主要議題
隨著會話式 AI 能力成長,一個持續且明顯的限制仍為使用者所感:許多語音代理仍然聽起來像機器。Smallest.ai 這家在 2024 年底創立的新創公司主張,語音互動的下一個重要進展,將來自於 更小型、專門化 的模型,這些模型針對人類對話的動態進行優化,而不是只透過擴大大型語言模型 (LLM) 並期望單靠延遲改善來解決問題。
Smallest.ai 的核心理念是模擬人類如何在即時語音互動中處理:同時傾聽、思考與說話。創辦人暨執行長 Sudarshan Kamath 解釋,人類不會等到接收完整一大段音訊才開始構思回應;我們會在部分輸入到達時開始處理、預期可能的延續,並在適當時打岔或做出快速插話。Smallest.ai 的做法是設計一個反映此種連續、遞增處理的語音模型,讓語音代理能以極小的感知延遲做出回應。
延遲是核心挑戰。雖然在文字聊天中短暫停頓可被接受,但在口語對話中則顯得突兀。Kamath 對比了傳統 LLM 的工作流程——先接收完整提示,然後開始較長時間的計算——與即時對話的期待。在語音互動中,即便是輕微的延遲 都會破壞對話流暢性並暴露講話者的非人性。透過使用針對快速、遞增推理調校的精簡模型,Smallest.ai 目標是將回應延遲降到幾乎無法察覺的程度。
為同時達成速度與能力,Smallest.ai 採用兩層系統。主要層是一個輕量的即時語音模型,能以接近零延遲處理大部分特定主題的客戶互動。當查詢超出此模型的領域知識時,系統會執行受控交接至較大型、能力更強的基礎 LLM。該離線模型在代理短暫讓使用者等待時執行更深入的推理或資訊檢索,模仿人類客服可能查閱資源或請教同事的做法。這種混合設計在保留對話即時性的同時,仍保有大型模型較廣泛問題解決能力的入口。
Smallest.ai 的專門化不止於延遲。該新創公司密集聚焦於一般 LLM 常忽略的語音專屬挑戰,例如對各種口音的強健處理、支援多十種語言,以及在嘈雜環境中的韌性——這些都是真實世界客戶支援的關鍵需求。Smallest.ai 並非企圖成為通用的一體化基礎模型,而是朝向能啟用自然、人類般語音互動的狹義、高影響目標前進。
這項產品策略已吸引投資資本:Smallest.ai 近日完成由 Seligman Ventures 領投的 1300 萬美元 A 輪,參與者包括 Sierra Ventures 與 3one4 Capital。新一輪融資使公司總募資超過 2100 萬美元,並將協助擴充工程、語音多樣性資料蒐集與企業整合。
Smallest.ai 已與語音領域的客戶合作,包括 RingCentral 與 Truecaller 等公司。該公司定位為那些核心產品非語音的企業的合作夥伴——提供專門的語音能力,避免讓這些企業分心自行建置。Kamath 指出,許多客戶支援新創公司可能寧願專注於其核心產品,而非轉而投入成為語音工程專家的資源分配。
在競爭格局上,Smallest.ai 的對手包括 ElevenLabs、Cartesia 以及強調在地語言支援的區域業者如 Sarvam。然而,許多競爭者追求更廣的音訊應用,例如配音與播客內容生成。Smallest.ai 的差異化在於專注於低延遲、即時對話代理以服務企業客戶支援——在這個利基市場中,即時性與自然度至關重要。
從研究與產品角度看,公司志向大膽:打造能通過會話等價圖靈測試的語音代理。Kamath 精簡地將目標表述為:使用者應無法分辨自己是在與人類還是 AI 對話。雖然仍存技術挑戰——包括跨廣泛主題領域的泛化、穩健的安全與合規,以及可靠交接至離線模型的工程實作——但這種混合架構提供了一條務實的前進路徑。
實務上,此方法對客戶支援工作流程具有即時優勢。即時感知能力可更快安撫憤怒來電者、提供更自然的確認與釐清,並帶來更順暢的整體體驗,較貼近人類互動。同時,回退至強大的離線推理可避免系統被限制在固定對話腳本中,使其能以類人般的深思熟慮回答複雜或不尋常的查詢。
最後,Smallest.ai 的工作凸顯 AI 系統設計中的一個更大趨勢:專門化與模組化。許多開發者正探索以聚焦且高效的元件組合來取代單靠愈來愈大的通用模型,藉此改善效能與使用者體驗。透過建立語音專屬的智慧層並與較大型的離線推理模型協同,Smallest.ai 範例說明了領域優化模型今日如何帶來實際且面向使用者的好處。
要點總表
| 面向 | 描述 |
|---|---|
| 募資 | 完成由 Seligman Ventures 領投的 1300 萬美元 A 輪;總募資超過 2100 萬美元。 |
| 核心方法 | 使用小型、專門化的即時語音模型,並由離線 LLM 補位處理複雜查詢。 |
| 延遲重點 | 旨在達到近乎零感知回應延遲,以保留自然的對話流程。 |
| 差異化 | 強調語音專屬挑戰:口音、語言、嘈雜環境;目標是即時的客戶支援。 |
| 客戶 | 包括 RingCentral 與 Truecaller;目標為客戶支援平台與企業。 |
| 競爭 | 與 ElevenLabs、Cartesia 及強調在地語言的區域業者如 Sarvam 競爭。 |
後續...
展望未來,Smallest.ai 的架構凸顯一條通向更具說服力語音代理的實務路徑:將 超快速 的會話模型與選擇性接入較大型推理系統相結合。若能成功大規模運行,這種模式可能重塑對語音客戶體驗的期待,促使企業在正確性之外也優先考量即時的自然度。持續進展將依賴資料多樣性、穩健的安全防護,以及即時與離線元件之間順暢的協調。
對企業而言,涵義明確:語音專業知識或許最好由專門供應商提供,而非內部構建,讓公司得以專注於核心產品,同時仍能提供類人語音支援。對使用者而言,承諾是未來與自動化代理對話會像與真人交談一樣無縫且即時。