Fish Audio 獲得 5200 萬美元種子輪融資,以擴展面向創作者與企業的具表現力且可操控的 AI 聲音模型
目錄
你可能想知道
單一平台是否能同時滿足需要具表現力、富角色感語音的創作者,以及需要高度可控且合規語音代理的企業?
語音模型公司可以採取哪些實際步驟,在擴展社群驅動資料集的同時保護藝術家權利?
主要議題
AI 生成語音模型的市場涵蓋創意與企業兩類用例,這些用例帶來不同的技術與倫理需求。創作者——遊戲開發者、獨立影片製作者與設計師——通常要求合成語音具高度表現力與細緻的表演。相較之下,企業更重視可控性、可靠性、低延遲與合規性,以用於客戶支援、銷售自動化與對話代理。
總部位於帕洛阿爾托的 Fish Audio 透過開發大量自然語言控制(用於語音生成),定位為同時服務這兩類客群的公司。自去年推出以來,該創業公司表示其開源與託管方案已廣泛被採用:超過八百萬用戶,年度經常性收入約為 $21 million。為加速產品開發與企業端市場進入,Fish Audio 宣布完成由 Coreline Ventures 與 Capital Today 領投的 5200 萬美元種子輪,其他參與投資者包括 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 與 HF0。
Fish Audio 的起源根植於對既有合成語音限制的研究與挫折感。創辦人廖世嘉(曾任職 NVIDIA)在單張 GPU 上訓練出一個語音生成模型並將結果開源。該專案 Fish Speech 在社群上獲得大量關注(在 GitHub 上擁有數萬顆星),被獨立開發者、遊戲工作室與尋求更自然且易適應語音模型的創作者使用。
過去一年,公司推出了五個模型:四個專注於語音生成,一個用於語音轉文字。三個語音生成模型為開源,最新的 S2.1 Pro 則僅透過付費 API 提供。Fish Audio 為創作者與團隊提供訂閱方案,綁定生成分鐘數與語音克隆功能,並提供企業級 API 與平台服務。已使用該公司技術的客戶據報包括 HeyGen 與 Sanas 等公司。
Fish Audio 將產品差異化聚焦在超過 15,000 種自然語言控制的庫,讓使用者能將語音輸出塑造成特定的表現或實務需求。此方法承認不同客戶有不同優先重點:AI 化身平台需要高度真實感;遊戲工作室希望具角色表現力的語音;語音代理供應商則需要自然度與對話使用情境的低延遲。
公司也透過邀請使用者貢獻語音樣本並在那些語音被用於訓練時提供報酬來擴大其資料集。雖然這種社群驅動模式加速了資料規模與多樣性,但也引發爭議:部分創作者聲稱其語音在未經同意下被上傳。Fish Audio 起初透過 DMCA 下架流程處理申訴,但該流程被視為緩慢並招致批評。
作為回應,Fish Audio 的執行長與共同創辦人曹麗莎表示,公司已自動化下架程序。創作者現在可以提交短樣本或契約性所有權證明,並可望在數分鐘內將未經授權的語音從平台移除。儘管如此,自動化並未完全防止未經授權的上傳;但一旦權利人指出問題,它能加速解決流程。
投資者與合作夥伴強調,建立以社群為先的語音平台長期成功取決於信任。Coreline Ventures 合夥人本田奧祐指出,創作者的信心至關重要:平台需要內建同意機制、透明度、歸屬標示、經過驗證的所有權、明確的授權條款、簡單明瞭的舉報與下架工作流程,並最終實施收益分成模式。此類保障措施能使社群驅動策略成為持久的優勢,而非風險。
Fish Audio 的領導層說明為何儘管作為一個高效的開源專案早期就已成功,仍尋求外部資金。額外資金將支持更先進模型的開發、更廣的企業功能,以及擴展基礎設施以因應日益增長的投資者與客戶需求。該創業公司計畫在年度內推出一個音訊理解模型,並同時開發語音到語音系統。
語音生成的競爭格局已相當擁擠。值得注意的競爭者包括 ElevenLabs、WellSaid、Cartesia、Speechify、Async(前身為 Podcastle)與 Krisp,皆在爭奪創作者與企業的預算。觀察者認為 Fish Audio 的優勢將取決於開發者控制的細緻度與成本效益的模型訓練。據投資者表示,團隊已展示出強大的技術能耐,在人工感與類人聲之間縮短差距。
超越產品與市場定位,公司發展路徑也突顯了產業面臨的一系列張力:在開放與快速創新之間,如何同時遵循倫理的收集做法、權利保護與企業級合規。實作穩健的來源追溯、同意驗證與創作者變現模型,將影響公眾觀感與監管審查。隨著使用量增加,對語音驗證、授權明確性與對貢獻者適切補償模式的標準需求也會提升。
總結來說,Fish Audio 的 5200 萬美元種子輪資金支撐了一項雙重企圖:深化能提升表現力與可操控性的技術能力,以及擴展可獲得創作者信任的企業級功能與治理。該公司的開源釋出與付費 API 服務的混合策略,旨在追求廣泛採用,同時為進階能力建立變現途徑。
關鍵見解表
| 面向 | 描述 |
|---|---|
| 資金 | 在由 Coreline Ventures 與 Capital Today 領投的種子輪中籌得 5200 萬美元,以擴展模型與企業產品。 |
| 採用情況 | 在開源與託管選項中擁有超過 800 萬用戶;據報 $21M 年度經常性收入。 |
| 產品組合 | 推出五款模型:四款語音生成、一款語音轉文字;三款生成模型為開源,S2.1 Pro 為付費。 |
| 差異化 | 擁有 15,000+ 的自然語言控制庫,使不同用例能產生具表現力且可操控的語音輸出。 |
| 倫理與治理 | 社群貢獻語音並提供報酬,現具自動化下架流程與基於證明的移除機制以回應同意相關疑慮。 |
後續…
展望未來,有幾個技術領域值得持續關注,以形塑負責任且具能力的語音 AI 系統。首先,語音來源與所有權驗證機制對保護創作者並促成公平變現至關重要;能以密碼學或程序化方式驗證同意的系統可減少未授權使用。
其次,細緻的控制介面與可解釋性工具將協助開發者與企業在不倚賴脆弱提示工程的情況下塑造語音行為。對自然語言控制分類法、透明的模型行為文件與使用限制功能的投資,將改善在受規範產業中的可部署性。
第三,可擴展且具成本效益的訓練與推理技術仍然重要,以在降低環境與計算成本的同時讓更多人能取得。對高效架構、模型蒸餾與硬體加速推理的研究,能降低創作者與小型企業的進入門檻。
最後,需要結合政策、倫理與創意實務的跨領域工作。 更好的授權框架、收益分配方法與社群治理模式 能使商業誘因與創作者權益及公共利益對齊。這些方向將有助確保具表現力、類人化的合成語音在技術上優秀且具社會責任。
總之,Fish Audio 最近的融資與產品路線圖同時反映了機會與責任。持續進展將依賴技術創新、透明治理,並與該技術旨在服務的創意社群密切合作。