AfterQuery 的迅速崛起:一家 AI 訓練數據新創公司如何成為 YC 有史以來最快的獨角獸
目錄
你可能想知道
1. 由兩位年輕創業家創立的公司如何在 18 個月內達到數十億美元估值?
2. 是什麼市場需求讓一家訓練數據新創公司能如此快速成長並吸引高價值客戶?
主題重點
在 2025 年初,兩位在高中相識的創辦人推出了一家專注於為 AI 模型蒐集專業推理數據的公司。大約在 18 個月內,該公司估值據報約為 32 億美元,較五個月前約 3 億美元的估值出現戲劇性增長。Y Combinator 內部的觀察者形容,根據從創辦人進入 YC 到報導輪次的時間線,這是該加速器從創辦到「獨角獸」(私人估值超過 10 億美元)最快的過渡。
該新創公司的策略圍繞一個市場缺口:現代前沿 AI 實驗室在公共網路上高品質文本的訓練資源已大致耗盡。與此同時,合成生成的數據無法完全取代領域專家提供的細緻、逐步的專業判斷。為了提供那個缺失的訊號,該公司招募具資格的專業人士——醫生、律師、工程師、財務分析師——並付酬讓他們撰寫詳細的文字記錄,說明他們如何在真實任務中進行推理。
這些記錄不是簡單的標籤或短註解,而是結構化的、專家級的推理軌跡,旨在教導模型專業人士在不確定情況下如何做決策。公司使用專有軟體對提交內容進行篩選與策劃,目標為「金髮姑娘」式的難度等級:任務應足夠具挑戰性以推動最先進的模型,但又不至於過於深奧讓模型無法從中學習。這個篩選步驟是與仰賴更大規模、低成本承包者群或自動化面試流程的競爭者的刻意區別。
關鍵洞見 在於,高保真度的判斷數據——由真實專家產出並經過教學價值驗證——對於訓練後預訓練或專門化模型的實驗室具有極高價值。值得注意的是,該公司在出售數據前也會先在內部用收集到的數據訓練自家模型,實證顯示這些資料集能改善模型表現,而不是要求客戶在沒有證據下接受主張。
對此類產品的需求來自多方。大型硬體與軟體供應商以及研究實驗室需要超越從網路抓取事實的訓練訊號,特別是針對專業與長期任務的情境。公開報導中,像 Nvidia 與專門實驗室等公司被點名為資料的使用者,其他先進 AI 組織也表現出興趣。高品質判斷數據的短缺也促使其他公司探索不同方法——有些開放廣泛用戶基底以捕捉真實世界行為,有些使用半自動化流程以擴大標註規模。
在財務方面,該公司報告在數月內年度經常性收入(ARR)快速成長:創辦人的公開聲明指出 ARR 在短時間內從約 1 億美元擴增到「數億美元」。一位消息來源提到公司獲利並已有主導投資者為新一輪融資排定,但在報導時該輪融資尚未公開完成或正式宣布。
資料供 AI 的競爭既激烈又多元。既有業者與新進者均在爭奪稀缺且高價值的訊號。一些公司依賴 AI 驅動的面試以規模化審查貢獻者;另一些公司建立高階工作流程以確保貢獻品質。該公司聲稱透過其策展軟體與交付預先驗證的資料集取得優勢:他們在內部訓練模型並能向客戶展示可衡量的改進。
除了商業機制外,這一事件還突顯出更廣泛的產業動態。隨著前沿 AI 系統的改進,邊際收益愈加依賴專門化、高品質的數據與嚴謹評估。能夠有效生產、驗證並展示此類數據效果的公司,可以取得高額估值並與模型建構者與運算供應商建立策略性夥伴關係。
關鍵洞見表
| 面向 | 說明 |
|---|---|
| 估值快速成長 | 估值在五個月內從約 3 億美元上升到據報約 32 億美元,反映投資人需求強勁與收入成長。 |
| 商業模式 | 支付具資格的專業人士創建詳細的推理數據,然後策劃並銷售經驗證的資料集給 AI 實驗室與公司。 |
| 競爭優勢 | 專有的篩選軟體可選出適當難度的任務,並透過內部模型訓練來證明資料集的效能。 |
| 市場需求 | 前沿模型需要開放網路上不存在的專家判斷;合成數據無法完全替代真實專家的推理。 |
| 客戶與使用案例 | 模型開發者、研究實驗室與需要高保真專業推理訊號的領域專用 AI 系統公司。 |
之後...
展望未來,稀缺的人類專業知識與大規模機器學習的融合指向數個有前景的研究與技術發展方向。首先,改進誘導與結構化專家推理的方法——結合人類工作流程與互動式工具——可在降低成本的同時提升資料集品質。其次,能量化特定資料集如何改變下游模型行為的客觀基準框架,將使市場更透明並幫助實驗室優先配置投資。
第三,隨著資料集越來越多包含敏感的專業判斷或涉及客戶情境,具隱私保護的技術與強健的來源追蹤將變得重要。像差分隱私、可安全多方計算與可驗證的資料來源溯源等技術,能在保護貢獻者權益的同時促進更廣泛的共享。最後,可補助而非取代具資格專家的自動化工具——幫助專家產出一致且機器可用的推理軌跡的工具——能在不稀釋品質的情況下擴大供給。
整體而言,對這些領域的投資能幫助 AI 生態系統超越單純的規模擴張,朝向更豐富、更可靠的知識來源,進而改善真實世界的決策。