Ox Alpha:挑戰 Claude Fable 與 GPT-5.6 的免費匿名模型
前言
Ox Alpha 於八月下旬出現,作為一個隱匿的多模態模型,在路由平台上可用,但沒有明確的作者標示。本文總結了已知的關於其性能、可用性與來源推測的資訊。文章說明了該模型為何迅速引起注意、基準測試的主張如何擴散,以及獨立分析對其可能製作者的推測。目的在於清楚陳述證據與背景,讓讀者在沒有炒作的情況下判斷這些主張與其影響。
懶人包
Ox Alpha 在路由服務上公開推出,作為一個免費且高容量的模型。早期小樣本結果顯示它在程式碼任務上擊敗了 Claude Fable 5 與 GPT-5.6 Sol,但更大規模的完整測試分數則讓它與 GPT-5.6 大致齊平。供應者尚未自我識別;獨立指紋比對指向了 智譜 AI 的 GLM-5.3 系列,雖然模型的多模態影片支援暗示可能是未發佈的升級版本。可用性、token 吞吐量與隱匿釋出模式解釋了該實驗室可能在正式公告前測試使用情況的原因。
主體
在 8 月 20 日,Ox Alpha 出現在數個路由門戶與閘道,作為一個公開可呼叫但未附帶公司名稱的模型。列表將其描述為一個以推理為重點、適合程式碼、長時運行代理任務與生產工作負載的模型。數小時至數日內,該模型因三個原因受到關注:在有限時段內免費使用;接受文字、影像與影片輸入並返回文字輸出;以及早期病毒式分享的樣本顯示其程式碼能力異常強勁。
該病毒性主張來自一名開發者,他在 DeepSWE 上執行了 10 題樣本測試,DeepSWE 是衡量程式碼代理在第一次嘗試時正確解決真實 GitHub 問題頻率的基準。那個初期小樣本給予 Ox Alpha 80% 的通過率,領先於 Claude Fable 5 的 65% 與 GPT-5.6 Sol 的 52%。由於樣本數小,這一發現令人振奮但統計上不穩固——它可能反映題目選取的變異,而非決定性的優勢。
隨後,更完整的 113 題測試顯示 Ox Alpha 得分約為 63%,大致與 GPT-5.6 Sol 相近,並未明顯超越現有最先進水準。這些數字使最初的興奮降溫:雖然 Ox Alpha 在一個具有挑戰性的真實世界程式碼基準上具競爭力,但早期的病毒性主張高估了證據強度。
除了性能之外,Ox Alpha 的釋出機制也值得注意。該模型提供非常大的單一上下文窗口——據報可達約一百萬 token——並接受多種模態(文字、影像、影片)。它也支援工具與函數呼叫,儘管其 JSON 輸出未強制使用 schema,對期望從工具取得結構化回應的代理開發者而言,這可能是一個實務上的不足。
該模型透過多個路徑提供:OpenRouter 將其列為 stealth/ox-alpha;其他閘道如 OpenCode、Cline 與 Nous Research 也提供存取。供應者宣稱慷慨的吞吐容量(OpenCode 宣稱每日容量約 100 兆 token;Nous Research 暗示更高數字),這意味著在預覽期間支援大量真實世界使用的意圖。能力與免費測試的結合,對實驗室而言是收集生產回饋的有吸引力方式。
當知名人士與公司發表評論時,關注程度加劇。一位知名科技主管的簡短背書助長了討論與更廣泛的測試。然而,沒有實驗室公開宣稱作者身分。這份匿名性引發了一陣推測。觀察者提出的候選者包括大型中國與國際實驗室——微軟 (MAI)、小米 (MiMo)、阿里巴巴 (Qwen)、Google (Gemini)、DeepSeek 與智譜 AI——各方支持者引用各種行為線索來支持他們的理論。
經過細緻比對後,範圍被縮小。若干提出的匹配在具體技術點上無法對齊:有些候選模型接受音頻輸入(而 Ox Alpha 拒絕),有些缺乏影片能力,還有些使用不同的 tokenizer 與影片編碼器。獨立的指紋比對更具決定性:多項測試將 Ox Alpha 的 tokenizer 與 GLM-5.3 相匹配,並顯示其影片 token 消耗模式與 GLM-5V-Turbo 相符。Ox Alpha 也呈現出 GLM 系列模型觀察到的獨特錯誤模式與音頻拒絕行為。這些趨同的跡象使智譜 AI 的 GLM 系列成為最可信的來源。
仍有一個曲折。GLM-5.3 在 Ox Alpha 出現前不久以純文字形式發佈,而 Ox Alpha 則具有多模態支援,這暗示 Ox Alpha 可能是多模態修訂版或內部變體,而非簡單的重新包裝。分析師開始以 GLM-5.3 Flash 來稱呼這一假設,反映出具備新增影片能力的近親概念。智譜 AI 在預覽期間並未公開確認或否認這一關聯。
Ox Alpha 也說明了越來越普遍的「隱匿」釋出做法:實驗室透過路由平台發佈強大的模型而不揭露來源,以收集使用數據並在正式公開前進行迭代。中國實驗室特別多次採用此方法;先前的匿名釋出在數日到數月內被追溯到已知產品線。這一模式幫助實驗室在大規模測試模型並觀察真實世界互動的同時,保留最終披露與包裝的彈性。
對於開發者與組織而言,情況既帶來機會也需謹慎。限時免費存取讓多人嘗試該模型並收集經驗印象。但對來源的不確定性、未記載的輸出 schema 限制,以及短暫的免費時窗,皆主張在將模型用於生產系統前應謹慎評估。像 DeepSWE 這類基準為比較提供有用且客觀的基線,但小樣本的病毒性結果不應取代在具代表性的任務上進行全面測試。
簡言之,Ox Alpha 是一個具競爭力、高容量的匿名多模態模型,以公開預覽方式提供。早期病毒性樣本顯示其在某些程式碼任務上可能勝過領先對手,但更完整的測試則使其與頂級模型大致齊平。獨立技術指紋最強烈地指向 GLM-5.3 系列的底層架構,可能是一個未發佈的多模態變體。隱匿釋出符合實驗室在正式揭露前尋求真實世界回饋的常見模式。觀察者應留意後續披露或更多技術分析,以確認該模型的來源與能力。
關鍵見解表
| 面向 | 說明 |
|---|---|
| 釋出與可用性 | Ox Alpha 以匿名方式在 OpenRouter、OpenCode、Cline 與 Nous Research 門戶上推出,並在有限預覽期間提供免費使用。 |
| 性能主張 | 一則病毒性的 10 題樣本顯示 Ox Alpha 優於 Claude Fable 5 與 GPT-5.6 Sol;完整的 113 題測試則將其置於約 63%,與 GPT-5.6 Sol 大致相當。 |
| 能力 | 據報為多模態(文字、影像、影片輸入),支援非常大的上下文窗口(約 1M token),並支援工具/函數呼叫,但未以 schema 強制 JSON。 |
| 基礎建設 | 閘道宣稱非常高的 token 吞吐量(例如每日 100T token),暗示已準備好進行大量真實世界測試。 |
| 歸屬 | 沒有實驗室宣稱該模型;獨立指紋比對最強烈指向智譜 AI 的 GLM-5.3 系列,可能為未發佈的多模態變體。 |