文章上線

Z.ai 發表 GLM-5.3,自詡為領先的開放權重程式碼模型

Z.ai 發表 GLM-5.3,自詡為領先的開放權重程式碼模型

前言

Z.ai (前身為 Zhipu AI) 宣布了 GLM-5.3,這是其 GLM 程式碼系列的一項重大升級。本文彙整了此釋出、該實驗室所述的工程方法、基準測試結果,以及新模型與開放與封閉商業替代方案的比較。目標是提供清晰、中立的概述:GLM-5.3 是什麼、它如何被打造、在程式碼與資安任務上達成了什麼,以及使用者可預期的可用性與定價。重點放在實驗室宣稱 GLM-5.3 優先考量的是標記(token)效率而非單純以參數數量取勝,以及這如何影響實務上的程式碼表現與成本。

簡要摘要

GLM-5.3 是 Z.ai 的新一代 7430 億參數程式碼模型,被呈現為 最有能力的開放權重程式碼模型。實驗室報告稱相較於前一版本及若干開放競爭對手,標記效率有所提升且表現更強;然而部分封閉源碼的美國模型仍在頂級基準中領先。可用性分階段釋出:可透過 GLM Coding Plan 與 ZCode 立即存取,API 與公開權重則會在安全審查後陸續提供。

主體內容

Z.ai 將 GLM-5.3 作為其 GLM 系列的一項漸進但具意義的進展發佈。該模型包含 7430 億參數,據實驗室表示是透過對 GLM-5.2 基礎進行額外的後訓練擴展而建立。Z.ai 團隊並未重新設計架構,而是專注於擴大訓練環境、任務多樣化,並在既有技術堆疊上投入更多運算資源。其宣稱目標在於提升運營效率——特別是標記經濟(token economy)——而非追求單純的參數軍備競賽。

參數與標記在模型行為中扮演不同角色:參數是編碼已學習模式的內部權重,而標記是模型消耗與生成的離散輸入與輸出單位。Z.ai 強調 GLM-5.3 在完成任務時使用較少的輸出標記,相較於 GLM-5.2,這可降低延遲、在以標記計價的情況下降低成本,並提升代理式程式碼工作流程的實際吞吐量。

在 Z.ai 內部的 Z.ai Code Bench,於實驗室所稱的 Max effort 設定下,GLM-5.3 據報達到 34.5% 的成功率,同時每項任務大約產生 75,000 個輸出標記。相較之下,GLM-5.2 在類似條件下得分為 23.4%,約產生 96,000 個輸出標記。這些百分比反映了實驗室所選的評估條件,顯示出更高的效能與改進的標記經濟性。

與封閉商業模型比較時,結果各有不同。Z.ai 主張 GLM-5.3 在標記效率上勝過 Claude Opus 4.8,但在同一 Z.ai 基準上仍落後於 Claude Fable 5——Fable 5 在 Max effort 上達到 39.5%。在其他公開的程式碼評測中,GLM-5.3 表現具競爭力但不一定領先。例如在衡量在真實 Linux 環境中自動化 shell 與工具使用的 Terminal Bench 3.0 上,GLM-5.3 得分為 28.3,低於 Fable 5(33.7)與 GPT-5.6 Sol(34.6)等封閉模型。

在針對真實 GitHub 問題進行端到端修復的 DeepSWE v1.1 基準上,GLM-5.3 得分為 66.9——表現強勁,但略遜於某些對手。開放競爭者 Kimi K3 得分為 67.5,而 Fable 5 達到 69.7。這些結果說明一個持續的模式:GLM-5.3 超越了 GLM-5.2 與某些開放模型,但在若干重要指標上仍被頂級封閉系統領先。

在資安導向的評估中,GLM-5.3 取得顯著躍進。Z.ai 報告稱該模型在 CyberGym 上得分為 84.5%,並在利用性測試基準上相較 GLM-5.2 有超過一倍的提升。實驗室還宣稱該模型在 269 個開放原始碼專案中識別出 2,436 個漏洞,其中 1,097 個被標記為中到高嚴重性。此等進步凸顯 GLM-5.3 在程式碼分析、漏洞偵測與自動化資安任務上的適用性。

除了原始分數之外,Z.ai 強調代理式編碼:模型以較少的輸出標記協調多步驟動作、呼叫工具並管理複雜工作流程的能力。這一重點與開發者工具與自動化程式碼生成的趨勢相符,因為標記成本與步驟效率會實質影響使用者體驗與運營成本。

可用性與定價是關鍵差異化因素。GLM-5.3 初期透過 GLM Coding Plan 訂閱與 ZCode 提供,允許立即互動使用。Z.ai 計畫在進行安全審查後分階段釋出 API 存取與可下載的權重。當實驗室將權重描述為 "open" 時,代表最終會公開釋出;然而在宣布時,完整權重仍待實驗室的安全檢查完成。

在定價方面,Z.ai 將其產品定位為每標記成本顯著低於許多美國前沿模型。實驗室先前提到的 GLM-5.2 價率約為輸入每百萬標記 1.40 美元、輸出每百萬標記 4.40 美元;這些數字相較於某些美國替代品(如 GPT-5.3-Codex 與較高階的 Anthropic 定價)具有成本優勢。Z.ai 也為程式碼方案運行基於點數的配額系統,並提供非尖峰時段的折扣使用。較低的成本與最終的開放權重授權,是吸引尋求可自託管且平價程式碼模型的開發者與組織的核心因素。

地緣政治情勢也很重要。Z.ai 位於北京,並被列入美國實體清單,該清單限制來自美國的某些出口。儘管如此,GLM 系列模型在國際上仍獲得關注,並有報導指出中國的開放權重模型在透過第三方路由服務的標記使用上具優勢。實驗室所述的時程表示公開權重會在宣布後約兩週釋出,使 GLM-5.3 在可用時成為較為突出的開放權重程式碼模型之一。

總結來說,GLM-5.3 代表一個務實的前進步伐:標記效率提升、在安全與程式碼任務上的表現相較前代更強,並在開放原始碼同儕中具競爭力。封閉源碼的美國模型在某些基準仍然領先,但在標記經濟與成本重要的情境下,GLM-5.3 縮小了差距。可用性為分階段——互動存取現已提供,API 與開放權重待安全審查後陸續釋出——這使其成為追蹤開放權重在開發者導向大型模型領域進展的重要釋出。

關鍵見解表格

面向 說明
模型與規模 GLM-5.3 是一個 7430 億參數的模型,透過對 GLM-5.2 基礎進行後訓練擴展而生成。
工程方法 Z.ai 著重於擴展訓練環境與在既有堆疊上投入運算,以提升標記效率,而非變更架構。
標記效率 據報每項任務使用的輸出標記較少(約 75k),相較 GLM-5.2(約 96k),提升實際吞吐量與降低成本。
程式碼基準 較 GLM-5.2 與部分開放競爭者有進步,但在若干頂級基準上仍落後於特定美國封閉模型。
安全性表現 報告指出顯著提升:在 CyberGym 上得分 84.5%,並標記出較多漏洞,超越 GLM-5.2。
可用性 現可透過 GLM Coding Plan 與 ZCode 使用;API 存取與開放權重將在安全審查後釋出。
定價與可及性 定位為每標記成本低於許多美國前沿模型;最終開放權重將提升可及性。
最後編輯時間:2026/8/14
#SOL

Mr. W

Z新聞專職作家