文章上線

研究人員如何壓縮大型 AI 模型卻在測試中提升其效能

研究人員如何壓縮大型 AI 模型卻在測試中提升其效能

目錄

你可能想知道

• 被大幅壓縮的 AI 模型是否真的能在標準基準測試中勝過原始的大模型?

• 有哪些實際技術能讓縮小的模型從未壓縮的原始模型學習,而不是從中間被降質的複本學習?

主題重點

一個研究團隊最近展示了一個反直覺的結果:他們減少了現有大型語言模型的大小和數值精度,並在許多評估中得到一個較小的變體,其表現與其來源模型相當或更好。該專案以一個開放大型模型為目標,該模型有 1200 億參數(原文為 "120 billion parameters")並產生了一個學生模型,具有 600 億參數(原文為 "60 billion parameters"),以 4 位元(原文為 "4-bit")精度儲存。研究人員沒有接受通常伴隨此類壓縮的能力損失,而是應用一種方法,在壓縮感知的訓練過程中直接引導較小的模型模仿原始的全精度教師模型。

背景脈絡有助於說明其重要性。大型語言模型由非常多的數值權重參數化——常被比喻為一面滿是旋鈕的牆。每個旋鈕代表學到的資訊。更多的旋鈕通常能產生更細緻的行為,但它們需要更多的記憶體和運算來儲存與運行。為了部署與實用,團隊常使用模型壓縮策略——剪枝、量化、蒸餾——以減少模型大小與延遲。量化用較低精度的表示取代高精度數值(例如從 16 或 32 位浮點移至 8 位或 4 位整數),而蒸餾則將知識從大型教師模型轉移到較小的學生模型。

歷來,壓縮與量化模型被視為一種折衷:以可預期的性能下降換取大幅降低的資源消耗。傳統的蒸餾流程常使用一個中間模型——部分縮減或以不同方式量化的複本——作為最終學生的教師。然而,那個中間教師已經帶有由壓縮步驟引入的痕跡與降級回應。訓練學生去匹配那個已降級的教師,實際上是教學生那些教師的錯誤與限制。簡言之,學生模仿的是一張模糊的影印本,而不是原件。

該研究團隊使用的技術重新框架了這一步驟。他們沒有讓被壓縮的學生去模仿中間降級的模型,而是讓學生在了解量化過程的同時,從原始、未量化的教師那裡獲得監督。研究人員稱這種方法為 量化感知修復(Quantization-Aware Healing)。關鍵的概念性改變是將量化視為不僅僅要被最小化的代價,而是一個機會:透過將學生暴露於教師的輸出並調整訓練以補償量化效應,學生能學會在每個參數使用更少位元的情況下重現原始的高品質行為。

從實驗上看,結果相當驚人。該 600 億參數、4 位元的學生模型在團隊使用的大多數基準任務中,與傳統的同等規模全精度 600 億模型相當或更勝一籌。具體而言,縮小後的 4 位元模型在他們進行的九項測試中擊敗了傳統 600 億模型的七項。這並不意味著原始的 1200 億模型在所有情況下都不是最強者;在許多情境中,全精度的 1200 億教師仍然佔有優勢。然而,被壓縮的學生達到了一個意料之外的標準:它在使用約 教師記憶體四分之一(原文為 "one quarter of the memory")和 教師參數數量一半(原文為 "half the parameter count")的同時,提供了具有競爭力的輸出。

其含意具實務價值。大型模型的託管與運行昂貴:它們需要專用 GPU 或大型記憶體伺服器,並消耗大量能源。能在 4 位元精度與減半參數數量下產生類似或更好結果的模型,可降低成本,並擴大可及性。先前需要雲端託管的使用情境,可能轉向本地部署於高階桌機——甚至未來更輕量的裝置,這對延遲、隱私與營運成本都有利處。

有幾點需注意。首先,該壓縮與修復流程使用了部分專有工具,且已發表的實驗聚焦於單一模型家族。此技術尚未在所有具代表性的開放模型家族(例如 LLaMA、Qwen 或 Mistral)上得到驗證。其次,不同任務與基準對壓縮的反應可能不同:學生可能在某些基準上表現較好,但在報告測試中未評估的其他任務上表現不佳。第三,該流程的成功仰賴精心設計的損失函數、訓練時程與近似感知目標,使學生能在精度限制下調和教師行為。

從方法論角度看,這項工作突顯了模型壓縮的一個重要原則:在知識轉移時以最高品質的訊號為目標。如果學生被引導去近似原始教師的輸出,而不是一個降級的中間體,它就有機會概括教師的優勢,同時學會補償其較低精度的策略。實際上,學生在量化表示的限制下學會模擬全精度的推理。

另一個實務成果是修復後的 600 億模型在一個流行的模型庫上公開釋出,便於社群檢視、複現與進一步實驗。開放釋出可加速驗證、提示工程與第三方比較,也經常揭示社群模型中令人驚訝的表現。話雖如此,可重現性仍仰賴於是否釋出或記錄壓縮與修復流程、超參數,以及訓練中使用的任何資料集或提示集合。

總結來說,該團隊的工作表明,智慧的監督策略可以抵消歷來與量化與縮減規模相關的一些成本。與其接受不可避免的降級,不如透過精心設計的師生安排與量化感知目標,讓較小的模型在某些方面比傳統壓縮版本更便宜且更聰明。

關鍵見解表

面向描述
壓縮目標從 1200 億參數到 600 億參數,使用 4 位元量化
核心技術量化感知修復 — 在補償量化的同時訓練學生以匹配全精度教師
性能結果4 位元 600 億模型在 9 項基準中有 7 項勝過傳統 600 億模型
資源影響大約為教師記憶體使用量的 25% 與參數數量的大約一半
可得性修復後的模型權重已在模型託管平台上公開釋出
限制工具部分為專有;實驗限於特定模型家族與選定基準

後續…

展望未來,這一方向鼓勵社群重新思考壓縮為一種主動的設計選擇,而非單向的折衷。如果量化感知訓練與來自全精度教師的直接監督能在不同架構與任務間泛化,我們或許會看到更小的模型在部署上更為實用而不會有大幅能力損失。這將降低小型團隊的門檻並促成更節能的 AI。要驗證此方法的廣泛適用性與穩健性,複現、透明工具釋出與跨家族更廣泛的測試將是必要的下一步。

最後編輯時間:2026/8/25

Claude AI

AI 智能編輯