文章上線

路由錯誤差點讓 Solana 停擺:失去最終確認的 86% 來由

路由錯誤差點讓 Solana 停擺:失去最終確認的 86% 來由

目錄

您可能想知道的事

1) 為何單一託管服務提供商的一個路由錯誤,能如此迅速地讓接近 29% 的已質押 SOL 下線?

2) 有哪些防護機制可以避免任何單一網路區段威脅 Solana 的最終確認,且為何這些機制幾乎失效?

主要議題

在週三清晨,單一託管服務提供商發生的路由錯誤,使近 28.83% 的 Solana 已質押 SOL 變為延遲狀態(delinquent),使網路距離停止區塊最終確認的臨界值僅差 4.51 個百分點。網路的最終確認臨界值為 33.34%,因此此事件大約代表距離完全停止的 86%。此次中斷僅持續數分鐘,工程師快速恢復服務,但事件揭露了源於網路拓撲與質押分布的集中風險與操作脆弱性。

核心技術故障始於該託管提供商 Teraswitch 內外部傳播路由資訊的方式。Teraswitch 使用一個稱為預設路由(default route)的概念來表示邊緣路由器可以連上網際網路。通常每個站點會偏好由本地來源發出的預設路由。在邁阿密的一個站點,一個預設路由被宣告時遺失了重要屬性——metric 與 community 標籤被剝離。這改變了其他路由器解讀該路由的方式。

位於阿姆斯特丹的一個路由反射器(route reflector)將被改動的預設路由重新分發到其他區域,包括歐洲與亞太地區。多個站點的邊緣路由器因而將此來自邁阿密的路由視為本地來源並偏好它勝過正當的本地路由。當那些邊緣路由器將該路由轉發至資料中心核心時,核心將其視為無效並拒絕。實際效果是,分布於倫敦、阿姆斯特丹、都柏林、法蘭克福、新加坡與東京等城市的十二個站點,失去對外轉發流量的有效路徑。北美站點未受影響,這限制了停機的地理範圍,但並未阻止大量質押下線。

工程師在十分鐘內偵測到錯誤並恢復服務;全面服務於 04:16:15 UTC 回復。儘管停機時間短暫,但對許多驗證者的瞬間連線中斷已足以使其被標記為延遲,並使可用質押降至不健康門檻以下。主要質押協議 Marinade Finance 匯總鏈上資料並衡量即時影響:約 29% 的已質押 SOL 變為延遲,約 90 名受影響驗證者合計的即時錯失獎勵為 333 SOL。這些錯失的獎勵將於時期結束時由驗證者保證金支付,但更令人擔憂的可能情況是跨越 33.34% 的邊界——若發生,鏈將停止最終確認,且沒有任何保證金機制能補償全球停擺。

Marinade 的分析指出質押在單一自治系統(AS)內的集中。AS20326 約承載 118,890,767 SOL,佔所有已質押 SOL 的四分之一以上,且約 94% 的該 AS 之質押在同一短暫時窗內下線。Solana 的委派政策原意是限制單一 AS 不超過網路質押的 25%;AS20326 約為 27.34%,超出該上限,使當該 AS 發生路由故障時,協議暴露於系統性風險之下。

質押分布的進一步細節顯示中斷期間之行為模式:持有約 80.2 百萬 SOL 的 59 個驗證者在路由重新收斂後同時於阿姆斯特丹、法蘭克福與東京回復服務,顯示他們在中斷期間未切換到替代路徑或熱備援(hot failover)。部分營運者比其他人恢復得更快;Helius——網路第二大驗證者——於整個事件期間的 33 分鐘都維持離線。在 Marinade 測量的 74 位驗證者營運者中,僅觀察到三位乾淨回復:Laine、Cogent Crypto(皆由 Sol Strategies 營運)與 Lion3d。此不均勻行為突顯了營運者在設定、冗餘與故障切換實務上的差異。

這種暴露不一定只侷限於單一託管提供商。除了與 AS20326 綁定的大量質押外,約有另外 14.1 百萬 SOL 在同一幾分鐘內於多家提供商(latitude.sh、Limestone、Butterfly Research 與 Allnodes)下線,Marinade 無法僅靠路由資料完全解釋。這表示僅按託管提供商彙總質押可能低估相關故障域——多家提供商或資料中心群組可能共享路由相依性,導致同時失效。

Marinade 也檢視了其自身的配置模型並發現集中風險。四個自治系統佔其分配之三分之二質押,其中一個 AS(AS395201)持有 Marinade 分配質押的 36.94%。該公司公開承認此問題並承諾檢討其在網路與資料中心層級的集中限額。它也表示將開始公布驗證者是否支援熱交換與自動故障切換——這些功能可在短暫停機中降低延遲風險,但難以從驗證者營運者外部環境偵測。

在操作層面,本次事件的錯失獎勵相對較小——333 SOL 將由驗證者保證金支付。但這次險些停擺的事件將注意力拉回系統治理與操作問題:集中限額究竟如何嚴格執行?網路如何激勵地理、AS 級與多提供商的多樣性?驗證者營運者應達到何種故障切換與監控標準?由於去中心化是對抗此類故障的首要防線,質押分布與單一路由小故障即可使近三分之一質押下線的事實,是關鍵的結論。

上一次 Solana 完全停擺是在 2024 年 2 月,當時復原花費近五小時。雖然本次事件解決得快得多,但它顯示出網路對於相關基礎建設故障的持續敏感性。短暫且快速的事件仍可能在質押集中與路由相依不利對齊時威脅最終確認。

重點摘要表

面向描述
即時影響在一次路由錯誤期間,28.83% 的已質押 SOL 變為延遲狀態。
接近失去最終確認的程度網路距離 33.34% 的最終確認臨界值僅差 4.51 個百分點(約 86% 的距離)。
主要原因一個來自邁阿密站點被誤傳播的預設路由,被邊緣路由器偏好再由核心拒絕。
集中風險AS20326 承載約 27.34% 的質押;該 AS 約 94% 的質押同時下線。
錯失獎勵約 333 SOL 的獎勵被錯失,將由驗證者保證金補償。
操作性教訓需要更強的 AS 與資料中心多樣性、改進故障切換,以及透明的驗證者能力披露。

後續…

此事件強調當質押集中且路由相依被共享時,短暫的基礎設施故障能迅速升級。短期緩解措施包括對單一 AS 質押實施更嚴格上限、清楚發布驗證者故障切換能力,以及鼓勵營運者實施熱交換或多宿主(multi-homing)策略。長期韌性可能依賴協議層面的防護、改善質押分布之遙測,以及透過經濟激勵獎勵驗證者在地理與網路層級的多樣性。

開發者、基金會與質押服務需合作制定可衡量的標準:自動檢查集中暴露、強制揭露故障切換支援,或許還有能根據新興集中指標動態調整的委派限制。對於網路參與者與代幣持有者而言,此事件提醒去中心化不僅是理論性質,而是操作上的必要條件——若無多元且獨立的基礎設施,即使短暫故障也可能威脅最終確認。

在短期內,利害關係人應預期主要質押提供商會進一步進行審計並調整委派與分配政策,同時改進公開報告。這些改變可降低重演機率,並使網路更能抵禦路由與資料中心日常運作的現實風險。

最後編輯時間:2026/8/12
#SOL#去中心化

Claude AI

AI 智能編輯