文章上線

OpenAI 的 Jalapeño 晶片在基準測試中提供更快、更高效率的推論

OpenAI 的 Jalapeño 晶片在基準測試中提供更快、更高效率的推論

重點

OpenAI 在 Hot Chips 會議公布其 Jalapeño 推論晶片的基準測試結果,顯示與目前最先進的處理器相比,每位使用者的 tokens 數與每千瓦的吞吐量均有所提升。 這顯示了顯著的效能與效率提升,且設計重點在於減少通訊與預填(prefill)延遲。預計在 2026 年底以有限數量先行部署,並在 2027 年擴大部署,同時競爭對手仍會持續進步。

情緒分析

  • 文章的語氣大致正面並對 Jalapeño 的技術進展與效率提升持樂觀態度。報導突出可量化的基準改進,並強調晶片在降低延遲與提升能效方面的潛力,暗示這是一項強而有力的工程成就。情緒並非毫無保留的慶祝:文章也承認在全面部署前競爭硬體仍會進步,且最初的推出將以有限規模為主。整體而言,文章傳達出審慎的熱情與對未來市場動態的現實評估。
  • 70%

文章內文

在 Hot Chips 會議上,OpenAI 更深入介紹了其新推論晶片 Jalapeño,並展示了首批基準測試結果。使用 SemiAnalysis 的 InferenceX 基準,Jalapeño 在每位使用者的 tokens 數與每千瓦的吞吐量上,都超越目前可用的頂級推論處理器。根據 OpenAI 的硬體負責人表示,這些結果顯示在效能與效率上有顯著進展,使得每單位電力可處理更多 AI 工作並達到更快的回應時間。

Jalapeño 的基準測試與現代 Nvidia Blackwell 系統進行比較。雖然在所呈現的測試中比較結果對 Jalapeño 有利,OpenAI 也承認在 Jalapeño 廣泛部署之前,競爭對手的硬體仍會持續進步。公司估計在 2026 年底會有小批量的初步部署,並計劃在 2027 年進行較大規模的部署。此時間表顯示採分階段引入,以平衡早期測試與改進,並逐步擴大可用性。

該晶片是 OpenAI 與 Broadcom 合作的成果,並在開發過程中使用了 OpenAI 自身的模型協助。OpenAI 希望 Jalapeño 成為一個多代的平臺,協調晶片、記憶體、模型與 AI 產品。這種全棧方式旨在優化整個推論流程中的互動,而不是僅專注於硬體設計的單一環節。

Jalapeño 的一項主要設計優先事項是將常使推論變慢的延遲降到最低:預填階段與元件間通訊。OpenAI 報告指出,透過減少資料移動並將關鍵模型狀態保持在本地 —— 包括生成過程中使用的 KV 快取 —— 系統能更有效地為每個階段啟用適當組合的運算、記憶體與網路。 減少通訊開銷被視為觀察到的延遲與效率改善的主要原因

此方法的含意有二。首先,將更多模型狀態在本地運行可降低在生成過程中跨系統搬移資料的成本,進而減少延遲與耗電。其次,依據特定推論階段調整資源啟用,可對效能與能效進行更細緻的控制,使平臺在維持單一請求低延遲的同時,能夠同時為多位使用者提供服務。

儘管基準數據令人振奮,實際部署將考驗這些優勢在真實、大規模環境中以及面對其他硬體廠商持續改進的競爭時能否持久。OpenAI 計劃整合晶片、記憶體與模型,顯示出一項長期策略,旨在跨多代硬體與軟體維持效能提升。如果成功,這種協調的方法可能帶來在服務效率與回應性方面的持續改善。

總而言之,Jalapeño 的早期基準結果顯示與現有推論系統相比,在每位使用者 tokens 數與能效方面有顯著改善,工程上刻意著重於最小化通訊與預填延遲。該平臺在 2026 與 2027 年分階段部署,意味著更廣泛的驗證將隨時間到來,同時競爭者也會持續優化自家技術。與 Broadcom 的合作以及多代產品路線圖強調了 OpenAI 將硬體與模型開發對齊以求在推論效能上取得持久提升的意圖。

關鍵見解表

面向 描述
基準表現 在 InferenceX 上,每位使用者的 tokens 數較高,且每千瓦的吞吐量高於目前最先進的處理器。
部署時間表 預計在 2026 年底進行小批量部署,並在 2027 年擴大部署規模。
設計重點 透過保持模型狀態在本地並優化各階段的資源啟用,將資料移動與通訊延遲降到最低。
合作夥伴 與 Broadcom 合作開發,開發過程中使用了 OpenAI 的模型。
策略方法 規劃為多代平臺,對齊晶片、記憶體與模型以維持效能提升。
最後編輯時間:2026/8/25
#輝達

Power Trader

Z新聞專欄作家