Anthropic 推出 Haiku 5.5:迄今速度最快、價格最親民的 Claude 模型
前言
Anthropic 的 Claude Haiku 5.5 是一款小型模型,專為重視速度、規模和成本的任務而設計。它於週三發布,定位於文件摘要、資料庫查詢等大量處理工作,以及即時客戶支援和瀏覽器操作等時間敏感型應用。最受矚目的變化是價格:提示詞最多 100,000 tokens 時,開發者每百萬個輸入 tokens 支付 $0.10,每百萬個輸出 tokens 支付 $0.50,遠低於 Haiku 4.5。同時,公布的基準測試結果顯示,Haiku 5.5 能有效處理部分電腦操作和命令列任務。本文將檢視其價格、預期用途、公布的評測結果、限制和可用情況。關鍵考量不只是模型是否快速或便宜,而是它是否足夠可靠,能勝任交付給它的工作。
懶人包
Haiku 5.5 的 token 價格低於 Haiku 4.5,適用於重複性高、處理量大或講求速度的任務。它在 OSWorld 2.1 得分 72.4%,在 Terminal-Bench 4.0 得分 39.2%,兩項測試的成績均高於文中引用的 OpenAI GPT-6 Luna 結果。它在 GDPval-AA v2.1 的得分為 1620。然而,一次實際測試中的簡單邏輯題,模型雖然迅速作答,答案卻錯了,凸顯基準測試表現出色並不代表每次互動都能答對。使用者應確認重要輸出,不要把快速回應當成準確的證明。Anthropic 也為 Haiku 推出可調整的 effort 設定,並調降 Sonnet 5.5 的快取讀取價格。
正文
Anthropic 於週三發布 Claude Haiku 5.5,並稱它是自家推出過最便宜、最快且能力最強的小型模型。這款模型適用於需要以低成本處理大量請求的工作負載,也適合重視短回應時間的應用。範例包括文件摘要、資料庫查詢、處理客戶支援對話,以及代替使用者操作網頁瀏覽器。這些用途的共同重點在於實際效益:高效率完成明確的任務,通常還要能處理大量工作,而非產出特別有創意或開放式的內容。
提示詞最多 100,000 tokens 時,透過 API 使用此模型的開發者,每百萬個輸入 tokens 支付 $0.10,每百萬個輸出 tokens 支付 $0.50。Tokens 是模型處理和生成的細小文字片段,也是服務供應商計算許多 API 費用時採用的單位。這項標示價格與 OpenAI 在 September 22 推出競爭的小型模型 GPT-6 Luna 時設定的價格相同。相較之下,Haiku 4.5 每百萬個輸入 tokens 收費 $1,每百萬個輸出 tokens 收費 $5。因此,對於這些長度的提示詞,新價格降低了 90%。
超過 100,000 tokens 的提示詞也可享有 50% 的降價。Anthropic 估計平均可節省約 75%;這項估算考量了舊模型約 90% 的請求低於 100,000-token 門檻,以及 Haiku 5.5 會將文字切分成略多的 tokens。因此,平均節省幅度是根據服務供應商對請求模式的說明所作的估算,並非宣稱每一筆個別請求都會便宜 75%。實際費用取決於提示詞長度、生成的輸出內容,以及適用的價格級距。
模型目標工作負載有助於說明其為何著重成本與速度。客戶支援對話和長篇電子郵件摘要,都是重複性高、相對簡單的任務;當使用量龐大時,每次請求價格較低便格外重要。若模型能在明確的工作流程中快速行動,資料庫查詢和瀏覽器操作也能從中受益。這些特性讓 Haiku 5.5 有望成為大型產品或服務中的一個元件。但光憑這些特性,不能證明它適合所有任務,也不能保證它可以在無人監督下運作。
基準測試結果能更具體地呈現它的能力。在測試 AI 是否能透過多步驟、長流程操作真實電腦的 OSWorld 2.1 中,Haiku 5.5 的成功率為 72.4%。來源將此結果與 OpenAI GPT Luna 的 48.9% 相比。OSWorld 採用部分計分百分比,因此這項分數反映模型在受評任務中的整體表現,而不保證模型能成功完成每一項電腦操作任務。儘管如此,結果仍顯示 Haiku 5.5 能有效處理部分涉及介面和一連串操作的工作流程。
Terminal-Bench 4.0 評估 AI 代理自行輸入命令完成專業任務的表現,衡量首次嘗試便正確完成任務的比例。Haiku 5.5 得分 39.2%,OpenAI 的 Luna 為 16.4%,Haiku 4.5 則為 0%。Anthropic 的 Claude Sonnet 5.5 在相同的程式設計測試中得分 70.6%。這項比較顯示 Haiku 5.5 優於文中引用的小型模型結果,但也看得出它與 Sonnet 5.5 的分數仍有顯著差距。特定基準測試的分數,只能反映模型在該測試條件下的表現,不應視為衡量程式設計能力的普遍標準。
在評估 44 種職業實際專業工作的 GDPval-AA v2.1 中,Haiku 5.5 得分 1620。此評估採用 Elo 評分系統,這是一種借用自西洋棋的對戰評分方法。公布的數據中,Luna 得分為 1437,Haiku 4.5 得分為 735。這提供了另一種比較模型的參考,但綜合評分無法涵蓋每種職業、組織或實際需求。整體而言,這些基準測試結果顯示 Haiku 5.5 是一款在特定電腦操作、命令列和專業工作評測中表現亮眼的小型模型,而不是在所有情境中都全面勝出的模型。
一次實際測試說明了這項區別為何重要。模型收到一道簡單的邏輯題,幾乎立刻就作答,但答案錯了。這項觀察僅來自一次互動,不能取代系統性評估。不過,這仍提醒我們,速度和基準測試分數並不能排除出錯的可能。對於影響重大的任務,使用者應檢查輸出、以具代表性的範例測試模型,並在依賴其答案或操作前建立適當的人工審核機制。
Haiku 5.5 是首款具備可調整 effort 設定的 Haiku 模型。使用者可以選擇模型投入的 effort 程度,在成本和更聰明的答案之間取捨。這為開發者提供另一種方法,能依不同任務類型管理效能與支出。簡單且重複的請求,可能不需要像複雜任務那樣投入相同程度的 effort。與任何可調整設定一樣,合適的平衡取決於實際應用:團隊需要評估增加 effort 是否能改善結果,並足以抵銷相應成本和回應時間影響。
Anthropic 也將 Sonnet 5.5 的快取讀取價格減半,調降至每百萬 tokens $0.10。快取讀取適用於模型已處理過的文字,因此當應用程式重複使用上下文時,折扣價格便格外相關。這項價格調整與 Haiku 5.5 的 token 費率不同,使用 Sonnet 5.5 處理重複文字工作流程的開發者可能會受到影響。這些公告合計降低了 Claude 系列不只一款模型的 API 成本。
此次發布為 Claude 5.5 系列模型的推出畫下句點。Haiku 5.5 在 Opus 5.5 於 September 22 發布後 15 days 推出,也是在 Sonnet 5.5 於 September 28 推出後 9 days 發布。它是 Anthropic 承諾推出的三款 Claude 5.5 模型中的最後一款。Opus 5.5 是執行長 Dario Amodei 發表文章呼籲業界放慢 AI 能力提升步調後,Anthropic 推出的首款模型。這個發布時序顯示 Haiku 5.5 是更大規模產品推出計畫的一環,而這款模型的定位則特別著重價格實惠和快速執行。
Haiku 5.5 目前可透過 Claude 網站、Amazon Web Services、Google Cloud 和 Microsoft Azure 使用,模型名稱為 claude-haiku-5-5。Anthropic 本週也將為部分訂閱者推出每月 API 點數:Max 5x 方案使用者可獲得 $100,Max 20x 可獲得 $200,Team 方案則可由使用者共享,最高 $500。這些點數與模型標示的 token 價格分開計算。對於考慮採用此模型的開發者和組織,決策將取決於 API 成本、模型與預定任務的契合度,以及管理錯誤結果所需的防護措施。
重點摘要表
| 項目 | 說明 |
|---|---|
| API 定價 | 提示詞最多 100,000 tokens 時,Haiku 5.5 每百萬個輸入 tokens 收費 $0.10,每百萬個輸出 tokens 收費 $0.50,比 Haiku 4.5 的 $1 和 $5 低 90%。 |
| 預估節省 | Anthropic 預估平均可節省約 75%,並指出舊模型約 90% 的請求低於 100,000 tokens,而 Haiku 5.5 使用的 tokens 略多。 |
| OSWorld 2.1 | Haiku 5.5 得分 72.4%,OpenAI GPT Luna 則為 48.9%。 |
| Terminal-Bench 4.0 | Haiku 5.5 得分 39.2%;OpenAI Luna 為 16.4%,Haiku 4.5 為 0%,Sonnet 5.5 為 70.6%。 |
| GDPval-AA v2.1 | 涵蓋 44 種職業的評測中,Haiku 5.5 得分 1620,Luna 為 1437,Haiku 4.5 為 735。 |
| 能力與注意事項 | 模型新增可調整的 effort 設定,在特定基準測試中表現良好,但據報一次邏輯測試中曾迅速給出錯誤答案。 |
| 可用情況與點數 | 可透過 Claude 網站、Amazon Web Services、Google Cloud 和 Microsoft Azure 使用,模型名稱為 claude-haiku-5-5。每月點數包括 Max 5x 的 $100、Max 20x 的 $200,以及 Team 方案共享的最高 $500。 |
最後編輯時間:2026/10/7
