Haiku 5.5:哪些工作適合小模型
比較分段費率與任務需求,從固定、能抽查的工作開始試小模型。
這篇會聊到
Claude Haiku 5.5 的 API 費率降了,但不是所有請求都算同一個價。提示詞在 10 萬 token 以內時,輸入與輸出單價都是 Sonnet 5.5 的二十分之一;超過門檻,就換另一組費率。
如果你每天要做分類、抽欄位或整理短文件,這次更新值得拿自己的資料試。本文整理官方文件,尚未用 Haiku 5.5 跑完我們的整套工作流程。
發生了什麼
Anthropic 在 2026-10-07 發表 Claude Haiku 5.5,官方形容它是 Anthropic 迄今最便宜、最快、也最強的小模型。三個 5.5 的官方資料如下,單位是每百萬 token 的美元價格:
| 模型 | 發表日 | 輸入 / 輸出 | 官方定位 |
|---|---|---|---|
| Haiku 5.5 | 2026-10-07 | $0.10 / $0.50 | 高量、低延遲,如分類、抽取、路由 |
| Sonnet 5.5 | 2026-09-28 | $2 / $10 | 速度與智慧的平衡 |
| Opus 5.5 | 2026-09-22 | $4 / $20 | 長時間寫程式與知識工作 |
Haiku 5.5 的價格適用於提示詞 10 萬 token 以內;超過的話是 $0.50 / $2.50。和上一代 Haiku 4.5($1 / $5)相比:
- 定價:10 萬 token 以內低 90%,超過低 50%。官方給的整體說法是平均約便宜 75%。
- 第一個有 effort 設定的 Haiku,分 low、medium、high、xhigh、max 五級,預設 medium。
- 上下文長度從 200k 增加到 1M,最大輸出從 64k 增加到 128k。
- 換了新的 tokenizer,同樣文字約多算 30% token。
- 平台:Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS。
媒體數字和官方有出入的地方,我以官方為準。「便宜 75%」是官方的平均值,定價降幅其實是 90% 或 50%。Sonnet 5.5 的定價和 Sonnet 5 一樣($2 / $10),「便宜 30%」指每個任務最多省 30%,因為用的 token 比較少;「快 30%」則是輸出速度快 30% 以上。
小模型適合做什麼、不適合做什麼
| 適合交給 Haiku 5.5 | 留給 Sonnet 5.5 或 Opus 5.5 |
|---|---|
| 分類、貼標籤,如留言、信件、客服訊息 | 多步驟、前後相依的長流程,如複雜的程式修改 |
| 摘要、壓縮長對話、整理逐字稿 | 需要取捨的決策,如報價、合約、對外聲明 |
| 抽取欄位,轉成表格或 JSON | 出錯代價高、事後又不好檢查的事 |
| 路由:判斷這件事該交給誰 | 要在長對話裡始終守住規則的對外客服 |
| 大模型分派下來的搜尋、讀檔、整理 |
差距因任務而異。Anthropic 自己的 GPQA Diamond 測試,Haiku 5.5 是 85%,Sonnet 5.5 和 Opus 5.5 都是 91%(拒答算答錯);複雜程式作業的 Terminal-Bench 4.0,Haiku 5.5 是 39.2%,Sonnet 5.5 是 70.6%,官方也明說這類工作仍該選 Sonnet 5.5 或 Opus 5.5。
小團隊的分層用法
用 Claude Code 時,簡單重複的任務交給小模型,需要判斷的才用大模型,開工前先用一行宣告這次的分層方案和預估用量,再執行。套用到 5.5 系列,可以先試這樣的分工:
- 第一層 Haiku 5.5(effort low 到 medium):留言與信件分類、逐字稿摘要、從一堆文字抽出日期和金額、素材命名與欄位整理。
- 第二層 Sonnet 5.5(medium 到 high):文章初稿、比較表、一般的資料分析與程式修改。
- 第三層 Opus 5.5:策略與提案取捨、合約風險檢查、要連跑好幾小時的自動化流程、定稿前的把關。
圖:可試用的三層分工,各層對應的模型、effort 範圍與任務。
判斷規則只有三題:
- 做錯了,我抽查十筆能不能發現?不能,升一級。
- 有固定格式或標準答案嗎?沒有,升一級。
- 要跨多步、前後相依地判斷嗎?要,至少用 Sonnet。
三題都過關才給 Haiku。同一個模型裡還有第二個旋鈕 effort:官方建議 low 用在聊天、短工具任務和簡單高量的請求,high 用在知識工作、較長的 agent 任務和需要嚴格遵守指令的場合。Anthropic 的選型指南提供兩種起點,其中一種就是先從 Haiku 5.5 開始,不夠再升級。
用官方定價試算(用量是假設,輸出數量不另加思考 token,未套用快取與 Batch 折扣):每月 1,000 次,每次輸入 2 萬 token、輸出 2 千 token,Haiku 5.5 約 $3,Sonnet 5.5 約 $60,Opus 5.5 約 $120。對外發布的東西我一定自己先看過,分層只決定誰先做草稿。
圖:每月 1,000 次、每次輸入 2 萬 token、輸出 2 千 token 的試算花費,作者自己算的,不含思考 token、快取與 Batch 折扣。資料:Anthropic 官方定價。
怎麼開始
- 列出這週重複做三次以上的任務,挑出有固定格式、能抽查的。
- 選一項,用 10 筆真實資料,同一份提示詞分別跑 Haiku 5.5 和 Sonnet 5.5,比較結果。官方也建議用自己的資料建評測,不要只看公開跑分。
- effort 從預設的 medium 起跑;簡單高量的任務再試 low,抽查有沒有漏步驟或提早收工,有就升回 medium。
- 在 Claude Code 先執行
claude update(Haiku 5.5 需要 v2.1.293 以上),用/model haiku切換;子代理在設定檔寫model: haiku;用/effort調整 effort。 - 用 API 的話,不趕時間的工作走 Batch API(再省 50%,Haiku 5.5 為 $0.05 / $0.25),重複的長提示詞開 prompt caching(快取讀取 $0.01)。
要注意的地方
- 預算要重算。新 tokenizer 讓同樣文字多約 30% token;思考預設開啟且計入 max_tokens,設太小可能只看到思考、沒有答案。
- 長提示詞會加價。超過 10 萬 token(含快取讀寫)整筆改按 $0.50 / $2.50 計,仍約是 Sonnet 5.5 的四分之一。
- 低 effort 有弱點。官方指南提到,長 agent 提示詞搭配 low 時容易提早收工;在 low 和 medium 下,改程式後也可能沒跑檢查就回報完成,要在提示詞裡明講要驗證。
- API 相容性。非預設的 temperature、top_p、top_k 會回 400 錯誤,也不支援 assistant prefill。
- 拒絕回應。新增安全分類器,會回傳
stop_reason: "refusal",沒有伺服器端備援,合法的資安工作也可能被擋。 - 平台差異。Bedrock 與 Google Cloud 的 Haiku 5.5 價格由各家公布,我沒有逐一核對,待確認;Claude Code 在 Bedrock、Google Cloud、Foundry 上的 haiku 別名目前仍指向 Haiku 4.5。claude.ai 與 Claude 應用程式是否提供 Haiku 5.5,發表文沒寫,待確認。
- 基準測試是 Anthropic 與客戶公布的結果,換成你的資料可能不同。
先比較一項固定任務
先挑一項有標準答案的工作,用同一批資料比較 Haiku 與目前的模型。記下錯誤、人工修改時間和實際帳單,再決定要不要擴大使用。
便宜的模型也可能把資料分錯,卻沒有任何錯誤訊息。能不能檢查結果,應該和價格一起考慮。
來源
- Introducing Claude Haiku 5.5 (Anthropic)
- Introducing Claude Sonnet 5.5 (Anthropic)
- Introducing Claude Opus 5.5 (Anthropic)
- Models overview (Claude Docs)
- Claude Haiku 5.5 model page (Claude Docs)
- What’s new in Claude Haiku 5.5 (Claude Docs)
- Pricing (Claude Docs)
- Effort (Claude Docs)
- Prompting Claude Haiku 5.5 (Claude Docs)
- Choosing the right model (Claude Docs)
- Multi-model strategies (Claude Docs)
- Model configuration (Claude Code Docs)
- Create custom subagents (Claude Code Docs)