Shawn Go NomadAI 新消息與工作筆記追蹤更新
工具筆記

Haiku 5.5:哪些工作適合小模型

比較分段費率與任務需求,從固定、能抽查的工作開始試小模型。

這篇會聊到

Claude Haiku 5.5 的 API 費率降了,但不是所有請求都算同一個價。提示詞在 10 萬 token 以內時,輸入與輸出單價都是 Sonnet 5.5 的二十分之一;超過門檻,就換另一組費率。

如果你每天要做分類、抽欄位或整理短文件,這次更新值得拿自己的資料試。本文整理官方文件,尚未用 Haiku 5.5 跑完我們的整套工作流程。

發生了什麼

Anthropic 在 2026-10-07 發表 Claude Haiku 5.5,官方形容它是 Anthropic 迄今最便宜、最快、也最強的小模型。三個 5.5 的官方資料如下,單位是每百萬 token 的美元價格:

模型 發表日 輸入 / 輸出 官方定位
Haiku 5.5 2026-10-07 $0.10 / $0.50 高量、低延遲,如分類、抽取、路由
Sonnet 5.5 2026-09-28 $2 / $10 速度與智慧的平衡
Opus 5.5 2026-09-22 $4 / $20 長時間寫程式與知識工作

Haiku 5.5 的價格適用於提示詞 10 萬 token 以內;超過的話是 $0.50 / $2.50。和上一代 Haiku 4.5($1 / $5)相比:

  • 定價:10 萬 token 以內低 90%,超過低 50%。官方給的整體說法是平均約便宜 75%。
  • 第一個有 effort 設定的 Haiku,分 low、medium、high、xhigh、max 五級,預設 medium。
  • 上下文長度從 200k 增加到 1M,最大輸出從 64k 增加到 128k。
  • 換了新的 tokenizer,同樣文字約多算 30% token。
  • 平台:Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS。

媒體數字和官方有出入的地方,我以官方為準。「便宜 75%」是官方的平均值,定價降幅其實是 90% 或 50%。Sonnet 5.5 的定價和 Sonnet 5 一樣($2 / $10),「便宜 30%」指每個任務最多省 30%,因為用的 token 比較少;「快 30%」則是輸出速度快 30% 以上。

小模型適合做什麼、不適合做什麼

適合交給 Haiku 5.5 留給 Sonnet 5.5 或 Opus 5.5
分類、貼標籤,如留言、信件、客服訊息 多步驟、前後相依的長流程,如複雜的程式修改
摘要、壓縮長對話、整理逐字稿 需要取捨的決策,如報價、合約、對外聲明
抽取欄位,轉成表格或 JSON 出錯代價高、事後又不好檢查的事
路由:判斷這件事該交給誰 要在長對話裡始終守住規則的對外客服
大模型分派下來的搜尋、讀檔、整理

差距因任務而異。Anthropic 自己的 GPQA Diamond 測試,Haiku 5.5 是 85%,Sonnet 5.5 和 Opus 5.5 都是 91%(拒答算答錯);複雜程式作業的 Terminal-Bench 4.0,Haiku 5.5 是 39.2%,Sonnet 5.5 是 70.6%,官方也明說這類工作仍該選 Sonnet 5.5 或 Opus 5.5。

小團隊的分層用法

用 Claude Code 時,簡單重複的任務交給小模型,需要判斷的才用大模型,開工前先用一行宣告這次的分層方案和預估用量,再執行。套用到 5.5 系列,可以先試這樣的分工:

  • 第一層 Haiku 5.5(effort low 到 medium):留言與信件分類、逐字稿摘要、從一堆文字抽出日期和金額、素材命名與欄位整理。
  • 第二層 Sonnet 5.5(medium 到 high):文章初稿、比較表、一般的資料分析與程式修改。
  • 第三層 Opus 5.5:策略與提案取捨、合約風險檢查、要連跑好幾小時的自動化流程、定稿前的把關。

小團隊的三層分工:Haiku 5.5 做重複的事,Sonnet 5.5 做草稿與分析,Opus 5.5 做取捨與把關

圖:可試用的三層分工,各層對應的模型、effort 範圍與任務。

判斷規則只有三題:

  1. 做錯了,我抽查十筆能不能發現?不能,升一級。
  2. 有固定格式或標準答案嗎?沒有,升一級。
  3. 要跨多步、前後相依地判斷嗎?要,至少用 Sonnet。

三題都過關才給 Haiku。同一個模型裡還有第二個旋鈕 effort:官方建議 low 用在聊天、短工具任務和簡單高量的請求,high 用在知識工作、較長的 agent 任務和需要嚴格遵守指令的場合。Anthropic 的選型指南提供兩種起點,其中一種就是先從 Haiku 5.5 開始,不夠再升級。

用官方定價試算(用量是假設,輸出數量不另加思考 token,未套用快取與 Batch 折扣):每月 1,000 次,每次輸入 2 萬 token、輸出 2 千 token,Haiku 5.5 約 $3,Sonnet 5.5 約 $60,Opus 5.5 約 $120。對外發布的東西我一定自己先看過,分層只決定誰先做草稿。

同樣工作量每月花費:Haiku 5.5 約 $3,Sonnet 5.5 約 $60,Opus 5.5 約 $120

圖:每月 1,000 次、每次輸入 2 萬 token、輸出 2 千 token 的試算花費,作者自己算的,不含思考 token、快取與 Batch 折扣。資料:Anthropic 官方定價。

怎麼開始

  1. 列出這週重複做三次以上的任務,挑出有固定格式、能抽查的。
  2. 選一項,用 10 筆真實資料,同一份提示詞分別跑 Haiku 5.5 和 Sonnet 5.5,比較結果。官方也建議用自己的資料建評測,不要只看公開跑分。
  3. effort 從預設的 medium 起跑;簡單高量的任務再試 low,抽查有沒有漏步驟或提早收工,有就升回 medium。
  4. 在 Claude Code 先執行 claude update(Haiku 5.5 需要 v2.1.293 以上),用 /model haiku 切換;子代理在設定檔寫 model: haiku;用 /effort 調整 effort。
  5. 用 API 的話,不趕時間的工作走 Batch API(再省 50%,Haiku 5.5 為 $0.05 / $0.25),重複的長提示詞開 prompt caching(快取讀取 $0.01)。

要注意的地方

  • 預算要重算。新 tokenizer 讓同樣文字多約 30% token;思考預設開啟且計入 max_tokens,設太小可能只看到思考、沒有答案。
  • 長提示詞會加價。超過 10 萬 token(含快取讀寫)整筆改按 $0.50 / $2.50 計,仍約是 Sonnet 5.5 的四分之一。
  • 低 effort 有弱點。官方指南提到,長 agent 提示詞搭配 low 時容易提早收工;在 low 和 medium 下,改程式後也可能沒跑檢查就回報完成,要在提示詞裡明講要驗證。
  • API 相容性。非預設的 temperature、top_p、top_k 會回 400 錯誤,也不支援 assistant prefill。
  • 拒絕回應。新增安全分類器,會回傳 stop_reason: "refusal",沒有伺服器端備援,合法的資安工作也可能被擋。
  • 平台差異。Bedrock 與 Google Cloud 的 Haiku 5.5 價格由各家公布,我沒有逐一核對,待確認;Claude Code 在 Bedrock、Google Cloud、Foundry 上的 haiku 別名目前仍指向 Haiku 4.5。claude.ai 與 Claude 應用程式是否提供 Haiku 5.5,發表文沒寫,待確認。
  • 基準測試是 Anthropic 與客戶公布的結果,換成你的資料可能不同。

先比較一項固定任務

先挑一項有標準答案的工作,用同一批資料比較 Haiku 與目前的模型。記下錯誤、人工修改時間和實際帳單,再決定要不要擴大使用。

便宜的模型也可能把資料分錯,卻沒有任何錯誤訊息。能不能檢查結果,應該和價格一起考慮。

來源

謝謝你讀到這裡。有問題或發現錯誤?來信告訴我 ↗
KEEP IN TOUCH

下次更新,再來看看。

最新文章會放在這裡。你可以用 RSS 追蹤;
電子報正在籌備,開刊時再通知你。

收到開刊通知 用 RSS 追蹤文章 →開刊通知會開啟郵件程式,寄出後由我們登記。
圖解另開圖片 ↗