Claude Haiku 5.5 が2026年10月7日に出て、Claude の小型モデルは入力 $0.10・出力 $0.50(100万トークンあたり・プロンプト10万トークン以下)まで下がりました。Sonnet 5.5 の $2.00・$10.00 と比べると20分の1です。結論から言うと、分類・抽出・要約・ルーティング・サブエージェントは Haiku 5.5 で足ります。足りないのは1領域で、エージェント型コーディングです(Terminal-Bench 4.0 で39.2%対70.6%)。この線引きを公式の数値で引いていきます。
先に結論:安いほうで足りるかを決める3つの問い
迷ったら次の順に自分へ問えば決まります。価格表もベンチマークも、この3問に答えるための材料です。
- 仕事の範囲は決まっているか。分類・抽出・要約・ルーティングのように入口と出口が決まっているなら Haiku 5.5。
- モデルが何十手も自分で考えて進める必要があるか。あるなら Sonnet 5.5 以上。Haiku 5.5 のエージェント型コーディングは Sonnet 5.5 の半分強しかありません。
- 1リクエストが10万トークンを超えるか。超えると Haiku 5.5 の単価が5倍に跳ね、価格差は20倍から4倍まで縮みます。ここでは Sonnet 5.5 を素直に検討したほうがよい。
価格差は20倍、ただし10万トークンを超えると4倍に縮む
Haiku 5.5 の料金でいちばん見落とされやすいのが段階制です。プロンプトの長さが10万トークンを超えると単価が5倍になります。旧世代の Haiku 4.5 には段階制が無く一律だったので、ここは新しく増えた判断軸です。なおコンテキストウィンドウ100万トークン・最大出力12.8万トークンという器の大きさは、Haiku 5.5 と Sonnet 5.5 で同じです。
項目(100万トークンあたり) | Haiku 5.5(10万以下) | Haiku 5.5(10万超) | Sonnet 5.5 | 価格差 |
|---|---|---|---|---|
入力 | $0.10 | $0.50 | $2.00 | 20倍 → 4倍 |
出力 | $0.50 | $2.50 | $10.00 | 20倍 → 4倍 |
キャッシュ読取 | $0.01 | $0.05 | $0.10 | 10倍 → 2倍 |
キャッシュ書込(5分) | $0.125 | $0.625 | $2.50 | 20倍 → 4倍 |
段階制が判断を変えるのは、「長い資料を丸ごと投げる」使い方が Haiku 5.5 のいちばん美味しいゾーンから外れるからです。10万トークン超のリクエストで計算すると、Sonnet 5.5 との差は4倍程度まで縮みます。それなら精度の高いほうを選ぶ、という判断が十分に成り立ちます。
逆に、Haiku 4.5 の実績ではリクエストの90%が10万トークン以下でした。現実の業務用途はほとんどが安いゾーンに収まる、というのが公式の見立てです(公式はこの内訳から「平均で約75%安くなる」と説明しています)。段階制ごとの単価と請求の読み方はClaude Haiku 5.5 の料金を段階制ごとに分解した記事で詳しく扱っています。
なお Sonnet 5.5 側も10月7日にキャッシュ読取が $0.20 から $0.10 へ半額になりました。キャッシュ読取はトークン消費の大半を占めるため、公式は「ほとんどのエージェント型タスクで Sonnet 5.5 のコストが約20%下がる」としています。値下げは Haiku だけの話ではない、という点は見落とさないほうがよいところです。
ベンチマーク:追いついた領域と、決定的に足りない領域
Anthropic が公開した数値を、Haiku 5.5・Sonnet 5.5・GPT-6 Luna の3列で並べました。分野によって勝ち負けがはっきり割れます。
評価 | Haiku 5.5 | Sonnet 5.5 | GPT-6 Luna | Haiku 5.5 の位置 |
|---|---|---|---|---|
GDPval-AA v2.1(実務の知識労働・Elo) | 1620 | 1840 | 1437 | Sonnet に近い |
AA-Briefcase v1.1(Elo) | 1578 | 1824 | 1336 | Sonnet に近い |
OSWorld 2.1(コンピュータ操作) | 72.4% | 83.9% | 48.9% | Sonnet に近い |
Chartography(視覚推論・ツール無し) | 46.4% | 61.6% | 29.1% | 差あり |
Terminal-Bench 4.0(エージェント型コーディング) | 39.2% | 70.6% | 16.4% | 決定的に足りない |
Humanity's Last Exam(ツール無し) | 45.9% | 公式図に記載なし | 56.9% | Luna が上 |
Humanity's Last Exam(ツールあり) | 57.4% | 公式図に記載なし | 64.5% | Luna が上 |
読み方は3つに分かれます。
- 知識労働とコンピュータ操作は、価格が20分の1でも意外に迫っている。GDPval-AA は1620対1840、OSWorld は72.4%対83.9%。20倍の価格差を払い続ける根拠として十分かは、仕事の性質次第です。
- エージェント型コーディングだけは埋めようがない。39.2%対70.6%は「安いから妥協する」で済む差ではありません。自律的に手を動かし続けるタスクを Haiku 5.5 に投げると、失敗のやり直しで結局コストが膨らみます。
- GPT-6 Luna との勝負は分野で割れる。Haiku 5.5 は知識労働(1620対1437)・コンピュータ操作(72.4%対48.9%)・エージェント型コーディング(39.2%対16.4%)で上ですが、Humanity's Last Exam では Luna のほうが上です(ツール無しで56.9%対45.9%、ツールありで64.5%対57.4%)。学術的な難問への一発回答では Luna が強い、という読み方になります。OpenAI 側の小型モデルの位置づけはGPT-6 Sol と Luna の違いと使える場所にまとめています。
この表で Haiku 4.5 を並べていないのは、比較の意味が薄いからです。Haiku 4.5 は Terminal-Bench 4.0 が0.0%、OSWorld が15.7%で、そもそも同じ土俵に乗っていません。
公式自身が引いている線
この記事の結論は、Anthropic 自身の記述とほぼ同じです。発表資料には次のように明記されています。
Terminal-Bench 4.0 のような複雑なエージェント型コーディングでは Sonnet 5.5 と Opus 5.5 のほうが良い選択。Haiku 5.5 はコンパクション・要約・サブエージェントのように、従来のモデルではコスト的に無理だった狭いタスクに向く。
重要なのは、公式が Haiku 5.5 を「Sonnet 5.5 の安い代替」として売っていない点です。「これまで AI に投げるには高すぎた狭い仕事を、ようやく投げられる価格になったモデル」として位置づけています。だから比較の問いは「Sonnet を Haiku に置き換えられるか」ではなく、「いま Sonnet に投げている仕事のうち、本当は狭い仕事がどれだけ混じっているか」になります。
公式が挙げる向き先は、要約・コンパクション(会話履歴の圧縮)・データベースクエリ・分類、そしてOpus 5.5 / Sonnet 5.5 のサブエージェントです。レイテンシが体感に直結するライブのカスタマーサポートやブラウザ操作も名指しされています。Sonnet と Opus の間の線引きは半額差の Sonnet 5.5 と Opus 5.5 をどう振り分けるかに整理してあるので、3段の全体像はそちらと併せて見てください。
顧客の早期検証は「どの種類の仕事」で効いたか
公式に掲載された早期検証を、スコアではなく仕事の種類で並べ替えると、線引きの答え合わせになります。
企業 | 仕事の種類 | 公式掲載の結果 |
|---|---|---|
Asana | AIエージェント製品の評価スイート | タスク完了のレイテンシが30%以上減少。エージェント1ターンあたりの推論が最大2.5倍速く |
HubSpot | CRM(顧客関係管理)タスク=型の決まった業務処理 | 3回平均92.8%=同社がこれまで見た中で最高スコア。最速・最高ヒット率・最低の誤検出率 |
AlphaSense | 文書への質問応答(週800万コール規模) | 400クエリの検証で Haiku 4.5 の0.76に対し0.84(統計的に有意な改善) |
Box | 早期検証 | Haiku 4.5 より11ポイント高いスコアを、レイテンシ約半分で |
並べてみると傾向がはっきりします。効いているのは「型の決まった処理を、速く・大量に」という仕事ばかりです。Asana はエージェントの1ターンあたりの速度、HubSpot は CRM タスクのヒット率、AlphaSense と Box は文書に対する問い合わせ。長い自律コーディングの事例は1つも挙がっていません。ベンチマークの読みと、顧客の使いどころが一致しているわけです。
実務の判断フレーム:仕事別の振り分け表
ここまでの材料を、実務で使える形に落とします。社内で AI を回すなら、「どのモデルを使うか」ではなく「どの仕事をどのモデルに割り当てるか」を決めるのが先です。
仕事の種類 | 割り当て | 根拠 |
|---|---|---|
問い合わせの分類・振り分け、タグ付け | Haiku 5.5 | 範囲が決まっており件数が多い。入力 $0.10 が効く |
帳票・メールからの項目抽出 | Haiku 5.5 | HubSpot の CRM タスク92.8%と同じ性質 |
議事録・長い会話の要約、コンパクション | Haiku 5.5 | 公式が名指しする向き先。ただし入力が10万トークンを超えるなら試算し直す |
チャットでの一次応答、社内検索の回答生成 | Haiku 5.5 | レイテンシが体感に直結する用途。公式も速度重視の用途として挙げている |
上位モデルのサブエージェント(調査・下調べ役) | Haiku 5.5 | 公式がコーディングでの向き先として明記 |
複数ファイルにまたがる実装、長い自律コーディング | Sonnet 5.5 以上 | Terminal-Bench 4.0 が39.2%対70.6%。やり直しのコストで逆転する |
設計判断、仕様の矛盾の洗い出し | Sonnet 5.5 以上 | 知識労働の Elo で220ポイント差。判断の質が成果物に直結する |
図表の読み取りを含む分析 | Sonnet 5.5 | Chartography が46.4%対61.6% |
1リクエストが10万トークンを超える処理 | 両方を試算 | 価格差が4倍まで縮むので、精度差のほうが効く可能性がある |
実務でコストが膨らむ典型は、この表の上半分(分類・抽出・要約)まで最上位モデルに投げているケースです。逆に、下半分を安いモデルに寄せすぎると失敗のやり直しが増えて、結果的に高くつきます。タスクごとにモデルを指定できる作りにしておくと、世代が変わるたびに上半分だけ段階的に載せ替えられます。今回の Haiku 5.5 は、まさにその上半分の単価が一段下がった更新です。
Mihata では、この「どの仕事をどのモデルに任せるか」の設計から、社内の仕組みへの実装までを含めて独自AIの構築をお手伝いしています。記事の途中で恐縮ですが、請求額と品質の両方に直結する部分ですので、よろしければ合わせてご覧いただけたら嬉しいです。
見積もりが外れる落とし穴:トークンの数え方が変わった
Haiku 5.5 はトークナイザが Claude 4.7 以降と同じものに変わり、同じ文章が Haiku 4.5 比で約30%多いトークン数になります。単価だけを見て「90%安い」と計算すると請求額は外れます。公式の「平均で約75%安くなる」という数字は、このトークン増加を織り込んだ後の値です。
ただしSonnet 5.5 との比較では、この30%増はそのまま効きません。Sonnet 5.5 も同系列のトークナイザなので、同じ文章なら両者のトークン数は揃います。つまり「Haiku 4.5 → Haiku 5.5」の乗り換え試算には30%増を入れる必要があり、「Sonnet 5.5 ↔ Haiku 5.5」の比較には入れなくてよい、という使い分けになります。試算の前提を混ぜると判断を間違えます。
もう一点、Haiku 5.5 はAdaptive thinking が既定でオン(既定 effort は medium)です。思考トークンは max_tokens に数えられるため、effort を上げるほど出力側の課金が増えます。価格差20倍の前提で比べるなら、effort を揃えてから測るのが基本です。temperature などのサンプリングパラメータや手動の extended thinking は400エラーになる破壊的変更が入っているので、既存コードから載せ替えるならClaude Haiku 5.5 の提供開始と移行時の変更点も確認しておくと手戻りが減ります。
まとめ
- 狭い仕事は Haiku 5.5 で足りる。分類・抽出・要約・コンパクション・ルーティング・サブエージェント。単価は Sonnet 5.5 の20分の1
- 足りないのはエージェント型コーディング。Terminal-Bench 4.0 で39.2%対70.6%。ここは公式自身が Sonnet 5.5 / Opus 5.5 を勧めている
- 知識労働とコンピュータ操作は意外に近い。GDPval-AA 1620対1840、OSWorld 72.4%対83.9%。ここは実際の業務で測って決める余地がある
- 10万トークンを超えると前提が変わる。価格差が20倍から4倍に縮むので、長文を丸ごと投げる用途では Sonnet 5.5 を検討する
- GPT-6 Luna との比較は分野で割れる。知識労働・PC操作・コーディングは Haiku 5.5 が上、Humanity's Last Exam は Luna が上
どの仕事をどのモデルに割り当てるかは、一度決めれば終わりではなく、世代が変わるたびに見直す対象です。社内の業務に当てはめた設計や試算のご相談があれば、お気軽にご連絡ください。
よくある質問
Haiku 5.5 と Sonnet 5.5 はどっちを使えばいいですか?
分類・抽出・要約・コンパクション・ルーティング・上位モデルのサブエージェントのように範囲が決まった仕事は Haiku 5.5 で足ります。複数ファイルにまたがる実装や長い自律コーディング、設計判断は Sonnet 5.5 以上を選んでください。公式も Terminal-Bench 4.0 のような複雑なエージェント型コーディングでは Sonnet 5.5 と Opus 5.5 のほうが良い選択だと明記しています。
価格差は何倍ですか?
100万トークンあたりで、プロンプトが10万トークン以下なら Haiku 5.5 が入力 $0.10・出力 $0.50、Sonnet 5.5 が入力 $2.00・出力 $10.00 で20倍です。ただし Haiku 5.5 は10万トークンを超えると入力 $0.50・出力 $2.50 に上がるため、価格差は4倍まで縮みます。
性能差がいちばん大きいのはどの分野ですか?
エージェント型コーディングです。Terminal-Bench 4.0 は Haiku 5.5 が39.2%、Sonnet 5.5 が70.6%。一方で実務の知識労働を測る GDPval-AA v2.1 は1620対1840、コンピュータ操作の OSWorld 2.1 は72.4%対83.9%で、こちらは比較的近い数値です。
GPT-6 Luna と比べるとどうですか?
分野で勝ち負けが割れます。Haiku 5.5 は GDPval-AA v2.1 が1620対1437、OSWorld 2.1 が72.4%対48.9%、Terminal-Bench 4.0 が39.2%対16.4% で上回ります。ただし Humanity's Last Exam は Luna のほうが上で、ツール無しで56.9%対45.9%、ツールありで64.5%対57.4%です。
Haiku 4.5 から乗り換えるとき、単価の比較だけで試算してよいですか?
よくありません。Haiku 5.5 はトークナイザが Claude 4.7 以降と同じものに変わり、同じ文章が Haiku 4.5 比で約30%多いトークン数になります。公式の「平均で約75%安くなる」はこの増加を織り込んだ数字です。なお Sonnet 5.5 とは同系列のトークナイザなので、両者の比較ではこの30%増を考える必要はありません。