Mihata
AI活用2026.10.09

Haiku 5.5とSonnet 5.5の使い分け|20倍安で足りる線引き

Claude Haiku 5.5 が2026年10月7日に出て、Claude の小型モデルは入力 $0.10・出力 $0.50(100万トークンあたり・プロンプト10万トークン以下)まで下がりました。Sonnet 5.5 の $2.00・$10.00 と比べると20分の1です。結論から言うと、分類・抽出・要約・ルーティング・サブエージェントは Haiku 5.5 で足ります。足りないのは1領域で、エージェント型コーディングです(Terminal-Bench 4.0 で39.2%対70.6%)。この線引きを公式の数値で引いていきます。

先に結論:安いほうで足りるかを決める3つの問い

迷ったら次の順に自分へ問えば決まります。価格表もベンチマークも、この3問に答えるための材料です。

  1. 仕事の範囲は決まっているか。分類・抽出・要約・ルーティングのように入口と出口が決まっているなら Haiku 5.5。
  2. モデルが何十手も自分で考えて進める必要があるか。あるなら Sonnet 5.5 以上。Haiku 5.5 のエージェント型コーディングは Sonnet 5.5 の半分強しかありません。
  3. 1リクエストが10万トークンを超えるか。超えると Haiku 5.5 の単価が5倍に跳ね、価格差は20倍から4倍まで縮みます。ここでは Sonnet 5.5 を素直に検討したほうがよい。

価格差は20倍、ただし10万トークンを超えると4倍に縮む

Haiku 5.5 の料金でいちばん見落とされやすいのが段階制です。プロンプトの長さが10万トークンを超えると単価が5倍になります。旧世代の Haiku 4.5 には段階制が無く一律だったので、ここは新しく増えた判断軸です。なおコンテキストウィンドウ100万トークン・最大出力12.8万トークンという器の大きさは、Haiku 5.5 と Sonnet 5.5 で同じです。

項目(100万トークンあたり)

Haiku 5.5(10万以下)

Haiku 5.5(10万超)

Sonnet 5.5

価格差

入力

$0.10

$0.50

$2.00

20倍 → 4倍

出力

$0.50

$2.50

$10.00

20倍 → 4倍

キャッシュ読取

$0.01

$0.05

$0.10

10倍 → 2倍

キャッシュ書込(5分)

$0.125

$0.625

$2.50

20倍 → 4倍

段階制が判断を変えるのは、「長い資料を丸ごと投げる」使い方が Haiku 5.5 のいちばん美味しいゾーンから外れるからです。10万トークン超のリクエストで計算すると、Sonnet 5.5 との差は4倍程度まで縮みます。それなら精度の高いほうを選ぶ、という判断が十分に成り立ちます。

逆に、Haiku 4.5 の実績ではリクエストの90%が10万トークン以下でした。現実の業務用途はほとんどが安いゾーンに収まる、というのが公式の見立てです(公式はこの内訳から「平均で約75%安くなる」と説明しています)。段階制ごとの単価と請求の読み方はClaude Haiku 5.5 の料金を段階制ごとに分解した記事で詳しく扱っています。

なお Sonnet 5.5 側も10月7日にキャッシュ読取が $0.20 から $0.10 へ半額になりました。キャッシュ読取はトークン消費の大半を占めるため、公式は「ほとんどのエージェント型タスクで Sonnet 5.5 のコストが約20%下がる」としています。値下げは Haiku だけの話ではない、という点は見落とさないほうがよいところです。

ベンチマーク:追いついた領域と、決定的に足りない領域

Anthropic が公開した数値を、Haiku 5.5・Sonnet 5.5・GPT-6 Luna の3列で並べました。分野によって勝ち負けがはっきり割れます。

評価

Haiku 5.5

Sonnet 5.5

GPT-6 Luna

Haiku 5.5 の位置

GDPval-AA v2.1(実務の知識労働・Elo)

1620

1840

1437

Sonnet に近い

AA-Briefcase v1.1(Elo)

1578

1824

1336

Sonnet に近い

OSWorld 2.1(コンピュータ操作)

72.4%

83.9%

48.9%

Sonnet に近い

Chartography(視覚推論・ツール無し)

46.4%

61.6%

29.1%

差あり

Terminal-Bench 4.0(エージェント型コーディング)

39.2%

70.6%

16.4%

決定的に足りない

Humanity's Last Exam(ツール無し)

45.9%

公式図に記載なし

56.9%

Luna が上

Humanity's Last Exam(ツールあり)

57.4%

公式図に記載なし

64.5%

Luna が上

読み方は3つに分かれます。

  • 知識労働とコンピュータ操作は、価格が20分の1でも意外に迫っている。GDPval-AA は1620対1840、OSWorld は72.4%対83.9%。20倍の価格差を払い続ける根拠として十分かは、仕事の性質次第です。
  • エージェント型コーディングだけは埋めようがない。39.2%対70.6%は「安いから妥協する」で済む差ではありません。自律的に手を動かし続けるタスクを Haiku 5.5 に投げると、失敗のやり直しで結局コストが膨らみます。
  • GPT-6 Luna との勝負は分野で割れる。Haiku 5.5 は知識労働(1620対1437)・コンピュータ操作(72.4%対48.9%)・エージェント型コーディング(39.2%対16.4%)で上ですが、Humanity's Last Exam では Luna のほうが上です(ツール無しで56.9%対45.9%、ツールありで64.5%対57.4%)。学術的な難問への一発回答では Luna が強い、という読み方になります。OpenAI 側の小型モデルの位置づけはGPT-6 Sol と Luna の違いと使える場所にまとめています。

この表で Haiku 4.5 を並べていないのは、比較の意味が薄いからです。Haiku 4.5 は Terminal-Bench 4.0 が0.0%、OSWorld が15.7%で、そもそも同じ土俵に乗っていません。

公式自身が引いている線

この記事の結論は、Anthropic 自身の記述とほぼ同じです。発表資料には次のように明記されています。

Terminal-Bench 4.0 のような複雑なエージェント型コーディングでは Sonnet 5.5 と Opus 5.5 のほうが良い選択。Haiku 5.5 はコンパクション・要約・サブエージェントのように、従来のモデルではコスト的に無理だった狭いタスクに向く。

重要なのは、公式が Haiku 5.5 を「Sonnet 5.5 の安い代替」として売っていない点です。「これまで AI に投げるには高すぎた狭い仕事を、ようやく投げられる価格になったモデル」として位置づけています。だから比較の問いは「Sonnet を Haiku に置き換えられるか」ではなく、「いま Sonnet に投げている仕事のうち、本当は狭い仕事がどれだけ混じっているか」になります。

公式が挙げる向き先は、要約・コンパクション(会話履歴の圧縮)・データベースクエリ・分類、そしてOpus 5.5 / Sonnet 5.5 のサブエージェントです。レイテンシが体感に直結するライブのカスタマーサポートやブラウザ操作も名指しされています。Sonnet と Opus の間の線引きは半額差の Sonnet 5.5 と Opus 5.5 をどう振り分けるかに整理してあるので、3段の全体像はそちらと併せて見てください。

顧客の早期検証は「どの種類の仕事」で効いたか

公式に掲載された早期検証を、スコアではなく仕事の種類で並べ替えると、線引きの答え合わせになります。

企業

仕事の種類

公式掲載の結果

Asana

AIエージェント製品の評価スイート

タスク完了のレイテンシが30%以上減少。エージェント1ターンあたりの推論が最大2.5倍速く

HubSpot

CRM(顧客関係管理)タスク=型の決まった業務処理

3回平均92.8%=同社がこれまで見た中で最高スコア。最速・最高ヒット率・最低の誤検出率

AlphaSense

文書への質問応答(週800万コール規模)

400クエリの検証で Haiku 4.5 の0.76に対し0.84(統計的に有意な改善)

Box

早期検証

Haiku 4.5 より11ポイント高いスコアを、レイテンシ約半分で

並べてみると傾向がはっきりします。効いているのは「型の決まった処理を、速く・大量に」という仕事ばかりです。Asana はエージェントの1ターンあたりの速度、HubSpot は CRM タスクのヒット率、AlphaSense と Box は文書に対する問い合わせ。長い自律コーディングの事例は1つも挙がっていません。ベンチマークの読みと、顧客の使いどころが一致しているわけです。

実務の判断フレーム:仕事別の振り分け表

ここまでの材料を、実務で使える形に落とします。社内で AI を回すなら、「どのモデルを使うか」ではなく「どの仕事をどのモデルに割り当てるか」を決めるのが先です。

仕事の種類

割り当て

根拠

問い合わせの分類・振り分け、タグ付け

Haiku 5.5

範囲が決まっており件数が多い。入力 $0.10 が効く

帳票・メールからの項目抽出

Haiku 5.5

HubSpot の CRM タスク92.8%と同じ性質

議事録・長い会話の要約、コンパクション

Haiku 5.5

公式が名指しする向き先。ただし入力が10万トークンを超えるなら試算し直す

チャットでの一次応答、社内検索の回答生成

Haiku 5.5

レイテンシが体感に直結する用途。公式も速度重視の用途として挙げている

上位モデルのサブエージェント(調査・下調べ役)

Haiku 5.5

公式がコーディングでの向き先として明記

複数ファイルにまたがる実装、長い自律コーディング

Sonnet 5.5 以上

Terminal-Bench 4.0 が39.2%対70.6%。やり直しのコストで逆転する

設計判断、仕様の矛盾の洗い出し

Sonnet 5.5 以上

知識労働の Elo で220ポイント差。判断の質が成果物に直結する

図表の読み取りを含む分析

Sonnet 5.5

Chartography が46.4%対61.6%

1リクエストが10万トークンを超える処理

両方を試算

価格差が4倍まで縮むので、精度差のほうが効く可能性がある

実務でコストが膨らむ典型は、この表の上半分(分類・抽出・要約)まで最上位モデルに投げているケースです。逆に、下半分を安いモデルに寄せすぎると失敗のやり直しが増えて、結果的に高くつきます。タスクごとにモデルを指定できる作りにしておくと、世代が変わるたびに上半分だけ段階的に載せ替えられます。今回の Haiku 5.5 は、まさにその上半分の単価が一段下がった更新です。

Mihata では、この「どの仕事をどのモデルに任せるか」の設計から、社内の仕組みへの実装までを含めて独自AIの構築をお手伝いしています。記事の途中で恐縮ですが、請求額と品質の両方に直結する部分ですので、よろしければ合わせてご覧いただけたら嬉しいです。

見積もりが外れる落とし穴:トークンの数え方が変わった

Haiku 5.5 はトークナイザが Claude 4.7 以降と同じものに変わり、同じ文章が Haiku 4.5 比で約30%多いトークン数になります。単価だけを見て「90%安い」と計算すると請求額は外れます。公式の「平均で約75%安くなる」という数字は、このトークン増加を織り込んだ後の値です。

ただしSonnet 5.5 との比較では、この30%増はそのまま効きません。Sonnet 5.5 も同系列のトークナイザなので、同じ文章なら両者のトークン数は揃います。つまり「Haiku 4.5 → Haiku 5.5」の乗り換え試算には30%増を入れる必要があり、「Sonnet 5.5 ↔ Haiku 5.5」の比較には入れなくてよい、という使い分けになります。試算の前提を混ぜると判断を間違えます。

もう一点、Haiku 5.5 はAdaptive thinking が既定でオン(既定 effort は medium)です。思考トークンは max_tokens に数えられるため、effort を上げるほど出力側の課金が増えます。価格差20倍の前提で比べるなら、effort を揃えてから測るのが基本です。temperature などのサンプリングパラメータや手動の extended thinking は400エラーになる破壊的変更が入っているので、既存コードから載せ替えるならClaude Haiku 5.5 の提供開始と移行時の変更点も確認しておくと手戻りが減ります。

まとめ

  • 狭い仕事は Haiku 5.5 で足りる。分類・抽出・要約・コンパクション・ルーティング・サブエージェント。単価は Sonnet 5.5 の20分の1
  • 足りないのはエージェント型コーディング。Terminal-Bench 4.0 で39.2%対70.6%。ここは公式自身が Sonnet 5.5 / Opus 5.5 を勧めている
  • 知識労働とコンピュータ操作は意外に近い。GDPval-AA 1620対1840、OSWorld 72.4%対83.9%。ここは実際の業務で測って決める余地がある
  • 10万トークンを超えると前提が変わる。価格差が20倍から4倍に縮むので、長文を丸ごと投げる用途では Sonnet 5.5 を検討する
  • GPT-6 Luna との比較は分野で割れる。知識労働・PC操作・コーディングは Haiku 5.5 が上、Humanity's Last Exam は Luna が上

どの仕事をどのモデルに割り当てるかは、一度決めれば終わりではなく、世代が変わるたびに見直す対象です。社内の業務に当てはめた設計や試算のご相談があれば、お気軽にご連絡ください。

よくある質問

Haiku 5.5 と Sonnet 5.5 はどっちを使えばいいですか?

分類・抽出・要約・コンパクション・ルーティング・上位モデルのサブエージェントのように範囲が決まった仕事は Haiku 5.5 で足ります。複数ファイルにまたがる実装や長い自律コーディング、設計判断は Sonnet 5.5 以上を選んでください。公式も Terminal-Bench 4.0 のような複雑なエージェント型コーディングでは Sonnet 5.5 と Opus 5.5 のほうが良い選択だと明記しています。

価格差は何倍ですか?

100万トークンあたりで、プロンプトが10万トークン以下なら Haiku 5.5 が入力 $0.10・出力 $0.50、Sonnet 5.5 が入力 $2.00・出力 $10.00 で20倍です。ただし Haiku 5.5 は10万トークンを超えると入力 $0.50・出力 $2.50 に上がるため、価格差は4倍まで縮みます。

性能差がいちばん大きいのはどの分野ですか?

エージェント型コーディングです。Terminal-Bench 4.0 は Haiku 5.5 が39.2%、Sonnet 5.5 が70.6%。一方で実務の知識労働を測る GDPval-AA v2.1 は1620対1840、コンピュータ操作の OSWorld 2.1 は72.4%対83.9%で、こちらは比較的近い数値です。

GPT-6 Luna と比べるとどうですか?

分野で勝ち負けが割れます。Haiku 5.5 は GDPval-AA v2.1 が1620対1437、OSWorld 2.1 が72.4%対48.9%、Terminal-Bench 4.0 が39.2%対16.4% で上回ります。ただし Humanity's Last Exam は Luna のほうが上で、ツール無しで56.9%対45.9%、ツールありで64.5%対57.4%です。

Haiku 4.5 から乗り換えるとき、単価の比較だけで試算してよいですか?

よくありません。Haiku 5.5 はトークナイザが Claude 4.7 以降と同じものに変わり、同じ文章が Haiku 4.5 比で約30%多いトークン数になります。公式の「平均で約75%安くなる」はこの増加を織り込んだ数字です。なお Sonnet 5.5 とは同系列のトークナイザなので、両者の比較ではこの30%増を考える必要はありません。

まずはお気軽にご相談ください

AI・IT・デザインに関するお悩みやご相談、お見積りのご依頼など、
どんなことでもお気軽にお問い合わせください。

お問い合わせ