Claude Opus 5.5 が2026年9月22日、Claude Sonnet 5.5 が9月28日に出そろいました。単価は Sonnet 5.5 が Opus 5.5 のちょうど半額です。では安いほうで足りるのか——結論から言うと、多くの日常業務は Sonnet 5.5 で足ります。ただし「足りない仕事」の見分け方を間違えると高くつきます。
まず数字で並べる
項目 | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
入力(100万トークン) | $2 | $4 |
出力(100万トークン) | $10 | $20 |
キャッシュ読み | $0.20 | $0.20 |
キャッシュ書き込み | $2.50 | $5 |
コンテキスト/最大出力 | 100万/12.8万トークン | 100万/12.8万トークン |
応答の速さ(公式の相対表記) | Fast | Moderate |
APIの既定 effort | high | medium |
知識のカットオフ | 2026年6月 | 2026年6月 |
提供開始 | 2026年9月28日 | 2026年9月22日 |
コンテキスト長・最大出力・知識のカットオフは同じです。違うのは価格と速度、そして「難しい仕事での粘り」だけと考えて差し支えありません。
性能差はどこに出るのか
Anthropic が公表した評価を、差が大きい順に並べ替えました。
評価 | Sonnet 5.5 | Opus 5.5 | 差 |
|---|---|---|---|
FrontierCode 1.1(Main) | 46.2%(Max) | 54.4% | 8.2pt |
Humanity's Last Exam(ツールあり) | 64.5% | 67.7% | 3.2pt |
Chartography(図表読み取り) | 61.6% | 64.4% | 2.8pt |
CursorBench 4.0 | 55.5% | 57.8% | 2.3pt |
OSWorld 2.1(コンピュータ操作) | 80.1% | 81.8% | 1.7pt |
GDPval-AA v2.1(実務の知識労働) | 1844 | 1846 | 2ポイント |
Terminal-Bench 4.0 | 70.6% | 66.4% | Sonnet が上 |
見てのとおり、多くの評価で差は数ポイント以内です。実務の知識労働を測る GDPval-AA に至っては 1844 対 1846 で、誤差と言っていい差しかありません。Terminal-Bench に至っては Sonnet 5.5 のほうが上に出ています。
ただし、この表だけで「Opus は要らない」と結論するのは早いです。Anthropic 自身が発表文で、「ベンチマークはモデルの一面しか捉えていない。社内テストでも外部テスターの評価でも、複雑で終わりの見えない、継続的な判断を要する仕事では Opus 5.5 が明確に強い」と書いています。ベンチマークは「決まった課題を解く力」は測れても、「どこで止まるべきか」「前提が間違っていないか」といった判断の質は測りにくい、ということです。
コスト比較は effort を揃えないと意味がない
ここが実務でいちばん誤解されるところです。Claude の 5.5 世代は effort(思考の深さ)で1タスクあたりの費用が大きく変わります。API の既定値は Sonnet 5.5 が high、Opus 5.5 が medium、Claude アプリと Claude Code はどちらも medium です。
つまり何も指定せずに API で両者を比べると、Sonnet 5.5 のほうが深く考える設定で走ります。「安いほうが遅かった」「安いほうが高くついた」という結果は、たいていこれが原因です。
公式の説明によれば、両者の関係はこうなります。
- Sonnet 5.5 を低〜中 effort で走らせると、Opus 5.5 を補完する形になる(1タスクあたりの費用が安く済む)
- Sonnet 5.5 を高い effort まで上げると、Opus 5.5 と同等の性能を同程度の費用で出すこともある
言い換えると、「Sonnet を目一杯使って Opus に並ぶ」なら、素直に Opus を使ったほうがよいということです。Sonnet 5.5 の価値は、低い effort で済む仕事を安く速く終わらせるところにあります。
仕事別の振り分け
仕事の種類 | 推奨 | 理由 |
|---|---|---|
バグ修正、テスト追加、リファクタ | Sonnet 5.5 | 範囲が決まっている。Terminal-Bench では Opus 5.5 を上回る |
資料・スライド・表計算の作成 | Sonnet 5.5 | 公式が明示的に得意分野として挙げている。デザインの詰めも効く |
社内アプリへの組み込み・対話応答 | Sonnet 5.5 | 速度が体感に直結し、単価が半額 |
大規模なコード移行、設計の見直し | Opus 5.5 | 終わりが見えない仕事での粘りが違う |
長時間の自律作業、監査 | Opus 5.5 | 判断の質がそのまま結果に出る |
分類・抽出の大量バッチ | Haiku 4.5(5.5待ち) | 単価$1/$5。5.5世代は数週間内と公式予告 |
実際に効くのは「全部を1つのモデルに任せない」ことです。社内で AI を回している会社の請求額が膨らむ典型は、分類や抽出のような定型処理まで最上位モデルに投げているケースです。タスクごとにモデルを指定できる作りにしておくと、世代が変わるたびに段階的に載せ替えられます。
Mihata では、この「どの仕事をどのモデルに任せるか」の設計と実装まで含めた AI 導入の伴走支援を行っています。記事の途中で恐縮ですが、請求額に直結する部分ですので、よろしければご覧ください。
切り替えるときの注意
Opus 5.5 と Sonnet 5.5 の間で会話を引き継ぐときは、1つだけ落とし穴があります。thinking ブロックはモデルに紐づいており、Sonnet 5.5 は Opus 5.5 の thinking を読めません。逆方向も同じで、Sonnet 5.5 の thinking を読めるモデルは他にありません。
読めないブロックはモデルに届く前に落とされるだけなので、リクエスト自体は成功し、落ちたぶんは課金もされません。ただし切り替えた後のやりとりは、それまでの思考を引き継がずに進みます。モデルを跨ぐ運用をするなら、会話の途中ではなくタスクの切れ目で分けるのが安全です。
この他の移行時の注意点(400エラーになる破壊的変更)は Claude Sonnet 5.5 が使えないときの原因5つにまとめています。
結論
- 範囲の決まった仕事は Sonnet 5.5。半額で、多くの評価では数ポイント差しかない
- 判断が要る・終わりが見えない仕事は Opus 5.5。ここはベンチマークに出ない差が出る
- 比較するときは effort を揃える。既定値が違う(Sonnet 5.5 は high、Opus 5.5 は medium)
- Sonnet を最高 effort まで上げて Opus に並ぶなら、Opus を使う
Sonnet 5.5 そのものの変更点は提供開始のまとめ記事、Opus 5.5 の料金の内訳はこちら、上位の Fable 5.1 との関係はOpus 5.5 と Fable 5.1 の違いで整理しています。
自社のどの業務をどのモデルに任せるべきか迷ったら、お気軽にご相談ください。
よくある質問
Claude Sonnet 5.5 と Opus 5.5 はどちらが安いですか?
Sonnet 5.5 が半額です。100万トークンあたり Sonnet 5.5 が入力$2・出力$10、Opus 5.5 が入力$4・出力$20。キャッシュ読みはどちらも$0.20で同じです。
性能差はどのくらいありますか?
公開されている評価では多くが数ポイント以内の差です。実務の知識労働を測る GDPval-AA v2.1 は Sonnet 5.5 が1844、Opus 5.5 が1846。Terminal-Bench 4.0 では Sonnet 5.5(70.6%)が Opus 5.5(66.4%)を上回ります。一方 FrontierCode 1.1 では 46.2% 対 54.4% と差が開きます。
Sonnet 5.5 で Opus 5.5 の代わりは務まりますか?
範囲の決まった日常業務なら務まります。ただし Anthropic は、複雑で終わりの見えない継続的な判断を要する仕事では Opus 5.5 が明確に強いと明記しています。Sonnet 5.5 を最高 effort まで上げて Opus 5.5 に並ぶ水準なら、費用も同程度になるため Opus 5.5 を使うほうが素直です。
コストを比べるときの注意点はありますか?
effort(思考の深さ)の既定値が違います。Claude API では Sonnet 5.5 が high、Opus 5.5 が medium です。指定せずに比べると Sonnet 5.5 のほうが深く考える設定で走るため、費用と速度の比較が歪みます。
会話の途中でモデルを切り替えても大丈夫ですか?
リクエストは成功しますが、思考は引き継がれません。thinking ブロックはモデルに紐づいており、Sonnet 5.5 は Opus 5.5 の thinking を読めません。読めないブロックは課金されずに落とされます。モデルを跨ぐ場合はタスクの切れ目で分けるのが安全です。