Mihata
AI活用2026.09.23

Claude Opus 5.5とFable 5.1の違い|性能同等・価格差

Claude Opus 5.5 と Claude Fable 5.1 のどちらを使うべきか。結論から書くと、2026年9月22日時点で選択の軸は「性能」ではなく「コストと速度」に移っています。Anthropic は Opus 5.5 の発表記事で、ほとんどの仕事において Fable 5.1 と同水準の性能だと明記し、さらに「自分たちの使用では、両者の差はベンチマークのスコアが示すより小さい」とまで書いているためです。

この記事では、公式が公開した9つのベンチマークの数値を並べたうえで、それでも数字だけで決めてはいけない理由と、実務でどう選び分けるかを整理します。

結論:性能はほぼ同等、判断材料はコスト・速度・制約

Anthropic の公式発表は、Opus 5.5 について2つのことを同時に言っています。ひとつは「ほとんどの仕事で Fable 5.1 と同水準の性能」、もうひとつは「Opus 5 と比べて運用コストが40%安い」ことです。

つまり Opus 5.5 は、Fable 5.1 を性能で置き換えにいったモデルというより、同じくらいの仕事を、より安く・より速くこなすことを狙ったモデルです。料金は入力 $4 / 出力 $20(100万トークンあたり)、キャッシュ読みは $0.20 まで下がりました。内訳はClaude Opus 5.5 の料金とキャッシュ単価の詳細にまとめています。

そして重要なのは、Anthropic 自身が「この水準になると、ベンチマークの差は実世界の差の指標としての信頼性が下がる」と書いていることです。ベンダーがこう書くのは珍しく、実務では数字の0.5ポイント差を追うより、後述するコストと制約で選ぶほうが合理的だという示唆になります。

ベンチマーク比較表:Opus 5.5 と Fable 5.1

公式表から、Opus 5.5 と Fable 5.1 の数値を並べます。注意点を先に書きます。これらは各社が自社に有利な effort(推論の強さ)条件で測った値です。Opus 5.5 は adaptive thinking の max effort(xhigh)が既定条件で、他社モデルの数値も各社の公表値をそのまま並べたものです。同じベンチマーク名でも、測定主体が違えば同じ数字にはなりません。

ベンチマーク

Opus 5.5

Fable 5.1

Terminal-Bench 4.0

66.4%

55.8%

+10.6pt

FrontierCode v1.1

54.4

50.3

+4.1

CursorBench 4.0

57.8

51.8

+6.0

GDPval-AA v2.1

1846

1735

+111

AutomationBench(Zapier)

40.0%

31.4%

+8.6pt

Humanity's Last Exam(ツール有)

67.7%

65.6%

+2.1pt

Terminal-Bench-Science 0.1

58.7

52.6

+6.1

OSWorld 2.0(partial)

81.8%

80.7%

+1.1pt

Chartography(ツール有)

89.0

88.4

+0.6

表のとおり、9指標すべてで Opus 5.5 が上回っています。ただし差の大きさが指標によってまるで違う点を見落とさないでください。ターミナル操作(Terminal-Bench 4.0)では10ポイント以上開く一方、OSWorld 2.0 は1.1ポイント、Chartography は0.6ポイント差しかありません。画面操作やチャート読み取りのような用途では、実質的に同じと考えたほうが実態に近いはずです。

勝ち負けは一枚岩ではない

Anthropic の同じ表には他社モデルも載っており、そこを見ると景色が変わります。Terminal-Bench-Science 0.1 では GPT-6 Astra が 64.6 で、Opus 5.5 の 58.7 を上回っています。AutomationBench でも GPT-6 Astra が 41.4% と Opus 5.5 の 40.0% を上回ります。

さらに、AutomationBench の数値は測定主体で食い違います。OpenAI 側の公表表では Claude Opus 5(max effort)が 26.9%、Anthropic 側の表では Opus 5.5 が 40.0% です。対象モデルも条件も違うので単純比較はできませんが、「どのベンチでどちらが上か」を根拠に断定的な優劣を語るのは危ういということです。他社モデルとの比較はGPT-6 Astra と Fable 5.1・Gemini 3.8 の比較と使い分けも併せてご覧ください。

実務での判断軸は4つ

1. コスト

いちばん効くのがここです。公式が挙げた実例では、HAProxy の C から Rust への移植を Opus 5.5 が 9.5時間、Fable 5.1 が 12時間で完了し、コストは51%減だったと報告されています。時間で約2割、費用で約半分です。長時間のエージェント実行を毎日回す用途なら、この差は月単位で無視できない金額になります。

2. 速度

Opus 5.5 は出力生成が Opus 5 比で30%以上高速になっています。加えて Claude Code と Claude Platform では Fast mode が提供され、最大2.5倍速で動きます(入力 $8 / 出力 $40)。応答待ちがそのまま人の待ち時間になる対話用途では、単価より体感速度が効きます。

3. セーフガードの介入

Opus 5.5 は生物・サイバー領域のリスク評価が Mythos 5.1 相当と判断されたため、Fable 5.1 と同等のセーフガードを付けて提供されています。実務上の意味は、自動化パイプラインで安全機構が介入したときに処理が止まりうる、ということです。AutomationBench でも Anthropic はフォールバックなしで、安全機構の介入を失敗扱いとして測定しています。無人で回す自動化では、停止時のリトライ設計を前提に組んでください。

4. API 側の制約

見落としやすい制約が2つあります。ひとつはthinking モードをオフにできないこと(公式ドキュメント記載)。「短く速く安く返す」ためにリーズニングを切る運用はできません。もうひとつは preserved thinking(蒸留防止のための思考内容の保護)で、2026年8月31日以降に作成された API アカウントの Fable 5.1 / Opus 5.5 に適用されます。アカウントの作成時期によって挙動が変わるため、既存アカウントでの検証結果が新規アカウントでそのまま再現するとは限りません。

なお、Mythos 5.1 と Fable 5.1 の関係で混乱している場合は、Claude Mythos 5.1 が使えないのは仕様という話を先に読むと整理できます。

実務でこのあたりの切り分けや、どのモデルをどの処理に割り当てるかの設計にお困りでしたら、私たちはAI導入支援も行っております。記事の途中で恐縮ですが、月1回のミーティングで社内の運用ごと整える形が好評ですので、よろしければ合わせてご覧いただけたら嬉しいです。

こう選ぶ(3行まとめ)

  • 長時間のコーディング・エージェント実行が主用途なら Opus 5.5。Terminal-Bench 4.0 で10ポイント以上の差があり、実例でも時間・コストの両方で上回っています。
  • すでに Fable 5.1 で安定運用できているなら、急いで切り替えなくてよい。公式自身が「差はスコアが示すより小さい」と書いています。切り替えコストのほうが高くつく場面は普通にあります。
  • コスト削減が目的なら、モデル変更より先にキャッシュ設計を見直す。Opus 5.5 のキャッシュ読みは $0.20 まで下がっており、同じプロンプトを繰り返す処理ではここの効きが最も大きくなります。

Opus 5.5 全体の変更点はClaude Opus 5.5 で何が変わったかのまとめを、今後のラインナップについてはClaude Sonnet 5.5 がいつ出るかの公式記述2026年後半に来る新モデルの一覧をご覧ください。

モデル選定は、ベンチマークの順位表ではなく「自社のどの処理に、いくらまで払えるか」から逆算するのが結局いちばん早い、というのが実務の感触です。選定や置き換えの相談は下記からお気軽にどうぞ。

よくある質問

Claude Opus 5.5 と Fable 5.1 はどちらが高性能ですか?

Anthropic の公式表では9つのベンチマークすべてで Opus 5.5 が上回っています。ただし公式自身が「この水準ではベンチマークの差は実世界の差の指標として信頼性が下がる」「自分たちの使用では差はスコアが示すより小さい」と書いており、断定的に優劣をつけられる状態ではありません。

ベンチマークの数値はそのまま比較できますか?

できません。各社が自社に有利な effort(推論の強さ)条件で測った値です。Opus 5.5 は adaptive thinking の max effort が既定条件で、同じ AutomationBench でも OpenAI 側と Anthropic 側で並ぶ数値が異なります。

Opus 5.5 がすべてのベンチで最上位なのですか?

いいえ。Anthropic の同じ表でも Terminal-Bench-Science 0.1 は GPT-6 Astra が 64.6 で Opus 5.5 の 58.7 を上回り、AutomationBench も GPT-6 Astra が 41.4% で上回っています。

コスト面ではどれくらい差がありますか?

公式が挙げた HAProxy の C から Rust への移植の実例では、Opus 5.5 が 9.5時間・Fable 5.1 が 12時間で、コストは51%減でした。また Opus 5.5 の料金は入力 $4 / 出力 $20、キャッシュ読みは $0.20(いずれも100万トークンあたり)です。

まずはお気軽にご相談ください

AI・IT・デザインに関するお悩みやご相談、お見積りのご依頼など、
どんなことでもお気軽にお問い合わせください。

お問い合わせ