Mihata
AI活用2026.09.22

Grok 4.7とGrok 4.6の違いは?ベンチ7項目と乗り換え判断

Grok 4.7 が2026年9月21日に公開されました。すでに Grok 4.6 を使っている方が最初に知りたいのは「何がどう違うのか」「いま差し替えるべきか」の2点だと思います。結論を先に書きます。違いは実質3つだけです。①ベンチマークの数字、②知識のカットオフ(2026年2月1日 → 2026年5月)、③高速版の提供先。料金・コンテキスト長・入出力の形式・推論の段階数は、公式値で見るかぎり完全に同じです。

単価が1セントも動いていないので、コスト面では「差し替えない理由がない」更新です。ただし公式が出しているベンチマークは推論設定をそろえた比較ではないため、そこだけは自社の設定で確かめてから切り替えるのが安全です。以下、公式ドキュメントで確認できた内容だけで整理します。

同じところ(変わっていない仕様)

項目

Grok 4.6 / Grok 4.7 に共通

コンテキスト長

50万トークン

入力単価(20万トークン未満)

$2.00 / 100万トークン

キャッシュ入力単価(同上)

$0.50 / 100万トークン

出力単価(同上)

$6.00 / 100万トークン

20万トークン以上のとき

入力 $4.00 / キャッシュ $1.00 / 出力 $12.00

入出力

テキスト・画像入力 → テキスト出力。出力トークンの上限なし

推論の強さ

low / medium / high(既定)/ xhigh

ここまで一致していると、移行作業そのものはモデルIDの文字列を1か所変えるだけで終わります。コスト見積もりの作り直しも不要です。実際にいくらかかるのかを数字で出したい方は、月間トークン数から Grok 4.7 の料金を試算する手順に計算式とケース別の例をまとめました。

違うところ(3点)

項目

Grok 4.6

Grok 4.7

モデルID

grok-4.6

grok-4.7

知識のカットオフ

2026年2月1日

2026年5月(約3か月前進)

高速版の提供

高速版あり(単価2倍)

Grok 4.7 Fast は Cursor と Grok Build 限定。公開APIでは使えず、Grok Build の無料枠にも含まれない

Responses API の挙動

通常どおり

include に指定しなくても reasoning.encrypted_content が常に返る(Chat Completions は変更なし)

ドキュメント上の推奨

(前の推奨モデル)

「コードを含むそれ以外のすべてに Grok 4.7 を」=第一推奨

実務で効くのは2行目と3行目です。知識カットオフが3か月前進したことで、2026年2月〜5月に起きたことを前提にした質問に素で答えられるようになります。一方で、Fast 版の提供先が絞られたのは後退です。Grok 4.6 の高速版を API 経由で使っていたチームは、同じやり方を 4.7 で続けられません。速度が必要なら Cursor か Grok Build に寄せるか、標準版で我慢するかの判断になります。

4行目も地味に刺さります。Responses API を使っていて、返ってきた JSON を厳密にパースしている実装だと、想定していないフィールドが常に付いてくることになります。移行時にここで落ちる可能性があるので、切り替え前に1回だけ実物のレスポンスを目視してください。

ベンチマーク7項目の差(公式値)

xAI 公式ブログが出している比較表を、そのまま並べます。重要な注意点をひとつ。表の見出しは「Grok 4.7 xHigh」と「Grok 4.6 High」です。新モデルだけ最上位の推論設定、旧モデルは既定の推論設定という、条件をそろえていない比較になっています。差のうちどこまでがモデルの進歩で、どこからが推論設定の差なのかは、この表からは分かりません。

ベンチマーク

Grok 4.6 High

Grok 4.7 xHigh

伸び

Terminal-Bench 4.0(長時間の端末作業)

20.3%

38.0%

+17.7pt(約1.9倍)

EEBench(電気工学)

53.0%

64.0%

+11.0pt

HealthBench Professional(臨床推論)

48.5%

56.7%

+8.2pt

DeepSWE v1.1

65.2%

71.0%(high effort)

+5.8pt

CursorBench 4.0(長時間のコーディング)

40.4%

46.3%

+5.9pt

Harvey Legal Agent(法務)

15.8%

19.6%

+3.8pt

AA Briefcase v1.1(数時間の事務作業)

1,546

1,657

+111(約7%)

伸び幅の順に並べると、今回の更新の性格がはっきり出ます。頭ひとつ抜けているのは Terminal-Bench 4.0 の +17.7pt で、これは「何時間も端末の中で作業を続ける」タイプの仕事の指標です。公式ブログも「何時間もかかる問題に重みを置いた、より長い強化学習を行った」「自分の作業を検証し、長いコンテキストを管理するのが上手になった」と説明しており、ベンチの形と説明が一致しています。

逆に、1回の質問に1回答えるだけの用途では、体感できる差は小さい可能性が高いと読むべきです。7%しか動いていない AA Briefcase や、4pt 弱の Harvey のような項目もあります。「新しいから全部よくなる」ではなく、「長く走らせる仕事ほど差が出る」というのが、この表から読める正しい期待値です。

自社の仕事に読み替える

自社の使い方

参考になる項目

差し替えの期待値

コーディングエージェントを夜通し走らせる

Terminal-Bench 4.0・CursorBench 4.0

大きい。最優先で試す価値がある

資料・提案書・スライドの作成

AA Briefcase v1.1・GDPval

中くらい。公式も「文書とプレゼンの作成が上手になった」と書いている

社内問い合わせチャット・FAQ応答

(該当ベンチなし)

小さい見込み。差し替えても害はないが、体感差は期待しない

契約書・規程のレビュー補助

Harvey Legal Agent

絶対値が2割弱なので任せきれない。ただし他社より差が大きい項目なので、比較検証の対象には入れてよい

2026年2〜5月の出来事を前提にした質問

知識カットオフ

確実に改善。4.6 は2026年2月1日で止まっている

差し替える前にやる3ステップ

実務では、モデルIDを変えて終わりにしないほうが安全です。当社が社内ツールでモデルを入れ替えるときは、次の順でやっています。特別なことはしていませんが、この3つを飛ばすと後から原因不明の劣化に悩みます。

  1. 評価セットを20〜30件そろえる。自社の実データで、答えの良し悪しを人が判断できるものだけを選びます。ベンチマークのスコアより、この30件のほうが自社にとっては正確です
  2. 推論設定をそろえて両方回す。公式表は xHigh 対 High なので、自社が high で運用しているなら 4.7 も high で測ります。ここをそろえないと「新モデルのほうが遅くて高い」という誤った結論が出ます
  3. 出力の形が変わっていないか見る。特に Responses API を使っている場合、reasoning.encrypted_content が必ず付いてくる点だけは実物で確認してください

Mihata でも社内の自動化ツールで複数のモデルを使い分けていて、正直に言うと「新しいモデルに変えたら一部の処理だけ悪くなった」という経験は何度もあります。記事の途中で恐縮ですが、こうした検証や社内展開の進め方についてのご相談も承っています。よろしければあわせてご覧いただけたら嬉しいです。

Grok 4.6 を使い続けたほうがよい場合

全部を 4.7 に寄せるのが正解とは限りません。次のどれかに当てはまるなら、当面 4.6 のままでも合理的です。

  • 高速版を API 経由で使っていた。Grok 4.7 Fast は Cursor と Grok Build 限定で、公開APIでは提供されません
  • 出力の再現性を厳密に固定している。モデルを変えれば出力は変わります。検証コストのほうが得られる差より大きいなら、次の更改まで待つ判断もあります
  • いま動いているのが単発の質問応答だけ。上の表のとおり、差が出やすいのは長時間走らせる用途です

なお、Grok 4.6 の仕様そのものを確認したい方はGrok 4.6 の料金と50万トークンの解説にまとめてあります。切り替えたのに画面やAPIに 4.7 が出てこないという方はGrok 4.7 が使えないときに確認する7点を先にご覧ください。そもそも Grok 5 はどうなったのか、という全体像はGrok 5 の現在地と 4.x のリリース間隔を追った記事で追いかけています。

どのモデルを選ぶかより、どの業務から始めるかで結果が変わる場面をよく見ています。具体的なご相談は下記からお気軽にどうぞ。

よくある質問

Grok 4.7とGrok 4.6で料金は変わりますか?

変わりません。どちらも20万トークン未満のプロンプトで入力2ドル・キャッシュ入力0.5ドル・出力6ドル(100万トークンあたり)、20万トークン以上で入力4ドル・キャッシュ1ドル・出力12ドルです。コンテキスト長も両方50万トークンで同じです。

Grok 4.7とGrok 4.6の違いは結局どこですか?

実質3点です。ベンチマークの数字(Terminal-Bench 4.0が20.3%から38.0%など)、知識のカットオフ(2026年2月1日から2026年5月へ)、高速版の提供先(Grok 4.7 FastはCursorとGrok Build限定で公開APIでは使えない)です。加えてResponses APIではreasoning.encrypted_contentが常に返るようになりました。

公式のベンチマーク比較はそのまま使えますか?

条件がそろっていない点に注意が必要です。公式表の見出しは「Grok 4.7 xHigh」と「Grok 4.6 High」で、新モデルだけ最上位の推論設定になっています。自社で使っている推論設定に合わせて、20〜30件の評価セットで両方を回してから判断してください。

どんな用途なら差し替える価値が大きいですか?

長時間走らせる用途です。伸び幅が最も大きいTerminal-Bench 4.0は「何時間も端末の中で作業を続ける」指標で、公式も長時間タスクに重みを置いた強化学習を行ったと説明しています。逆に単発の質問応答では体感差は小さい見込みです。

Grok 4.6を使い続けたほうがよい場合はありますか?

あります。高速版をAPI経由で使っていた場合(Grok 4.7 FastはCursorとGrok Build限定)、出力の再現性を厳密に固定している場合、用途が単発の質問応答だけの場合は、当面4.6のままでも合理的です。

まずはお気軽にご相談ください

AI・IT・デザインに関するお悩みやご相談、お見積りのご依頼など、
どんなことでもお気軽にお問い合わせください。

お問い合わせ