4.6
SPACEXAI ─ 2026.08.12 RELEASE
Grok 4.6
同じお題を4体のAIに同時に投げて確かめる
2分でわかる実機検証
GROK 4.6 実機検証
01 / 17
結論
報じられている「61で並んだ」は
半分だけ本当です
公式の同じ表の中で勝つ仕事と負ける仕事が割れています
だから順位ではなく、用途で選ぶモデルです
GROK 4.6 実機検証
02 / 17
01
世代差
前世代からどれだけ伸びたか
9つのベンチを合成した総合指標 AA Intelligence Index
61
Grok 4.5 の 56 から+5ポイント。価格は据え置きのまま
出典:x.ai 公式アナウンス(2026-08-12)
GROK 4.6 実機検証
03 / 17
公式グラフ
総合指標では、ほぼ横並びに追いついた
AA Intelligence Index の公式グラフ
出典:x.ai — Introducing Grok 4.6
GROK 4.6 実機検証
04 / 17
02
勝っている領域
単独1位のベンチが3つあります
GDPVal-AA v2 1753
AA-Briefcase 1577
Harvey LAB 15.8%
どれもコードそのものより調査・書類・知識労働に寄った評価です
出典:x.ai 公式アナウンス
GROK 4.6 実機検証
05 / 17
最大の差
法務タスクの評価 Harvey LAB では
6.3倍
Grok 4.6 が 15.8% に対して、GPT-5.6 Sol Max は 2.5%
同じ土俵でこれだけ開くのは珍しい差です
出典:x.ai 公式アナウンス
GROK 4.6 実機検証
06 / 17
03
負けている領域
一方で、大きく離されている項目も
Terminal-Bench v3.0
26%
GPT-5.6 Sol Max
34.6%
ターミナルを操作して長時間かけて実装する仕事はまだ苦手です
出典:x.ai 公式アナウンス
GROK 4.6 実機検証
07 / 17
公式グラフ
開発元は不利な数字も同じページに載せている
DeepSWE 1.1 の公式グラフ
オレンジが Grok 4.6。4本中3番目 / 出典:x.ai
GROK 4.6 実機検証
08 / 17
全体像
10のベンチを並べると、割れ方が見える
Grok 4.6 の公式ベンチマーク比較表
出典:Cursor — Introducing Grok 4.6
GROK 4.6 実機検証
09 / 17
理由
なぜ見た目の生成が強くなったのか
CAD学習から画面レイアウト生成への因果
CADが学習環境として名指しされたのは今回が初 / 出典:x.ai
GROK 4.6 実機検証
10 / 17
検証方法
同じお題を4体に、同時に投げる
同じお題を4体に同時に投げるフロー
追加指示なし・再生成なしの一発勝負
GROK 4.6 実機検証
11 / 17
04
お題 01
見た目とインタラクションを問う
動画共有サイトを1ファイルで作らせる
外部ライブラリも画像も禁止。アイコンまでコードで描かせる
触って壊れないかまで見ます
GROK 4.6 実機検証
12 / 17
05
お題 02
論理の正確さを問う
正規表現エンジンを一から自作させる
20問の固定テストを自動実行させ、合否を表で出させます
重いパターンで固まるかどうかが最大の差になります
GROK 4.6 実機検証
13 / 17
落とし穴
50万トークンの裏にある、20万の関門
20万トークンで単価が倍になる関門
出典:docs.x.ai のモデル料金表
GROK 4.6 実機検証
14 / 17
料金
100万トークンあたり(20万を境に倍額)
20万トークン未満
$2 / $6
20万トークン以上
$4 / $12
※ 超えた分だけではなく、そのリクエストの全トークンが対象
単価は4.5から据え置き。ただしキャッシュだけ $0.30 → $0.50
出典:docs.x.ai / OpenRouter API(2026-08-13 実測)
GROK 4.6 実機検証
15 / 17
結論
順位表の1位を選ぶ時代は終わりつつある
仕事の種類で、
モデルを選ぶ。
見た目の試作と知識労働なら Grok 4.6
ターミナル作業なら GPT-5.6 Sol、総合力なら Fable 5
GROK 4.6 実機検証
16 / 17
注意
数字を読むときに、押さえておくこと
ベンチは開発元の自己申告
競合値は各社の公開資料から引用
料金は2026年8月13日時点
公式グラフの脚注にも、競合値の出どころは明記されています
GROK 4.6 実機検証
17 / 17
▶ 再生する