4.6
SPACEXAI ─ 2026.08.12 RELEASE
Grok 4.6
同じお題を4体のAIに同時に投げて確かめる
2分でわかる実機検証
結論
報じられている「61で並んだ」は
半分だけ本当です
公式の同じ表の中で勝つ仕事と負ける仕事が割れています
だから順位ではなく、用途で選ぶモデルです
01
世代差
前世代からどれだけ伸びたか
9つのベンチを合成した総合指標 AA Intelligence Index
61
Grok 4.5 の 56 から+5ポイント。価格は据え置きのまま
出典:x.ai 公式アナウンス(2026-08-12)
公式グラフ
総合指標では、ほぼ横並びに追いついた
出典:x.ai — Introducing Grok 4.6
02
勝っている領域
単独1位のベンチが3つあります
どれもコードそのものより調査・書類・知識労働に寄った評価です
出典:x.ai 公式アナウンス
最大の差
法務タスクの評価 Harvey LAB では
6.3倍
Grok 4.6 が 15.8% に対して、GPT-5.6 Sol Max は 2.5%
同じ土俵でこれだけ開くのは珍しい差です
出典:x.ai 公式アナウンス
03
負けている領域
一方で、大きく離されている項目も
ターミナルを操作して長時間かけて実装する仕事はまだ苦手です
出典:x.ai 公式アナウンス
公式グラフ
開発元は不利な数字も同じページに載せている
オレンジが Grok 4.6。4本中3番目 / 出典:x.ai
全体像
10のベンチを並べると、割れ方が見える
出典:Cursor — Introducing Grok 4.6
理由
なぜ見た目の生成が強くなったのか
CADが学習環境として名指しされたのは今回が初 / 出典:x.ai
検証方法
同じお題を4体に、同時に投げる
追加指示なし・再生成なしの一発勝負
04
お題 01
見た目とインタラクションを問う
動画共有サイトを1ファイルで作らせる
外部ライブラリも画像も禁止。アイコンまでコードで描かせる
触って壊れないかまで見ます
05
お題 02
論理の正確さを問う
正規表現エンジンを一から自作させる
20問の固定テストを自動実行させ、合否を表で出させます
重いパターンで固まるかどうかが最大の差になります
落とし穴
50万トークンの裏にある、20万の関門
出典:docs.x.ai のモデル料金表
料金
100万トークンあたり(20万を境に倍額)
※ 超えた分だけではなく、そのリクエストの全トークンが対象
単価は4.5から据え置き。ただしキャッシュだけ $0.30 → $0.50
出典:docs.x.ai / OpenRouter API(2026-08-13 実測)
結論
順位表の1位を選ぶ時代は終わりつつある
仕事の種類で、
モデルを選ぶ。
見た目の試作と知識労働なら Grok 4.6
ターミナル作業なら GPT-5.6 Sol、総合力なら Fable 5
注意
数字を読むときに、押さえておくこと
公式グラフの脚注にも、競合値の出どころは明記されています