850
OPEN WEIGHTS ─ 2026.08.13 GA (0813)
DeepSeek V4 Pro
落とせるのに、動かせない
2分でわかる要点
結論
このモデルをひとことで言うと
個人には重すぎる、組織向けの最大級
重みはMITで公開されている。でも4bitでも850GBで、
H100を8枚積んだ構成にも載りません
基本
まず、何が出たのか
総パラメータ 約1.6兆
アクティブ 490億
コンテキスト 100万
ライセンス MIT
出典:unsloth/DeepSeek-V4-Pro-0813-GGUF(2026-08-19 取得)|huggingface.co
注意 01
モデルカードは「1.7兆」と書いてある
モデルカードの表記
1.7兆
DSpark を同梱した数字
差分は投機デコード用のドラフト。
0813でパラメータが増えたわけではありません
注意 02
「V4-Pro-Max」はモデル名ではない
GAで入った thinking-effort の3段階(公式が挙げる用途)
low ─ データ抽出・簡単なQA・整形
high ─ 一般的なコーディング・論理推論・要約
max ─ 複雑なソフトウェア工学・数学の証明
同じモデルの中の、思考の深さの設定です
ここが山場
4bitまで圧縮しても、これだけある
出典:unsloth/DeepSeek-V4-Pro-0813-GGUF ファイル一覧(2026-08-19 取得)|huggingface.co
?
なぜ載らないか
H100を8枚積んでも足りない
必要(4bit時)
850 GB
UD-Q4_K_XL
8×H100 80GB
640 GB
合計VRAM
210 GB 不足
公式が示す推論構成の例はGB300ノード×4です
よくある誤解
「490億しか動かないなら足りるのでは?」
図解:Routine Labo
仕組み
MoEで減るもの・減らないもの
減るのは計算量。メモリではない
どのエキスパートが呼ばれるか事前に決まらないので、
全部の重みを載せておく必要があります
使い分け
Proか、Flashか
図解:Routine Labo
サイズ差
4bit量子化どうしで比べると
V4 Pro ─ UD-Q4_K_XL
V4 Flash ─ UD-Q4_K_XL
850GB / 155GB
Flashは3bitなら103GB。個人向けマシンの射程に入ります
$
料金
GAと同時に値上げされました(8月16日〜)
プレビュー期(〜8/16)
$0.87
出力 100万トークンあたり
入力は $0.435 → $1.32。
時間帯で単価が倍変わるので、回す時間で実額が変わります
第三者評価
総合指標では107モデル中3位
53点
同じ規模のオープンウェイトの中央値は27点。
出力速度 75.5 tokens/秒、初回応答 1.67秒
出典:Artificial Analysis Intelligence Index(2026-08-19 取得)|artificialanalysis.ai
独立評価
強みと弱みは、はっきり分かれる
数学(PUMaC 2024) 96% / GPT-5.5 96% = 互角
ソフトウェア工学(SWE-Bench) 74% / GPT-5.5 81%
抽象推論(ARC-AGI-2 半私有) 46% / GPT-5.5 79%
出典:CAISI Evaluation of DeepSeek V4 Pro(2026-08-19 取得)|nist.gov ※評価対象はプレビュー版
結論 01
向いている使い方
型が決まった作業(数学・定型コーディング)
100万トークンを丸ごと読ませる
閑散時間帯にまとめてバッチ処理する
重みを自社サーバーに置く必要がある組織
向かない
結論 02
向いていない使い方
前例のない抽象推論を任せる
手元のマシンだけで完結させたい
混雑時間帯に大量に流す
個人が自前のマシンで動かす
まとめ
持ち帰る3つ
重みはMIT。でも4bitでも850GBで載らない
MoEで減るのは計算量。メモリではない
個人はFlash、組織はProという住み分け
用途を選べば、十分に戦えるモデルです