2
2026.08.26 ─ 同じ日に公開
Qwen3.8-Flash
GLM-5.3-Flash と、どっちを刺すか
2分でわかる選び方
結論
総合点では決まらない
自分の作業で選ぶ
速さと省メモリなら Qwen/難しい一発とライセンスなら GLM
起きたこと
2026年8月26日、高速モデルが2つ同時に出た
Qwen3.8-Flashアリババ/Qwen4 の先行アーキテクチャ
GLM-5.3-FlashZ.ai/重み公開は 16:31 UTC
名前はどちらも Flash。値段までほぼ重なっている
料金
Qwen3.8-Flash の公式価格
出典:Qwen3.8-Flash モデルページ(2026-08-28 取得)|qwencloud.com
$
値段
入力100万トークンあたり。両方まったく同じ額
$0.15
出力は Qwen $0.47/GLM $0.50。ただし GLM は9月9日まで半額
出典:QwenCloud 価格ページ/docs.z.ai 価格表(2026-08-28 取得)|qwencloud.com・z.ai
01
中身の差 01
1トークンを作るとき、実際に動くパラメータ
6B
GLM は 18B=毎回3倍が動く。総パラは 125B 対 320B
出典:Qwen3.8-Flash-Next モデルカード/GLM-5.3-Flash モデルカード(2026-08-28 取得)|huggingface.co
02
中身の差 02
ところが、ディスク上の実サイズは逆転する
360GB
GLM は 328GB。小さいはずの Qwen の方が大きい
出典:Hugging Face API でファイル容量を実測(2026-08-28)|huggingface.co
理由
Qwen には、他にない層が乗っている
N-gram 埋め込み 51B
この層は GPU の専用メモリではなく通常のメモリ側で扱われる
構造
Qwen4 の先行アーキテクチャ
出典:Qwen3.8-Flash-Next モデルカード アーキテクチャ図(2026-08-28 取得)|huggingface.co
効いてくる場面
専用メモリが少なくても動かせる
GPU1枚+通常メモリ100GBで動作
大容量GPUで毎秒80トークン
ノートPC128GBで毎秒9〜10トークン
量子化しても111GB=万人向けではない
誰のPCでも動く、とは言えない。128GB級が要る
出典:利用者の実測報告(X)/Zenn 実測記事(2026-08-28 取得)|x.com・zenn.dev
使い方
公式が Anthropic 互換の窓口を出している
Claude Code に刺さる
接続先はプランごとに違う。ここの取り違えが事故のもと
注意
公式手順は、既定モデルの指定そのものを書き換える
出典:QwenCloud 公式ドキュメント Claude Code(2026-08-28 取得)|docs.qwencloud.com
対策
表示と実体が食い違うと、取り違えに気づけない
設定ファイルを書き換える選んだつもりと違うモデルが動く
起動時だけ渡すその作業単位だけ切り替わる/閉じれば元通り
推奨は後者。設定ファイルを1文字も変えない
数字の読み方
2社は、別々の相手と比べている
Qwen の比較相手Claude Opus 4.6 Max
GLM の比較相手Claude Opus 4.8
公表値をそのまま並べて優劣は決められない
出典:両社の公式ベンチ表(2026-08-28 取得)|huggingface.co・z.ai
得意分野
勝ち負けは、項目ごとに入れ替わる
指示追従 Qwen 81.3
競技コード Qwen 91.9
実務タスク Qwen 55.7
難問 HLE は Opus 4.6 が上
DeepSWE は GLM 63.4 が上
集計では GLM 4勝 Qwen 2勝
速いのは Qwen、賢いのは GLM。混ぜて使うのが実際
出典:Qwen 公式モデルカード/llm-stats 比較(2026-08-28 取得)|huggingface.co・llm-stats.com
まとめ
仕事で使うなら、性能より先にここを見る
Qwen = 独自ライセンスqwen-community-1.0/速さと省メモリ
GLM = MIT商用が素直/難しい一発に強い
一部の記事は Apache 2.0 と書いているが誤り。原文で確かめる
出典:Qwen3.8-Flash-Next モデルカード frontmatter(2026-08-28 実測)|huggingface.co