STT
OPENAI 文字起こしAPI ─ 2026.07 実機検証
文字起こしが刷新
新モデル2本で、Whisperは卒業できるのか
工程ごとに、置き換えの可否を判定する
OPENAI TRANSCRIPTION API
01 / 18
結論
先に答えから言います
全部ではなく、工程ごとに乗り換える
安くなって精度も上がった。ただし置き換えられない工程が残ります
OPENAI TRANSCRIPTION API
02 / 18
何が起きたか
用途で2つに分かれた
録り終えた音声
GPT-Transcribe
喋っている最中
GPT-Live-Transcribe
ここを選び間違えると、払う額が3.8倍変わります
OPENAI TRANSCRIPTION API
03 / 18
公式資料
価格は公式に明記されている
出典:OpenAI API / Pricing(2026-07-31 取得)
OPENAI TRANSCRIPTION API
04 / 18
料金
1時間の音声を処理するといくらか
GPT-Transcribe
前世代 4o-transcribe
GPT-Live-Transcribe
1時間の会議で40円ほど。ライブだけは3.8倍かかります
OPENAI TRANSCRIPTION API
05 / 18
コストの位置づけ
値段で悩む段階は終わった
月に20時間回しても、1,000円に届きません
OPENAI TRANSCRIPTION API
06 / 18
精度
誤認識率は、ほぼ半分になった
whisper-1
40.37%
GPT-Transcribe
19.27%
22の言語で測った単語誤認識率。52%の削減です
OPENAI TRANSCRIPTION API
07 / 18
新機能
先に言っておくと、精度が上がる
01状況を文章で渡す
02固有名詞を渡す
03使う言語を渡す
会議の前に議題を共有するのと同じ。人間に効くことはAIにも効く
OPENAI TRANSCRIPTION API
08 / 18
その効果
文脈を渡すと、意味の精度が上がる
文脈なし
38.5%
文脈あり
44.6%
ライブ側で6.1ポイントの改善が報告されています
OPENAI TRANSCRIPTION API
09 / 18
注意
渡した言葉は、必ず出るわけではない
これは命令ではなく、ヒント
実際に話された時にだけ反映されます
OPENAI TRANSCRIPTION API
10 / 18
公式資料
ライブは遅延を5段階で選べる
出典:OpenAI API / Realtime transcription(2026-07-31 取得)
OPENAI TRANSCRIPTION API
11 / 18
遅延の設計
速さを取るか、正確さを取るか
最も速い
minimal
最も正確
xhigh
何ミリ秒かは公式も明言していません。自分の音声で測るしかない
OPENAI TRANSCRIPTION API
12 / 18
判定 その1
本文の文字起こしはどうか
ここは、卒業できる
要約やブログ化に使うテキストは、安くて精度が高い方
OPENAI TRANSCRIPTION API
13 / 18
公式資料
公式が「別のモデルを使え」と書いている
出典:OpenAI API / Realtime transcription(2026-07-31 取得)
OPENAI TRANSCRIPTION API
14 / 18
判定 その2
字幕づくりはどうか
本文のテキスト
新しい方へ
字幕・テロップ
Whisperを残す
単語ごとの時間が返らないので、そのままでは字幕になりません
OPENAI TRANSCRIPTION API
15 / 18
判定 その3
議事録で話者を分けたいとき
話者を分ける
専用の別モデル
ただし
先出しヒントが効かない
話者を分けるか、固有名詞の精度を取るか。二択になります
OPENAI TRANSCRIPTION API
16 / 18
使う前に
残っている制約は3つ
時間の情報、話者の区別、そして1ファイル25メガまで
OPENAI TRANSCRIPTION API
17 / 18
まとめ
乗り換えるのは、工程の単位で
全部を一度に替えないほうが、結果的に早い
OPENAI TRANSCRIPTION API
18 / 18
▶ 再生する