記事やマニュアルの読み上げ音声、問い合わせ応答のアナウンス、動画のナレーション——tts-1 や gpt-4o-mini-tts で音声ファイルを作る仕組みは、社内の地味なところで静かに動いていることが多い部分です。そのOpenAI の音声合成(TTS)モデル4本が、2026年10月1日に廃止を告知され、2027年1月6日にAPIから削除されます。
結論を先に書きます。公式が示す移行先は gpt-realtime-2.1-mini の1本だけで、しかもこのモデルは音声合成エンドポイント v1/audio/speech に対応していません。つまり「モデル名を差し替えれば済む」移行ではなく、mp3 を1回のAPI呼び出しで受け取る作り自体が使えなくなります。料金も単位が文字課金からトークン課金へ変わり、読み上げ音声1時間あたりで比べると gpt-4o-mini-tts の $0.864 に対し移行先は $1.44=約1.67倍(+約67%)です。この記事は2026年10月2日に OpenAI 公式の提供終了ページ・モデルページ・料金ページ・音声レイテンシ/コストのガイドを直接確認し、期日・単価・移行の落とし穴を整理したものです。
何が終わるのか:音声合成4本が2027年1月6日に削除
OpenAI は2026年10月1日、以下の4モデルについて「少なくとも3か月の予告期間をもって、2027年1月6日にAPIから削除する」と提供終了ページに記載しました。推奨移行先は4本すべて同じ gpt-realtime-2.1-mini です。
削除されるモデル | 削除日 | 公式の推奨移行先 |
|---|---|---|
tts-1 | 2027年1月6日 | gpt-realtime-2.1-mini |
tts-1-hd | 2027年1月6日 | gpt-realtime-2.1-mini |
gpt-4o-mini-tts-2025-03-20 | 2027年1月6日 | gpt-realtime-2.1-mini |
gpt-4o-mini-tts-2025-12-15 | 2027年1月6日 | gpt-realtime-2.1-mini |
gpt-4o-mini-tts と書いていても止まります
ここは見落としやすいところです。提供終了ページの表に載っているのは日付つきのスナップショット2本で、エイリアス(日付なしの gpt-4o-mini-tts)そのものは表に出てきません。「うちはエイリアスで書いているから対象外だろう」と読めてしまいます。
ところが gpt-4o-mini-tts のモデルページを見ると、その既定スナップショットは gpt-4o-mini-tts-2025-12-15 です(2026年10月2日に公式モデルページで確認)。そして廃止対象のスナップショットは 2025-03-20 と 2025-12-15 の2本とも。つまりエイリアスで呼んでいる実装も、既定の中身が削除されるので同じ日に止まります。コードに tts-1 tts-1-hd gpt-4o-mini-tts のどれが書かれていても、2027年1月6日が自分の期日だと考えてください。
移行先は「音声合成API」ではない(ここが一番の障害)
移行で本当に効くのは単価ではなく、エンドポイントが引き継がれていないことです。両者のモデルページの対応表を並べると、こうなります。
エンドポイント | gpt-4o-mini-tts(廃止側) | gpt-realtime-2.1-mini(移行先) |
|---|---|---|
Speech generation( | 対応 | 非対応 |
Realtime( | 非対応 | 対応 |
Chat Completions / Responses / Batch | 非対応 | 非対応 |
いま client.audio.speech.create({ model: "gpt-4o-mini-tts", voice, input }) のようにテキストを渡して mp3 を1回で受け取っている実装は、移行先では一切動きません。gpt-realtime-2.1-mini は WebRTC・WebSocket・SIP でつなぐリアルタイムセッション専用のモデルです。
公式の Realtime 入門が示すブラウザ構成は、次の4段階になります。
- アプリのサーバーが、Realtime セッション用の一時的なクライアントシークレット(ephemeral client secret)を発行する
- フロントエンドで
RealtimeSessionを作る - ブラウザは WebRTC で、サーバーは WebSocket で接続する
- 音声ターン・ツール呼び出し・割り込み・ハンドオフは、そのセッションの中で処理する
「1行のAPI呼び出し」から「サーバーでトークンを発行し、セッションを張り、音声を流し込む」構成への変更です。対話型の音声エージェントを作るならこの形は合っていますが、記事を読み上げて mp3 に保存するような非対話のナレーション用途には、構造そのものが噛み合いません。この点について公式ページは、ナレーション用途の別の受け皿を明示していません(2026年10月2日時点)。当サイトとしても、公式に書かれていない代替案を断定はしません。
gpt-realtime-2.1-mini はどんなモデルか
移行先そのものの素性も押さえておきます。公式モデルページの記載は次のとおりです。
- 入力:テキスト / 音声 / 画像 出力:テキスト / 音声
- コンテキストウィンドウ:128,000トークン 最大出力:32,000トークン
- 知識のカットオフ:2024年9月30日 推論トークン:対応
- 位置づけ:リアルタイム音声を速く安くするための蒸留推論モデル。GPT-Realtime-2 より英数字の認識が改善されている(公式説明)
リアルタイム音声モデル同士の単価と選び方はGPT-Live-1 と gpt-realtime の料金比較で整理しています。今回の移行先を検討するなら、同じリアルタイム系の他の選択肢と並べて見ておくほうが判断を1回で済ませられます。
料金はどう変わるか:音声1時間あたりに揃えて比べる
課金の単位が変わるので、まず単価表を揃えます。
モデル | 課金単位 | 単価(公式) | 使える音声合成エンドポイント |
|---|---|---|---|
tts-1 | 文字 | $15.00 / 100万文字 | v1/audio/speech |
tts-1-hd | 文字 | $30.00 / 100万文字 | v1/audio/speech |
gpt-4o-mini-tts | トークン | テキスト入力 $0.60 / 100万、音声出力 $12 / 100万 | v1/audio/speech |
gpt-realtime-2.1-mini(移行先) | トークン | テキスト 入力$0.60 / キャッシュ$0.06 / 出力$2.40、音声 入力$10 / キャッシュ$0.30 / 出力$20、画像入力$0.80(いずれも100万トークンあたり) | なし(v1/realtime のみ) |
音声トークンの換算レートは公式が明示している
トークン課金は「で、結局いくら?」が見えにくいのですが、音声トークンと秒数の換算レートは公式ガイドに書かれています。原文はこうです——ユーザー側メッセージの音声トークンは音声100msあたり1トークン、アシスタント側メッセージの音声トークンは音声50msあたり1トークン。
読み上げ(=アシスタントの音声出力)は50msで1トークンなので、1秒=20トークン、1分=1,200トークン、1時間=72,000トークンです。ここまで決まれば実額が出ます。
- gpt-4o-mini-tts:72,000 × $12 ÷ 1,000,000 = $0.864 / 音声1時間
- gpt-realtime-2.1-mini:72,000 × $20 ÷ 1,000,000 = $1.44 / 音声1時間
- 差は 約1.67倍(+約67%)。音声出力の単価比($20 ÷ $12)とちょうど同じです
月に100時間ぶんの音声を生成している場合、$86.4 が $144 になります(年換算で約$692)。移行で機能が増えるわけではなく、同じ尺の音声に対して1.67倍を払う形になるので、予算側は「値上がりする前提」で組み直しておくほうが安全です。
文字課金からの移行は「1,000文字が何秒になるか」で分岐する
tts-1 / tts-1-hd は文字課金なので、トークン課金とは尺度が違います。そこで損益分岐を「1,000文字が何秒の音声に読み上げられるか」で出します。
移行先の音声出力は1秒20トークンなので、$20 ÷ 100万 × 20トークン = $0.0004 / 秒です。これを使うと次の形になります。
- tts-1:1,000文字 = $0.015。$0.015 ÷ $0.0004 = 37.5秒。1,000文字が37.5秒より長く読み上げられるなら、移行先のほうが高くなります
- tts-1-hd:1,000文字 = $0.030 → 分岐点は 75秒
この分岐点をどう読むかは、自社の原稿が実際に何秒になるかを測らないと決まりません。読み上げ速度は言語・声・原稿の中身(数字や英字の多さ)で変わるもので、公式に「日本語は毎秒◯文字」という数字はありません。ですので当サイトでは一般論としての読み上げ速度を断定せず、やるべきことは1つだけとしておきます——自社の代表的な原稿1本をいま実際に読み上げさせて、1,000文字あたりの秒数を測る。測った値が37.5秒(tts-1)/75秒(tts-1-hd)より大きければ、移行はコスト増です。
Mihata としての推奨は、tts-1 からの移行は「コスト増になる前提」で予算を組むことです。1,000文字をわずか37.5秒で読み切る速度は、ナレーション用途では現実的に出にくい水準だと考えています。tts-1-hd からの移行は分岐点が75秒と緩いので、こちらは自社実測の結果しだいです。
音声合成そのものを他社に振る選択肢もあります。単価と声の選び方を横に並べるなら、Gemini TTS と OpenAI の音声合成を料金で比べた記事が出発点になります。今回のように移行先でエンドポイントが減る場合、他社比較は「乗り換え」ではなく「要件を満たす先を探す」作業として現実的です。
音声まわりの仕組みは、作った当時の担当者しか中身を知らない状態になりがちです。Mihata では、こうした「どこで何が動いているか分からない」仕組みの棚卸しと作り替えをお手伝いしています。記事の途中で恐縮ですが、同じ悩みで止まっている方のお役に立てることがあるかもしれません。
移行の落とし穴4つ
1. v1/audio/speech が使えない(設計変更が必要)
繰り返しになりますが、ここが最大の障害です。移行先 gpt-realtime-2.1-mini のモデルページで Speech generation(v1/audio/speech)は「Not supported」です。モデル名の一括置換で終わらせると、2027年1月6日に「音声だけが出なくなる」という形で表面化します。棚卸しではモデル名ではなくエンドポイントで検索するのが確実です。
2. エイリアス指定でも止まる
前述のとおり、gpt-4o-mini-tts の既定スナップショットは廃止対象の gpt-4o-mini-tts-2025-12-15 です。提供終了ページの表を文字列検索して「自分のモデル名が無いから大丈夫」と判断するのは危険です。エイリアスを使っている場合は、モデルページで既定スナップショットが何かまで確認してください。
3. 音声トークンは入力と出力で換算が非対称
公式の換算レートはユーザー音声=100msで1トークン、アシスタント音声=50msで1トークンです。同じ1秒の音声でも、入力は10トークン、出力は20トークンと倍違います。見積もり表を作るときに片方のレートで両方を計算すると、出力側が半分に見えます。読み上げ中心の用途は「出力=20トークン/秒」で計算してください。
4. 非対話のナレーション用途の受け皿が公式に明示されていない
対話型の音声エージェントであれば、Realtime への移行は方向として自然です。しかし「原稿を渡して音声ファイルを受け取る」だけの用途について、公式は代わりの経路を書いていません(2026年10月2日時点)。当サイトは推測で代替案を断定しませんが、該当する実装がある場合は「同じ作り方は続けられない」ことを前提に、2027年1月6日までの設計変更を計画に入れる必要があります。
音声系は1か月半に3つの期限が並ぶ(棚卸しは1回でやる)
当サイトでこれまで追ってきた OpenAI の廃止告知と突き合わせると、音声まわりの削除日は2027年1月から2月にかけて3つ並んでいます。
削除日 | 対象 | 告知日 |
|---|---|---|
2027年1月6日 | 音声合成:tts-1 / tts-1-hd / gpt-4o-mini-tts のスナップショット2本 | 2026年10月1日 |
2027年1月20日 | レガシーの audio / realtime / transcription 系 | 2026年7月20日 |
2027年2月26日 | 文字起こし:whisper-1 / gpt-4o-transcribe / gpt-4o-mini-transcribe / gpt-4o-transcribe-diarize | 2026年8月26日 |
この3つは別々の告知なので、1本ずつ追っていると「また音声の棚卸しをする」ことを3回繰り返すことになります。実務では、読み上げ・文字起こし・リアルタイムをまとめて1回で洗い出すほうが短く終わります。文字起こし側の期日と移行先はwhisper-1 の2027年2月26日終了と移行先の使い分けに整理しました。
なお、同じ2026年10月1日にはテキスト系モデルの廃止告知も出ています(GPT-5.3-Codex / GPT-5.1 / GPT-5.4-Nano が2027年4月1日停止)。そちらはGPT-5.1・GPT-5.3-Codex の停止と移行先で扱っています。
いま何をすればいいか(残り約3か月で逆算する)
2026年10月2日時点で、削除日まで約3か月です。予告期間は「少なくとも3か月」とされており、今回はほぼその下限にあたります。年末年始を挟むぶん、実働で動ける時間は見た目より短いと考えてください。
- 1週目:エンドポイントで探す。社内のコード・GAS・ノーコードツールの設定を
audio/speechtts-1mini-ttsの3語で検索します。外注した仕組みなら、開発元へ「音声合成に使っているモデルIDとエンドポイントを教えてください」と1通送るだけで済みます。 - 2週目:用途を2つに分ける。ヒットした箇所が対話(ユーザーの発話に応答する)なのか、非対話(原稿を音声ファイルにする)なのかを分けます。前者は Realtime への移行が方向として素直で、後者は設計から考え直す側です。
- 3週目:1,000文字あたりの秒数を測る。実際の原稿1本を現行モデルで読み上げ、音声の長さを秒で記録します。これが分岐点(tts-1=37.5秒/tts-1-hd=75秒)より長ければ、移行後はコスト増です。見積もりではなく実測値で稟議を通してください。
- 4週目以降:切り替えて監視する。期日の1か月以上前(=2026年12月上旬まで)に切り替え、しばらくは出力された音声を人が聞いて確認する運用を残します。
あわせて、モデル名をコードに直書きせず設定ファイルへ切り出す形にしておくと、次の廃止のときの作業が1行の書き換えで済みます。主要各社の提供終了カレンダーと移行の進め方はAIモデル提供終了への企業の対応と移行6手順にまとめています。
まとめ
今回の廃止が効くのは、AIを本格導入している会社ではなく「音声だけは前から自動で作っている」会社です。読み上げ音声やアナウンスは、止まったときに利用者側からすぐ気づかれる一方、仕組みの中身は外注先しか知らない状態になりやすい領域です。
やることは3つに畳めます。①audio/speech を使っている箇所を探す ②対話用途と非対話のナレーション用途に分ける ③1,000文字あたりの秒数を測って値上がり幅を出す。ここまでを2026年のうちに終えておけば、2027年1月6日は何も起きない日になります。
逆に、いちばん重いのは非対話のナレーション用途です。公式に代わりの経路が示されていないため、モデル名の差し替えでは済まず、仕組みの作り方そのものを決め直すことになります。ここは早めに判断の場を持つほうが安全です。
Mihata では、こうした「外注した仕組みの中で何が動いているか分からない」状態の棚卸しからご相談を受けています。モデルの乗り換えそのものより、どこで何がどのエンドポイントを叩いているかを一覧にするところが、実際にはいちばん時間のかかる工程です。お困りの段階がはっきりしていなくても構いませんので、よろしければお気軽にご相談ください。
よくある質問
tts-1はいつ使えなくなりますか?
2027年1月6日です。OpenAIは2026年10月1日に、tts-1・tts-1-hd・gpt-4o-mini-tts-2025-03-20・gpt-4o-mini-tts-2025-12-15の4本について、少なくとも3か月の予告期間をもって同日にAPIから削除すると公式の提供終了ページに記載しています。
gpt-4o-mini-ttsと書いている場合は対象外ですか?
対象です。提供終了ページの表に載っているのは日付つきのスナップショット2本ですが、エイリアスgpt-4o-mini-ttsの既定スナップショットはgpt-4o-mini-tts-2025-12-15で、これは廃止対象に含まれます。エイリアスで呼んでいる実装も2027年1月6日に止まります。
モデル名を差し替えるだけで移行できますか?
できません。公式の推奨移行先gpt-realtime-2.1-miniは、モデルページでSpeech generation(v1/audio/speech)が「Not supported」とされており、対応しているのはv1/realtimeだけです。テキストを渡してmp3を1回で受け取る作りは動かず、サーバーで一時的なクライアントシークレットを発行してWebRTCまたはWebSocketでセッションを張る構成への変更が必要になります。
移行すると料金はいくら変わりますか?
読み上げ音声1時間あたりで比べると、gpt-4o-mini-ttsが$0.864、移行先のgpt-realtime-2.1-miniが$1.44で、約1.67倍(+約67%)です。公式ガイドがアシスタントの音声トークンを50msあたり1トークンと明示しているため、1時間=72,000トークンとして音声出力単価($12と$20/100万トークン)を掛けて算出できます。
tts-1からの移行はいつ損になりますか?
1,000文字が37.5秒より長い音声になる場合です。tts-1は1,000文字で$0.015、移行先の音声出力は1秒あたり$0.0004なので、分岐点は37.5秒になります。tts-1-hdは1,000文字$0.030なので分岐点は75秒です。読み上げ速度は原稿や声で変わるため、自社の代表的な原稿1本を実際に読み上げさせて秒数を測ってから判断してください。
原稿を音声ファイルにするだけの用途はどこへ移せばいいですか?
2026年10月2日時点で、公式ページにはこの用途の代わりとなる経路が明示されていません。移行先のgpt-realtime-2.1-miniは対話型のリアルタイムセッション専用です。当サイトでは公式に書かれていない代替案を断定しませんが、該当する実装がある場合は同じ作り方を続けられない前提で、2027年1月6日までの設計変更を計画に入れてください。