2026年9月22日に Gemini の音声合成(TTS)モデルが世代交代し、Gemini TTS と OpenAI TTS を比べる前提そのものが変わりました。単価が下がっただけでなく、声を作る・複製する機能を「誰が使えるか」で両社が分かれたためです。中小企業が読み上げやナレーション生成でどちらを採用すべきかを、1枚で決められる形に整理します。
結論:3つの質問でほぼ決まる
先に Mihata としての推奨を出します。読み上げ用途なら、迷ったらまず gemini-3.8-flash-lite-tts から試すのが合理的です。出力の音声トークンが 1Mあたり $6.00、Google が公開している「音声1秒=25トークン」換算で 1分あたり $0.009(1時間 $0.54)と、料金の見通しが立てやすいからです。ただしこれは2026年12月31日までの導入価格で、2027年1月1日から2倍になります(後述)。
選定は次の3つの質問でほぼ決まります。
- 大量に読み上げる/コストが最優先 →
gemini-3.8-flash-lite-tts(101言語・高スループット向け) - ナレーション品質・演技・方言・長尺の安定が要る →
gemini-3.8-flash-tts(130言語・公式が「スタジオ級の声の忠実さ」と位置づけ) - すでに OpenAI に寄せている/内蔵11音声で足りる/実装を増やしたくない →
gpt-4o-mini-tts(入力 $0.60・出力 $12.00 per 1M)
もう1つ、間違えやすい分岐があります。「対話でその場で応答する」用途は TTS ではありません。原稿を音声にするのが TTS で、相手の発話に即応するのはリアルタイム音声の領域です。後者は gpt-live-1(1分 $0.05・秒課金)や gpt-realtime-2.1、Gemini 3.8 の Live API 側を見るべきで、TTS の単価表で比べると判断を誤ります。違いはリアルタイム音声モデルで何ができるかの整理にまとめました。
機能の比較表
項目 | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts | gpt-4o-mini-tts |
|---|---|---|---|
入力(text)/1M | $0.50 | $0.50 | $0.60 |
出力(audio)/1M | $9.00 | $6.00 | $12.00 |
対応言語 | 130言語 | 101言語 | 公式に言語数の明記なし |
音声の選択肢 | プリセット30種+拡張ライブラリ(150種以上) | 同左 | 内蔵11種(alloy / coral など) |
カスタム音声 | Voice design / Voice replication を API から直接 | 同左 | eligible customers 限定・営業窓口経由 |
入力トークン上限 | 8,192 | 8,192 | 2,000 |
既定の出力形式 | WAV(RIFFヘッダ付き) | 同左 | 形式を指定して取得 |
複数話者 | 1リクエスト最大2話者・プリセット音声のみ | 同左 | 1リクエスト1話者 |
話し方の指定 |
| 同左 |
|
実務でいちばん効くのは、じつは料金より入力トークン上限です。gpt-4o-mini-tts は2,000トークンなので、少し長い記事を一発で読ませることはできず、原稿を分割して音声を連結する処理が必ず要ります。Gemini 側は8,192トークンなので粗い塊のまま投げられます。この差は案件によっては単価差より大きくなります。Gemini 側の料金内訳はGemini 3.8 Flash TTS の料金と使い方をまとめた記事で扱っています。
料金は「1Mトークン」までしか横並びにできない
ここは多くの比較記事が踏み外すところなので、正直に書きます。両社の TTS を「1分いくら」で横並びにすることは、公式情報だけではできません。
Google は料金ページの脚注で「音声トークンは音声1秒あたり25トークンに相当する」と明記しています。だから60秒=1,500音声トークンとして、gemini-3.8-flash-tts は $0.0135/分、gemini-3.8-flash-lite-tts は $0.009/分と換算できます。旧 gemini-3.1-flash-tts-preview は $20.00/1M=$0.03/分でしたから、新2モデルは出力単価で55%減・70%減です。
一方で OpenAI は料金ページに「音声1秒が何トークンか」を書いていません。$12.00/1M を分あたりに換算する根拠がなく、「Gemini のほうが1分あたり何倍安い」という比較は公式情報だけでは成立しません。換算済みの表がネット上にありますが、レートの出所が公式でない限り社内の予算資料に写すべきではありません。
Mihata の結論は、1Mトークンあたりの数字は並べてよい(上の表)/分あたりの横並びは出さないです。どうしても分あたりで比べるなら、自分の原稿で両方を1回ずつ叩き、請求されたトークン数と生成された秒数を割り算するのが唯一正確な方法です。10分ぶんの原稿1本で済むので、見積もりの前に必ずやることを勧めています。月額の積み方は音声AIエージェントの月額コストの試算記事にまとめました。
実務の分岐はカスタム音声の敷居
単価が近いモデル同士で迷うとき、判断を決めるのは「自社の声を使えるか」です。Gemini 側は Voice design(自然文の説明から声のペルソナを作る)と Voice replication(録音から声を複製する)を、誰でも API から直接叩けます。POST /v1beta/voices に投げると恒久IDと試聴用の WAV が返るので、その場で社内の合意を取れます。複製には同一話者の録音2本(10〜30秒のリファレンスと、規定の同意文をそのまま読み上げた同意録音)が要り、同意文は一字でも違うと失敗します。詳しくはGemini で声を作る・複製する手順の記事へ。
OpenAI 側の custom voices は eligible customers 限定で、営業窓口(Contact sales)経由で有効化してもらう必要があります。手順は Google とほぼ同型(同意録音を /v1/audio/voice_consents に上げて consent ID を得てから作る)ですが、有効化を待つ工程が入るため着手日を自分で決められません。「社長の声でナレーションを作りたい」という要望が案件に含まれるなら、実質的に Gemini 側が先に手をつけられる選択肢です。逆に内蔵音声で足りるなら、この差は選定に効きません。なお OpenAI の利用規約は「その声が AI 生成であることをエンドユーザーに明確に開示すること」を求めています。どちらを使うにせよ、公開物には AI 音声と書く前提で企画してください。
2027年1月1日に Gemini TTS の単価が2倍になる
いま Gemini 側が安く見える理由の一部は、導入価格に期限があるからです。公式の料金ページには、出力 $9.00(3.8 Flash TTS)と $6.00(3.8 Flash-Lite TTS)は2026年12月31日までの価格で、2027年1月1日から $18.00 / $12.00 になると書かれています。入力も $0.50 から $1.00 へ倍です。分あたりでは $0.027/分・$0.018/分になり、この水準だと gpt-4o-mini-tts の出力 $12.00/1M との差はかなり縮まります。
Mihata の判断として書いておきます。いまの価格差が来年も続く前提でシステムを設計しないでください。①TTS の呼び出しを1か所のラッパー関数に閉じ込めてモデル名を設定値にする、②月の生成秒数をログに残して単価2倍のときの請求額を即算できるようにする。この2つを最初から入れておけば、価格改定のたびに設計を触らずに済みます。
なお旧 gemini-3.1-flash-tts-preview は、公式が置き換え先として新2モデルを指定しているものの、停止日はまだ発表されていません。即日使えなくなるわけではないので、慌てて一夜で切り替える必要はありません。方向は確定しているので、次の改修で移行する計画にしておけば十分です。
音質はベンチマークではなくブラインド比較で決める
この記事では自然性のスコアを出しません。公開されているのは各社が自社の条件で測った値だけで、条件が揃っていないスコアを並べても選定の根拠にならないからです。日本語の、しかも自社の原稿に対する良し悪しは、サンプルを鳴らして耳で決めるしかありません。かわりに Mihata が案件で使っている手順を置きます。丸1日かかりません。
- 原稿を1本だけ固定する。納品する原稿から、読みにくい固有名詞・数字・英字混在を含む200〜400字を選ぶ。きれいな文だけで測ると本番で崩れます。
- 話者設定を揃える。3モデルとも同じ性別・年齢帯のプリセット音声を選び、話し方の指定(Gemini は
speech_metadata.style、OpenAI はinstructions)を同じ意味の文にする。 - 1モデル3本ずつ生成する。同じ入力でも出力は毎回揺れるため、1本で決めると運で選んでしまいます。計9本。
- ファイル名を伏せて社内3人以上で聞く。連番にリネームして配り、「このまま公開できる/手直しが要る/使えない」の3択だけ答えてもらう。
- NGの理由を記録する。読み間違い・間の詰まり・語尾の不自然さのどれで落ちたかを残すと、原稿側で直せるものとモデルを変えないと直らないものが分かれます。
この手順で落ちるのは、たいていモデルの音質ではなく原稿側の書き方です。とくに Gemini 3.8 TTS は入力テキストを厳密に読み上げ原稿として扱うので、「明るく言って:こんにちは」のような地の文の指示をそのまま読み上げます。「なぜか指示文まで読む」と感じたら、品質ではなく書き方の問題です。逆向きの選定は文字起こしAPIの比較記事で整理しています。
この比較を自社の原稿でやってみたいものの、手を動かす人がいないという相談もよくいただきます。Mihata では月1回の AI ミーティングで、こうした検証を一緒に回しています。
中小企業での現実的な落とし所
社内向けの読み上げ機能(マニュアルの音声化、記事の読み上げ)なら gemini-3.8-flash-lite-tts とプリセット音声で十分です。無料枠で試せるので稟議の前に実物を聞かせられます。月10時間ぶんでも導入価格なら $5.4 程度です。顧客に出すナレーションや採用動画は gemini-3.8-flash-tts を第一候補に。数円を削っても撮り直しの手間で逆転します。
そして既に OpenAI で他の機能を動かしているなら、gpt-4o-mini-tts のまま進める判断も合理的です。管理するキーを増やさない、請求書を1枚に保つ、レビュー体制を分けない――こうした運用コストは単価表に出ませんが毎月かかります。入力2,000トークンの上限だけ先に確認しておけば詰まりません。
どのモデルを選ぶかより、「どこに音声を入れると業務が楽になるのか」を決めるほうが難しいのが実情です。用途がはっきりしていない段階でも問題ございませんので、気になる点があればお気軽にお問い合わせください。
すでに gemini-3.1-flash-tts-preview で動かしている場合は、比較の前にまず移行が必要です。公式が置き換え先を名指ししており、コード側で壊れる箇所も決まっているので、gemini-3.1-flash-tts-preview の移行手順を先にご覧ください。
よくある質問
Gemini TTS と OpenAI TTS は、1分あたりどちらが安いですか?
公式情報だけでは比較できません。Google は音声1秒=25トークンを公開しているため gemini-3.8-flash-lite-tts は1分 $0.009 と換算できますが、OpenAI は料金ページに音声1秒あたりのトークン数を記載していないため、分あたりに換算する根拠がありません。1Mトークンあたりの単価(出力 $6.00 対 $12.00)までなら並べられます。
自社の社員の声でナレーションを作れますか?
Gemini は Voice replication を API から直接使えます。同一話者の10〜30秒のリファレンス録音と、規定の同意文をそのまま読み上げた同意録音の2本が必要です。OpenAI のカスタム音声は eligible customers 限定で、営業窓口経由で有効化してもらう必要があります。
いまの Gemini TTS の安さはいつまで続きますか?
公式の料金ページによると2026年12月31日までが導入価格で、2027年1月1日から入力・出力とも2倍になります。出力は 3.8 Flash TTS が $18.00、3.8 Flash-Lite TTS が $12.00 per 1M です。いまの価格差が続く前提で設計せず、モデル名を設定値にしておくことを勧めます。
旧モデルの gemini-3.1-flash-tts-preview はいつ止まりますか?
停止日は発表されていません。公式は置き換え先として gemini-3.8-flash-tts と gemini-3.8-flash-lite-tts を指定しているので方向は確定していますが、期限は未定です。次の改修のタイミングで移行する計画で問題ありません。
どちらの音質が良いか、スコアで比べられますか?
公開されているのは各社が自社の条件で測った値だけなので、この記事ではスコア比較をしていません。同じ原稿・同じ話者設定で3本ずつ生成し、ファイル名を伏せて社内3人以上でブラインド比較する手順を勧めています。