Google が 2026年9月22日に Gemini 3.8 Flash TTS と Gemini 3.8 Flash-Lite TTS を正式版(GA)として公開しました。導入を検討するとき最初に知りたいのは「1時間しゃべらせていくらか」です。公式の料金ページは1Mトークン単位でしか書かれていないので、分・時間・案件単位の金額に直して整理します。
結論:1分あたり約2円、1時間あたり約122円(2026年内の導入価格)
Gemini 3.8 Flash TTS の音声出力は 1Mトークンあたり $9.00、Flash-Lite TTS は $6.00 です(Gemini API 料金ページ・Paid Tier 標準)。音声トークンは公式に「音声1秒 = 25トークン」と定義されているので、1分 = 1,500トークンで換算できます。
つまり Flash TTS は 1分 $0.0135(1時間 $0.81)、Flash-Lite TTS は 1分 $0.009(1時間 $0.54)。1ドル150円と仮定すれば 1時間 約122円と約81円です(為替は本記事の仮定値で、請求はドル建てです)。
ただし条件が1つあります。この単価は 2026年12月31日までの導入価格で、2027年1月1日から2倍になると料金ページに明記されています。年をまたぐ運用なら「1時間 約243円/約162円」で見積もってください。無料枠には両モデルとも無料の行があるので、試すだけなら費用はかかりません。
料金表:導入価格と2027年からの通常価格
モデル | 入力(テキスト) | 出力(音声) | 2027-01-01 以降 |
|---|---|---|---|
gemini-3.8-flash-tts | $0.50 / 1M | $9.00 / 1M | 入力 $1.00・出力 $18.00 |
gemini-3.8-flash-lite-tts | $0.50 / 1M | $6.00 / 1M | 入力 $1.00・出力 $12.00 |
gemini-3.1-flash-tts-preview(旧) | $1.00 / 1M | $20.00 / 1M | — |
旧 gemini-3.1-flash-tts-preview と比べた音声出力の単価は Flash TTS で 55%減、Flash-Lite TTS で 70%減。preview の仕組みを新モデルへ向けるだけで請求額が半分以下になります。コンテキストキャッシュは入力 $0.125 / 1M(2027年から $0.25)。さらに Batch API は 50%オフで、即時性が要らない生成は Batch に寄せたほうが安く済みます。
分・時間あたりの円換算(1ドル150円と仮定)
条件 | 1分 | 1時間 | 2027年以降の1時間 |
|---|---|---|---|
Flash TTS(標準) | 約2.0円 | 約122円 | 約243円 |
Flash TTS(Batch 50%オフ) | 約1.0円 | 約61円 | 約122円 |
Flash-Lite TTS(標準) | 約1.4円 | 約81円 | 約162円 |
Flash-Lite TTS(Batch 50%オフ) | 約0.7円 | 約41円 | 約81円 |
旧 3.1 Flash TTS Preview(参考) | 約4.5円 | 約270円 | — |
入力側(読み上げる原稿)は $0.50 / 1M なので、日本語3,000字でも 1円未満。TTS の費用は「出力した音声の秒数」でほぼ決まると割り切って見積もって構いません。
現場のケース試算
ブログ記事の音声版を毎月100本つくる
日本語3,000字はゆっくり読んで約10分の音声です。1本 Flash TTS で 約20円、Flash-Lite TTS で 約14円。月100本(1,000分)なら 約2,000円/約1,400円、夜間に Batch でまとめれば 約1,000円/約700円。「全記事に音声版を付ける」が現実的な金額になりました。
電話の自動応答・館内放送を200パターン
1パターン30秒で合計100分、Flash-Lite TTS で 約140円。作り直しても同じ桁で、「1文言直すたびに録り直しの手配」が原稿の修正と再生成だけになります。ただし電話系は生PCMやmu-lawが要ることが多く、出力形式の指定が必要です(落とし穴②)。
5時間のオーディオブックを1冊
声の演技と長時間の安定性が要るので Flash TTS の場面。300分で 約610円、章ごとの作り直しを3回繰り返しても2,000円弱で収まります。
2モデルの使い分け:130言語の Flash か、101言語の Flash-Lite か
比較項目 | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
|---|---|---|
公式の位置づけ | 声の忠実度・演技のニュアンス・方言のカバー | 高スループット・低レイテンシ・低コスト |
対応言語 | 130言語 | 101言語 |
音声出力の単価 | $9.00 / 1M | $6.00 / 1M |
向く用途 | オーディオブック、スタジオ級ナレーション、複雑な複数話者の対話、難読語、地域方言 | 大量生産、リアルタイム音声エージェント、記事の読み上げ機能、声の複製、日常の1話者生成 |
旧 preview の置き換え先 | — | gemini-3.1-flash-tts-preview の推奨置き換え先 |
上限は入力8,192トークン・出力16,384トークン。Function calling・Thinking・Live API・構造化出力は非対応です。長い原稿は入力上限に当たるため、章や段落で分割して連結する前提で設計してください。
Mihata の推奨は単純です。まず Flash-Lite TTS で作り、耳で聞いて物足りなかったところだけ Flash TTS に上げる。モデル名の差し替えだけで比較できるので、最初から高いほうを選ぶ理由はありません。旧 preview の移行先として公式が指名しているのも Flash-Lite TTS 側です。
なお名前の似た テキスト生成モデル Gemini 3.8 Flash の料金とは別モデル・別の料金表です。混ざりやすいので、社内で見積もりを共有するときはモデル ID まで書いておくと事故が減ります。
日本語は使えるのか
使えます。Flash TTS の130言語・Flash-Lite TTS の101言語のどちらにも日本語が含まれ、声の複製で読み上げる同意文にも日本語(ja-JP)の規定文があります。入力言語は自動判定なので、原稿を日本語で渡すだけで読み上げられます。
一方で、日本語の音質や読み間違いの頻度は、私たちもまだ実案件で作り込んだ検証をしていません。漢字の読み分けや固有名詞・業界用語の読みは、公式が難読語や方言への強さをうたっていても実物を聞かないと判断できません。無料枠で自社の原稿を10本ほど生成し、耳で確かめてから採否を決めてください。
使い方:決めることは4つだけ
1. モデルを決める
gemini-3.8-flash-tts か gemini-3.8-flash-lite-tts。迷ったら Flash-Lite TTS から。
2. 声を決める(4通り)
①プリセットのスタジオ音声30種(Zephyr・Puck・Kore など。Bright / Upbeat / Informative といった性格ラベル付き)②Extended Voice Library で150種以上を絞り込み ③Voice design で文章から声を新規に作る ④Voice replication で実在の声を複製する。③④は恒久 ID が発行され、以降はその ID を指定するだけです。作り方と同意録音の要件は Voice design と Voice replication で声を作る手順にまとめました。
3. 話し方を決める
継続する話し方(落ち着いて・ささやくように)は構造化メタデータの style に、その瞬間だけの発声イベント(<laugh> <sigh> <breath> <short pause>)は原稿内の山括弧タグに書きます。この2つを混ぜないことが最大のコツです。
4. 出力形式を決める
既定は RIFF ヘッダ付きの WAV。生PCM・mu-law・A-law が必要なら response_format に audio/l16・audio/mulaw・audio/alaw を明示します。複数話者の対話は1リクエスト最大2話者・プリセット音声のみなので、3人以上は話者ごとに個別生成して24kHz PCM を連結します。
難しいのは「自社のどの業務に音声を足すと元が取れるか」を決める部分で、そこは一緒に考えたほうが早い場合があります。Mihata では独自AI開発として、社内の資料や原稿を音声化する仕組みづくりもお手伝いしています。
実務での落とし穴4つ
① 原稿に書いた「指示」がそのまま読み上げられる
3.8 TTS は入力テキストを厳密に読み上げ原稿として扱います。旧世代でよく使った「Say cheerfully: Hello!」や「Speaker 1: こんにちは」と書くと、「セイ チアフリー」「スピーカー ワン」まで声に出ます。話し方は style、話者ラベルは speaker という構造化メタデータへ移してください。移行の手順は gemini-3.1-flash-tts-preview からの移行で直す5点で整理しています。
② 既定の出力が WAV に変わった
旧モデルはヘッダ無しの生PCM(audio/l16)が既定だったため、Python の wave や ffmpeg で自分で WAV ヘッダを付けているコードが多いはずです。3.8 TTS でそのままにするとヘッダが二重になって壊れたファイルができます。ヘッダ付与の処理は外してください。
③ 複数話者は最大2話者・プリセット音声のみ
3人の対談を1リクエストで作ることはできず、「複製した社長の声と担当者の声で対話させる」もできません。原稿を話者ターンごとに分けて管理し、生成して連結する前提で設計してください。
④ 2027年1月1日から単価が2倍になる
月1,000分なら Flash-Lite TTS の月額が約1,400円から約2,800円へ上がります。金額は小さくても、予算稟議に「2027年から倍」を書き忘れると翌年に説明が必要になります。見積書には両方を並べてください。なお旧 gemini-3.1-flash-tts-preview の停止日は未発表なので、移行を慌てる必要はありません(置き換え先は公式に指定済みで方向は確定)。
採否の判断軸:音声にする価値があるのはどこか
1時間122円まで下がった今、費用は判断のボトルネックではありません。決めるべきは「誰が、いつ聞くのか」です。通勤中に聞く社内マニュアル、電話でしか届かない層への案内、視覚に頼れない現場の作業手順。こうした読ませることが難しい相手がいる場所に絞れば投資対効果は明確になります。
逆向きの用途なら Gemini 3.5 Transcribe API での文字起こし、同じ Gemini API で音楽を作る話は Lyria 3 の音楽生成 APIへ。OpenAI と迷っているなら Gemini TTS と OpenAI TTS の使い分けで料金体系と声の複製の条件を比べました。
音声読み上げをどこから組み込むかで迷われることが多いようです。小さく試す範囲の切り方から一緒に考えられますので、気になる点があればお気軽にご相談ください。
よくある質問
Gemini 3.8 Flash TTS の料金は1時間でいくらですか?
音声出力が1Mトークンあたり9.00ドルで、音声1秒が25トークンなので1時間(90,000トークン)で0.81ドルです。1ドル150円と仮定すると約122円になります。Flash-Lite TTS は0.54ドル=約81円です。ただしこれは2026年12月31日までの導入価格で、2027年1月1日から2倍になります。
無料で試せますか?
試せます。料金ページの Free Tier には 3.8 Flash TTS・3.8 Flash-Lite TTS のどちらにも無料の行があります。Google AI Studio の音声生成画面からも、コードを書かずに声を選んで生成を試せます。
日本語の読み上げに対応していますか?
対応しています。Flash TTS の130言語・Flash-Lite TTS の101言語のどちらにも日本語が含まれ、声の複製で使う同意文にも日本語の規定文があります。ただし漢字の読み分けや固有名詞の精度は原稿次第なので、無料枠で自社の原稿を実際に生成して確認してから採用を決めるのが安全です。
2つのモデルはどう選べばいいですか?
大量生成・リアルタイムの音声エージェント・記事の読み上げなら Flash-Lite TTS、オーディオブックや演技のニュアンスが要るナレーションなら Flash TTS です。まず安い Flash-Lite TTS で作り、耳で聞いて足りないところだけ Flash TTS に上げる進め方を推奨します。
旧 gemini-3.1-flash-tts-preview はいつ止まりますか?
停止日はまだ発表されていません。公式の廃止スケジュールには停止日未発表と記載されています。ただし置き換え先として 3.8 Flash TTS / 3.8 Flash-Lite TTS が公式に指定されており、単価も半分以下になるため、移行の方向自体は確定しています。