合成音声を自社のサービスに入れたいと思ったとき、止まるのは技術ではなく「この声を使っていいのか」の一点です。2026年9月22日に Gemini API へ Voice design と Voice replication が入り、声を作る/声を複製するという2つの道が正式に使えるようになりました。この記事は料金や実装ではなく、同意をどう取り、どう保管し、いつ消すかだけに絞って整理します。
結論:同意が必要なのは「複製」だけ
この2つは名前が似ているだけで、リスクの性質がまったく違います。Voice design は「落ち着いた低めの声で少しゆっくり」といった自然文の説明から架空の声を新規に作る機能で、実在の人を一人も必要としません。Voice replication は実在の話者の声を写す機能で、10〜30秒のリファレンス録音と、規定の同意文を読み上げた同意録音の2本が必須です。
つまり同意・権利・退職後の扱いといった面倒が乗ってくるのは Voice replication 側だけです。逆に言えば、用途がブランドの読み上げや電話の一次対応なら、実在の人の声を複製する必要はほとんどありません。まず Voice design で足りないかを検討するのが、いちばん確実にリスクを下げる判断です。
Voice design と Voice replication の違い
どちらも同じエンドポイント(POST /v1beta/voices)で作られ、返る ID も同じ voice_… 形式なので、コードの見た目は似ています。分かれるのは入力に生身の人間が必要かどうかです。
Voice design | Voice replication | |
|---|---|---|
作り方 | type="prompted"/自然文の説明から生成 | type="replicated"/実在話者の録音から生成 |
実在の人 | 不要(架空の声) | 必須(同一の成人話者) |
必要な素材 | テキストの説明だけ | source_audio(10〜30秒)+consent_audio(規定文) |
主なリスク | ブランドとの不一致 | 本人の権利・同意の範囲・撤回・退職後の扱い |
社内の手続き | 実質なし | 本人との取り決め(用途・期間・撤回手順) |
Voice design で作った声も恒久 ID として保存され、生成時に sample_audio(WAV)が返るのでその場で試聴して採否を決められます。Google AI Studio の Voice Design 画面なら説明文を書き換えながら対話的に追い込めます。設計のコツは、年齢・性別・音色・地域アクセントなど変わらない特性は Voice design 側に書き、その場の話し方は style に書くことです。料金と実装の全体像はGemini 3.8 Flash TTS の料金と使い方をまとめた記事、旧 preview から動かしている場合はgemini-3.1-flash-tts-preview からの移行手順を先に確認してください。
同意録音は規定文を一字も変えずに読む
Voice replication に必要な録音は2本で、どちらも同一の成人話者のものでなければなりません。1本目の source_audio は10〜30秒のきれいな自然発話、2本目の consent_audio は Google が定めた同意文をそのまま読み上げた録音です。日本語の規定文は次の1文で、一字でも違うと作成が失敗します。
私はこの音声の所有者であり、Googleがこの音声を使用して音声合成モデルを作成することを承認します。
同意文は30ロケールぶん用意されており、日本語(ja-JP)も含まれます。読ませるときは画面に文をそのまま出すのが安全です。口頭で伝えると助詞が変わったり「Google が」を「グーグルが」と読み替えたりして、原因の分かりにくい失敗になります。
録音条件は公式にコツが書かれています。静かな環境で録る、24kHz・モノラル・16bit の PCM WAV に変換する、そして2本を同じマイク・同じ環境で録る——最後のひとつが実務では重要です。同意録音だけスマートフォンで慌てて録ると話者の照合が通りにくくなるので、ヘッドセットを1本決めて続けて録るのがいちばん早いです。
保持期間は1年か7日。生体情報を残さない選択肢がある
保存には2つのモードがあり、ここはあとから変えにくいので最初に決めるところです。
モード | 識別子 | 上限 | 保持期間 |
|---|---|---|---|
ステートフル store=True(既定・推奨) | voice_… | 1プロジェクト200音声(Voice design 分と共用) | 1年 |
ステートレス store=False | voicekey_…(暗号化・自前保管) | クライアント側で管理 | 7日 |
ステートレスは「声の生体情報をサーバーに一切残したくない」要件のために用意されたモードです。返るのは暗号化された voicekey_… で、保管の責任は自社に移り、有効期間は7日しかありません。運用は確実に面倒になりますが、本人に「あなたの声はクラウドに保存されません」と説明できるのは社内の合意を取るうえで想像以上に効きます。声を貸す側の不安は、精度より「いつまで残るのか」に集まります。
200音声の上限は Voice design 分と共用です。試作を消さずに溜めると早く埋まるので、検証用と本番のプロジェクトは分けておくと安全です。
実務の落とし穴と、Mihata としての推奨
規定の同意録音は「Google に対する同意」でしかない
いちばん多い誤解がここです。同意文が承認しているのは「Google がこの音声を使用して音声合成モデルを作成すること」で、自社がその声をどの用途にどこまで使えるかという本人との取り決めは一切含まれていません。用途の範囲(社内向けだけか広告にも使うか)、期間、退職・契約終了後の扱い、本人が撤回したいときの手順は、自社と本人の間で別に書面にしておく必要があります。社員の声を使う会社でここを文書化しているところは、まだ多くありません。
肖像権やパブリシティ権の侵害にあたるかどうかは事案ごとの判断で、ここで断定はできません。「社員の声を商用の音声に使う契約書の書き方」「本人が撤回を申し出たときの扱い」は弁護士に確認すべき論点として整理し、導入前に一度相談してください。
消す担当を決めていないと、退職後も声が残る
保持期間1年は、何もしなければ勝手に消えるまで1年かかるという意味でもあります。声を提供した社員が3か月後に退職しても、残り9か月は音声を生成できる状態が続きます。対策は単純で、退職・異動・契約終了のチェックリストに「カスタム音声の削除(voices.delete())」を1行足し、実行する担当を名前で決めることです。加えて、どの声が誰のものかを台帳にしておかないと200件から該当の voice_… を探せません。ID・本人名・用途・同意日・削除予定日の5列で十分です。
まず「架空の声で足りないか」を検討する
Mihata としての推奨は明確で、実在の人の声を複製するのは、その人の声でなければ成立しない用途に限るべきだと考えています。代表本人が語るコンテンツや、すでに顔と声が知られている講師の教材などです。逆に記事の読み上げ、社内マニュアルのナレーション、電話の一次対応を音声AIに任せる仕組みのような用途では、架空の声のほうが運用が楽です。退職に左右されず、同意の管理も要らず、何度でも作り直せます。費用感は音声AIエージェントの月額を試算した記事にまとめています。
AI生成音声であることを伝える前提で設計する
どちらを使う場合でも外せないのが利用者への開示です。OpenAI は音声合成の利用規約で、その声が人間ではなく AI 生成であることをエンドユーザーに明確に開示することを明示的に求めています。Google 側で同じ文言は確認できていませんが、電話応答や接客のように相手が人間だと思い込みやすい場面では、開示を前提に冒頭を設計するのが安全です。預けたデータの扱いという観点は、AIサービスの利用規約と学習オプトアウトの確認ポイントと同じ読み方で点検できます。
社内向けの音声読み上げや電話の一次対応を、この同意設計まで含めて組み立てたい場合は、Mihata の独自AI開発でお手伝いできます。まず「架空の声で足りるか」の切り分けからご相談いただけます。
OpenAI 側も同型だが、カスタム音声は申請制
OpenAI のカスタム音声も手順はほぼ同型です。規定の同意文(英語は "I am the owner of this voice and I consent to OpenAI using this voice to create a synthetic voice model.")を録音して consent ID を取り、音声サンプルと一緒に渡して声を作ります。こちらも同意文が一字でも外れると失敗し、同じ同意録音を同一話者の複数回の作成に使い回せます。大きく違うのは入口で、OpenAI のカスタム音声は eligible customers 限定・営業窓口経由の有効化が必要です。今日試したいだけなら Gemini API のほうが早いです。選び方はGemini TTS と OpenAI TTS の使い分けで整理しています。
導入前に決めておく5つ
- その用途は Voice design(架空の声)で足りないか。足りるなら複製はしない。
- 複製するなら、本人との取り決め(用途・期間・撤回手順・退職後)を書面にする。
- store=True(1年・サーバー保存)か store=False(7日・自前保管)か。本人への説明とセットで決める。
- 同意録音は画面に規定文を出して読ませ、リファレンスと同じマイク・同じ環境で録る。
- 音声台帳(ID・本人名・用途・同意日・削除予定日)と、削除を回す担当を決める。
技術的にはどれも1日で試せます。時間がかかるのは2番だけなので、先に法務の確認を走らせながら、並行して Voice design で試作するのがいちばん詰まりにくい進め方です。
音声機能の導入で「どこまで自社で決められて、どこから専門家に聞くべきか」の線引きに迷ったら、お気軽にご相談ください。用途をお聞きして、複製が必要かどうかの切り分けからお答えします。
よくある質問
Voice design と Voice replication のどちらに同意が必要ですか?
同意録音が必要なのは Voice replication だけです。Voice design はプロンプトから架空の声を作る機能で、実在の話者を必要としないため同意録音はありません。
日本語の同意文はどう読み上げればいいですか?
「私はこの音声の所有者であり、Googleがこの音声を使用して音声合成モデルを作成することを承認します。」を一字も変えずに読み上げます。30ロケールぶん規定文があり、一字でも違うと作成が失敗するため、画面に文を表示して読ませるのが安全です。
作った音声はどれくらい保存されますか?
store=True のステートフルモードは voice_ で始まるIDで1年、1プロジェクト200音声まで保存されます。store=False のステートレスモードは voicekey_ で始まる暗号化IDを自社で保管し、有効期間は7日です。
社員の声を使うとき、Google への同意録音だけで足りますか?
足りません。同意録音が承認しているのは Google が音声合成モデルを作ることまでで、自社がその声をどの用途にどこまで使えるかという本人との取り決めは含まれません。用途・期間・撤回手順・退職後の扱いは別に書面化し、契約面は弁護士に確認してください。
AI生成の声であることを利用者に伝える必要はありますか?
OpenAI は利用規約で、その声が人間ではなく AI 生成であることをエンドユーザーに明確に開示することを求めています。電話応答や接客のように相手が人間だと思われやすい場面では、どちらの提供元を使う場合でも開示を前提に設計するのが安全です。