Googleは2026年9月23日から24日にかけて、音声生成AIの新モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。日本語を含む100以上の言語に対応し、わずか30秒の音声サンプルから声を複製する「音声クローン」機能が搭載されています。
現在提供されている価格は2026年12月31日までの期間限定料金で、2027年1月1日からは標準価格が2倍に引き上げられる予定です。本記事では、機能の詳細と料金体系、値上げ前に知っておきたいポイントを整理します。
結論:何ができるようになったのか
- 30秒程度の音声サンプルから、声質・イントネーションを複製できる「音声クローン」機能を搭載
- Flash TTSは130言語(日本語含む)、Flash-Liteは101言語に対応
- 文単位で感情・リズム・アクセントを制御でき、笑い声やため息などの音も挿入可能
- Gemini APIおよびGoogle AI Studioから利用可能。無料枠あり
- 現行料金は2026年12月31日まで。2027年1月1日から標準価格が実質2倍になる
Gemini 3.8 Flash TTS/Flash-Lite TTSとは
Gemini 3.8 Flash TTSは、テキストを自然な音声に変換する生成AIモデルです。従来のテキスト読み上げ(TTS)と異なり、単に文章を読み上げるだけでなく、文脈に応じた感情表現やイントネーションのコントロールができる点が特徴です。
ラインナップは用途に応じて2種類用意されています。
- Gemini 3.8 Flash TTS:音声品質と長文処理を重視したスタンダードモデル。130言語に対応
- Gemini 3.8 Flash-Lite TTS:処理速度とコスト効率を優先した軽量モデル。101言語に対応
いずれもGemini APIとGoogle AI Studioから利用できます。
音声クローン機能の詳細
今回のアップデートの目玉が、参照音声から声を複製する音声クローン機能です。
- 約30秒の音声サンプルを用意するだけで、声質を複製できる
- 文単位で感情・リズム・アクセントを指定できる
- 笑い声やため息といった、言葉ではない音の挿入にも対応
- あらかじめ用意された声(プリセットボイス)に加え、拡張ボイスライブラリをAPI経由で利用可能
- 1プロジェクトあたり最大200種類の音声を作成でき、保存期間は1年とされている
用途としては、ナレーション制作、多言語吹き替え、カスタマーサポートの音声対応、教育コンテンツの読み上げなどが想定されます。日本語にも対応しているため、国内向けサービスへの組み込みもしやすくなっています。
料金体系(2027年1月に値上げ)
料金はトークン単位の従量課金制です。2026年12月31日までは以下のキャンペーン価格が適用されますが、2027年1月1日からは標準価格に切り替わり、入力・出力ともにおよそ2倍に引き上げられます。
Gemini 3.8 Flash TTS
| 区分 | 〜2026年12月31日 | 2027年1月1日〜 |
|---|---|---|
| 入力(テキスト) | 100万トークンあたり $0.50 | 100万トークンあたり $1.00 |
| 出力(音声) | 100万トークンあたり $9.00 | 100万トークンあたり $18.00 |
Gemini 3.8 Flash-Lite TTS
| 区分 | 〜2026年12月31日 | 2027年1月1日〜 |
|---|---|---|
| 入力(テキスト) | 100万トークンあたり $0.50 | 100万トークンあたり $1.00 |
| 出力(音声) | 100万トークンあたり $6.00 | 100万トークンあたり $12.00 |
出力音声のコストを秒数換算すると、Flash TTSは10秒あたり約0.00225ドル(値上げ後は約0.0045ドル)、Flash-Liteは10秒あたり約0.0015ドル(値上げ後は約0.003ドル)となります。まとまった音声コンテンツを大量生成する場合は、年内と年明け以降でコストが大きく変わる点に注意してください。
なお、Google AI Studioでは無料ティアが用意されていますが、無料ティアで生成したコンテンツはGoogleがサービス改善のために利用する場合があるとされています。企業利用でデータの取り扱いに配慮が必要な場合は、有料ティア(API)の利用を検討するとよいでしょう。
既存モデルとの違い
これまでのGemini音声モデル(3.1 Flash TTSプレビュー版など)と比較すると、出力単価が引き下げられ、対応言語数や音声クローンの精度も向上しているとされています。特に、30秒という短いサンプルで声を複製できる点、感情表現を文単位で細かく制御できる点は、大きな進化ポイントです。
一方で、音声クローン機能は「本人になりすました音声を作られる」リスクもはらむため、Googleの利用ポリシーに沿った適切な用途での利用が求められます。第三者の声を無断でクローンして公開するといった行為は、権利侵害や規約違反にあたる可能性があるため注意が必要です。
まとめ
Gemini 3.8 Flash TTS/Flash-Lite TTSは、30秒の音声サンプルから声をクローンできる点と、日本語を含む130言語への対応が大きな特徴です。API・AI Studioからすぐに試すことができ、無料ティアも用意されています。
ただし、現在の料金は2026年12月31日までの期間限定であり、2027年1月1日からは標準価格が実質2倍になります。音声コンテンツの本格導入を検討している場合は、年内のうちに使用感やコストを確認しておくことをおすすめします。