Gemini 3.8 Live、音声対話向けの2モデルが正式提供に
GeminiGoogle音声AILive APIモデルリリース
Google は2026年9月15日、Live API 向けの audio-to-audio モデル2種、Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking を一般提供(GA)とした。前者は低遅延の音声エージェント向けの既定選択肢、後者は音声のやり取り中にバックグラウンドで推論を回す高推論モデルという位置づけ。
何が発表されたか
- リアルタイム音声アプリ向けの audio-to-audio モデル2種が GA に到達
gemini-3.8-live:低遅延の音声エージェントやリアルタイム対話の既定選択肢。推論による遅延を挟まない。インターリーブ推論、既定で非同期の関数呼び出し、セッション中のクライアントコンテンツ全面更新に対応gemini-3.8-live-extended-thinking:音声のやり取りの裏側で推論を継続できる高推論モデル。より深いバックグラウンド推論が必要な用途向け- 利用の入口として Live API ガイド、Capabilities ガイド、Thinking ガイドが用意されている
開発者への影響
音声まわりは「試作は動くが本番に載せられない」状態が長く続いていた領域で、GA になった意味は小さくない。プレビュー扱いのモデルはクライアント案件の提案に載せづらいが、GA なら見積もりと保守の話ができる。
2モデルの使い分けはシンプルに考えてよい。ECサイトの問い合わせ受付や予約受付のように、テンポよく返すことが体験の質に直結する用途は gemini-3.8-live。返答までに少し間があっても、在庫や配送条件を照合したうえで正確に答えてほしい用途は Extended Thinking 側、という切り分けになる。
既定で非同期の関数呼び出しになっている点は設計に効く。音声を止めずに裏で在庫APIやCRMを叩ける前提で組めるので、「調べますので少々お待ちください」の無音時間をどう埋めるかという、音声UIで毎回問題になる部分の作り込みが変わる。
補足
今回の変更に料金やレート制限の記載はない。本番投入前に現行の料金表とクォータを確認しておきたい。なお Vercel AI Gateway 側では9月15日時点で同モデルが利用可能になっており、自前でGoogle認証を組まずに試すルートもある。
