Gemini 3.8 Liveとは?新音声AIの特徴と提供先を解説
Googleが「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表しました。音声で応答するだけでなく、会話を続けながら依頼された処理を進められるモデルです。対話の滑らかさや推論能力にどのような特徴があるのか、両モデルの違いと提供先を発表内容に沿って紹介します。
ARCHETYP Staffingでは現在クリエイターを募集しています。
エンジニア、デザイナー、ディレクター以外に、生成AI人材など幅広い職種を募集していますのでぜひチェックしてみてください!
会話を止めずに処理を進める 2つのモデルで何が変わるのか
Gemini 3.8 Liveは、大規模な利用とコスト効率を重視した音声対話モデルです。視覚情報をほぼリアルタイムで処理して会話の文脈に取り入れるほか、対応する97言語を自動で検出し、会話の途中でも言語を切り替えられます。
会話中にバックグラウンドでツールを実行したり、APIを呼び出したりできる点も特徴です。APIとは、外部のサービスや機能と情報をやり取りするための仕組みを指します。依頼を受け付けたことを伝えた後も、裏側で処理を進めながら対話を続けられるため、作業の完了を待つ間も会話が途切れません。
一方、Gemini 3.8 Live Extended Thinkingは、複数の段階を踏んで考える必要がある、複雑なタスク向けのモデルです。
推論、つまり情報を整理して答えを導く処理と発話を同時に行い、「確認しますね」といった言葉で依頼に応じながら、作業の進捗も音声で伝えます。考える時間が必要な場面でも、会話の流れを保てる点が特徴です。
Googleの発表によると、Extended Thinkingは、音声対話の品質を評価するArtificial Analysisの「Speech to Speech Quality Index」で82.6を記録し、総合1位を獲得しました。タスク遂行能力の評価でも、τ-Voiceで68.6%、Sierraのτ-Voice-bankingで35.1%を記録し、首位に立ったとしています。また、推論能力を評価するBig Bench Audioでは97.7%を記録しました。
LiveもSpeech Agent Arenaで2位を獲得し、ユーザーから高い支持を得たと報告されています。さらに、音声で依頼を受けて処理を実行する「音声エージェント」を評価するServiceNowのEVA-Benchでも、Googleは両モデルが複雑な作業の正確性と会話品質の両立で従来の性能水準を引き上げたと説明しています。この評価は、Gemini Enterprise Agent Platform上のLive APIで実施されました。
Googleは性能に加え、Liveのコスト効率と、Extended Thinkingの他の最先端モデルに対する価格競争力も強調しています。
両モデルを比較する際は、評価指標の順位に加え、任せたい作業に必要な推論の複雑さにも目を向けるとよいでしょう。定型的な応対が中心なのか、複数の条件を整理して処理を進める必要があるのかを整理すると、用途に応じて検討しやすくなります。
では、これらのモデルは、どのサービスで利用できるのでしょうか。
どこで使える? 提供先と音声エージェントへの広がり

一般ユーザー向けには、Gemini 3.8 LiveをSearch Liveで、Gemini 3.8 Live Extended ThinkingをGemini Liveで提供します。Googleは順次提供を開始すると案内しています。以下は、2026年9月17日更新の公式発表に基づく提供情報です。
Extended ThinkingはGoogle Workspaceにも展開され、Google DocsではGoogle AI ProとUltraの登録ユーザー、GmailとGoogle KeepではGoogle AIの全プランの登録ユーザーが対象となります。
開発者向けには、両モデルをGemini APIとGoogle AI Studioで提供します。企業向けのGemini Enterpriseでは、対象を限定した先行提供である「プライベートプレビュー」として公開し、Gemini Enterprise for Customer Experienceにも両モデルを近日中に導入する予定です。
Google Workspaceの法人ユーザーには、Extended Thinkingを近日中に提供するとしています。
外部サービスでの活用を支える連携も紹介されています。LiveKitやVercelなどの開発者向けプラットフォームは、Gemini Live APIを利用し、音声で操作するインターフェースの構築と公開を支援します。インターフェースとは、利用者がサービスを操作するための窓口です。音声や映像をリアルタイムで配信する複雑な基盤をプラットフォーム側が管理することで、開発者は操作のしやすさなど、利用者の体験の設計に集中できます。
GoogleはSalesforce、Genspark、Lumerisとも連携しており、各社が両モデルの応答の遅延の少なさや対話の滑らかさ、ツール呼び出し機能を評価していると紹介しています。
生成音声の識別には、SynthIDを使用します。人の耳には聞き取れない電子透かしを音声に直接埋め込み、AIが生成したコンテンツを検出できるようにする技術です。Googleは、自社のAI製品が生成するすべての音声に適用し、誤情報の拡散防止に役立てると説明しています。安全性に関する詳細は、モデルの特性や安全対策をまとめたモデルカードで案内しています。音声AIをさまざまなサービスに展開するとともに、生成された音声を識別する仕組みも設けています。
普段使うサービスに音声AIが組み込まれることで、調べものや日々の用事を音声で進める場面も増える可能性があります。提供先の広がりに加え、それぞれのサービスで具体的にどのような場面で役立つかにも注目するとよいでしょう。
まとめ

いかがだったでしょうか?
今回発表されたGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingは、音声での対話と依頼された作業の実行を並行して進められるモデルです。Liveは大規模な利用とコスト効率を、Extended Thinkingは複雑なタスクへの対応を重視しており、提供先や対象プランも異なります。
活用を検討する際は、会話の自然さだけでなく、任せたい作業を正確に進められるかも判断のポイントになるでしょう。