用語解説 ジェミニサンテンハチライブ

Gemini 3.8 Liveとは

Gemini 3.8 Live は、Google DeepMind が発表した音声対話向けの AI モデルです。会話を止めずに裏で推論やツール実行を進められ、映像入力もほぼリアルタイムで処理します。複雑なタスク向けの Extended Thinking 版もあり、Gemini API などで順次提供が始まっています。

Gemini 3.8 Live は、Google(開発は Google DeepMind)が発表した音声対話向けの AI モデルです。最大の特徴は、ユーザーとの会話を止めずに、裏で推論やツール実行を進められる点です。

発表は9月15日(現地時間)です。同時に、複雑なタスク向けの「Gemini 3.8 Live Extended Thinking」も公開されました。Gemini 3.8 Live はスケールとコスト効率を重視しています。一方の Extended Thinking は、何段階もの推論が必要な複雑なタスク向けです。つまり2つのモデルを用途で使い分ける形になっています。

エンジニア向けに、発表から確認できる中身を整理します。1つ目は、会話と処理を同時に進められることです。話している途中でもツールを呼び出したり推論したりでき、そのために会話が止まりません。2つ目は、映像などの視覚情報をほぼリアルタイムで処理できることです。音声だけでなく、目の前の状況を見せながら話す使い方ができます。3つ目は提供先です。開発者は Gemini API と Google AI Studio から使えます。利用者向けには Search Live、Gemini Live、Gemini アプリ、Google Workspace に組み込まれます。提供は一斉ではなく「順次」です。API で指定するモデル名、SDK の設定、使える地域は、参考にした記事には書かれていません。実装するときは Google の公式ドキュメントで確認してください。

事業会社の企画・DX 担当者が気になるのは、使い道と料金でしょう。会話を止めずに裏で処理する仕組みは、話しながら社内システムを検索したり、手続きを進めたりする場面に合います。このため、電話やチャットの自動応答、画面やカメラ映像を見せながらの作業サポートなどに使える可能性があります。ただし、これは機能から考えた筆者の推測で、Google が導入例として挙げたものではありません。料金は参考記事に記載がなく、この記事では金額を示せません。標準版は「コスト効率重視」とされているので、Extended Thinking 版より安く使える位置づけだと考えられます。これも推測なので、実際の単価は Gemini API の料金ページで確認してください。

投資家の視点では、作り手が Google(Google DeepMind)であることが重要です。自社の検索(Search Live)、業務ツール(Google Workspace)、Gemini アプリに直接組み込めるため、API で外部に売るだけでなく、自社サービスの利用者にそのまま届けられます。これは発表内容から言える事実です。そこから収益にどうつながるかは、まだ判断できる情報がありません。競合について、参考記事は具体的な会社名や製品名を挙げていません。参考記事以外の情報ですが、リアルタイムで音声対話ができる AI は OpenAI なども提供しており、この分野は複数の会社が競っています。ただし、性能や料金を他社と比べたデータは今回の情報に含まれていないため、どちらが優れているかは評価していません。

まとめると、Gemini 3.8 Live は「話し続けながら裏で考え、ツールを動かす」ことに特化した Google の音声 AI です。コスト重視の標準版と、複雑なタスク向けの Extended Thinking 版の2種類があります。対応言語の範囲、料金、提供スケジュールの詳細は、公式発表で最新の情報を確認してください。

Gemini 3.8 Liveに関する記事

2 件

ほかの用語