
Gemini 3.1 Flash-Liteは、GoogleのGemini 3ラインナップの中で最もコスト効率に優れたモデルであり、高い費用をかけずにスピードとスケールを求めるチームのために作られています。フラッグシップモデルがスピードよりも深さを重視するのに対し、Flash-Liteはその方程式を逆転させます。応答は速く、コストはごくわずかでありながら、翻訳、文字起こし、データ抽出、文書の要約といった実務を、Gemini 2.5 Flashに近い品質でこなします。この記事では、Gemini 3.1 Flash-Liteが実際に何をするモデルなのか、Geminiラインナップの中での料金比較、そしてChat Smithのワークフローのどこで活躍するのかを解説します。

Gemini 3.1 Flash-Liteとは?
Gemini 3.1 Flash-Liteは、GoogleのGemini 3シリーズの中で最も軽量かつコスト効率の高いモデルです。1日に何千回、何百万回と実行されるバックグラウンド処理のような、大量かつレイテンシに敏感なワークロード向けに設計されており、1ミリ秒、1セントの端数までもが重要になる場面を想定しています。Googleはまず、Google AI StudioのGemini APIを通じてプレビュー版として、エンタープライズ向けにはVertex AI経由で提供を開始し、その後一般提供を開始しました。
旧世代のGemini 2.0 Flash-LiteやGemini 2.5 Flash-Liteと比較すると、今回のバージョンは品質面で大きく進化しています。指示追従、推論、音声理解といった主要な能力においてGemini 2.5 Flashとの差を大きく縮めながら、Liteクラスの料金を維持しています。また、4段階の思考レベル(最小・低・中・高)を調整できるため、開発者はリクエストの難易度に応じて推論の深さをコントロールできます。
Gemini 3.1 Flash-Liteの主な機能
マルチモーダル入力、テキスト出力
Gemini 3.1 Flash-Liteは、テキスト、画像、動画、音声、PDFファイルを入力として受け付けますが、出力はテキストのみです。最大1,048,576トークンの入力コンテキストウィンドウと、最大65,536トークンの出力に対応しており、長い文書や音声データ全体、大量のチャット履歴を1回の呼び出しで処理するのに十分な容量があります。
調整可能な思考レベル
すべてのリクエストに深い推論が必要なわけではありません。Gemini 3.1 Flash-Liteでは呼び出しごとに思考レベルを設定でき、難しい問題では多少のレイテンシと引き換えに精度を高めたり、タスクがシンプルでスピードが重要な場合は追加の推論ステップを完全にスキップしたりできます。
エージェント型・大量処理ワークロード向けの設計
純粋なスピードに加えて、このモデルはバッチ処理、プロンプトキャッシュ、Function Calling、構造化JSON出力、コード実行、検索によるグラウンディングをサポートしています。単なるチャット画面ではなく、エージェント型パイプラインや自動分類器が実際に必要とするインフラを備えています。
Gemini 3.1 Flash-Liteの料金と性能
Gemini 3.1 Flash-Liteの料金は、入力トークン100万あたり0.25ドル、出力トークン100万あたり1.50ドルで、Gemini 3 Flashの約半分のコストです。速度面では、Artificial Analysisによる独立したベンチマークで、Gemini 2.5 Flashと比べて最初のトークンが返るまでの時間が明らかに速く、出力スループットも高いことが確認されており、品質は同等かそれ以上とされています。
| ティア | 重視するポイント | Chat Smithでの例 |
|---|---|---|
| Pro | 深い推論、研究レベルの分析 | Gemini 2.5 Pro |
| Flash | 速度と性能のバランス | Gemini 3 Flash |
| Flash-Lite | 最速・最低コスト、大量タスク向け | Gemini 3.1 Flash-Lite |
このティアを狙っているのはFlash-Liteだけではありません。GPT-5 NanoやClaude Haiku 4.5も同じ設計思想、つまり推論の深さを多少犠牲にしてスピードとコストを優先するという方針を採っており、3モデルとも同種の高頻度タスクに向いています。Google自身のラインナップの中では、Gemini 3.1 Flash-Liteがデフォルトの低コスト選択肢としてGemini 2.5 Flash-Liteに取って代わり、Gemini 2.5 Flashは依然として品質面で追いつくべき基準であり続けています。
Chat SmithでのGemini 3.1 Flash-Liteの使い方
Chat Smithでは、Googleの他のモデルラインナップとあわせてGemini 3.1 Flash-Liteに直接アクセスできるため、1つのモデルに固定するのではなく、タスクに応じてモデルを切り替えられます。素早く安価な出力が欲しいとき——短い返信、初稿の作成、翻訳、長いPDFの要約など——にはよいデフォルトの選択肢であり、より深い推論が必要な作業ではいつでもより強力なモデルに切り替えられます。
文書中心のワークフローでは、Flash-Liteのスピードと Chat SmithのPDF要約ツールを組み合わせることで、ファイル全体を開く前に長いレポートを素早く仕分けできます。
まとめ
Gemini 3.1 Flash-Liteは、フラッグシップのGeminiモデルが提供する機能の多くを、はるかに低いコストで実現します。そのため、実際のAI利用の大部分を占める大量のバックグラウンド処理にとって、現実的なデフォルトの選択肢となります。Chat Smithの中で、ラインナップ内の他のすべてのモデルとあわせて、直接試すことができます。
よくある質問
1. Gemini 3.1 Flash-Liteとは何ですか?
Gemini 3.1 Flash-Liteは、GoogleのGemini 3シリーズで最もコスト効率の高いモデルで、翻訳、文字起こし、構造化データ抽出のような大量・低レイテンシのタスク向けに設計されており、品質はGemini 2.5 Flashに近づいています。
2. Gemini 3.1 Flash-Liteの料金はいくらですか?
入力トークン100万あたり0.25ドル、出力トークン100万あたり1.50ドルで、Gemini 3 Flashの約半分のコストです。大量のAIワークロードを運用する上で、最も低コストな選択肢のひとつです。
3. Gemini 3.1 Flash-Liteはどんな用途に向いていますか?
翻訳、音声の文字起こし、構造化データ抽出、文書の要約など、頻度が高く定義が明確なタスクに向いています。また、リクエストがより重いモデルを必要とするかどうかを素早く判断する軽量なルーティングにも活用されています。


