⚡ Gemini 3シリーズ最安 — $0.25/$1.50(2026年5月GA)

Gemini 3.1 Flash-Lite

Gemini 3シリーズ最安・最高速モデル。Gemini 3 Proアーキテクチャベースで2.5 Flashの主要性能に匹敵し、入力17%安・出力40%安で提供。

$0.25
入力 / 1M tokens
$1.50
出力 / 1M tokens
1,048,576
コンテキストウィンドウ
65,536
最大出力トークン

料金(2026年5月GA以降・現行)

Google AI公式料金ページ(ai.google.dev)で確認。全額USD/1Mトークン。Flash-Liteはコンテキスト長に関わらず一律料金。

ティア入力(text/image/video)入力(audio)キャッシュ入力出力備考
Standard$0.25$0.50$0.025 / $0.05(audio)$1.50デフォルト料金。全コンテキスト長で一律
Batch$0.125$0.25$0.0125 / $0.025$0.75Standardの半額。完了まで最大24時間
Flex$0.125$0.25$0.0125 / $0.025$0.75低優先度処理。Standardの半額
Priority$0.45$0.90$0.045 / $0.09$2.70高優先度。Standardの1.8倍
💡 Thinkingレベル(思考深度)によるコスト制御: Gemini 3.1 Flash-Liteは minimal / low / medium / high の4段階のthinkingレベルに対応。thinking tokensも出力トークンとして課金されるため、レベル選択がコストに直結する。バルク処理ではminimal、エッジケースではmedium/highに引き上げる戦略が有効。
⚠️ 音声入力は2倍: 音声(audio)入力はテキスト/画像/動画の2倍。音声処理が主用途の場合はコスト試算に注意。

一次情報: ai.google.dev/gemini-api/docs/pricing · Google Cloud Docs: Gemini 3.1 Flash-Lite(2026-08-10確認)

モデル仕様

Preview公開
2026-03-03
GA(一般提供)
2026-05-07
知識カットオフ
2025年1月(第三者報告)
コンテキスト
1,048,576 tokens
最大出力
65,536 tokens
入力モダリティ
テキスト + 画像 + 音声 + 動画
出力モダリティ
テキスト
ツール呼出
対応(Function Calling)
ベースアーキテクチャ
Gemini 3 Pro
モデルID
gemini-3.1-flash-lite

出典: Google Cloud: Gemini 3.1 Flash-Lite · Google DeepMind Model Card

性能 — Gemini 2.5 Flashの主要性能に匹敵、より低価格で

Gemini 3.1 Flash-LiteはGemini 3 Proアーキテクチャをベースに、高スループット向けに最適化。前世代(2.5 Flash-Lite)から大幅な品質向上を達成し、主要能力領域で2.5 Flashに匹敵。

  • 応答品質: 主要能力領域でGemini 2.5 Flashに匹敵する性能
  • 命令追従: 複雑なチャットボット・命令駆動ワークフロー向けに改善
  • 音声入力: 自動音声認識(ASR)タスクで音声入力品質が向上
  • マルチモーダル: テキスト・画像・音声・動画の全入力に対応
  • Thinkingレベル: minimal〜highの4段階で推論深度を制御可能。シンプルなタスクはminimalで高速処理、複雑なタスクはmedium/highで品質向上
  • 対Gemini 2.5 Flash: 入力17%安($0.25 vs $0.30)、出力40%安($1.50 vs $2.50)
  • 対Gemini 3 Flash: 半額(入力$0.25 vs $0.50、出力$1.50 vs $3.00)

GoogleはFlash-Liteを「高頻度・コスト重視のLLMトラフィック向けに最適化された、最も費用対効果の高いGeminiモデル」と位置づけている。翻訳、データ抽出、コード補完など、トークン単価が事業性を左右するユースケースで真価を発揮。

出典: Google Cloud Docs · Google DeepMind Model Card · Google Blog

競合モデルとの料金比較

安さでは業界トップクラスだが、GPT-5.6 Lunaの80%値下げにより競争が激化。価格はすべてUSD/1Mトークン(Standard料金・テキスト入力)。

モデル提供元入力出力Flash-Liteより備考
Gemini 3.1 Flash-LiteGoogle$0.25$1.50基準モデル。マルチモーダル対応
GPT-5.6 LunaOpenAI$0.20$1.20Luna安Lunaは入力20%安・出力20%安。テキスト+画像のみ
Gemini 3.5 Flash-LiteGoogle$0.30$2.503.1安次世代だが3.1より高価。3.1は入力17%安・出力40%安
Gemini 2.5 Flash-LiteGoogle$0.10$0.402.5安絶対額で最安だが旧世代。品質差大
Claude Haiku 4.5Anthropic$1.00$5.00Flash-Lite安Flash-Liteは入力75%安・出力70%安
DeepSeek V4 FlashDeepSeek$0.14$0.28DeepSeek安現行公式料金。今後の値上げを案内中

※ GPT-5.6 Lunaとの比較はテキスト入力のみ。Gemini 3.1 Flash-Liteは音声・動画入力にも対応するマルチモーダルモデルであり、画像/音声/動画を含むワークロードではLunaより総合的なコスパで有利な場合がある。DeepSeek V4 Flashの現行公式料金はcache miss入力 $0.14、出力 $0.28。DeepSeekはAPIサービス全体の近い将来の値上げを案内中ですが、具体的な新料金・適用日は公式未発表です。

出典: 各社公式料金ページ(2026-08-10確認)。詳細は料金比較ページを参照。GPT-5.6 Lunaの詳細はこちら →

こんな用途に最適

高スループット・低コスト・マルチモーダルが必要なワークロード全般。

🌐

翻訳・多言語処理

大量テキストの翻訳パイプライン。thinkingレベル最小化でトークン効率最大化。

📊

データ抽出・分類

文書からの構造化データ抽出、コンテンツモデレーション、感情分析。

🎤

音声認識(ASR)

音声入力に対応。2.5 Flash-LiteからASR品質が改善。文字起こしパイプラインに。

💻

コード補完・レビュー

IDE/CI/CDスケールでのインライン補完、lint的レビュー、リファクタ提案。

🔄

バッチ処理・夜間バッチ

Batch/Flexでさらに50%オフ。大規模データの非同期処理に。

📹

マルチモーダル一括処理

画像・動画・音声を含む複合メディアの分類・メタデータ抽出。

Gemini 3.xシリーズの選び方

モデル入力出力選ぶべき場面
Gemini 3.1 Pro Preview$2.00$12.00最難関推論・エージェント・複雑なマルチステップ問題
Gemini 3.6 Flash$1.50$7.50速度重視の本番ワークロード。Grounding対応
Gemini 3.5 Flash$1.50$9.00Flash帯の標準。出力が3.6よりやや高め
Gemini 3.1 Flash-Lite ⬅$0.25$1.50高スループット・コスト重視・マルチモーダル一括処理

💡 基本戦略: Flash-Liteで日常的な高頻度タスクを処理し、品質が必要な場合はFlash、最難関タスクはProへエスカレーション。

実際のコストを試算する

Gemini 3.1 Flash-Liteを含む全モデルのトークンコストを一括計算。入力・出力トークン数を入れるだけ。

🧮 トークン計算機で試算する →

📊 全モデル料金比較 · 🌙 GPT-5.6 Lunaと比較 · 🗓️ リリース年表 · 🔗 Google公式料金ページ

⚠️ 免責事項

  • 料金はGoogle AI公式ページ(ai.google.dev)を2026-08-10に確認したものです。予告なく変動します。契約前に必ず公式ページをご確認ください。
  • 本サイトは情報提供目的であり、特定プロバイダーの推薦・代理ではありません。
  • 性能評価はGoogleの公表値および各評価機関のデータに基づきます。実際の使用感を保証するものではありません。