🌐 モダリティ別 In / Out 対応可否+料金を一覧

マルチモーダル対応 LLM 一覧

「どのモデルが画像・音声・動画を入力できて、出力できるのか、いくらかかるのか」を迷わずに分かる早見ページ。サイトに掲載している主要LLMを、公式料金ページ・公式ドキュメントの一次情報だけで整理しています。

13
掲載モデル
音声2倍
Gemini 3.1系の音声入力課金
別モデル
ライブ・画像生成・TTS
最終更新: | 出典: Google AI 料金ページ · OpenAI GPT-6 Astra Docs · Claude PDFサポート · DeepSeek API Docs ほか各社公式 | 料金比較 · 計算機

主要LLM マルチモーダル対応マトリクス

全モデル共通でテキスト入出力は対応。表はテキスト以外だけ。列は「入力」「出力」の2本。出ているアイコンがそのモデルが扱える形式。注記付きは条件付き(下の説明)。アイコンが無いものは非対応。$は USD / 1M tokens(テキスト基準の標準料金)。

画像🔊 音声🎬 動画 PDF📝 DOCX📊 XLSX📑 PPTX

モデル入力出力入力$/M出力$/M
Gemini 3.8 Flash
Google料金 · Document
画像音声動画PDFDOCXXLSXPPTXテキスト抽出
$0.75→$1.50$3.75→$7.50
Gemini 3.7 Flash
Google料金 · Document
画像音声動画PDFDOCXXLSXPPTXテキスト抽出
$0.75→$1.50$3.75→$7.50
Gemini 3.1 Flash-Lite
Google料金(音声は2倍)
画像音声動画PDFDOCXXLSXPPTXテキスト抽出
$0.25$1.50
GPT-6 Astra
OpenAIModel docs(入力 text/image)
画像
画像ツール経由
$10$50
GPT-5.6 Sol
OpenAIModel docs
画像
画像ツール経由
$4$20
GPT-5.6 Luna
OpenAIModel docs
画像
画像ツール経由
$0.20$1.20
Claude Fable 5.1
AnthropicPDFサポート
画像PDF
$10$50
Claude Mythos 5.1
AnthropicPDFサポート
画像PDF
$10$50
Qwen3.8-Flash
AlibabaQwenCloud(画像・動画理解)
画像動画
$0.15$0.47
GLM 5.3 Flash
Z.aiGLM docs(Video/Image。Fileはツール経由のため非掲載)
画像動画
$0.15$0.50
Grok 4.6
xAIModel docs(Text, Image)
画像
$2$6
DeepSeek V4.1 Flash
DeepSeekVision · 料金(旧V4 ProはVision非対応)
画像
$0.15→$0.30$0.60→$1.20

一次情報に基づく対応可否(2026-09-06確認)。この表はAPIへバイナリを直接渡せる形式だけを載せます(確実にOKなもののみ)。ツールでテキスト化して渡す方式はどのモデルでも可能なので非掲載です。Qwen3.8-Flashは公式が画像・動画理解を明記しているのでアイコンを出しています。音声・PDF・Officeの直読みは同ページで確認できないため非表示。ClaudeのPDFは公式の視覚理解なので掲載、DOCX/XLSXは事前変換が必要なので非表示。

注記の意味

  • Gemini の DOCX / XLSX / PPTX = テキスト抽出。公式 Document understandingPDFだけ視覚理解(レイアウト・チャート・表を画像として見る)。Word / Excel / PowerPoint はテキストを抜き出して渡す扱いで、PDFと同じ視覚解析ではない。ファイルを送れても「PDF相当」ではない。
  • GPT-6 Astra / GPT-5.6 Sol / Luna の画像出力 = ツール経由。公式モデルページの本体出力はテキスト。画像を出すには Responses API の image generation tool(GPT-Image 2.0) を別途呼ぶ。モデルがピクセルを直接返すわけではない。
  • GLM 5.3 Flash の PDF / Office は非掲載。公式 How to Use が明示するネイティブ入力は image_url(画像)と動画。Input Modality の File や Office成果物は「ツールを呼んで文書を処理・作成する」作業で、バイナリ直読みではない。テキスト化ツールを渡せば他モデルでも同じなので、この表では非対応とする。

一次情報(公式URL)

  • Google 料金: ai.google.dev/gemini-api/docs/pricing — Gemini 3.8/3.7 Flash は導入価格 $0.75/$3.75(〜2026-12-31)、以降 $1.50/$7.50。3.1 Flash-Lite は text/image/video $0.25、audio $0.50。
  • Google 文書: Document understanding — PDFは視覚理解。PDF以外はテキスト抽出。
  • OpenAI GPT-6 Astra: developers.openai.com/.../gpt-6-astra — Input modalities: text, image。$10 / $50。
  • OpenAI GPT-5.6 Sol: gpt-5.6-sol · Luna: gpt-5.6-luna
  • Anthropic PDF: PDFサポート — 全アクティブモデルがPDF対応。xlsx/docxは事前変換が必要。
  • Qwen3.8-Flash: qwencloud.com/models/qwen3.8-flash — 「Non-Real-Time Image Understanding」「Non-Real-Time Video Understanding」。料金は公式ブログ qwen.ai/blog(入力 $0.15 / 出力 $0.47)。
  • Z.ai GLM-5.3-Flash: docs.z.ai/.../glm-5.3-flash — How to Use: image_url。File / Office成果物はツール呼び出し(バイナリ直読みではないので非掲載)。
  • xAI Grok 4.6: docs.x.ai/.../grok-4.6 — Modalities: Text, Image → Text。$2 / $6。音声・動画は別API。
  • DeepSeek Vision: Visiondeepseek-flash(V4.1 Flash)がネイティブ対応(2026-09-10〜)。旧 deepseek-v4-flash-vision-exp と V4 Pro は退役・統合。料金: Models & Pricing

モダリティ別の課金ルール全モデル共通の注意点

同じ「1M tokens」でも、モダリティによって単価が変わる・トークン換算される、というのが最大の落とし穴。主要ポイントをまとめます。

ライブストリーミング・音声/画像/動画生成は「別モデル」に分化

コアLLMの出力がテキストのみなのは、テキスト以外の出力を専門のモデルに分離しているため。用途別に覚えてください。

用途モデル例In / Out料金(USD)出典
リアルタイム音声対話
Live / Realtime
Gemini 3.1 Flash Live Preview
Gemini 2.5 Flash Native Audio
音声⇄音声3.1 Live: 入力 音声$3.00・画像動画$1.00 / 出力 音声$12.00Google
リアルタイム音声対話
OpenAI Realtime / Audio
gpt-realtime-2.1
gpt-audio-1.5
音声⇄音声(ネイティブ)Realtime: text $4/$24・audio $32/$64
Audio: text $2.5/$10・audio $32/$64
OpenAI Realtime · Audio
画像生成・編集Gemini 3.1 Flash Image(Nano Banana 2)
Gemini 3 Pro Image(Nano Banana Pro)
画像→画像Flash Image: 出力画像$60/M(1K画像=$0.067)・Pro Image: $120/MGoogle
音声生成(TTS)Gemini 3.1 Flash TTS Previewテキスト→音声入力 text $1.00 / 出力 audio $20.00Google
動画生成Gemini Omni 1.1 Flash / Veo 3.1テキスト/画像→動画Omni: video出力 5,792tok/秒(720p)≒$0.10/秒・Veo: $0.40/秒Google

🎤 OpenAI系は要注意: GPT-6 Astra や GPT-5.6 系本体は音声・動画入力に非対応ですが、gpt-realtime-2.1・gpt-audio-1.5(音声 in/out ネイティブ)や Responses API の画像生成ツール(GPT-Image 2.0)で音声・画像の生成・対話を実現できます。単体のモデル名で選ぶのではなく、「入力したいモダリティ」と「出力したいモダリティ」をセットで考えるのがポイント。

「この入力・出力をしたい」ときのモデル選び

マルチモーダルが絡む典型的なパターンで、どのモデルを選べばいいかを一言で。

画像を「理解」して回答
ほぼ全モデル対応。コスパなら Qwen3.8-FlashGLM 5.3 Flash、品質なら GPT-6 Astra
音声(会話)を入力したい
Gemini 3.8/3.7 Flash が音声入力を標準単価で受ける。音声中心なら 3.1 Flash-Lite は2倍課金に注意
動画を理解して要約・分析
Gemini 3.8 Flash(動画+音声対応)。Qwen3.8-Flashも公式に Non-Real-Time Video Understanding を記載(音声入力は非対応)。
Office文書(PDF/PPTX/DOCX/XLSX)を扱う
バイナリ直読みできるのは GeminiのPDF(視覚)と ClaudeのPDF。DOCX/XLSX/PPTX はGeminiでもテキスト抽出。GLMのOfficeはツール経由なので他モデルと同列に置かない。
リアルタイム音声対話(speech-to-speech)
Gemini 3.1 Flash Live / gpt-realtime-2.1(専用モデル)
画像・音声・動画を「生成」したい
Gemini Nano Banana 2 / 3.1 Flash TTS / Veo 3.1(いずれも専用モデル)
💡 コストを計算したいなら: テキスト・画像・音声・動画のトークン単価を入力するだけで、各モデルのコストをUSD+円で一括比較できる トークンコスト計算機 があります。マルチモーダル入力はモデルごとのトークン単価で見積もれます。

本ページの掲載情報は各社公式料金ページ・公式ドキュメント(Google AI · Google Document understanding · OpenAI · Anthropic PDFサポート · QwenCloud · xAI · DeepSeek Vision · Z.ai)を2026-09-06に確認して作成しています。料金・対応可否は予告なく変動するため、ご利用前に必ず公式ページをご確認ください。