主要LLM マルチモーダル対応マトリクス
全モデル共通でテキスト入出力は対応。表はテキスト以外だけ。列は「入力」「出力」の2本。出ているアイコンがそのモデルが扱える形式。注記付きは条件付き(下の説明)。アイコンが無いものは非対応。$は USD / 1M tokens(テキスト基準の標準料金)。
画像🔊 音声🎬 動画 PDF📝 DOCX📊 XLSX📑 PPTX
| モデル | 入力 | 出力 | 入力$/M | 出力$/M |
|---|---|---|---|---|
| Gemini 3.8 Flash Google料金 · Document | 画像音声動画PDFDOCXXLSXPPTXテキスト抽出 | — | $0.75→$1.50 | $3.75→$7.50 |
| Gemini 3.7 Flash Google料金 · Document | 画像音声動画PDFDOCXXLSXPPTXテキスト抽出 | — | $0.75→$1.50 | $3.75→$7.50 |
| Gemini 3.1 Flash-Lite Google料金(音声は2倍) | 画像音声動画PDFDOCXXLSXPPTXテキスト抽出 | — | $0.25 | $1.50 |
| GPT-6 Astra OpenAIModel docs(入力 text/image) | 画像 | 画像ツール経由 | $10 | $50 |
| GPT-5.6 Sol OpenAIModel docs | 画像 | 画像ツール経由 | $4 | $20 |
| GPT-5.6 Luna OpenAIModel docs | 画像 | 画像ツール経由 | $0.20 | $1.20 |
| Claude Fable 5.1 AnthropicPDFサポート | 画像PDF | — | $10 | $50 |
| Claude Mythos 5.1 AnthropicPDFサポート | 画像PDF | — | $10 | $50 |
| Qwen3.8-Flash AlibabaQwenCloud(画像・動画理解) | 画像動画 | — | $0.15 | $0.47 |
| GLM 5.3 Flash Z.aiGLM docs(Video/Image。Fileはツール経由のため非掲載) | 画像動画 | — | $0.15 | $0.50 |
| Grok 4.6 xAIModel docs(Text, Image) | 画像 | — | $2 | $6 |
| DeepSeek V4.1 Flash DeepSeekVision · 料金(旧V4 ProはVision非対応) | 画像 | — | $0.15→$0.30 | $0.60→$1.20 |
一次情報に基づく対応可否(2026-09-06確認)。この表はAPIへバイナリを直接渡せる形式だけを載せます(確実にOKなもののみ)。ツールでテキスト化して渡す方式はどのモデルでも可能なので非掲載です。Qwen3.8-Flashは公式が画像・動画理解を明記しているのでアイコンを出しています。音声・PDF・Officeの直読みは同ページで確認できないため非表示。ClaudeのPDFは公式の視覚理解なので掲載、DOCX/XLSXは事前変換が必要なので非表示。
注記の意味
- Gemini の DOCX / XLSX / PPTX = テキスト抽出。公式 Document understanding は PDFだけ視覚理解(レイアウト・チャート・表を画像として見る)。Word / Excel / PowerPoint はテキストを抜き出して渡す扱いで、PDFと同じ視覚解析ではない。ファイルを送れても「PDF相当」ではない。
- GPT-6 Astra / GPT-5.6 Sol / Luna の画像出力 = ツール経由。公式モデルページの本体出力はテキスト。画像を出すには Responses API の image generation tool(GPT-Image 2.0) を別途呼ぶ。モデルがピクセルを直接返すわけではない。
- GLM 5.3 Flash の PDF / Office は非掲載。公式 How to Use が明示するネイティブ入力は image_url(画像)と動画。Input Modality の File や Office成果物は「ツールを呼んで文書を処理・作成する」作業で、バイナリ直読みではない。テキスト化ツールを渡せば他モデルでも同じなので、この表では非対応とする。
一次情報(公式URL)
- Google 料金: ai.google.dev/gemini-api/docs/pricing — Gemini 3.8/3.7 Flash は導入価格 $0.75/$3.75(〜2026-12-31)、以降 $1.50/$7.50。3.1 Flash-Lite は text/image/video $0.25、audio $0.50。
- Google 文書: Document understanding — PDFは視覚理解。PDF以外はテキスト抽出。
- OpenAI GPT-6 Astra: developers.openai.com/.../gpt-6-astra — Input modalities: text, image。$10 / $50。
- OpenAI GPT-5.6 Sol: gpt-5.6-sol · Luna: gpt-5.6-luna
- Anthropic PDF: PDFサポート — 全アクティブモデルがPDF対応。xlsx/docxは事前変換が必要。
- Qwen3.8-Flash: qwencloud.com/models/qwen3.8-flash — 「Non-Real-Time Image Understanding」「Non-Real-Time Video Understanding」。料金は公式ブログ qwen.ai/blog(入力 $0.15 / 出力 $0.47)。
- Z.ai GLM-5.3-Flash: docs.z.ai/.../glm-5.3-flash — How to Use:
image_url。File / Office成果物はツール呼び出し(バイナリ直読みではないので非掲載)。 - xAI Grok 4.6: docs.x.ai/.../grok-4.6 — Modalities: Text, Image → Text。$2 / $6。音声・動画は別API。
- DeepSeek Vision: Vision —
deepseek-flash(V4.1 Flash)がネイティブ対応(2026-09-10〜)。旧deepseek-v4-flash-vision-expと V4 Pro は退役・統合。料金: Models & Pricing。
モダリティ別の課金ルール全モデル共通の注意点
同じ「1M tokens」でも、モダリティによって単価が変わる・トークン換算される、というのが最大の落とし穴。主要ポイントをまとめます。
ライブストリーミング・音声/画像/動画生成は「別モデル」に分化
コアLLMの出力がテキストのみなのは、テキスト以外の出力を専門のモデルに分離しているため。用途別に覚えてください。
| 用途 | モデル例 | In / Out | 料金(USD) | 出典 |
|---|---|---|---|---|
| リアルタイム音声対話 Live / Realtime | Gemini 3.1 Flash Live Preview Gemini 2.5 Flash Native Audio | 音声⇄音声 | 3.1 Live: 入力 音声$3.00・画像動画$1.00 / 出力 音声$12.00 | |
| リアルタイム音声対話 OpenAI Realtime / Audio | gpt-realtime-2.1 gpt-audio-1.5 | 音声⇄音声(ネイティブ) | Realtime: text $4/$24・audio $32/$64 Audio: text $2.5/$10・audio $32/$64 | OpenAI Realtime · Audio |
| 画像生成・編集 | Gemini 3.1 Flash Image(Nano Banana 2) Gemini 3 Pro Image(Nano Banana Pro) | 画像→画像 | Flash Image: 出力画像$60/M(1K画像=$0.067)・Pro Image: $120/M | |
| 音声生成(TTS) | Gemini 3.1 Flash TTS Preview | テキスト→音声 | 入力 text $1.00 / 出力 audio $20.00 | |
| 動画生成 | Gemini Omni 1.1 Flash / Veo 3.1 | テキスト/画像→動画 | Omni: video出力 5,792tok/秒(720p)≒$0.10/秒・Veo: $0.40/秒 |
🎤 OpenAI系は要注意: GPT-6 Astra や GPT-5.6 系本体は音声・動画入力に非対応ですが、gpt-realtime-2.1・gpt-audio-1.5(音声 in/out ネイティブ)や Responses API の画像生成ツール(GPT-Image 2.0)で音声・画像の生成・対話を実現できます。単体のモデル名で選ぶのではなく、「入力したいモダリティ」と「出力したいモダリティ」をセットで考えるのがポイント。
「この入力・出力をしたい」ときのモデル選び
マルチモーダルが絡む典型的なパターンで、どのモデルを選べばいいかを一言で。
本ページの掲載情報は各社公式料金ページ・公式ドキュメント(Google AI · Google Document understanding · OpenAI · Anthropic PDFサポート · QwenCloud · xAI · DeepSeek Vision · Z.ai)を2026-09-06に確認して作成しています。料金・対応可否は予告なく変動するため、ご利用前に必ず公式ページをご確認ください。