Skip to content

Multimodal AI Models

261 AI models that go beyond text-only interaction. These multimodal models can see images, generate visuals, or accept multiple input types like audio and video alongside text - enabling richer, more capable AI applications.

261
Multimodal Models
39
Providers
232
Vision Models
18
Image Output
8
Free

All Multimodal Models - Ranked by Score

261 models with vision, image output, or multi-input capabilities. Average score: 56.

#ModelScore
1Claude Fable 5Anthropic97
2Claude Fable 5 (batch)Anthropic97
3Claude Opus 5 (Fast)Anthropic95
4Claude Opus 5Anthropic95
5Claude Opus 4.8 (Fast)Anthropic95
6Claude Opus 4.8Anthropic95
7Claude Opus 4.7 (Fast)Anthropic95
8Claude Opus 4.7Anthropic95
9Claude Opus 4.7 (batch)Anthropic95
10Claude Opus 4.8 (batch)Anthropic95
11GPT-5.5 ProOpenAI93
12GPT-5.5 Pro (batch)OpenAI93
13GPT-5.5OpenAI93
14GPT-5.5 (batch)OpenAI93
15Gemini 3.1 Pro Preview Custom ToolsGoogle92
16Gemini 3.1 Pro PreviewGoogle92
17Gemini 3.1 Pro Preview (batch)Google92
18GPT-5.4 ProOpenAI92
19GPT-5.4 Pro (batch)OpenAI92
20GPT-5.4OpenAI92
21GPT-5.4 (batch)OpenAI92
22GPT-5.3-CodexOpenAI91
23GPT-5.2-CodexOpenAI91
24GPT-5.2 ChatOpenAI91
25GPT-5.2 ProOpenAI91
26GPT-5.2 Pro (batch)OpenAI91
27GPT-5.2OpenAI91
28GPT-5.2 (batch)OpenAI91
29Claude Opus 4.6Anthropic90
30Claude Opus 4.6 (batch)Anthropic90
31GPT-5.6 Luna ProOpenAI89
32GPT-5.6 Luna Pro (batch)OpenAI89
33GPT-5.6 LunaOpenAI89
34GPT-5.6 Luna (batch)OpenAI89
35GPT-5.6 Terra ProOpenAI89
36GPT-5.6 Terra Pro (batch)OpenAI89
37GPT-5.6 TerraOpenAI89
38GPT-5.6 Terra (batch)OpenAI89
39GPT-5.6 Sol ProOpenAI89
40GPT-5.6 Sol Pro (batch)OpenAI89
41GPT-5.6 SolOpenAI89
42GPT-5.6 Sol (batch)OpenAI89
43Grok 4.5xAI89
44Grok 4.3xAI89
45Grok 4.20xAI89
46GPT-5.1-Codex-MaxOpenAI89
47GPT-5.1OpenAI89
48GPT-5.1-CodexOpenAI89
49GPT-5 ProOpenAI89
50GPT-5 Pro (batch)OpenAI89
51GPT-5 Codex (batch)OpenAI89
52GPT-5OpenAI89
53GPT-5 (batch)OpenAI89
54Gemini 3 Flash PreviewGoogle88
55Gemini 3 Flash Preview (batch)Google88
56Grok 4.20 Multi-AgentxAI88
57GPT-5.1 (batch)OpenAI88
58o3 ProOpenAI87
59o3 Pro (batch)OpenAI87
60o3OpenAI87

Text + Image Input

(256)

Models that accept images alongside text prompts for visual understanding.

#ModelScore
1Claude Fable 5Anthropic97
2Claude Fable 5 (batch)Anthropic97
3Claude Opus 5 (Fast)Anthropic95
4Claude Opus 5Anthropic95
5Claude Opus 4.8 (Fast)Anthropic95
6Claude Opus 4.8Anthropic95
7Claude Opus 4.7 (Fast)Anthropic95
8Claude Opus 4.7Anthropic95
9Claude Opus 4.7 (batch)Anthropic95
10Claude Opus 4.8 (batch)Anthropic95
11GPT-5.5 ProOpenAI93
12GPT-5.5 Pro (batch)OpenAI93
13GPT-5.5OpenAI93
14GPT-5.5 (batch)OpenAI93
15Gemini 3.1 Pro Preview Custom ToolsGoogle92
16Gemini 3.1 Pro PreviewGoogle92
17Gemini 3.1 Pro Preview (batch)Google92
18GPT-5.4 ProOpenAI92
19GPT-5.4 Pro (batch)OpenAI92
20GPT-5.4OpenAI92
21GPT-5.4 (batch)OpenAI92
22GPT-5.3-CodexOpenAI91
23GPT-5.2-CodexOpenAI91
24GPT-5.2 ChatOpenAI91
25GPT-5.2 ProOpenAI91
26GPT-5.2 Pro (batch)OpenAI91
27GPT-5.2OpenAI91
28GPT-5.2 (batch)OpenAI91
29Claude Opus 4.6Anthropic90
30Claude Opus 4.6 (batch)Anthropic90

Image Output

(18)

Models that can generate or edit images from text or multimodal prompts.

#ModelScore
1Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)Google-
2Nano Banana 2 (Gemini 3.1 Flash Image)Google-
3Nano Banana Pro (Gemini 3 Pro Image)Google-
4GPT-5.4 Image 2OpenAI-
5Nano Banana 2 (Gemini 3.1 Flash Image Preview)Google-
6Nano Banana Pro (Gemini 3 Pro Image Preview)Google-
7GPT-5 Image MiniOpenAI-
8GPT-5 ImageOpenAI-
9Nano Banana (Gemini 2.5 Flash Image)Google-
10Midjourney v6.1Midjourney-
11DALL-E 3OpenAI-
12Stable Diffusion 3.5Stability AI-
13FLUX.1 ProBlack Forest Labs-
14Ideogram 2.0Ideogram-
15Recraft V3Recraft-
16Imagen 3Google-
17Adobe Firefly 3Adobe-
18Leonardo PhoenixLeonardo AI-

Multi-Input (3+ Modalities)

(176)

Models accepting three or more input types such as text, image, audio, and video.

#ModelScore
1Claude Fable 5Anthropic97
2Claude Fable 5 (batch)Anthropic97
3Claude Opus 5 (Fast)Anthropic95
4Claude Opus 5Anthropic95
5Claude Opus 4.8 (Fast)Anthropic95
6Claude Opus 4.8Anthropic95
7Claude Opus 4.7 (Fast)Anthropic95
8Claude Opus 4.7Anthropic95
9Claude Opus 4.7 (batch)Anthropic95
10Claude Opus 4.8 (batch)Anthropic95
11GPT-5.5 ProOpenAI93
12GPT-5.5 Pro (batch)OpenAI93
13GPT-5.5OpenAI93
14GPT-5.5 (batch)OpenAI93
15Gemini 3.1 Pro Preview Custom ToolsGoogle92
16Gemini 3.1 Pro PreviewGoogle92
17Gemini 3.1 Pro Preview (batch)Google92
18GPT-5.4 ProOpenAI92
19GPT-5.4 Pro (batch)OpenAI92
20GPT-5.4OpenAI92
21GPT-5.4 (batch)OpenAI92
22GPT-5.3-CodexOpenAI91
23GPT-5.2 ChatOpenAI91
24GPT-5.2 ProOpenAI91
25GPT-5.2 Pro (batch)OpenAI91
26GPT-5.2OpenAI91
27GPT-5.2 (batch)OpenAI91
28Claude Opus 4.6Anthropic90
29Claude Opus 4.6 (batch)Anthropic90
30GPT-5.6 Luna ProOpenAI89

What Are Multimodal AI Models?

Beyond Text-Only

Multimodal AI models can process and generate more than just text. They understand images, diagrams, screenshots, and in some cases audio or video. This lets you build applications that interact with the world the way humans do - through multiple senses.

Vision (Image Input)

Vision-capable models accept images alongside text prompts. They can describe photos, extract text via OCR, analyze charts, review UI designs, and answer questions about visual content. Most frontier models now include vision as a core capability.

Image Generation (Image Output)

Some models can generate new images from text descriptions or edit existing ones. These range from dedicated image generators to unified models that handle both text and image output in a single conversation, like GPT-4o with image generation.

Use Cases

Document analysis and OCR, screenshot-to-code, chart interpretation, medical imaging, accessibility descriptions, visual QA, creative image generation, diagram-to-code conversion, and agentic workflows that require visual understanding.

相关页面

Explore more model capabilities, rankings, and head-to-head comparisons.

Frequently Asked Questions

Multimodal AI models can process multiple types of input - text, images, audio, and video - in a single interaction. They understand context across modalities, like analyzing a chart image while answering text questions about it.

GPT-4o accepts text, images, and audio, and can generate text, images, and speech. Gemini 2.0 handles text, images, video, and audio input. Claude 3.5 processes text and images with best-in-class document understanding.

Multimodal models enable applications that were previously impossible - analyzing medical images, understanding video content, processing documents with charts and tables, and building AI assistants that see and hear.

Best Multimodal AI Models (2026) | LM Market Cap