Skip to content

AI Models with Vision

232 multimodal AI models that support image input and visual understanding, ranked by composite score. These models can analyze images, screenshots, diagrams, and documents alongside text prompts.

Vision Models

232

Of All Models

57%

Providers

27

Avg Score

62

Vision Model Rankings

All 232 models with vision capability, sorted by composite score. Score is computed from capabilities, pricing, context window, recency, output capacity, and versatility.

#ModelScore
1Claude Opus 4.7 (Fast)Anthropic90.9
2GPT-5.5 ProOpenAI90.9
3GPT-5.4 ProOpenAI90.9
4GPT-5.5 Pro (batch)OpenAI88.4
5GPT-5.4 Pro (batch)OpenAI88.4
6GPT-5.2 ProOpenAI88.3
7GPT-5 ProOpenAI86.5
8GPT-5.2 Pro (batch)OpenAI84.3
9Claude Opus 5 (Fast)Anthropic78.4
10Claude Fable Latest~anthropic78.4
11Claude Fable 5Anthropic78.4
12Claude Opus 4.8 (Fast)Anthropic78.4
13o3 ProOpenAI77.4
14GPT-5 Pro (batch)OpenAI76.5
15o1-proOpenAI76.5
16o1-pro (batch)OpenAI76.5
17GPT-5.6 Sol ProOpenAI73.4
18GPT-5.6 SolOpenAI73.4
19OpenAI GPT Latest~openai73.4
20GPT-5.5OpenAI73.4
21Claude Opus 4.1Anthropic73.3
22Claude Opus 5Anthropic72.1
23Claude Fable 5 (batch)Anthropic72.1
24Claude Opus 4.8Anthropic72.1
25Claude Opus Latest~anthropic72.1
26Claude Opus 4.7Anthropic72.1
27Claude Opus 4.6Anthropic72
28Google Gemini Pro Latest~google71.8
29Gemini 3.1 Pro Preview Custom ToolsGoogle71.8
30Gemini 3.1 Pro PreviewGoogle71.8
31Fugu Ultrasakana71.7
32Claude Opus 4Anthropic71.2
33Gemini 3.5 FlashGoogle71
34Gemini 3.6 FlashGoogle70.6
35Google Gemini Flash Latest~google70.6
36Gemini 3.1 Pro Preview (batch)Google70.3
37Gemini 3.5 Flash (batch)Google69.9
38GPT-5.4 Image 2OpenAI69.9
39Gemini 3.6 Flash (batch)Google69.7
40GPT-5.6 Sol Pro (batch)OpenAI69.7
41GPT-5.6 Sol (batch)OpenAI69.7
42GPT-5.5 (batch)OpenAI69.7
43GPT-5.4OpenAI69.7
44Claude Sonnet 4.6Anthropic69.6
45Gemini 3.5 Flash LiteGoogle69.4
46Nano Banana Pro (Gemini 3 Pro Image)Google69.3
47Gemini 3.5 Flash Lite (batch)Google69.1
48Gemini 3.1 Flash LiteGoogle69.1
49Gemini 3.1 Flash Lite PreviewGoogle69.1
50Claude Opus 5 (batch)Anthropic69
51Claude Opus 4.8 (batch)Anthropic69
52Claude Opus 4.7 (batch)Anthropic69
53Gemini 3.1 Flash Lite (batch)Google68.9
54Claude Opus 4.6 (batch)Anthropic68.9
55GPT Chat LatestOpenAI68.8
56Claude Sonnet 5Anthropic68.4
57Anthropic Claude Sonnet Latest~anthropic68.4
58GPT-5.3-CodexOpenAI68.4
59Gemini 3 Flash PreviewGoogle68
60Claude Opus 4.5Anthropic67.9
61GPT-5.4 (batch)OpenAI67.8
62Claude Sonnet 4.6 (batch)Anthropic67.7
63Gemini 3 Flash Preview (batch)Google67.7
64o1OpenAI67.6
65Claude Opus 4.1 (batch)Anthropic67.5
66GPT-5.6 Terra ProOpenAI67.4
67GPT-5.6 Terra Pro (batch)OpenAI67.4
68GPT-5.6 TerraOpenAI67.4
69GPT-5.6 Terra (batch)OpenAI67.4
70Gemma 4 26B A4B (free)Google67.4
71Gemma 4 31B (free)Google67.4
72o3 Pro (batch)OpenAI67.4
73Claude Sonnet 5 (batch)Anthropic67.1
74GPT-5.2OpenAI66.8
75GPT-5.6 Luna ProOpenAI66.1
76GPT-5.6 Luna Pro (batch)OpenAI66.1
77GPT-5.6 LunaOpenAI66.1
78GPT-5.6 Luna (batch)OpenAI66.1
79Nemotron 3 Nano Omni (free)NVIDIA66
80OpenAI GPT Mini Latest~openai66
81GPT-5.4 MiniOpenAI66
82GPT-5.2-CodexOpenAI66
83GPT-5 ImageOpenAI65.9
84MoonshotAI Kimi Latest~moonshotai65.7
85GPT-5.4 Mini (batch)OpenAI65.5
86Claude Sonnet 4.5Anthropic65.5
87GPT-5.4 NanoOpenAI65.2
88GPT-5.4 Nano (batch)OpenAI65.1
89GPT-5.2 (batch)OpenAI65
90GPT-5.1OpenAI65
91Anthropic Claude Haiku Latest~anthropic64.9
92Gemini 2.5 ProGoogle64.8
93Claude Opus 4.5 (batch)Anthropic64.7
94MiMo-V2.5Xiaomi64.1
95Inklingthinkingmachines63.9
96GPT-5.1-Codex-MaxOpenAI63.9
97GPT-5 Image MiniOpenAI63.9
98Muse Spark 1.2meta63.8
99Qwen3.8 MaxAlibaba63.8
100Muse Spark 1.1meta63.8
101GPT-5.1 (batch)OpenAI63.8
102Gemini 2.5 Pro Preview 05-06Google63.7
103MiniMax M3MiniMax63.6
104Claude Sonnet 4.5 (batch)Anthropic63.6
105Gemini 2.5 Pro (batch)Google63.6
106Nano Banana 2 (Gemini 3.1 Flash Image)Google63.5
107GPT-5.1-CodexOpenAI63.4
108Gemini 2.5 Flash LiteGoogle63.4
109Nano Banana 2 (Gemini 3.1 Flash Image Preview)Google63.3
110Gemini 2.5 Flash Lite (batch)Google63.3
111Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)Google62.9
112Nano Banana Pro (Gemini 3 Pro Image Preview)Google62.9
113Gemini 2.5 FlashGoogle62.9
114Gemini 2.5 Pro Preview 06-05Google62.8
115Gemini 2.5 Flash (batch)Google62.6
116Qwen3.5 Plus 2026-04-20Alibaba62.3
117Qwen3.6 27BAlibaba62.3
118Qwen3.6 PlusAlibaba62.3
119GPT-5OpenAI62.3
120Lyria 3 Pro PreviewGoogle62.2
121Lyria 3 Clip PreviewGoogle62.2
122GPT-5.3 ChatOpenAI62.2
123Qwen3.5 Plus 2026-02-15Alibaba62.2
124Qwen3.6 FlashAlibaba62.1
125Qwen3.5-FlashAlibaba61.9
126Qwen3.7 FlashAlibaba61.8
127Claude Haiku 4.5Anthropic61.8
128Step 3.7 FlashStepFun61.7
129Qwen3.6 35B A3BAlibaba61.7
130GLM 5V TurboZhipu AI61.7
131Qwen3.5-35B-A3BAlibaba61.7
132Gemma 4 31BGoogle61.5
133Qwen3.5-9BAlibaba61.5
134Seed-2.0-LiteByteDance61.4
135GPT-5.1-Codex-MiniOpenAI61.4
136Nemotron Nano 12B 2 VL (free)NVIDIA61.3
137Qwen3.5-122B-A10BAlibaba61.2
138Claude Haiku 4.5 (batch)Anthropic61.1
139GPT-5 (batch)OpenAI61.1
140Qwen3.7 PlusAlibaba61
141Seed-2.0-MiniByteDance61
142Qwen3.5 397B A17BAlibaba61
143Qwen3.5-27BAlibaba60.8
144Grok 4.20xAI60.7
145GPT-5 Codex (batch)OpenAI60.7
146Kimi K2.7 CodeMoonshot AI60.6
147GPT-5.2 ChatOpenAI60.5
148Kimi K2.6Moonshot AI60.4
149GPT-5 MiniOpenAI60.3
150Grok 4.5xAI60.2
151Grok Latest~x-ai60.2
152Kimi K2.5Moonshot AI60.1
153GPT-5 Mini (batch)OpenAI60.1
154o1 (batch)OpenAI60.1
155Grok 4.3xAI60
156GPT-5 NanoOpenAI59.9
157GPT-5 Nano (batch)OpenAI59.9
158Gemma 4 26B A4B Google59.5
159Seed 1.6ByteDance59.1
160Inkling Smallthinkingmachines58.9
161Seed 1.6 FlashByteDance58.7
162Nova 2 LiteAmazon58.7
163Grok Build 0.1xAI58.5
164Claude Sonnet 4Anthropic58.4
165Kimi K3Moonshot AI57.9
166Sonar Pro SearchPerplexity57.9
167o3OpenAI57.9
168GLM 4.6VZhipu AI57.7
169Grok 4.20 Multi-AgentxAI57.1
170o4 Mini HighOpenAI57
171o4 MiniOpenAI57
172Nemotron 3.5 Content Safety (free)NVIDIA56.9
173o3 (batch)OpenAI56.9
174o4 Mini High (batch)OpenAI56.4
175o4 Mini (batch)OpenAI56.4
176Mistral Medium 3.5Mistral AI56.3
177Qwen3 VL 30B A3B ThinkingAlibaba55.4
178MiniMax M3 (batch)MiniMax55.3
179GPT-4.1OpenAI55.2
180Qwen3 VL 8B ThinkingAlibaba54.9
181Qwen3 VL 235B A22B ThinkingAlibaba54.8
182GPT-4.1 (batch)OpenAI54.2
183Nano Banana (Gemini 2.5 Flash Image)Google54
184Perceptron Mk1perceptron53.6
185GPT-4.1 MiniOpenAI53.6
186GPT-4.1 Mini (batch)OpenAI53.4
187Kimi K2.7 Code (batch)Moonshot AI53.3
188GPT-4.1 NanoOpenAI53.3
189GPT-4.1 Nano (batch)OpenAI53.2
190Reka Edgerekaai53
191Mistral Small 4Mistral AI52.9
192Nova Premier 1.0Amazon52.9
193Inkling (batch)thinkingmachines52.1
194GLM 4.5VZhipu AI51.8
195Qwen3 VL 8B InstructAlibaba51.6
196Qwen3 VL 235B A22B InstructAlibaba51.4
197Qwen3 VL 32B InstructAlibaba51.1
198Qwen3 VL 30B A3B InstructAlibaba50.9
199Mistral Large 3 2512Mistral AI49.3
200Mistral Small 3.2 24BMistral AI47.8
201Llama 4 ScoutMeta47.5
202Ministral 3 14B 2512Mistral AI47.4
203Llama 4 MaverickMeta47.4
204Ministral 3 8B 2512Mistral AI47.3
205Gemma 3 27BGoogle46.7
206Ministral 3 3B 2512Mistral AI46.6
207Mistral Medium 3.1Mistral AI45.7
208GPT-4o (2024-11-20)OpenAI45.5
209GPT-4o (batch)OpenAI44.9
210GPT-4 TurboOpenAI44.9
211GPT-4 Turbo (batch)OpenAI44.8
212Gemma 3 12BGoogle44.4
213Llama Guard 4 12BMeta44.3
214Sonar ProPerplexity44.3
215ERNIE 4.5 VL 424B A47B Baidu44
216GPT-4o-mini (batch)OpenAI43.8
217Mistral Medium 3Mistral AI43.1
218UI-TARS 7B ByteDance42.9
219GPT-4o (2024-05-13)OpenAI42.9
220GPT-4o (2024-08-06)OpenAI42.6
221GPT-4oOpenAI42.6
222Sonar Reasoning ProPerplexity41.2
223MiniMax-01MiniMax41
224Gemma 3 4BGoogle40.9
225GPT-4o-miniOpenAI40.3
226GPT-4o-mini (2024-07-18)OpenAI40.3
227Mistral Small 3.1 24BMistral AI39
228Nova Pro 1.0Amazon39
229Nova Lite 1.0Amazon38.2
230Claude 3 HaikuAnthropic38.2
231Qwen2.5 VL 72B InstructAlibaba34.9
232SonarPerplexity34.8

What Else Can Vision Models Do?

Vision-capable models often support additional capabilities. Here is how the 232 vision models break down by other features.

Function Calling

89%

206 of 232 vision models

JSON Mode

92%

213 of 232 vision models

Streaming

100%

232 of 232 vision models

Reasoning

78%

182 of 232 vision models

Web Search

64%

148 of 232 vision models

Image Output

4%

9 of 232 vision models

Top Providers of Vision Models

Which providers offer the most AI models with image understanding capabilities.

OpenAI

78

vision models

Google

37

vision models

Anthropic

28

vision models

Alibaba

23

vision models

Mistral AI

10

vision models

Moonshot AI

5

vision models

xAI

5

vision models

ByteDance

5

vision models

Top Vision Models - Full Capability Breakdown

Detailed capability matrix for the top 15 vision models by composite score.

Supported
Not supported

What Are Vision / Multimodal AI Models?

Vision-capable AI models (also called multimodal models) can process both text and images as input. Instead of being limited to text-only prompts, these models can understand photos, screenshots, charts, diagrams, handwritten notes, and other visual content.

How Vision Input Works

You send an image (as a URL or base64-encoded data) alongside your text prompt via the API. The model processes both together, allowing it to answer questions about the image, describe its contents, extract text (OCR), analyze charts, or reason about visual information.

Common Use Cases for Vision Models

Document analysis and OCR, screenshot-to-code generation, chart and graph interpretation, medical image analysis, accessibility (image descriptions), visual QA for customer support, UI/UX review, diagram-to-code conversion, and real-time visual understanding in agentic workflows.

Vision vs. Image Output

Vision (image input) and image output are distinct capabilities. Vision means the model can see and understand images you send to it. Image output means the model can generate new images. Some models support both, but many vision models are text-output only - they analyze images but respond with text.

Pricing Considerations

Image tokens typically cost more than text tokens. A single high-resolution image can consume thousands of tokens. Most providers charge for image input based on the image dimensions and detail level. Check each model's specific pricing for image token costs.

Explore More Model Comparisons

Dive deeper into model capabilities, rankings, and head-to-head comparisons to find the right vision model for your use case.

Frequently Asked Questions

Vision AI models (multimodal LLMs) can understand and analyze images alongside text. They accept image inputs and can describe photos, extract text from screenshots, analyze charts, and answer questions about visual content.

The top vision models include GPT-4o, Claude 3.5 Sonnet, and Gemini 2.0 Flash. Rankings change frequently as models improve — check our leaderboard for the latest scores.

Not all of them. Vision capabilities refer to understanding images (input). Some models like DALL-E and Stable Diffusion specialize in generating images (output). A few models like GPT-4o can both understand and generate images.

AI Models with Vision - Best Multimodal AI (2026) | LM Market Cap