Skip to content

模态探索器

按输入和输出模态分析406个AI模型。查看哪些模型接受文本、图像、音频或视频输入以及它们产生什么输出。发现支持视觉的模型、图像生成器和真正的多模态AI。

模型总数

406

输入模态

5

输出模态

4

真正多模态

13

输入模态分布

text45.4%
image27.4%
file16.9%
video6.5%
audio3.8%
LMMarketCap.com

输出模态分布

text92.4%
image4.3%
video2.4%
audio1.0%
LMMarketCap.com

输入模态

模型可以接受哪些类型的数据作为输入。

text
405
image
245
file
151
video
58
audio
34
模态模型数量占比
text
405100%
image
24560%
file
15137%
video
5814%
audio
348%

输出模态

模型可以产生哪些类型的数据作为输出。

text
387
image
18
video
10
audio
4
模态模型数量占比
text
38795%
image
184%
video
102%
audio
41%

模态流 (输入 → 输出)

所有模型中最常见的输入到输出模态组合。

输入模态输出模态数量占比
text
text
14335%
fileimagetext
text
11127%
imagetext
text
4812%
imagetextvideo
text
307%
audiofileimagetextvideo
text
256%
filetext
text
92%
imagetext
video
82%
imagetext
imagetext
61%
text
image
51%
imagetext
image
41%
audioimagetext
text
31%
fileimagetext
imagetext
31%
audioimagetextvideo
text
20%
imagetext
audiotext
20%
audiotext
audiotext
20%
fileimagetextvideo
text
10%
audiofiletext
text
10%
audiofileimagetext
text
10%
image
video
10%
text
video
10%

最通用的模型

按总独特模态数排名,模态支持最多样化的前20个模型。

模型输入模态输出模态总计独特
Gemini 2.5 Flash
audiofileimagetextvideo
text
5
Gemini 2.5 Flash (batch)
audiofileimagetextvideo
text
5
Gemini 2.5 Flash Lite
audiofileimagetextvideo
text
5
Gemini 2.5 Flash Lite (batch)
audiofileimagetextvideo
text
5
Gemini 2.5 Pro
audiofileimagetextvideo
text
5
Gemini 2.5 Pro (batch)
audiofileimagetextvideo
text
5
Gemini 2.5 Pro Preview 05-06
audiofileimagetextvideo
text
5
Gemini 3 Flash Preview
audiofileimagetextvideo
text
5
Gemini 3 Flash Preview (batch)
audiofileimagetextvideo
text
5
Gemini 3.1 Flash Lite
audiofileimagetextvideo
text
5
Gemini 3.1 Flash Lite (batch)
audiofileimagetextvideo
text
5
Gemini 3.1 Flash Lite Preview
audiofileimagetextvideo
text
5
Gemini 3.1 Pro Preview
audiofileimagetextvideo
text
5
Gemini 3.1 Pro Preview (batch)
audiofileimagetextvideo
text
5
Gemini 3.1 Pro Preview Custom Tools
audiofileimagetextvideo
text
5
Gemini 3.5 Flash
audiofileimagetextvideo
text
5
Gemini 3.5 Flash (batch)
audiofileimagetextvideo
text
5
Gemini 3.5 Flash Lite
audiofileimagetextvideo
text
5
Gemini 3.5 Flash Lite (batch)
audiofileimagetextvideo
text
5
Gemini 3.6 Flash
audiofileimagetextvideo
text
5

支持视觉的模型

245个接受图像输入的模型,按字母顺序排列。

模型免费?上下文
Adobe Firefly 3Adobe0K
Anthropic Claude Haiku Latest~anthropic200K
Anthropic Claude Sonnet Latest~anthropic1M
Claude 3 HaikuAnthropic200K
Claude Fable 5Anthropic1M
Claude Fable 5 (batch)Anthropic1M
Claude Fable Latest~anthropic1M
Claude Haiku 4.5Anthropic200K
Claude Haiku 4.5 (batch)Anthropic200K
Claude Opus 4Anthropic200K
Claude Opus 4.1Anthropic200K
Claude Opus 4.1 (batch)Anthropic200K
Claude Opus 4.5Anthropic200K
Claude Opus 4.5 (batch)Anthropic200K
Claude Opus 4.6Anthropic1M
Claude Opus 4.6 (batch)Anthropic1M
Claude Opus 4.7Anthropic1M
Claude Opus 4.7 (batch)Anthropic1M
Claude Opus 4.7 (Fast)Anthropic1M
Claude Opus 4.8Anthropic1M
Claude Opus 4.8 (batch)Anthropic1M
Claude Opus 4.8 (Fast)Anthropic1M
Claude Opus 5Anthropic1M
Claude Opus 5 (batch)Anthropic1M
Claude Opus 5 (Fast)Anthropic1M
Claude Opus Latest~anthropic1M
Claude Sonnet 4Anthropic1M
Claude Sonnet 4.5Anthropic1M
Claude Sonnet 4.5 (batch)Anthropic1M
Claude Sonnet 4.6Anthropic1M
Claude Sonnet 4.6 (batch)Anthropic1M
Claude Sonnet 5Anthropic1M
Claude Sonnet 5 (batch)Anthropic1M
ERNIE 4.5 VL 424B A47B Baidu123K
Fugu Ultrasakana1M
Gemini 2.5 FlashGoogle1.0M
Gemini 2.5 Flash (batch)Google1.0M
Gemini 2.5 Flash LiteGoogle1.0M
Gemini 2.5 Flash Lite (batch)Google1.0M
Gemini 2.5 ProGoogle1.0M
Gemini 2.5 Pro (batch)Google1.0M
Gemini 2.5 Pro Preview 05-06Google1.0M
Gemini 2.5 Pro Preview 06-05Google1.0M
Gemini 3 Flash PreviewGoogle1.0M
Gemini 3 Flash Preview (batch)Google1.0M
Gemini 3.1 Flash LiteGoogle1.0M
Gemini 3.1 Flash Lite (batch)Google1.0M
Gemini 3.1 Flash Lite PreviewGoogle1.0M
Gemini 3.1 Pro PreviewGoogle1.0M
Gemini 3.1 Pro Preview (batch)Google1.0M
Gemini 3.1 Pro Preview Custom ToolsGoogle1.0M
Gemini 3.5 FlashGoogle1.0M
Gemini 3.5 Flash (batch)Google1.0M
Gemini 3.5 Flash LiteGoogle1.0M
Gemini 3.5 Flash Lite (batch)Google1.0M
Gemini 3.6 FlashGoogle1.0M
Gemini 3.6 Flash (batch)Google1.0M
Gemma 3 12BGoogle131.1K
Gemma 3 27BGoogle262.1K
Gemma 3 4BGoogle131.1K
Gemma 4 26B A4B Google262.1K
Gemma 4 26B A4B (free)Google262.1K
Gemma 4 31BGoogle262.1K
Gemma 4 31B (free)Google262.1K
GLM 4.5VZhipu AI65.5K
GLM 4.6VZhipu AI131.1K
GLM 5V TurboZhipu AI202.8K
Google Gemini Flash Latest~google1.0M
Google Gemini Pro Latest~google1.0M
GPT Chat LatestOpenAI400K
GPT-4 TurboOpenAI128K
GPT-4 Turbo (batch)OpenAI128K
GPT-4.1OpenAI1.0M
GPT-4.1 (batch)OpenAI1.0M
GPT-4.1 MiniOpenAI1.0M
GPT-4.1 Mini (batch)OpenAI1.0M
GPT-4.1 NanoOpenAI1.0M
GPT-4.1 Nano (batch)OpenAI1.0M
GPT-4oOpenAI128K
GPT-4o (2024-05-13)OpenAI128K
GPT-4o (2024-08-06)OpenAI128K
GPT-4o (2024-11-20)OpenAI128K
GPT-4o (batch)OpenAI128K
GPT-4o-miniOpenAI128K
GPT-4o-mini (2024-07-18)OpenAI128K
GPT-4o-mini (batch)OpenAI128K
GPT-5OpenAI400K
GPT-5 (batch)OpenAI400K
GPT-5 Codex (batch)OpenAI400K
GPT-5 ImageOpenAI400K
GPT-5 Image MiniOpenAI400K
GPT-5 MiniOpenAI400K
GPT-5 Mini (batch)OpenAI400K
GPT-5 NanoOpenAI400K
GPT-5 Nano (batch)OpenAI400K
GPT-5 ProOpenAI400K
GPT-5 Pro (batch)OpenAI400K
GPT-5.1OpenAI400K
GPT-5.1 (batch)OpenAI400K
GPT-5.1-CodexOpenAI400K
GPT-5.1-Codex-MaxOpenAI400K
GPT-5.1-Codex-MiniOpenAI400K
GPT-5.2OpenAI400K
GPT-5.2 (batch)OpenAI400K
GPT-5.2 ChatOpenAI128K
GPT-5.2 ProOpenAI400K
GPT-5.2 Pro (batch)OpenAI400K
GPT-5.2-CodexOpenAI400K
GPT-5.3 ChatOpenAI128K
GPT-5.3-CodexOpenAI400K
GPT-5.4OpenAI1.1M
GPT-5.4 (batch)OpenAI1.1M
GPT-5.4 Image 2OpenAI272K
GPT-5.4 MiniOpenAI400K
GPT-5.4 Mini (batch)OpenAI400K
GPT-5.4 NanoOpenAI400K
GPT-5.4 Nano (batch)OpenAI400K
GPT-5.4 ProOpenAI1.1M
GPT-5.4 Pro (batch)OpenAI1.1M
GPT-5.5OpenAI1.1M
GPT-5.5 (batch)OpenAI1.1M
GPT-5.5 ProOpenAI1.1M
GPT-5.5 Pro (batch)OpenAI1.1M
GPT-5.6 LunaOpenAI1.1M
GPT-5.6 Luna (batch)OpenAI1.1M
GPT-5.6 Luna ProOpenAI1.1M
GPT-5.6 Luna Pro (batch)OpenAI1.1M
GPT-5.6 SolOpenAI1.1M
GPT-5.6 Sol (batch)OpenAI1.1M
GPT-5.6 Sol ProOpenAI1.1M
GPT-5.6 Sol Pro (batch)OpenAI1.1M
GPT-5.6 TerraOpenAI1.1M
GPT-5.6 Terra (batch)OpenAI1.1M
GPT-5.6 Terra ProOpenAI1.1M
GPT-5.6 Terra Pro (batch)OpenAI1.1M
Grok 4.20xAI2M
Grok 4.20 Multi-AgentxAI2M
Grok 4.3xAI1M
Grok 4.5xAI500K
Grok Build 0.1xAI256K
Grok Latest~x-ai500K
Inklingthinkingmachines1.0M
Inkling (batch)thinkingmachines524.3K
Inkling Smallthinkingmachines524.3K
Kimi K2.5Moonshot AI262.1K
Kimi K2.6Moonshot AI262.1K
Kimi K2.7 CodeMoonshot AI262.1K
Kimi K2.7 Code (batch)Moonshot AI262.1K
Kimi K3Moonshot AI1.0M
Kling 1.6Kuaishou0K
Leonardo PhoenixLeonardo AI0K
Llama 4 MaverickMeta1.0M
Llama 4 ScoutMeta1.3M
Llama Guard 4 12BMeta1.0M
LTX-Video 2Lightricks0K
Luma Dream MachineLuma AI0K
Lyria 3 Clip PreviewGoogle1.0M
Lyria 3 Pro PreviewGoogle1.0M
Midjourney v6.1Midjourney0K
MiMo-V2.5Xiaomi1.1M
MiniMax M3MiniMax1.0M
MiniMax M3 (batch)MiniMax524.3K
MiniMax Video-01MiniMax0K
MiniMax-01MiniMax1.0M
Ministral 3 14B 2512Mistral AI262.1K
Ministral 3 3B 2512Mistral AI131.1K
Ministral 3 8B 2512Mistral AI262.1K
Mistral Large 3 2512Mistral AI262.1K
Mistral Medium 3Mistral AI131.1K
Mistral Medium 3.1Mistral AI131.1K
Mistral Medium 3.5Mistral AI262.1K
Mistral Small 3.1 24BMistral AI128K
Mistral Small 3.2 24BMistral AI256K
Mistral Small 4Mistral AI262.1K
MoonshotAI Kimi Latest~moonshotai1.0M
Muse Spark 1.1meta1.0M
Muse Spark 1.2meta1.0M
Nano Banana (Gemini 2.5 Flash Image)Google32.8K
Nano Banana 2 (Gemini 3.1 Flash Image Preview)Google65.5K
Nano Banana 2 (Gemini 3.1 Flash Image)Google131.1K
Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)Google65.5K
Nano Banana Pro (Gemini 3 Pro Image Preview)Google65.5K
Nano Banana Pro (Gemini 3 Pro Image)Google131.1K
Nemotron 3 Nano Omni (free)NVIDIA256K
Nemotron 3.5 Content Safety (free)NVIDIA128K
Nemotron Nano 12B 2 VL (free)NVIDIA128K
Nova 2 LiteAmazon1M
Nova Lite 1.0Amazon300K
Nova Premier 1.0Amazon1M
Nova Pro 1.0Amazon300K
o1OpenAI200K
o1 (batch)OpenAI200K
o1-proOpenAI200K
o1-pro (batch)OpenAI200K
o3OpenAI200K
o3 (batch)OpenAI200K
o3 ProOpenAI200K
o3 Pro (batch)OpenAI200K
o4 MiniOpenAI200K
o4 Mini (batch)OpenAI200K
o4 Mini HighOpenAI200K
o4 Mini High (batch)OpenAI200K
OpenAI GPT Latest~openai1.1M
OpenAI GPT Mini Latest~openai400K
Perceptron Mk1perceptron32.8K
Pika 2.0Pika0K
Qwen2.5 VL 72B InstructAlibaba128K
Qwen3 VL 235B A22B InstructAlibaba262.1K
Qwen3 VL 235B A22B ThinkingAlibaba131.1K
Qwen3 VL 30B A3B InstructAlibaba262.1K
Qwen3 VL 30B A3B ThinkingAlibaba262.1K
Qwen3 VL 32B InstructAlibaba131.1K
Qwen3 VL 8B InstructAlibaba262.1K
Qwen3 VL 8B ThinkingAlibaba131.1K
Qwen3.5 397B A17BAlibaba262.1K
Qwen3.5 Plus 2026-02-15Alibaba1M
Qwen3.5 Plus 2026-04-20Alibaba1M
Qwen3.5-122B-A10BAlibaba262.1K
Qwen3.5-27BAlibaba262.1K
Qwen3.5-35B-A3BAlibaba262.1K
Qwen3.5-9BAlibaba262.1K
Qwen3.5-FlashAlibaba1M
Qwen3.6 27BAlibaba262.1K
Qwen3.6 35B A3BAlibaba262.1K
Qwen3.6 FlashAlibaba1M
Qwen3.6 PlusAlibaba1M
Qwen3.7 FlashAlibaba1M
Qwen3.7 PlusAlibaba1M
Qwen3.8 MaxAlibaba1M
Reka Edgerekaai16.4K
Runway Gen-3 AlphaRunway0K
Seed 1.6ByteDance262.1K
Seed 1.6 FlashByteDance262.1K
Seed-2.0-LiteByteDance262.1K
Seed-2.0-MiniByteDance262.1K
SonarPerplexity127.1K
Sonar ProPerplexity200K
Sonar Pro SearchPerplexity200K
Sonar Reasoning ProPerplexity128K
SoraOpenAI0K
Stable Diffusion 3.5Stability AI0K
Stable Video DiffusionStability AI0K
Step 3.7 FlashStepFun262.1K
UI-TARS 7B ByteDance128K
Veo 2Google0K

图像生成器

18个可以生成图像输出的模型。

模型免费?
Adobe Firefly 3Adobe
DALL-E 3OpenAI
FLUX.1 ProBlack Forest Labs
GPT-5 ImageOpenAI
GPT-5 Image MiniOpenAI
GPT-5.4 Image 2OpenAI
Ideogram 2.0Ideogram
Imagen 3Google
Leonardo PhoenixLeonardo AI
Midjourney v6.1Midjourney
Nano Banana (Gemini 2.5 Flash Image)Google
Nano Banana 2 (Gemini 3.1 Flash Image Preview)Google
Nano Banana 2 (Gemini 3.1 Flash Image)Google
Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)Google
Nano Banana Pro (Gemini 3 Pro Image Preview)Google
Nano Banana Pro (Gemini 3 Pro Image)Google
Recraft V3Recraft
Stable Diffusion 3.5Stability AI

探索更多

深入了解多模态AI、视觉模型或浏览所有探索器。

Frequently Asked Questions

Modalities refer to the types of data an AI model can process as input or generate as output. Common input modalities include text, images, and audio. Output modalities include text generation, image creation, code, and structured data like JSON.

A multimodal AI model can process and generate multiple types of data - for example, accepting both text and images as input. Models like GPT-4o, Claude 3.5, and Gemini 2.0 are multimodal, supporting text, image, and sometimes audio inputs.

Our tracker shows that a growing majority of new AI models support vision (image) input. Most top-tier models from OpenAI, Anthropic, Google, and Meta now accept image inputs alongside text, making vision a near-standard capability.

AI Model Modality Explorer - Input & Output Analysis | LM Market Cap