Skip to content

Best AI Models for Multilingual Tasks

AI models ranked by multilingual performance using MMLU benchmark scores across languages. Find the best LLM for translation and non-English tasks.

Last updated: 45m ago
#1 Model

GPT-5.4

Score: 95.4

Average Score

74.2

Across all ranked models

Models Ranked

109

With benchmark data

Weights:MMLU (60%)Arena Elo (40%)

Top Best for Multilingual Models by Weighted Score

Top 15 models by weighted score

LMMarketCap.com

Benchmark Breakdown

Per-benchmark scores for top 10 models

MMLU
Arena Elo
LMMarketCap.com
#ModelScore
1GPT-5.4OpenAI95.4
2Claude Opus 4.6Anthropic95.3
3Gemini 3.1 Pro PreviewGoogle95.2
4GPT-5.2OpenAI94.8
5GPT-5.1OpenAI94.3
6GPT-5.5OpenAI93.8
7GPT-5OpenAI93.5
8Claude Sonnet 4.6Anthropic92.1
9Claude Sonnet 4.5Anthropic91.3
10Gemini 3 Flash PreviewGoogle91.1
11Gemini 2.5 ProGoogle90.7
12Claude Opus 4.5Anthropic90.2
13o3OpenAI89.7
14DeepSeek V3.2DeepSeek88.1
15R1 0528DeepSeek86.9
16Claude Sonnet 4Anthropic86.2
17R1DeepSeek85.7
18o1OpenAI85.1
19Gemini 2.5 FlashGoogle84.5
20Muse Spark 1.1meta84
21Claude Opus 4.7Anthropic83.7
22o3 MiniOpenAI83.5
23DeepSeek V3 0324DeepSeek83.2
24Claude Opus 4.8Anthropic82
25Gemini 3.5 FlashGoogle81.7
26GPT-5.2 ChatOpenAI81.6
27GLM 5.3 FlashZhipu AI81.5
28Llama 4 MaverickMeta81.1
29DeepSeek V3DeepSeek81
30Grok 4.5xAI80.5
31MiMo-V2.5-ProXiaomi80.3
32GLM 5.1Zhipu AI80.2
33GPT-4.1OpenAI80.2
34Kimi K2.6Moonshot AI79.3
35Qwen3.6 Max PreviewAlibaba79.3
36GLM 5Zhipu AI79.1
37GPT-4oOpenAI79
38Gemini 3.5 Flash LiteGoogle78.8
39Hy3Tencent78.8
40Qwen3.7 PlusAlibaba78.8
41GPT-5.5 ProOpenAI78.5
42Gemma 4 31BGoogle78.1
43Claude Opus 4.1Anthropic77.9
44Qwen3.6 PlusAlibaba76.9
45Qwen3.5 397B A17BAlibaba76.8
46GLM 4.7Zhipu AI76.8
47MiniMax M3MiniMax76.6
48Inklingthinkingmachines76.5
49Gemma 4 26B A4B Google76.2
50Mistral LargeMistral AI76.2
51Qwen3.8 27BAlibaba76.1
52MiMo-V2.5Xiaomi75.6
53GPT-4 TurboOpenAI75.6
54GLM 5V TurboZhipu AI75.5
55Gemini 3.1 Flash Lite PreviewGoogle75.4
56Phi 4Microsoft74.6
57Llama 3.3 70B InstructMeta74.6
58Mistral Medium 3.5Mistral AI74.5
59GLM 4.6Zhipu AI74.4
60DeepSeek V3.2 ExpDeepSeek74
61Claude Haiku 4.5Anthropic73.4
62DeepSeek V3.1DeepSeek73.2
63Qwen3.5-122B-A10BAlibaba73.2
64MiniMax M2.7MiniMax73
65DeepSeek V3.1 TerminusDeepSeek73
66Qwen3 VL 235B A22B InstructAlibaba72.8
67Hy3 previewTencent72.7
68GLM 4.5Zhipu AI72.4
69Qwen3.5-27BAlibaba72
70Inkling Smallthinkingmachines71.5
71Llama 3.1 70B InstructMeta71.5
72Qwen3 Next 80B A3B InstructAlibaba70.7
73GPT-4o-miniOpenAI70.7
74Qwen3.5-FlashAlibaba70.4
75Qwen3 VL 235B A22B ThinkingAlibaba70.1
76Qwen3.5-35B-A3BAlibaba70.1
77Step 3.5 FlashStepFun70
78MiniMax M2.5MiniMax69.4
79GPT-5 MiniOpenAI69.4
80GPT-4.1 MiniOpenAI68.4
81o4 MiniOpenAI68
82GLM 4.6VZhipu AI67.7
83Llama 4 ScoutMeta67.7
84GLM 4.5 AirZhipu AI67
85Qwen3 Next 80B A3B ThinkingAlibaba66.4
86Trinity Large Thinkingarcee-ai66.4
87GLM 4.7 FlashZhipu AI66
88MiniMax M1MiniMax65.7
89o3 Mini HighOpenAI65.6
90GLM 4.5VZhipu AI64.2
91gpt-oss-120bOpenAI64
92Gemma 2 27BGoogle63.9
93Qwen3 8BAlibaba63.3
94Mercury 2Inception63.2
95MiniMax M2MiniMax63.2
96GPT-5 NanoOpenAI61.9
97Nova 2 LiteAmazon61.8
98GPT-4.1 NanoOpenAI59.8
99GPT-4o-mini (2024-07-18)OpenAI59.2
100gpt-oss-20bOpenAI59.1
101Mistral Large 2407Mistral AI58.7
102Granite 4.2 8BIBM54.8
103GPT-4OpenAI53.3
104Command ACohere51.1
105Claude 3 HaikuAnthropic51.1
106Command R+ (08-2024)Cohere49.6
107Llama 3.1 8B InstructMeta44.1
108Llama 3.2 3B InstructMeta37.8
109Llama 3.2 1B InstructMeta29.9

How scores are calculated

Each model's score is a weighted average of its available benchmark results. When a model is missing some benchmarks, the weights are re-normalized across the benchmarks that are available. All scores are on a 0-100 scale. Data sourced from official model cards, published papers, and third-party evaluation platforms.

Frequently Asked Questions

Based on our benchmark analysis, GPT-5.4 by OpenAI is currently the #1 ranked model for multilingual, with a weighted score of 95.4/100.

Models are ranked using a weighted average of MMLU, Arena Elo benchmark scores. All scores are normalized to a 0-100 scale.

We currently rank 109 models that have relevant benchmark data for multilingual tasks.

Best AI Models for Multilingual Tasks (2026) | LM Market Cap