Skip to content

最佳多语言AI模型

使用跨语言MMLU基准测试分数对AI模型的多语言性能进行排名。找到翻译和非英语任务的最佳LLM。

Last updated: 15m ago
第一名模型

GPT-5.4

评分: 95.4

平均评分

74.5

所有排名模型

已排名模型

113

有基准测试数据

权重:MMLU (60%)Arena Elo (40%)

Top Best for Multilingual Models by Weighted Score

Top 15 models by weighted score

LMMarketCap.com

Benchmark Breakdown

Per-benchmark scores for top 10 models

MMLU
Arena Elo
LMMarketCap.com
#模型评分
1GPT-5.4OpenAI95.4
2Claude Opus 4.6Anthropic95.3
3Gemini 3.1 Pro PreviewGoogle95.2
4GPT-5.2OpenAI94.8
5GPT-5.1OpenAI94.3
6GPT-5.5OpenAI93.8
7GPT-5OpenAI93.5
8Claude Sonnet 4.6Anthropic92.1
9Claude Sonnet 4.5Anthropic91.3
10Gemini 3 Flash PreviewGoogle91.1
11Gemini 2.5 ProGoogle90.7
12Claude Opus 4.5Anthropic90.2
13o3OpenAI89.7
14Claude Opus 4Anthropic89.3
15DeepSeek V3.2DeepSeek88.1
16R1 0528DeepSeek86.9
17Claude Sonnet 4Anthropic86.2
18R1DeepSeek85.7
19o1OpenAI85.1
20Claude Fable 5Anthropic85
21Gemini 2.5 FlashGoogle84.5
22Claude Opus 4.7Anthropic83.7
23Qwen3.8 MaxAlibaba83.7
24o3 MiniOpenAI83.5
25Muse Spark 1.1meta83.4
26DeepSeek V3 0324DeepSeek83.2
27Gemini 3.6 FlashGoogle82.7
28Claude Opus 4.8Anthropic82
29Gemini 3.5 FlashGoogle81.7
30GPT-5.2 ChatOpenAI81.6
31Llama 4 MaverickMeta81.1
32DeepSeek V3DeepSeek81
33Grok 4.5xAI80.6
34MiMo-V2.5-ProXiaomi80.5
35GLM 5.1Zhipu AI80.3
36GPT-4.1OpenAI80.2
37DeepSeek V4 ProDeepSeek79.8
38Kimi K2.6Moonshot AI79.3
39Qwen3.6 Max PreviewAlibaba79.3
40Gemini 3.5 Flash LiteGoogle79.1
41Qwen3.7 PlusAlibaba79.1
42GPT-4oOpenAI79
43GLM 5Zhipu AI78.9
44Hy3Tencent78.8
45GPT-5.5 ProOpenAI78.5
46Gemma 4 31BGoogle78.1
47Claude Opus 4.1Anthropic77.8
48Qwen3.6 PlusAlibaba77.1
49MiniMax M3MiniMax76.9
50Inklingthinkingmachines76.9
51Qwen3.5 397B A17BAlibaba76.8
52GLM 4.7Zhipu AI76.8
53Gemma 4 26B A4B Google76.2
54Mistral LargeMistral AI76.2
55MiMo-V2.5Xiaomi75.6
56GPT-4 TurboOpenAI75.6
57GLM 5V TurboZhipu AI75.5
58Gemini 3.1 Flash Lite PreviewGoogle75.4
59Inkling Smallthinkingmachines75.2
60Mistral Medium 3.5Mistral AI74.7
61Phi 4Microsoft74.6
62Llama 3.3 70B InstructMeta74.6
63GLM 4.6Zhipu AI74.2
64DeepSeek V3.2 ExpDeepSeek74
65Claude Haiku 4.5Anthropic73.4
66Qwen3.5-122B-A10BAlibaba73.2
67DeepSeek V3.1DeepSeek73.2
68MiniMax M2.7MiniMax73.1
69DeepSeek V3.1 TerminusDeepSeek73
70Qwen3 VL 235B A22B InstructAlibaba73
71Hy3 previewTencent72.7
72GLM 4.5Zhipu AI72.4
73Qwen3.5-27BAlibaba72
74Llama 3.1 70B InstructMeta71.5
75Qwen3 Next 80B A3B InstructAlibaba71
76GPT-4o-miniOpenAI70.7
77Qwen3.5-FlashAlibaba70.4
78Qwen3.5-35B-A3BAlibaba70.1
79Qwen3 VL 235B A22B ThinkingAlibaba70.1
80Step 3.5 FlashStepFun70.1
81MiniMax M2.5MiniMax69.4
82GPT-5 MiniOpenAI69.4
83GPT-4.1 MiniOpenAI68.4
84o4 MiniOpenAI68
85Llama 4 ScoutMeta67.7
86GLM 4.6VZhipu AI67.6
87GLM 4.5 AirZhipu AI67
88Trinity Large Thinkingarcee-ai66.4
89Qwen3 Next 80B A3B ThinkingAlibaba66.4
90GLM 4.7 FlashZhipu AI66.2
91o3 Mini HighOpenAI65.7
92MiniMax M1MiniMax65.6
93GLM 4.5VZhipu AI64.2
94gpt-oss-120bOpenAI64
95Gemma 2 27BGoogle63.9
96Qwen3 8BAlibaba63.3
97Mercury 2Inception63.2
98MiniMax M2MiniMax63.2
99GPT-5 NanoOpenAI62.1
100Nova 2 LiteAmazon61.8
101GPT-4.1 NanoOpenAI59.8
102GPT-4o-mini (2024-07-18)OpenAI59.2
103gpt-oss-20bOpenAI59.2
104Mistral Large 2407Mistral AI58.7
105Granite 4.1 8BIBM57.5
106Olmo 3 32B ThinkAllen AI57.4
107GPT-4OpenAI53.1
108Command ACohere51.1
109Claude 3 HaikuAnthropic51.1
110Command R+ (08-2024)Cohere49.6
111Llama 3.1 8B InstructMeta44.1
112Llama 3.2 3B InstructMeta37.7
113Llama 3.2 1B InstructMeta29.9

评分计算方式

每个模型的评分是其可用基准测试结果的加权平均值。当模型缺少某些基准测试时,权重会在可用的基准测试之间重新归一化。 所有评分均为0-100的刻度。数据来源于官方模型卡片、已发表论文和第三方评估平台。

Frequently Asked Questions

根据我们的基准测试分析,OpenAI的GPT-5.4目前在Multilingual领域排名第一,加权评分为95.4/100。

模型使用MMLU、Arena Elo基准测试分数的加权平均进行排名。所有分数均归一化到0-100的刻度。

我们目前对113个拥有相关基准测试数据的模型进行了Multilingual任务排名。

Best AI Models for Multilingual Tasks (2026) | LM Market Cap