Skip to content

最佳多语言AI模型

使用跨语言MMLU基准测试分数对AI模型的多语言性能进行排名。找到翻译和非英语任务的最佳LLM。

Last updated: 36m ago
第一名模型

GPT-5.4

评分: 95.4

平均评分

74.5

所有排名模型

已排名模型

110

有基准测试数据

权重:MMLU (60%)Arena Elo (40%)

Top Best for Multilingual Models by Weighted Score

Top 15 models by weighted score

LMMarketCap.com

Benchmark Breakdown

Per-benchmark scores for top 10 models

MMLU
Arena Elo
LMMarketCap.com
#模型评分
1GPT-5.4OpenAI95.4
2Claude Opus 4.6Anthropic95.3
3Gemini 3.1 Pro PreviewGoogle95.2
4GPT-5.2OpenAI94.8
5GPT-5.1OpenAI94.3
6GPT-5.5OpenAI93.8
7GPT-5OpenAI93.5
8Claude Sonnet 4.6Anthropic92.1
9Claude Sonnet 4.5Anthropic91.3
10Gemini 3 Flash PreviewGoogle91.1
11Gemini 2.5 ProGoogle90.7
12Claude Opus 4.5Anthropic90.2
13o3OpenAI89.7
14DeepSeek V3.2DeepSeek88.1
15R1 0528DeepSeek86.9
16Claude Sonnet 4Anthropic86.2
17R1DeepSeek85.7
18o1OpenAI85.1
19Gemini 2.5 FlashGoogle84.5
20Claude Opus 4.7Anthropic83.7
21Muse Spark 1.1meta83.7
22o3 MiniOpenAI83.5
23DeepSeek V3 0324DeepSeek83.2
24MiMo-V2.6-ProXiaomi82.2
25Claude Opus 4.8Anthropic82
26Gemini 3.5 FlashGoogle81.7
27GPT-5.2 ChatOpenAI81.6
28GLM 5.3 FlashZhipu AI81.3
29Llama 4 MaverickMeta81.1
30DeepSeek V3DeepSeek81
31MiMo-V2.5-ProXiaomi80.3
32GPT-4.1OpenAI80.2
33Grok 4.5xAI80
34GLM 5.1Zhipu AI80
35Kimi K2.6Moonshot AI79.5
36Qwen3.6 Max PreviewAlibaba79.3
37GPT-4oOpenAI79
38GLM 5Zhipu AI78.9
39Hy3Tencent78.9
40Gemini 3.5 Flash LiteGoogle78.8
41Qwen3.7 PlusAlibaba78.8
42MiMo-V2.6-FlashXiaomi78.5
43GPT-5.5 ProOpenAI78.5
44Gemma 4 31BGoogle78.3
45Claude Opus 4.1Anthropic77.9
46Qwen3.6 PlusAlibaba76.9
47Inklingthinkingmachines76.8
48Qwen3.5 397B A17BAlibaba76.8
49GLM 4.7Zhipu AI76.6
50MiniMax M3MiniMax76.5
51Qwen3.8 27BAlibaba76.2
52Gemma 4 26B A4B Google76.2
53Mistral LargeMistral AI76.2
54MiMo-V2.5Xiaomi75.6
55GPT-4 TurboOpenAI75.6
56GLM 5V TurboZhipu AI75.5
57Gemini 3.1 Flash Lite PreviewGoogle75.5
58Phi 4Microsoft74.6
59Llama 3.3 70B InstructMeta74.6
60Mistral Medium 3.5Mistral AI74.5
61GLM 4.6Zhipu AI74.2
62DeepSeek V3.2 ExpDeepSeek74
63Claude Haiku 4.5Anthropic73.4
64DeepSeek V3.1DeepSeek73.2
65Qwen3.5-122B-A10BAlibaba73.1
66MiniMax M2.7MiniMax73
67DeepSeek V3.1 TerminusDeepSeek73
68Qwen3 VL 235B A22B InstructAlibaba72.7
69GLM 4.5Zhipu AI72.4
70Hy3 previewTencent72.1
71Qwen3.5-27BAlibaba72.1
72Inkling Smallthinkingmachines71.5
73Llama 3.1 70B InstructMeta71.5
74Qwen3 Next 80B A3B InstructAlibaba70.7
75GPT-4o-miniOpenAI70.7
76Qwen3.5-FlashAlibaba70.3
77Qwen3 VL 235B A22B ThinkingAlibaba70.1
78Qwen3.5-35B-A3BAlibaba70
79Step 3.5 FlashStepFun69.8
80MiniMax M2.5MiniMax69.6
81GPT-5 MiniOpenAI69.4
82GPT-4.1 MiniOpenAI68.4
83o4 MiniOpenAI68
84GLM 4.6VZhipu AI67.9
85Llama 4 ScoutMeta67.7
86GLM 4.5 AirZhipu AI67
87Qwen3 Next 80B A3B ThinkingAlibaba66.4
88Trinity Large Thinkingarcee-ai66.3
89GLM 4.7 FlashZhipu AI65.9
90MiniMax M1MiniMax65.7
91o3 Mini HighOpenAI65.7
92GLM 4.5VZhipu AI64
93gpt-oss-120bOpenAI64
94Gemma 2 27BGoogle63.9
95Qwen3 8BAlibaba63.3
96MiniMax M2MiniMax62.8
97Mercury 2Inception62.8
98GPT-5 NanoOpenAI62.1
99Nova 2 LiteAmazon61.6
100GPT-4.1 NanoOpenAI59.8
101GPT-4o-mini (2024-07-18)OpenAI59.2
102gpt-oss-20bOpenAI59.2
103Mistral Large 2407Mistral AI58.7
104Granite 4.2 8BIBM55.1
105GPT-4OpenAI53.3
106Command ACohere51.1
107Command R+ (08-2024)Cohere49.6
108Llama 3.1 8B InstructMeta44.1
109Llama 3.2 3B InstructMeta37.8
110Llama 3.2 1B InstructMeta29.9

评分计算方式

每个模型的评分是其可用基准测试结果的加权平均值。当模型缺少某些基准测试时,权重会在可用的基准测试之间重新归一化。 所有评分均为0-100的刻度。数据来源于官方模型卡片、已发表论文和第三方评估平台。

Frequently Asked Questions

根据我们的基准测试分析,OpenAI的GPT-5.4目前在Multilingual领域排名第一,加权评分为95.4/100。

模型使用MMLU、Arena Elo基准测试分数的加权平均进行排名。所有分数均归一化到0-100的刻度。

我们目前对110个拥有相关基准测试数据的模型进行了Multilingual任务排名。

Best AI Models for Multilingual Tasks (2026) | LM Market Cap