Skip to content

最佳编程AI模型

使用SWE-bench Verified、HumanEval和BigCodeBench评分对AI模型的编程能力进行排名。未进行基准测试的模型使用Arena Elo回退。

Last updated: 12m ago
第一名模型

Claude Opus 4.6

评分: 83.9

平均评分

57.4

所有排名模型

已排名模型

118

有基准测试数据

权重:SWE-bench Verified (40%)HumanEval (30%)BigCodeBench (30%)备选: Arena Elo

Top Best for Coding Models by Weighted Score

Top 15 models by weighted score

LMMarketCap.com

Benchmark Breakdown

Per-benchmark scores for top 10 models

SWE-bench Verified
HumanEval
BigCodeBench
LMMarketCap.com
#模型评分
1Claude Opus 4.6Anthropic83.9
2Claude Sonnet 4.6Anthropic80.9
3GPT-5.4OpenAI78.7
4Claude Opus 4.5Anthropic78.3
5GPT-5.2OpenAI77.5
6GPT-5.1OpenAI76.7
7Claude Sonnet 4.5Anthropic76.2
8Claude Fable 5Anthropic76
9GPT-5OpenAI75.8
10Gemini 3 Flash PreviewGoogle75.6
11o3OpenAI74.3
12Claude Opus 4Anthropic73.9
13o4 MiniOpenAI71.7
14GPT-5.5OpenAI71
15GPT-5.5 ProOpenAI71
16Claude Opus 4.8Anthropic70.9
17Claude Opus 4.7Anthropic70.1
18GPT-4o-miniOpenAI69.8
19Claude Haiku 4.5Anthropic68.9
20Claude Sonnet 4Anthropic66.9
21Gemini 2.5 FlashGoogle65.8
22Gemini 3.1 Pro PreviewGoogle64.5
23DeepSeek V4 ProDeepSeek64.5
24GPT-4 TurboOpenAI60.9
25Llama 3.3 70B InstructMeta60.9
26MiniMax M2.5MiniMax60.6
27GPT-4OpenAI60.5
28Qwen3.8 Max(回退)Alibaba60
29Muse Spark 1.1(回退)meta60
30Gemini 3.6 Flash(回退)Google60
31GPT-5.2 Chat(回退)OpenAI60
32Grok 4.5(回退)xAI60
33MiMo-V2.5-Pro(回退)Xiaomi60
34GLM 5.1(回退)Zhipu AI60
35Kimi K2.6(回退)Moonshot AI60
36Qwen3.6 Max Preview(回退)Alibaba60
37Gemini 3.5 Flash Lite(回退)Google60
38Qwen3.7 Plus(回退)Alibaba60
39Hy3(回退)Tencent60
40Gemma 4 31B(回退)Google60
41Claude Opus 4.1(回退)Anthropic60
42Qwen3.6 Plus(回退)Alibaba60
43MiniMax M3(回退)MiniMax60
44Inkling(回退)thinkingmachines60
45Qwen3.5 397B A17B(回退)Alibaba60
46GLM 4.7(回退)Zhipu AI60
47Gemma 4 26B A4B (回退)Google60
48MiMo-V2.5(回退)Xiaomi60
49GLM 5V Turbo(回退)Zhipu AI60
50Gemini 3.1 Flash Lite Preview(回退)Google60
51Mistral Medium 3.5(回退)Mistral AI60
52DeepSeek V3.2 Exp(回退)DeepSeek60
53DeepSeek V3.1(回退)DeepSeek60
54Qwen3.5-122B-A10B(回退)Alibaba60
55MiniMax M2.7(回退)MiniMax60
56DeepSeek V3.1 Terminus(回退)DeepSeek60
57Qwen3 VL 235B A22B Instruct(回退)Alibaba60
58Hy3 preview(回退)Tencent60
59Qwen3.5-27B(回退)Alibaba60
60Qwen3 Next 80B A3B Instruct(回退)Alibaba60
61Qwen3.5-Flash(回退)Alibaba60
62Qwen3.5-35B-A3B(回退)Alibaba60
63Qwen3 VL 235B A22B Thinking(回退)Alibaba60
64Step 3.5 Flash(回退)StepFun60
65GLM 4.6V(回退)Zhipu AI60
66GLM 4.5 Air(回退)Zhipu AI60
67Qwen3 Next 80B A3B Thinking(回退)Alibaba60
68Trinity Large Thinking(回退)arcee-ai60
69GLM 4.7 Flash(回退)Zhipu AI60
70o3 Mini High(回退)OpenAI60
71MiniMax M1(回退)MiniMax60
72Command A(回退)Cohere60
73GLM 4.5V(回退)Zhipu AI60
74Qwen3 8B(回退)Alibaba60
75Mercury 2(回退)Inception60
76Nova 2 Lite(回退)Amazon60
77gpt-oss-20b(回退)OpenAI60
78Mistral Large 2407(回退)Mistral AI60
79Granite 4.1 8B(回退)IBM60
80Olmo 3 32B Think(回退)Allen AI60
81Inkling Small(回退)thinkingmachines60
82Gemini 3.5 Flash(回退)Google60
83GPT-4.1OpenAI58.8
84GLM 5Zhipu AI58.2
85GPT-5.2-CodexOpenAI58.2
86Phi 4Microsoft57.6
87Llama 3.1 70B InstructMeta57
88o1OpenAI57
89DeepSeek V3DeepSeek56.6
90DeepSeek V3.2DeepSeek56
91Gemma 2 27BGoogle55.6
92Mistral LargeMistral AI54.9
93GPT-4oOpenAI54.7
94GPT-5.1-CodexOpenAI52.8
95Claude 3 HaikuAnthropic52.3
96DeepSeek V3 0324DeepSeek50.5
97Llama 4 MaverickMeta50.2
98MiniMax M2MiniMax48.8
99GPT-5 MiniOpenAI47.8
100R1 0528DeepSeek46.1
101Llama 3.1 8B InstructMeta46
102Gemini 2.5 ProGoogle44.3
103GLM 4.6Zhipu AI44.3
104GLM 4.5Zhipu AI43.4
105GPT-4o (2024-11-20)OpenAI38.4
106o3 MiniOpenAI38.1
107GPT-4o-mini (2024-07-18)OpenAI36.9
108R1DeepSeek36.8
109GPT-4.1 MiniOpenAI31.2
110Llama 4 ScoutMeta30.9
111Qwen2.5 7B InstructAlibaba30.1
112Command R+ (08-2024)Cohere29.7
113R1 Distill Llama 70BDeepSeek28.2
114GPT-5 NanoOpenAI27.8
115GPT-4.1 NanoOpenAI22.7
116gpt-oss-120bOpenAI20.8
117Llama 3.2 3B InstructMeta18.7
118Llama 3.2 1B InstructMeta6.6

评分计算方式

每个模型的评分是其可用基准测试结果的加权平均值。当模型缺少某些基准测试时,权重会在可用的基准测试之间重新归一化。 没有任何主要基准测试数据的模型将回退到Arena Elo(归一化到0-100)并相应标记。 所有评分均为0-100的刻度。数据来源于官方模型卡片、已发表论文和第三方评估平台。

Frequently Asked Questions

根据我们的基准测试分析,Anthropic的Claude Opus 4.6目前在Coding领域排名第一,加权评分为83.9/100。

模型使用SWE-bench Verified、HumanEval、BigCodeBench基准测试分数的加权平均进行排名。没有主要基准测试数据的模型会回退到Arena Elo。所有分数均归一化到0-100的刻度。

我们目前对118个拥有相关基准测试数据的模型进行了Coding任务排名。

Best AI Models for Coding (2026) | LM Market Cap