Skip to content

最佳编程AI模型

使用SWE-bench Verified、HumanEval和BigCodeBench评分对AI模型的编程能力进行排名。未进行基准测试的模型使用Arena Elo回退。

Last updated: 33m ago
第一名模型

Claude Opus 4.6

评分: 83.9

平均评分

58.8

所有排名模型

已排名模型

114

有基准测试数据

权重:SWE-bench Verified (40%)HumanEval (30%)BigCodeBench (30%)备选: Arena Elo

Top Best for Coding Models by Weighted Score

Top 15 models by weighted score

LMMarketCap.com

Benchmark Breakdown

Per-benchmark scores for top 10 models

SWE-bench Verified
HumanEval
BigCodeBench
LMMarketCap.com
#模型评分
1Claude Opus 4.6Anthropic83.9
2Claude Sonnet 4.6Anthropic80.9
3GPT-5.4OpenAI78.7
4Claude Opus 4.5Anthropic78.3
5GPT-5.2OpenAI77.5
6GPT-5.1OpenAI76.7
7Claude Sonnet 4.5Anthropic76.2
8Claude Fable 5Anthropic76
9GPT-5OpenAI75.8
10Gemini 3 Flash PreviewGoogle75.6
11o3OpenAI74.3
12Claude Haiku 4.5Anthropic71.8
13o4 MiniOpenAI71.7
14GPT-5.5OpenAI71
15GPT-5.5 ProOpenAI71
16Claude Opus 4.8Anthropic70.9
17Claude Opus 4.7Anthropic70.1
18GPT-4o-miniOpenAI69.8
19Claude Sonnet 4Anthropic66.9
20Gemini 2.5 FlashGoogle65.8
21Gemini 3.1 Pro PreviewGoogle64.5
22Llama 4 MaverickMeta62.6
23GPT-4 TurboOpenAI60.9
24Llama 3.3 70B InstructMeta60.9
25GPT-4OpenAI60.5
26Muse Spark 1.1(回退)meta60
27MiMo-V2.6-Pro(回退)Xiaomi60
28GPT-5.2 Chat(回退)OpenAI60
29GLM 5.3 Flash(回退)Zhipu AI60
30MiMo-V2.5-Pro(回退)Xiaomi60
31Grok 4.5(回退)xAI60
32GLM 5.1(回退)Zhipu AI60
33Kimi K2.6(回退)Moonshot AI60
34Qwen3.6 Max Preview(回退)Alibaba60
35GLM 5(回退)Zhipu AI60
36Hy3(回退)Tencent60
37Gemini 3.5 Flash Lite(回退)Google60
38Qwen3.7 Plus(回退)Alibaba60
39MiMo-V2.6-Flash(回退)Xiaomi60
40Gemma 4 31B(回退)Google60
41Claude Opus 4.1(回退)Anthropic60
42Qwen3.6 Plus(回退)Alibaba60
43Inkling(回退)thinkingmachines60
44Qwen3.5 397B A17B(回退)Alibaba60
45GLM 4.7(回退)Zhipu AI60
46MiniMax M3(回退)MiniMax60
47Qwen3.8 27B(回退)Alibaba60
48Gemma 4 26B A4B (回退)Google60
49MiMo-V2.5(回退)Xiaomi60
50GLM 5V Turbo(回退)Zhipu AI60
51Gemini 3.1 Flash Lite Preview(回退)Google60
52Mistral Medium 3.5(回退)Mistral AI60
53DeepSeek V3.2(回退)DeepSeek60
54GLM 4.6(回退)Zhipu AI60
55DeepSeek V3.2 Exp(回退)DeepSeek60
56DeepSeek V3.1(回退)DeepSeek60
57Qwen3.5-122B-A10B(回退)Alibaba60
58MiniMax M2.7(回退)MiniMax60
59DeepSeek V3.1 Terminus(回退)DeepSeek60
60Qwen3 VL 235B A22B Instruct(回退)Alibaba60
61GLM 4.5(回退)Zhipu AI60
62Hy3 preview(回退)Tencent60
63Qwen3.5-27B(回退)Alibaba60
64Inkling Small(回退)thinkingmachines60
65Qwen3 Next 80B A3B Instruct(回退)Alibaba60
66Qwen3.5-Flash(回退)Alibaba60
67Qwen3 VL 235B A22B Thinking(回退)Alibaba60
68Qwen3.5-35B-A3B(回退)Alibaba60
69Step 3.5 Flash(回退)StepFun60
70MiniMax M2.5(回退)MiniMax60
71GPT-5 Mini(回退)OpenAI60
72GLM 4.6V(回退)Zhipu AI60
73GLM 4.5 Air(回退)Zhipu AI60
74Qwen3 Next 80B A3B Thinking(回退)Alibaba60
75Trinity Large Thinking(回退)arcee-ai60
76GLM 4.7 Flash(回退)Zhipu AI60
77MiniMax M1(回退)MiniMax60
78o3 Mini High(回退)OpenAI60
79Command A(回退)Cohere60
80GLM 4.5V(回退)Zhipu AI60
81gpt-oss-120b(回退)OpenAI60
82Qwen3 8B(回退)Alibaba60
83MiniMax M2(回退)MiniMax60
84Mercury 2(回退)Inception60
85GPT-5 Nano(回退)OpenAI60
86Nova 2 Lite(回退)Amazon60
87gpt-oss-20b(回退)OpenAI60
88Mistral Large 2407(回退)Mistral AI60
89Granite 4.2 8B(回退)IBM60
90Gemini 3.5 Flash(回退)Google60
91GPT-4.1OpenAI58.8
92Phi 4Microsoft57.6
93Llama 3.1 70B InstructMeta57
94o1OpenAI57
95DeepSeek V3DeepSeek56.6
96Gemma 2 27BGoogle55.6
97Mistral LargeMistral AI54.9
98GPT-4oOpenAI54.7
99DeepSeek V3 0324DeepSeek50.5
100R1 0528DeepSeek46.1
101Llama 3.1 8B InstructMeta46
102Gemini 2.5 ProGoogle44.3
103Llama 4 ScoutMeta40.9
104GPT-4.1 MiniOpenAI39.1
105GPT-4o (2024-11-20)OpenAI38.4
106o3 MiniOpenAI38.1
107GPT-4o-mini (2024-07-18)OpenAI36.9
108R1DeepSeek36.8
109Qwen2.5 7B InstructAlibaba30.1
110Command R+ (08-2024)Cohere29.7
111R1 Distill Llama 70BDeepSeek28.2
112GPT-4.1 NanoOpenAI22.7
113Llama 3.2 3B InstructMeta18.7
114Llama 3.2 1B InstructMeta6.6

评分计算方式

每个模型的评分是其可用基准测试结果的加权平均值。当模型缺少某些基准测试时,权重会在可用的基准测试之间重新归一化。 没有任何主要基准测试数据的模型将回退到Arena Elo(归一化到0-100)并相应标记。 所有评分均为0-100的刻度。数据来源于官方模型卡片、已发表论文和第三方评估平台。

Frequently Asked Questions

根据我们的基准测试分析,Anthropic的Claude Opus 4.6目前在Coding领域排名第一,加权评分为83.9/100。

模型使用SWE-bench Verified、HumanEval、BigCodeBench基准测试分数的加权平均进行排名。没有主要基准测试数据的模型会回退到Arena Elo。所有分数均归一化到0-100的刻度。

我们目前对114个拥有相关基准测试数据的模型进行了Coding任务排名。

Best AI Models for Coding (2026) | LM Market Cap