Skip to content

最佳数学AI模型

使用MATH-500、GSM8K和AIME 2024基准测试分数对AI模型的数学推理能力进行排名。

Last updated: 29m ago
第一名模型

o3

评分: 88.2

平均评分

72.1

所有排名模型

已排名模型

34

有基准测试数据

权重:MATH-500 (40%)GSM8K (30%)AIME 2024 (30%)

Top Best for Math Models by Weighted Score

Top 15 models by weighted score

LMMarketCap.com

Benchmark Breakdown

Per-benchmark scores for top 10 models

MATH-500
GSM8K
AIME 2024
LMMarketCap.com
#模型评分
1o3OpenAI88.2
2o4 MiniOpenAI86.1
3Gemini 2.5 ProGoogle84.4
4o3 MiniOpenAI84
5R1 0528DeepSeek82.7
6o1OpenAI81.7
7R1DeepSeek80.8
8Gemini 2.5 FlashGoogle78.1
9DeepSeek V3DeepSeek76.9
10Claude Opus 4.6Anthropic76.6
11GPT-5.4OpenAI76.4
12GPT-4oOpenAI76.3
13GPT-5.2OpenAI75.2
14GPT-5.1OpenAI74.8
15GPT-5OpenAI74
16GPT-4 TurboOpenAI73.7
17DeepSeek V3 0324DeepSeek73.6
18Claude Opus 4.5Anthropic73.1
19GPT-4o-miniOpenAI72.1
20Llama 3.1 70B InstructMeta71.7
21Gemma 4 31BGoogle71.4
22Claude Opus 4Anthropic70.5
23Gemini 3 Flash PreviewGoogle70.4
24Claude Sonnet 4.6Anthropic68.9
25Gemma 2 27BGoogle68.2
26Claude Sonnet 4.5Anthropic65.8
27Llama 4 MaverickMeta64.8
28Phi 4Microsoft64.3
29Claude Sonnet 4Anthropic64.2
30GPT-4.1OpenAI62.8
31Llama 3.3 70B InstructMeta61.6
32Mistral LargeMistral AI60.8
33Claude Haiku 4.5Anthropic58
34Llama 4 ScoutMeta40.2

评分计算方式

每个模型的评分是其可用基准测试结果的加权平均值。当模型缺少某些基准测试时,权重会在可用的基准测试之间重新归一化。 所有评分均为0-100的刻度。数据来源于官方模型卡片、已发表论文和第三方评估平台。

Frequently Asked Questions

根据我们的基准测试分析,OpenAI的o3目前在Math领域排名第一,加权评分为88.2/100。

模型使用MATH-500、GSM8K、AIME 2024基准测试分数的加权平均进行排名。所有分数均归一化到0-100的刻度。

我们目前对34个拥有相关基准测试数据的模型进行了Math任务排名。

Best AI Models for Math (2026) | LM Market Cap