Skip to content

最佳指令遵循AI模型

使用IFEval基准测试对AI模型的指令遵循准确性进行排名。

Last updated: 26m ago
第一名模型

GPT-5.4

评分: 93.5

平均评分

86.6

所有排名模型

已排名模型

34

有基准测试数据

权重:IFEval (100%)

Top Best for Instructions Models by Weighted Score

Top 15 models by weighted score

LMMarketCap.com
#模型评分
1GPT-5.4OpenAI93.5
2GPT-5.2OpenAI93
3Claude Opus 4.6Anthropic92.8
4GPT-5.1OpenAI92.5
5Llama 3.3 70B InstructMeta92.1
6GPT-5OpenAI92
7o3OpenAI92
8Claude Opus 4.5Anthropic91.5
9Gemini 3 Flash PreviewGoogle91
10Claude Sonnet 4.6Anthropic91
11Claude Sonnet 4Anthropic90.8
12Claude Opus 4Anthropic90.5
13Claude Sonnet 4.5Anthropic90.2
14o3 MiniOpenAI90.2
15o4 MiniOpenAI90
16DeepSeek V3 0324DeepSeek89
17GPT-4.1OpenAI88.2
18Llama 4 MaverickMeta88
19Gemini 2.5 ProGoogle87.2
20DeepSeek V3DeepSeek87.1
21Mistral LargeMistral AI86.5
22o1OpenAI86.5
23R1 0528DeepSeek85.5
24Gemini 2.5 FlashGoogle85.5
25GPT-4oOpenAI84.3
26Claude Haiku 4.5Anthropic84
27Llama 3.1 70B InstructMeta83.6
28R1DeepSeek83.3
29GPT-4o-miniOpenAI80.4
30Phi 4Microsoft80.1
31Command R7B (12-2024)Cohere77.1
32Qwen2.5 7B InstructAlibaba75.9
33Llama 3.1 8B InstructMeta72.1
34Llama 3.2 3B InstructMeta68.5

评分计算方式

每个模型的评分是其可用基准测试结果的加权平均值。当模型缺少某些基准测试时,权重会在可用的基准测试之间重新归一化。 所有评分均为0-100的刻度。数据来源于官方模型卡片、已发表论文和第三方评估平台。

Frequently Asked Questions

根据我们的基准测试分析,OpenAI的GPT-5.4目前在Instructions领域排名第一,加权评分为93.5/100。

模型使用IFEval基准测试分数的加权平均进行排名。所有分数均归一化到0-100的刻度。

我们目前对34个拥有相关基准测试数据的模型进行了Instructions任务排名。

Best AI Models for Instruction Following (2026) | LM Market Cap