Skip to content

最佳角色扮演AI模型

使用Arena Elo评分(归一化到0-100刻度)对AI模型的角色扮演和创意对话质量进行排名。

Last updated: 25m ago
第一名模型

Claude Fable 5

评分: 100

平均评分

81.4

所有排名模型

已排名模型

110

有基准测试数据

权重:Arena Elo (100%)

Top Best for Roleplay Models by Weighted Score

Top 15 models by weighted score

LMMarketCap.com
#模型评分
1Claude Fable 5Anthropic100
2Claude Opus 4.6Anthropic100
3Qwen3.8 MaxAlibaba99.5
4Gemini 3.1 Pro PreviewGoogle99
5Claude Opus 4.7Anthropic98.5
6Muse Spark 1.1meta97.8
7Gemini 3.6 FlashGoogle97.5
8GPT-5.4OpenAI97.5
9GPT-5.2OpenAI96.8
10Claude Opus 4.8Anthropic96.5
11Gemini 3.5 FlashGoogle96.2
12GPT-5.2 ChatOpenAI96
13GPT-5.5OpenAI95.8
14GPT-5.1OpenAI95.8
15Gemini 3 Flash PreviewGoogle95.7
16Grok 4.5xAI94.7
17GLM 5.1Zhipu AI94.7
18MiMo-V2.5-ProXiaomi94.5
19GPT-5OpenAI94.2
20DeepSeek V4 ProDeepSeek93.8
21Kimi K2.6Moonshot AI93.5
22Claude Sonnet 4.6Anthropic93.3
23Qwen3.6 Max PreviewAlibaba93.3
24Gemini 3.5 Flash LiteGoogle93.2
25Qwen3.7 PlusAlibaba93
26GLM 5Zhipu AI92.8
27Hy3Tencent92.2
28Claude Sonnet 4.5Anthropic92
29Gemma 4 31BGoogle91.8
30Claude Opus 4.1Anthropic91.5
31MiniMax M3MiniMax90.8
32Gemini 2.5 ProGoogle90.7
33Qwen3.6 PlusAlibaba90.5
34Qwen3.5 397B A17BAlibaba90.3
35GLM 4.7Zhipu AI90.3
36Inklingthinkingmachines90.3
37Gemma 4 26B A4B Google89.7
38MiMo-V2.5Xiaomi89
39GLM 5V TurboZhipu AI88.8
40Gemini 3.1 Flash Lite PreviewGoogle88.7
41Inkling Smallthinkingmachines88.5
42Claude Opus 4.5Anthropic88.3
43Mistral Medium 3.5Mistral AI87.8
44DeepSeek V3.2DeepSeek87.5
45GLM 4.6Zhipu AI87.5
46DeepSeek V3.2 ExpDeepSeek87.2
47Claude Opus 4Anthropic86.7
48DeepSeek V3.1DeepSeek86.3
49Qwen3.5-122B-A10BAlibaba86.2
50MiniMax M2.7MiniMax86
51o3OpenAI85.8
52Qwen3 VL 235B A22B InstructAlibaba85.8
53DeepSeek V3.1 TerminusDeepSeek85.8
54Hy3 previewTencent85.3
55GLM 4.5Zhipu AI85.2
56Qwen3.5-27BAlibaba84.7
57Qwen3 Next 80B A3B InstructAlibaba83.5
58Qwen3.5-FlashAlibaba82.8
59Gemini 2.5 FlashGoogle82.5
60Qwen3 VL 235B A22B ThinkingAlibaba82.5
61Qwen3.5-35B-A3BAlibaba82.5
62Step 3.5 FlashStepFun82.3
63GPT-5 MiniOpenAI81.7
64MiniMax M2.5MiniMax81.7
65Claude Sonnet 4Anthropic81.2
66GPT-4.1 MiniOpenAI80.5
67R1 0528DeepSeek80
68o4 MiniOpenAI80
69GLM 4.6VZhipu AI79.5
70GLM 4.5 AirZhipu AI78.8
71o3 MiniOpenAI78.5
72R1DeepSeek78.2
73Qwen3 Next 80B A3B ThinkingAlibaba78.2
74Trinity Large Thinkingarcee-ai78.2
75GLM 4.7 FlashZhipu AI78
76MiniMax M1MiniMax77.3
77o3 Mini HighOpenAI77.3
78GLM 4.5VZhipu AI75.7
79gpt-oss-120bOpenAI75.3
80o1OpenAI75
81Qwen3 8BAlibaba74.5
82Mercury 2Inception74.5
83MiniMax M2MiniMax74.3
84DeepSeek V3 0324DeepSeek74.2
85GPT-5 NanoOpenAI72.8
86Nova 2 LiteAmazon72.8
87Llama 4 MaverickMeta70.8
88GPT-4.1 NanoOpenAI70.3
89DeepSeek V3DeepSeek69.7
90GPT-4o-mini (2024-07-18)OpenAI69.7
91gpt-oss-20bOpenAI69.5
92Mistral Large 2407Mistral AI69
93Granite 4.1 8BIBM67.7
94Olmo 3 32B ThinkAllen AI67.5
95GPT-4.1OpenAI66.7
96GPT-4oOpenAI64.3
97Mistral LargeMistral AI63.3
98GPT-4OpenAI62.5
99Command ACohere60.2
100Claude 3 HaikuAnthropic60.2
101Phi 4Microsoft59.3
102GPT-4 TurboOpenAI59.2
103Command R+ (08-2024)Cohere58.3
104Llama 3.3 70B InstructMeta57.2
105Claude Haiku 4.5Anthropic56.7
106GPT-4o-miniOpenAI53.7
107Llama 3.1 8B InstructMeta51.8
108Llama 3.1 70B InstructMeta49.7
109Llama 3.2 3B InstructMeta44.3
110Llama 3.2 1B InstructMeta35.2

评分计算方式

每个模型的评分是其可用基准测试结果的加权平均值。当模型缺少某些基准测试时,权重会在可用的基准测试之间重新归一化。 所有评分均为0-100的刻度。数据来源于官方模型卡片、已发表论文和第三方评估平台。

Frequently Asked Questions

根据我们的基准测试分析,Anthropic的Claude Fable 5目前在Roleplay领域排名第一,加权评分为100/100。

模型使用Arena Elo基准测试分数的加权平均进行排名。所有分数均归一化到0-100的刻度。

我们目前对110个拥有相关基准测试数据的模型进行了Roleplay任务排名。

Best AI Models for Roleplay (2026) | LM Market Cap