模型稳定性报告
哪些AI模型随时间最为一致?本报告分析了 300 个被追踪模型的排名变化、状态分类和波动曲线,生成0到100的稳定性评分。
坚如磐石
79
一致
11
可变
70
波动
140
稳定性分类分布
服务商稳定性排名 (平均分)
最稳定模型
稳定性评分最高的前20个模型。这些模型保持一致的排名,波动性最小。
| # | 模型 | 评分 | 稳定性 | 24小时 | 7天 |
|---|---|---|---|---|---|
| 1 | Claude Fable 5Anthropic | 97.1 | 100 | 0 | 0 |
| 2 | Claude Fable 5 (batch)Anthropic | 97.1 | 100 | 0 | 0 |
| 3 | Claude Opus 4.8 (Fast)Anthropic | 95.1 | 100 | 0 | +1 |
| 4 | Claude Opus 4.8Anthropic | 95.1 | 100 | 0 | +1 |
| 5 | Claude Opus 4.8 (batch)Anthropic | 94.6 | 100 | 0 | -2 |
| 6 | GPT-5.5 Pro (batch)OpenAI | 92.7 | 100 | 0 | -3 |
| 7 | GPT-5.5 (batch)OpenAI | 92.7 | 100 | 0 | -3 |
| 8 | Gemini 3.1 Pro Preview (batch)Google | 92.2 | 100 | 0 | -3 |
| 9 | GPT-5.4 Pro (batch)OpenAI | 91.9 | 100 | 0 | -3 |
| 10 | GPT-5.4 (batch)OpenAI | 91.9 | 100 | 0 | -3 |
| 11 | Grok Build 0.1xAI | 40.0 | 100 | 0 | -3 |
| 12 | Perceptron Mk1perceptron | 40.0 | 100 | 0 | -3 |
| 13 | Ring-2.6-1Tinclusionai | 40.0 | 100 | 0 | -3 |
| 14 | GPT Chat LatestOpenAI | 40.0 | 100 | 0 | -3 |
| 15 | Nemotron 3 Nano Omni (free)NVIDIA | 40.0 | 100 | 0 | -3 |
| 16 | Anthropic Claude Haiku Latest~anthropic | 40.0 | 100 | 0 | -3 |
| 17 | OpenAI GPT Mini Latest~openai | 40.0 | 100 | 0 | -3 |
| 18 | Google Gemini Pro Latest~google | 40.0 | 100 | 0 | -3 |
| 19 | MoonshotAI Kimi Latest~moonshotai | 40.0 | 100 | 0 | -3 |
| 20 | Google Gemini Flash Latest~google | 40.0 | 100 | 0 | -3 |
最不稳定模型
稳定性评分最低的后20个模型。这些模型表现出显著的排名波动或不一致的状态。
| # | 模型 | 评分 | 稳定性 | 24小时 | 7天 |
|---|---|---|---|---|---|
| 1 | GPT-5.1-Codex-MiniOpenAI | 49.8 | 19 | -167 | -174 |
| 2 | GLM 4.5Zhipu AI | 73.6 | 19 | -13 | -23 |
| 3 | GLM 5Zhipu AI | 82.1 | 22 | +29 | +18 |
| 4 | GLM 4.6Zhipu AI | 73.6 | 23 | -14 | +12 |
| 5 | Qwen3.6 PlusAlibaba | 74.1 | 24 | +4 | -7 |
| 6 | R1DeepSeek | 74.2 | 24 | +4 | -7 |
| 7 | o1OpenAI | 74.4 | 24 | +4 | -8 |
| 8 | Claude Sonnet 4Anthropic | 74.4 | 24 | +4 | -8 |
| 9 | Gemini 2.5 FlashGoogle | 79.1 | 24 | -4 | -12 |
| 10 | Gemini 2.5 Flash LiteGoogle | 79.1 | 24 | -4 | -12 |
| 11 | R1 0528DeepSeek | 79.4 | 24 | -4 | -12 |
| 12 | Muse Spark 1.2meta | 80.2 | 24 | -4 | +138 |
| 13 | DeepSeek V3.2DeepSeek | 81.3 | 24 | -4 | -12 |
| 14 | o4 MiniOpenAI | 81.4 | 24 | -4 | -12 |
| 15 | Claude Opus 4Anthropic | 82.1 | 24 | -4 | -12 |
| 16 | Claude Opus 4.1Anthropic | 82.1 | 25 | -4 | +40 |
| 17 | Qwen3.7 MaxAlibaba | 74.8 | 25 | +4 | +135 |
| 18 | Qwen3.5 397B A17BAlibaba | 79.4 | 26 | -4 | -12 |
| 19 | Qwen3.5 Plus 2026-04-20Alibaba | 74.8 | 27 | +4 | +147 |
| 20 | GLM 5 TurboZhipu AI | 82.1 | 27 | +28 | +67 |
各服务商稳定性
各服务商的汇总稳定性指标。服务商按所有模型的平均稳定性评分排名。
| 提供商 | 模型 | 平均稳定性 |
|---|---|---|
| perceptron | 1 | 100.0 |
| ~openai | 2 | 100.0 |
| 2 | 100.0 | |
| ~moonshotai | 1 | 100.0 |
| Writer | 1 | 100.0 |
| Upstage | 1 | 99.7 |
| ~anthropic | 4 | 99.5 |
| rekaai | 1 | 98.3 |
| sakana | 1 | 98.0 |
| Kuaishou | 3 | 96.7 |
| aion-labs | 3 | 96.5 |
| NVIDIA | 9 | 96.3 |
| poolside | 4 | 95.0 |
| Meituan | 1 | 95.0 |
| ~x-ai | 1 | 95.0 |
| inclusionai | 5 | 91.8 |
| ByteDance | 4 | 85.5 |
| StepFun | 2 | 69.7 |
| xAI | 5 | 67.4 |
| Anthropic | 28 | 64.8 |
| ~deepseek | 1 | 64.0 |
| TII | 3 | 64.0 |
| OpenAI | 86 | 58.8 |
| DeepSeek | 12 | 55.4 |
| Cohere | 4 | 55.0 |
| Moonshot AI | 8 | 55.0 |
| Amazon | 1 | 54.1 |
| 27 | 53.6 | |
| Inception | 1 | 50.3 |
| Alibaba | 31 | 49.6 |
| Mistral AI | 6 | 48.6 |
| Tencent | 2 | 48.5 |
| MiniMax | 8 | 47.8 |
| IBM | 1 | 46.8 |
| thinkingmachines | 3 | 46.7 |
| Allen AI | 1 | 43.1 |
| Xiaomi | 2 | 42.5 |
| arcee-ai | 1 | 41.7 |
| Meta | 5 | 40.5 |
| Cursor | 2 | 40.0 |
| Microsoft | 1 | 39.0 |
| Zhipu AI | 13 | 38.3 |
| meta | 2 | 33.6 |
稳定性分布
所有 300 个被追踪模型的稳定性评分分布。
什么让模型保持稳定?
我们的稳定性评分系统使用三个关键信号来衡量模型随时间的一致性表现。
排名一致性
稳定性的最直接衡量标准。模型因24小时内较大的排名变化最多失去25分(每移动一个排名位置扣5分),7天变化最多失去21分(每个位置扣3分)。排名保持稳定的模型得分更高。
状态分类
每个模型都有一个反映其整体可靠性的状态。处于"稳定"状态的模型获得10分加分,而"脆弱"模型被扣15分。这捕捉了超越简单排名变动的系统性可靠性。
波动曲线
14天的波动曲线数据揭示了隐藏的波动性。我们计算波动曲线的标准差并最多减去20分。即使最终回到起点的模型,如果中间剧烈波动也会被扣分。
相关
The stability score starts at 100 and is reduced based on three factors: 24-hour rank changes (up to -25 points, at 5 per position moved), 7-day rank changes (up to -21 points, at 3 per position), and sparkline volatility measured by standard deviation (up to -20 points). Models in a "stable" state get a +10 bonus, while "fragile" models lose 15 points.
Models are classified into four tiers based on their stability score: "Rock Solid" (85-100) means extremely consistent performance with minimal fluctuation. "Consistent" (70-84) means generally reliable with minor variations. "Variable" (50-69) shows noticeable ranking fluctuations. "Volatile" (below 50) indicates significant instability and unpredictable performance.
Stability indicates how predictably a model will perform over time. A highly rated but volatile model may deliver inconsistent results, which is problematic for production applications requiring reliable output quality. Stable models provide more predictable performance, making them safer choices for mission-critical workloads even if they do not always hold the top rank.