变化显著性追踪器
并非所有排名变化都有意义,有些只是随机噪音。此页面使用统计分析来判断哪些模型评分变动是真实趋势,哪些只是正常波动。
已分析模型
228
显著变化
7
噪音 (不显著)
221
双时间维度
0
这意味着什么
- 7 / 228 个模型的评分变化具有统计显著性--这些是真实的性能变化,不是随机噪音。
- 221 个模型的评分变化在正常波动范围内--不要过度解读这些模型的小幅排名变化。
- 使用方法:当模型排名发生变化时,先查看此页面。如果未标记为显著,则变化很可能是暂时的噪音。如果确实显著,则模型正在真正地改善或下降。
最显著变化 (按|Z分数|)
真实性能变化
7 个模型的近期评分偏离其历史平均值足以被认为是真实变化(非噪音)。按变化极端程度排序。Z分数衡量变化的异常程度--超过±1.96表示有95%的概率该变化是真实的。
| 模型 | 当前 | Z分数 | 方向 |
|---|---|---|---|
| Qwen3 30B A3B Instruct 2507Alibaba | 64.1 | 4.47 | 提升 |
| GLM 5.1Zhipu AI | 78.0 | 3.91 | 提升 |
| Qwen3.5 Plus 2026-04-20Alibaba | 74.8 | 3.74 | 提升 |
| Qwen3.7 MaxAlibaba | 74.8 | 3.32 | 提升 |
| GPT-4o (2024-11-20)OpenAI | 71.2 | 2.30 | 提升 |
| Claude Opus 4.7 (Fast)Anthropic | 95.1 | 2.24 | 提升 |
| Claude Sonnet 5Anthropic | 85.2 | 2.24 | 提升 |
短期变化 vs. 持续变化
24小时内的排名变化可能只是暂时的。但如果7天内也在变动,那就是真正的趋势。在两个时间维度上都被标记的模型最值得关注--它们代表已确认的持续性能变化。
在两个时间维度上均显著(最强信号)
目前没有模型在每日和每周时间维度上均显著。
仅每日(可能是噪音)
没有仅在每日维度上显著的模型。
仅每周(正在形成趋势)
哪些模型嘈杂、哪些模型稳定?
有些模型天然评分稳定--即使小幅排名变化也有意义。其他模型评分波动较大--需要更大的变化才值得关注。CV%(变异系数)告诉你每个模型的波动程度。越高 = 越嘈杂。
最不稳定模型(最高CV% - 最宽显著性阈值)
| 模型 | 评分 | CV% |
|---|---|---|
| Gemma 2 27BGoogle | 77.4 | 48.2% |
| Claude Opus 5 (Fast)Anthropic | 95.1 | 44.5% |
| Claude Opus 5Anthropic | 95.1 | 44.5% |
| Phi 4Microsoft | 60.2 | 43.5% |
| R1DeepSeek | 74.2 | 39.0% |
| Command ACohere | 50.8 | 36.2% |
| GPT-4OpenAI | 64.8 | 36.0% |
| Mixtral 8x22B InstructMistral AI | 63.4 | 35.5% |
| Claude Sonnet 5Anthropic | 85.2 | 35.4% |
| Llama 3.1 70B InstructMeta | 65.3 | 35.4% |
| Llama 3.3 70B InstructMeta | 66.8 | 35.1% |
| Mistral LargeMistral AI | 65.9 | 35.0% |
| MiniMax M2-herMiniMax | 69.1 | 34.9% |
| o3 MiniOpenAI | 75.3 | 33.9% |
| DeepSeek V3DeepSeek | 69.5 | 33.5% |
| GPT-4 Turbo PreviewOpenAI | 64.8 | 32.0% |
| Mistral Large 2407Mistral AI | 65.9 | 31.2% |
| GPT-4o (2024-05-13)OpenAI | 71.2 | 30.9% |
| GLM 5V TurboZhipu AI | 72.3 | 30.6% |
| GPT-4oOpenAI | 71.2 | 30.3% |
最稳定模型(最低CV% - 最窄显著性阈值)
| 模型 | 评分 | CV% |
|---|---|---|
| Laguna S 2.1poolside | 40.0 | 0.0% |
| Laguna S 2.1 (free)poolside | 40.0 | 0.0% |
| LongCat 2.0Meituan | 40.0 | 0.0% |
| KAT-Coder-Air V2.5Kuaishou | 40.0 | 0.0% |
| KAT-Coder-Pro V2.5Kuaishou | 40.0 | 0.0% |
| Grok Latest~x-ai | 40.0 | 0.0% |
| Aion-3.0-Miniaion-labs | 40.0 | 0.0% |
| Aion-3.0aion-labs | 40.0 | 0.0% |
| Laguna XS 2.1poolside | 40.0 | 0.0% |
| Laguna XS 2.1 (free)poolside | 40.0 | 0.0% |
| Fugu Ultrasakana | 40.0 | 0.0% |
| North Mini Code (free)Cohere | 40.0 | 0.0% |
| Claude Fable Latest~anthropic | 40.0 | 0.0% |
| Nemotron 3.5 Content Safety (free)NVIDIA | 40.0 | 0.0% |
| Nemotron 3 UltraNVIDIA | 40.0 | 0.0% |
| Nemotron 3 Ultra (free)NVIDIA | 40.0 | 0.0% |
| Step 3.7 FlashStepFun | 40.0 | 0.0% |
| Perceptron Mk1perceptron | 40.0 | 0.0% |
| Ring-2.6-1Tinclusionai | 40.0 | 0.0% |
| GPT Chat LatestOpenAI | 40.0 | 0.0% |
如何计算显著性
了解我们显著性分析背后的统计方法,帮助您区分真实的性能变化和随机波动。
统计显著性
我们使用95%置信度阈值(|z| > 1.96)的z分数。z分数衡量模型当前评分偏离其历史基准的标准差倍数。只有超过1.96个标准差的变化才被标记为统计显著。
基准评分
基准值是根据每个模型14天波动曲线数据的算术平均值计算的。该滚动平均值平滑了每日波动,提供了检测有意义偏差的稳定参考点。
置信区间
每个模型的95%置信区间计算公式为:基准值 +/- 1.96 x 标准差。落在此范围之外的评分表示统计上有意义的变化。"置信度"列显示 +/- 阈值。
多时间维度分析
每日(24小时)和每周(7天)排名变化分别分析。每日显著性要求排名移动超过3位,每周要求超过5位。在两个时间维度上都显著的模型代表最强、最可靠的信号。
噪音与信号
变异系数(CV%)衡量相对波动性。高CV模型天然评分嘈杂,需要更大的绝对变化才能达到显著性。低CV模型更可预测,因此即使小偏差也可能代表真实变化。
相关
Statistical significance indicates whether a model's rank change represents a real performance shift or is just random noise. We use z-scores with a 95% confidence threshold (|z| > 1.96), meaning a change is only flagged as significant if there is less than a 5% chance it occurred by random variation.
A z-score measures how many standard deviations a model's current score deviates from its historical baseline. It is calculated as (current score - baseline mean) / standard deviation. Values above +1.96 indicate significant improvement, while values below -1.96 indicate significant decline.
The CV% measures a model's relative score volatility. A high CV% means the model's performance fluctuates a lot, requiring larger changes to be statistically significant. A low CV% means the model is very consistent, so even small deviations may represent meaningful shifts. This helps distinguish inherently noisy models from truly changing ones.