变化显著性追踪器
并非所有排名变化都有意义,有些只是随机噪音。此页面使用统计分析来判断哪些模型评分变动是真实趋势,哪些只是正常波动。
已分析模型
290
显著变化
18
噪音 (不显著)
272
双时间维度
2
这意味着什么
- 18 / 290 个模型的评分变化具有统计显著性--这些是真实的性能变化,不是随机噪音。
- 272 个模型的评分变化在正常波动范围内--不要过度解读这些模型的小幅排名变化。
- 2 个模型在每日和每周两个时间维度上都显示显著变化--这些是最强、最可靠的真实性能变化信号。
- 使用方法:当模型排名发生变化时,先查看此页面。如果未标记为显著,则变化很可能是暂时的噪音。如果确实显著,则模型正在真正地改善或下降。
最显著变化 (按|Z分数|)
真实性能变化
18 个模型的近期评分偏离其历史平均值足以被认为是真实变化(非噪音)。按变化极端程度排序。Z分数衡量变化的异常程度--超过±1.96表示有95%的概率该变化是真实的。
| 模型 | 当前 | Z分数 | 方向 |
|---|---|---|---|
| Qwen3 30B A3B Instruct 2507Alibaba | 64.1 | 5.04 | 提升 |
| Qwen3.5 Plus 2026-04-20Alibaba | 74.8 | 4.58 | 提升 |
| GLM 5.1Zhipu AI | 78.0 | 4.29 | 提升 |
| Qwen3.7 MaxAlibaba | 74.8 | 4.24 | 提升 |
| Claude Sonnet 5Anthropic | 85.2 | 3.46 | 提升 |
| gpt-oss-120bOpenAI | 61.6 | 3.02 | 提升 |
| Claude Opus 5Anthropic | 95.1 | 3.00 | 提升 |
| Kimi K2.5Moonshot AI | 47.5 | -2.99 | 下降 |
| Claude Fable 5Anthropic | 95.9 | -2.68 | 下降 |
| Grok 4.3xAI | 88.8 | 2.65 | 提升 |
| Muse Spark 1.2meta | 80.9 | 2.65 | 提升 |
| Grok 4.5xAI | 88.8 | 2.64 | 提升 |
| Grok 4.6xAI | 88.8 | 2.45 | 提升 |
| Claude Fable 5 (batch)Anthropic | 95.9 | -2.45 | 下降 |
| GPT-4o (2024-11-20)OpenAI | 71.2 | 2.41 | 提升 |
| GPT-5 MiniOpenAI | 53.8 | -2.10 | 下降 |
| GPT-5 NanoOpenAI | 61.9 | 2.01 | 提升 |
| Kimi K2.7 CodeMoonshot AI | 40.0 | -2.00 | 下降 |
短期变化 vs. 持续变化
24小时内的排名变化可能只是暂时的。但如果7天内也在变动,那就是真正的趋势。在两个时间维度上都被标记的模型最值得关注--它们代表已确认的持续性能变化。
在两个时间维度上均显著(最强信号)
| 模型 | 评分 | 24小时变化 | 7天变化 |
|---|---|---|---|
| Claude Sonnet 4Anthropic | 73.9 | -5 | -15 |
| Claude Opus 4.1Anthropic | 74.4 | -61 | -11 |
仅每日(可能是噪音)
没有仅在每日维度上显著的模型。
仅每周(正在形成趋势)
哪些模型嘈杂、哪些模型稳定?
有些模型天然评分稳定--即使小幅排名变化也有意义。其他模型评分波动较大--需要更大的变化才值得关注。CV%(变异系数)告诉你每个模型的波动程度。越高 = 越嘈杂。
最不稳定模型(最高CV% - 最宽显著性阈值)
| 模型 | 评分 | CV% |
|---|---|---|
| Gemma 2 27BGoogle | 77.4 | 41.4% |
| Phi 4Microsoft | 60.2 | 37.7% |
| Claude Opus 5Anthropic | 95.1 | 36.3% |
| Gemini 3.6 FlashGoogle | 40.0 | 35.3% |
| Muse Spark 1.3meta | 80.9 | 35.3% |
| R1DeepSeek | 73.8 | 34.0% |
| Kimi K3Moonshot AI | 40.0 | 32.7% |
| Command ACohere | 50.8 | 31.7% |
| Qwen3.8 Max (0902)Alibaba | 75.6 | 31.5% |
| GPT-4OpenAI | 64.9 | 31.5% |
| Mixtral 8x22B InstructMistral AI | 63.4 | 31.0% |
| Llama 3.1 70B InstructMeta | 65.3 | 31.0% |
| Llama 3.3 70B InstructMeta | 66.8 | 30.8% |
| Mistral LargeMistral AI | 65.9 | 30.7% |
| Gemini 3.6 Flash (batch)Google | 40.0 | 30.6% |
| MiniMax M2-herMiniMax | 68.1 | 30.5% |
| Muse Spark 1.2meta | 80.9 | 30.0% |
| o3 MiniOpenAI | 75.3 | 29.8% |
| DeepSeek V3DeepSeek | 69.5 | 29.4% |
| GPT-6 AstraOpenAI | 81.8 | 29.0% |
最稳定模型(最低CV% - 最窄显著性阈值)
| 模型 | 评分 | CV% |
|---|---|---|
| GPT-5.5 Pro (batch)OpenAI | 92.7 | 0.0% |
| GPT-5.5 (batch)OpenAI | 92.7 | 0.0% |
| GPT-5.2 Pro (batch)OpenAI | 90.5 | 0.0% |
| GPT-5.2 (batch)OpenAI | 90.5 | 0.0% |
| GPT-5.6 Luna Pro (batch)OpenAI | 89.0 | 0.0% |
| GPT-5.6 Luna (batch)OpenAI | 89.0 | 0.0% |
| GPT-5.6 Terra Pro (batch)OpenAI | 89.0 | 0.0% |
| GPT-5.6 Terra (batch)OpenAI | 89.0 | 0.0% |
| GPT-5.6 Sol Pro (batch)OpenAI | 89.0 | 0.0% |
| GPT-5.6 Sol (batch)OpenAI | 89.0 | 0.0% |
| GPT-5 Pro (batch)OpenAI | 88.7 | 0.0% |
| GPT-5 (batch)OpenAI | 88.7 | 0.0% |
| GPT-5.1 (batch)OpenAI | 87.8 | 0.0% |
| o3 (batch)OpenAI | 86.7 | 0.0% |
| Claude Sonnet 4.6 (batch)Anthropic | 85.2 | 0.0% |
| Gemini 2.5 Pro (batch)Google | 83.5 | 0.0% |
| Grok 4.3 (batch)xAI | 81.0 | 0.0% |
| GPT-5.4 Nano (batch)OpenAI | 79.3 | 0.0% |
| GPT-5.4 Mini (batch)OpenAI | 79.3 | 0.0% |
| Gemini 3.5 Flash (batch)Google | 79.0 | 0.0% |
如何计算显著性
了解我们显著性分析背后的统计方法,帮助您区分真实的性能变化和随机波动。
统计显著性
我们使用95%置信度阈值(|z| > 1.96)的z分数。z分数衡量模型当前评分偏离其历史基准的标准差倍数。只有超过1.96个标准差的变化才被标记为统计显著。
基准评分
基准值是根据每个模型14天波动曲线数据的算术平均值计算的。该滚动平均值平滑了每日波动,提供了检测有意义偏差的稳定参考点。
置信区间
每个模型的95%置信区间计算公式为:基准值 +/- 1.96 x 标准差。落在此范围之外的评分表示统计上有意义的变化。"置信度"列显示 +/- 阈值。
多时间维度分析
每日(24小时)和每周(7天)排名变化分别分析。每日显著性要求排名移动超过3位,每周要求超过5位。在两个时间维度上都显著的模型代表最强、最可靠的信号。
噪音与信号
变异系数(CV%)衡量相对波动性。高CV模型天然评分嘈杂,需要更大的绝对变化才能达到显著性。低CV模型更可预测,因此即使小偏差也可能代表真实变化。
相关
Statistical significance indicates whether a model's rank change represents a real performance shift or is just random noise. We use z-scores with a 95% confidence threshold (|z| > 1.96), meaning a change is only flagged as significant if there is less than a 5% chance it occurred by random variation.
A z-score measures how many standard deviations a model's current score deviates from its historical baseline. It is calculated as (current score - baseline mean) / standard deviation. Values above +1.96 indicate significant improvement, while values below -1.96 indicate significant decline.
The CV% measures a model's relative score volatility. A high CV% means the model's performance fluctuates a lot, requiring larger changes to be statistically significant. A low CV% means the model is very consistent, so even small deviations may represent meaningful shifts. This helps distinguish inherently noisy models from truly changing ones.