Skip to content

变化显著性追踪器

并非所有排名变化都有意义,有些只是随机噪音。此页面使用统计分析来判断哪些模型评分变动是真实趋势,哪些只是正常波动。

已分析模型

228

显著变化

7

噪音 (不显著)

221

双时间维度

0

这意味着什么

  • 7 / 228 个模型的评分变化具有统计显著性--这些是真实的性能变化,不是随机噪音。
  • 221 个模型的评分变化在正常波动范围内--不要过度解读这些模型的小幅排名变化。
  • 使用方法:当模型排名发生变化时,先查看此页面。如果未标记为显著,则变化很可能是暂时的噪音。如果确实显著,则模型正在真正地改善或下降。

最显著变化 (按|Z分数|)

LMMarketCap.com

真实性能变化

7 个模型的近期评分偏离其历史平均值足以被认为是真实变化(非噪音)。按变化极端程度排序。Z分数衡量变化的异常程度--超过±1.96表示有95%的概率该变化是真实的。

模型当前Z分数方向
Qwen3 30B A3B Instruct 2507Alibaba64.14.47提升
GLM 5.1Zhipu AI78.03.91提升
Qwen3.5 Plus 2026-04-20Alibaba74.83.74提升
Qwen3.7 MaxAlibaba74.83.32提升
GPT-4o (2024-11-20)OpenAI71.22.30提升
Claude Opus 4.7 (Fast)Anthropic95.12.24提升
Claude Sonnet 5Anthropic85.22.24提升

短期变化 vs. 持续变化

24小时内的排名变化可能只是暂时的。但如果7天内也在变动,那就是真正的趋势。在两个时间维度上都被标记的模型最值得关注--它们代表已确认的持续性能变化。

在两个时间维度上均显著(最强信号)

目前没有模型在每日和每周时间维度上均显著。

仅每日(可能是噪音)

没有仅在每日维度上显著的模型。

仅每周(正在形成趋势)

模型评分24小时变化7天变化
Claude Opus 5 (Fast)Anthropic95.10+171
Claude Opus 5Anthropic95.10+171
GPT-5.5OpenAI92.70-7
Gemini 3.1 Pro Preview Custom ToolsGoogle92.20-8
Gemini 3.1 Pro PreviewGoogle92.20-8
GPT-5.4 ProOpenAI91.90-9
GPT-5.4OpenAI91.90-10
GPT-5.3 ChatOpenAI90.50+10
GPT-5.2-CodexOpenAI90.50-12
GPT-5.2 ChatOpenAI90.50+40
GPT-5.2 ProOpenAI90.50-13
GPT-5.2OpenAI90.50-14
Claude Opus 4.6Anthropic90.40-15
GPT-5.6 Luna ProOpenAI89.00-16
GPT-5.6 LunaOpenAI89.00-17
GPT-5.6 Terra ProOpenAI89.00-18
GPT-5.6 TerraOpenAI89.00-19
GPT-5.6 Sol ProOpenAI89.00-20
GPT-5.6 SolOpenAI89.00-21
GPT-5.1-Codex-MaxOpenAI88.70-19
GPT-5.1OpenAI88.70-19
GPT-5.1-CodexOpenAI88.70-19
GPT-5 ProOpenAI88.70-26
GPT-5OpenAI88.70-28
Gemini 3 Flash PreviewGoogle88.40-29
GPT-5.1-Codex-MiniOpenAI87.80-28
DeepSeek V4 ProDeepSeek86.70-27
o3 ProOpenAI86.70-27
o3OpenAI86.70-28
Claude Sonnet 5Anthropic85.20+123
Claude Sonnet 4.6Anthropic85.20-30
Claude Opus 4.5Anthropic85.10-31
Gemini 2.5 ProGoogle83.50-32
Gemini 2.5 Pro Preview 06-05Google83.50-33
Gemini 2.5 Pro Preview 05-06Google83.50-33
Claude Sonnet 4.5Anthropic82.40-33
Claude Opus 4Anthropic82.10-35
o4 MiniOpenAI81.40-36
DeepSeek V3.2DeepSeek81.30-37
Gemma 4 31BGoogle80.50-36
Gemma 4 31B (free)Google80.50-36
Muse Spark 1.1meta80.20-40
Gemini 3.6 FlashGoogle80.00-38
Qwen3.5 397B A17BAlibaba79.40-39
R1 0528DeepSeek79.40-39
GPT-5.4 NanoOpenAI79.30-39
GPT-5.4 MiniOpenAI79.30-40
Gemini 3.1 Flash Lite PreviewGoogle79.30-41
Gemini 2.5 Flash LiteGoogle79.10-41
Gemini 2.5 FlashGoogle79.10-42
Gemini 3.5 FlashGoogle79.00-43
GLM 5.2Zhipu AI78.50-44
GLM 5.1Zhipu AI78.00-32
GLM 5 TurboZhipu AI78.00-8
MiniMax M2.5MiniMax78.00-48
GLM 5Zhipu AI78.00-48
Qwen3.5-122B-A10BAlibaba77.70-46
Gemma 2 27BGoogle77.40-46
Qwen3.5-27BAlibaba77.00-45
Gemini 3.5 Flash LiteGoogle76.90-45
MiMo-V2.5-ProXiaomi76.20-47
Qwen3.5-35B-A3BAlibaba76.00-47
Qwen3.7 PlusAlibaba75.90-50
Kimi K2.6Moonshot AI75.80-48
o3 MiniOpenAI75.30-47
GLM 4.7Zhipu AI75.10-33
GLM 4.6Zhipu AI75.10-21
GLM 4.5Zhipu AI75.10-49
Qwen3.7 MaxAlibaba74.80+71
Qwen3.5 Plus 2026-04-20Alibaba74.80+83
Qwen3.6 Max PreviewAlibaba74.80-51
Claude Sonnet 4Anthropic74.40-50
o1OpenAI74.40-50
MiniMax M3MiniMax74.30-51
R1DeepSeek74.20-52
Qwen3.6 PlusAlibaba74.10-55
Inklingthinkingmachines74.00-54
Hy3Tencent74.00-61
o1-proOpenAI73.60-55
MiMo-V2.5Xiaomi73.00-56
Gemma 4 26B A4B Google73.00-56
Gemma 4 26B A4B (free)Google73.00-56
GLM 5V TurboZhipu AI72.3+1-56
o4 Mini HighOpenAI72.1+1-56
MiniMax M2.1MiniMax72.0+1-44
MiniMax M2MiniMax72.0+1-57
DeepSeek V3.2 ExpDeepSeek71.8+1-48
DeepSeek V3.1DeepSeek71.8+1-45
DeepSeek V3 0324DeepSeek71.8+1-60
Mistral Medium 3.5Mistral AI71.7+1-60
GPT-4o (2024-08-06)OpenAI71.20-61
GPT-4oOpenAI71.20-61
GPT-4o (2024-05-13)OpenAI71.20-61
MiniMax M1MiniMax70.80-60
GLM 4.5 AirZhipu AI70.70-60
Claude Haiku 4.5Anthropic69.50-56
DeepSeek V3DeepSeek69.50-56
Qwen3 VL 235B A22B ThinkingAlibaba69.40-47
Qwen3 VL 235B A22B InstructAlibaba69.40-57
DeepSeek V3.1 TerminusDeepSeek69.30-57
GPT-4o-miniOpenAI69.30-57
MiniMax M2-herMiniMax69.10-56
Qwen3.5-FlashAlibaba68.60-56
Hy3 previewTencent68.20-59
Qwen3.5 Plus 2026-02-15Alibaba68.20+55
Qwen3 Max ThinkingAlibaba68.20-58
Llama 4 MaverickMeta67.90-58
GPT-4.1OpenAI67.70-58
Qwen3 MaxAlibaba67.40-58
Mistral Large 3 2512Mistral AI67.00-58
Qwen3 Next 80B A3B ThinkingAlibaba66.90-41
Qwen3 Next 80B A3B InstructAlibaba66.90-59
Llama 3.3 70B InstructMeta66.80-59
GPT-4 TurboOpenAI66.70-59
Qwen3.5-9BAlibaba66.50-59
Step 3.5 FlashStepFun66.10-59
Mistral Large 2407Mistral AI65.90-33
Mistral LargeMistral AI65.90-60
Composer 2Cursor65.70-60
Composer 2 FastCursor65.70-60
GLM 4.6VZhipu AI65.50-60
Qwen3 235B A22B Thinking 2507Alibaba65.50-60
Llama 3.1 70B InstructMeta65.30-60
GPT-4 Turbo PreviewOpenAI64.80-45
GPT-4OpenAI64.80-61
Qwen3 235B A22B Instruct 2507Alibaba64.70-61
Qwen3 30B A3B Thinking 2507Alibaba64.10-59
Qwen3 30B A3B Instruct 2507Alibaba64.10+65
Qwen3 30B A3BAlibaba64.10-63
o3 Mini HighOpenAI64.10-63
Trinity Large Thinkingarcee-ai63.90-62
GPT-5 MiniOpenAI63.90-61
GLM 4.7 FlashZhipu AI63.70-61
Mixtral 8x22B InstructMistral AI63.40-61
GLM 4.5VZhipu AI62.50-61
Mercury 2Inception61.00-63
Qwen3 8BAlibaba61.00-63
Nova 2 LiteAmazon60.50-63
Phi 4Microsoft60.20-63
Kimi K2.5Moonshot AI59.10-62
gpt-oss-20bOpenAI57.40-64
gpt-oss-20b (free)OpenAI57.40-64
GPT-4o-mini (2024-07-18)OpenAI56.50-64
Granite 4.1 8BIBM55.30-63
Olmo 3 32B ThinkAllen AI54.90-63
Llama 4 ScoutMeta54.70-63
Kimi K2.7 CodeMoonshot AI54.10-63
Qwen3 235B A22BAlibaba54.00-64
GPT-4.1 MiniOpenAI53.60-64
Kimi K2 ThinkingMoonshot AI53.30-64
Kimi K2 0905Moonshot AI52.40-63
Kimi K2 0711Moonshot AI51.40-63
Claude 3 HaikuAnthropic51.30-63
Command ACohere50.80-63
Command R (08-2024)Cohere48.7+1-62
Command R+ (08-2024)Cohere48.70-63
GPT-5 NanoOpenAI46.90-63
Llama 3.1 8B InstructMeta44.50-63
GPT-4.1 NanoOpenAI42.10-63
R1 Distill Llama 70BDeepSeek40.70-63
gpt-oss-120bOpenAI40.40-63
Laguna S 2.1poolside40.00-63
Laguna S 2.1 (free)poolside40.00-63
LongCat 2.0Meituan40.00-63
Kimi K3Moonshot AI40.00-63
KAT-Coder-Air V2.5Kuaishou40.00-63
KAT-Coder-Pro V2.5Kuaishou40.00-63
Grok Latest~x-ai40.00-63
Aion-3.0-Miniaion-labs40.00-63
Aion-3.0aion-labs40.00-63
Laguna XS 2.1poolside40.00-63
Laguna XS 2.1 (free)poolside40.00-63
Fugu Ultrasakana40.00-63
North Mini Code (free)Cohere40.00-63
Claude Fable Latest~anthropic40.00-63
Nemotron 3.5 Content Safety (free)NVIDIA40.00-63
Nemotron 3 UltraNVIDIA40.00-63
Nemotron 3 Ultra (free)NVIDIA40.00-64
Step 3.7 FlashStepFun40.00-64
Perceptron Mk1perceptron40.00-63
Ring-2.6-1Tinclusionai40.00-63
GPT Chat LatestOpenAI40.00-63
Nemotron 3 Nano Omni (free)NVIDIA40.00-63
Anthropic Claude Haiku Latest~anthropic40.00-63
OpenAI GPT Mini Latest~openai40.00-63
Google Gemini Pro Latest~google40.00-63
MoonshotAI Kimi Latest~moonshotai40.00-63
Google Gemini Flash Latest~google40.00-63
Anthropic Claude Sonnet Latest~anthropic40.00-63
OpenAI GPT Latest~openai40.00-63
Qwen3.6 FlashAlibaba40.00-62
Qwen3.6 35B A3BAlibaba40.00-62
Qwen3.6 27BAlibaba40.00-62
Ling-2.6-1Tinclusionai40.00-63
Ling-2.6-flashinclusionai40.00-63
Claude Opus Latest~anthropic40.00-63
Lyria 3 Pro PreviewGoogle40.00-63
Lyria 3 Clip PreviewGoogle40.00-63
KAT-Coder-Pro V2Kuaishou40.00-63
Reka Edgerekaai40.00-63
Mistral Small 4Mistral AI40.00-63
Nemotron 3 SuperNVIDIA40.00-63
Nemotron 3 Super (free)NVIDIA40.00-63
Seed-2.0-LiteByteDance40.00-63
Seed-2.0-MiniByteDance40.00-63
Aion-2.0aion-labs40.00-63
Qwen3 Coder NextAlibaba40.00-62
Solar Pro 3Upstage40.00-62
Palmyra X5Writer40.00-62
GPT AudioOpenAI40.00-62
GPT Audio MiniOpenAI40.00-62
Seed 1.6 FlashByteDance40.00-65
Seed 1.6ByteDance40.00-65
Nemotron 3 Nano 30B A3BNVIDIA40.00-65
Nemotron 3 Nano 30B A3B (free)NVIDIA40.00-65

哪些模型嘈杂、哪些模型稳定?

有些模型天然评分稳定--即使小幅排名变化也有意义。其他模型评分波动较大--需要更大的变化才值得关注。CV%(变异系数)告诉你每个模型的波动程度。越高 = 越嘈杂。

最不稳定模型(最高CV% - 最宽显著性阈值)

模型评分CV%
Gemma 2 27BGoogle77.448.2%
Claude Opus 5 (Fast)Anthropic95.144.5%
Claude Opus 5Anthropic95.144.5%
Phi 4Microsoft60.243.5%
R1DeepSeek74.239.0%
Command ACohere50.836.2%
GPT-4OpenAI64.836.0%
Mixtral 8x22B InstructMistral AI63.435.5%
Claude Sonnet 5Anthropic85.235.4%
Llama 3.1 70B InstructMeta65.335.4%
Llama 3.3 70B InstructMeta66.835.1%
Mistral LargeMistral AI65.935.0%
MiniMax M2-herMiniMax69.134.9%
o3 MiniOpenAI75.333.9%
DeepSeek V3DeepSeek69.533.5%
GPT-4 Turbo PreviewOpenAI64.832.0%
Mistral Large 2407Mistral AI65.931.2%
GPT-4o (2024-05-13)OpenAI71.230.9%
GLM 5V TurboZhipu AI72.330.6%
GPT-4oOpenAI71.230.3%

最稳定模型(最低CV% - 最窄显著性阈值)

模型评分CV%
Laguna S 2.1poolside40.00.0%
Laguna S 2.1 (free)poolside40.00.0%
LongCat 2.0Meituan40.00.0%
KAT-Coder-Air V2.5Kuaishou40.00.0%
KAT-Coder-Pro V2.5Kuaishou40.00.0%
Grok Latest~x-ai40.00.0%
Aion-3.0-Miniaion-labs40.00.0%
Aion-3.0aion-labs40.00.0%
Laguna XS 2.1poolside40.00.0%
Laguna XS 2.1 (free)poolside40.00.0%
Fugu Ultrasakana40.00.0%
North Mini Code (free)Cohere40.00.0%
Claude Fable Latest~anthropic40.00.0%
Nemotron 3.5 Content Safety (free)NVIDIA40.00.0%
Nemotron 3 UltraNVIDIA40.00.0%
Nemotron 3 Ultra (free)NVIDIA40.00.0%
Step 3.7 FlashStepFun40.00.0%
Perceptron Mk1perceptron40.00.0%
Ring-2.6-1Tinclusionai40.00.0%
GPT Chat LatestOpenAI40.00.0%

如何计算显著性

了解我们显著性分析背后的统计方法,帮助您区分真实的性能变化和随机波动。

统计显著性

我们使用95%置信度阈值(|z| > 1.96)的z分数。z分数衡量模型当前评分偏离其历史基准的标准差倍数。只有超过1.96个标准差的变化才被标记为统计显著。

基准评分

基准值是根据每个模型14天波动曲线数据的算术平均值计算的。该滚动平均值平滑了每日波动,提供了检测有意义偏差的稳定参考点。

置信区间

每个模型的95%置信区间计算公式为:基准值 +/- 1.96 x 标准差。落在此范围之外的评分表示统计上有意义的变化。"置信度"列显示 +/- 阈值。

多时间维度分析

每日(24小时)和每周(7天)排名变化分别分析。每日显著性要求排名移动超过3位,每周要求超过5位。在两个时间维度上都显著的模型代表最强、最可靠的信号。

噪音与信号

变异系数(CV%)衡量相对波动性。高CV模型天然评分嘈杂,需要更大的绝对变化才能达到显著性。低CV模型更可预测,因此即使小偏差也可能代表真实变化。

相关

Frequently Asked Questions

Statistical significance indicates whether a model's rank change represents a real performance shift or is just random noise. We use z-scores with a 95% confidence threshold (|z| > 1.96), meaning a change is only flagged as significant if there is less than a 5% chance it occurred by random variation.

A z-score measures how many standard deviations a model's current score deviates from its historical baseline. It is calculated as (current score - baseline mean) / standard deviation. Values above +1.96 indicate significant improvement, while values below -1.96 indicate significant decline.

The CV% measures a model's relative score volatility. A high CV% means the model's performance fluctuates a lot, requiring larger changes to be statistically significant. A low CV% means the model is very consistent, so even small deviations may represent meaningful shifts. This helps distinguish inherently noisy models from truly changing ones.

AI Model Change Significance - Statistical Analysis | LM Market Cap