Skip to content

变化显著性追踪器

并非所有排名变化都有意义,有些只是随机噪音。此页面使用统计分析来判断哪些模型评分变动是真实趋势,哪些只是正常波动。

已分析模型

290

显著变化

18

噪音 (不显著)

272

双时间维度

2

这意味着什么

  • 18 / 290 个模型的评分变化具有统计显著性--这些是真实的性能变化,不是随机噪音。
  • 272 个模型的评分变化在正常波动范围内--不要过度解读这些模型的小幅排名变化。
  • 2 个模型在每日每周两个时间维度上都显示显著变化--这些是最强、最可靠的真实性能变化信号。
  • 使用方法:当模型排名发生变化时,先查看此页面。如果未标记为显著,则变化很可能是暂时的噪音。如果确实显著,则模型正在真正地改善或下降。

最显著变化 (按|Z分数|)

LMMarketCap.com

真实性能变化

18 个模型的近期评分偏离其历史平均值足以被认为是真实变化(非噪音)。按变化极端程度排序。Z分数衡量变化的异常程度--超过±1.96表示有95%的概率该变化是真实的。

模型当前Z分数方向
Qwen3 30B A3B Instruct 2507Alibaba64.15.04提升
Qwen3.5 Plus 2026-04-20Alibaba74.84.58提升
GLM 5.1Zhipu AI78.04.29提升
Qwen3.7 MaxAlibaba74.84.24提升
Claude Sonnet 5Anthropic85.23.46提升
gpt-oss-120bOpenAI61.63.02提升
Claude Opus 5Anthropic95.13.00提升
Kimi K2.5Moonshot AI47.5-2.99下降
Claude Fable 5Anthropic95.9-2.68下降
Grok 4.3xAI88.82.65提升
Muse Spark 1.2meta80.92.65提升
Grok 4.5xAI88.82.64提升
Grok 4.6xAI88.82.45提升
Claude Fable 5 (batch)Anthropic95.9-2.45下降
GPT-4o (2024-11-20)OpenAI71.22.41提升
GPT-5 MiniOpenAI53.8-2.10下降
GPT-5 NanoOpenAI61.92.01提升
Kimi K2.7 CodeMoonshot AI40.0-2.00下降

短期变化 vs. 持续变化

24小时内的排名变化可能只是暂时的。但如果7天内也在变动,那就是真正的趋势。在两个时间维度上都被标记的模型最值得关注--它们代表已确认的持续性能变化。

在两个时间维度上均显著(最强信号)

模型评分24小时变化7天变化
Claude Sonnet 4Anthropic73.9-5-15
Claude Opus 4.1Anthropic74.4-61-11

仅每日(可能是噪音)

没有仅在每日维度上显著的模型。

仅每周(正在形成趋势)

模型评分24小时变化7天变化
Claude Opus 5Anthropic95.10+273
GPT-5.5 ProOpenAI92.70+9
GPT-5.3-CodexOpenAI90.50+19
GPT-5.2 ChatOpenAI90.50+81
Grok 4.5xAI88.8-1+57
Grok 4.3xAI88.8-1+31
Grok 4.20xAI88.8-1-7
GPT-5 ProOpenAI88.7-1-9
GPT-5 Pro (batch)OpenAI88.7-1-9
GPT-5OpenAI88.7-1-9
GPT-5 (batch)OpenAI88.7-1-9
Gemini 3 Flash PreviewGoogle88.4-1-9
Gemini 3 Flash Preview (batch)Google88.4-1-9
Grok 4.20 Multi-AgentxAI87.9-1-8
GPT-5.1 (batch)OpenAI87.8-1-6
Claude Sonnet 5Anthropic85.2-1+232
Claude Sonnet 4.6Anthropic85.2-1-6
Claude Sonnet 4.6 (batch)Anthropic85.2-1-6
Claude Opus 4.5Anthropic85.1-1-6
Claude Opus 4.5 (batch)Anthropic85.1-1-6
Gemini 2.5 ProGoogle83.5-1-6
Gemini 2.5 Pro (batch)Google83.5-1-6
Gemini 2.5 Pro Preview 06-05Google83.5-1-6
DeepSeek V3.2DeepSeek83.4-1-6
Claude Sonnet 4.5Anthropic82.4-1-6
Claude Sonnet 4.5 (batch)Anthropic82.4-1-6
Muse Spark 1.3meta80.9+1+162
Muse Spark 1.2meta80.9+1+190
Muse Spark 1.1meta80.9+1-6
Gemma 4 31BGoogle80.5+1-6
Gemma 4 31B (free)Google80.5+1-6
Qwen3.5 397B A17BAlibaba79.4+1-6
R1 0528DeepSeek79.4+1-6
GPT-5.4 NanoOpenAI79.3+1-6
GPT-5.4 Nano (batch)OpenAI79.3+1-6
GPT-5.4 MiniOpenAI79.3+1-6
GPT-5.4 Mini (batch)OpenAI79.3+1-6
Gemini 3.1 Flash Lite PreviewGoogle79.3+1-6
Gemini 2.5 Flash LiteGoogle79.1+1-6
Gemini 2.5 Flash Lite (batch)Google79.1+1-6
Gemini 2.5 FlashGoogle79.1+1-6
Gemini 2.5 Flash (batch)Google79.1+1-6
Gemini 3.5 FlashGoogle79.0+1-6
Gemini 3.5 Flash (batch)Google79.0+1-6
GLM 5.3 (batch)Zhipu AI78.6+1-7
GLM 5.2Zhipu AI78.6+1-7
GLM 5.2 (batch)Zhipu AI78.6+1-7
GLM 5.3 FlashZhipu AI78.0+1-7
GLM 5.1Zhipu AI78.0+1+11
GLM 5 TurboZhipu AI78.0+1+43
GLM 5Zhipu AI78.0+1-9
GLM 5.3 Flash (batch)Zhipu AI77.9+1-9
Qwen3.5-122B-A10BAlibaba77.7+1-8
Gemma 2 27BGoogle77.4+1-8
Qwen3.5-27BAlibaba77.0+1-6
GPT-5 Mini (batch)OpenAI76.8+1-6
GPT-5 Nano (batch)OpenAI76.8+1-6
Gemini 3.5 Flash LiteGoogle76.5+1-6
Gemini 3.5 Flash Lite (batch)Google76.5+1-6
MiMo-V2.5-ProXiaomi76.20-7
Qwen3.5-35B-A3BAlibaba76.00-7
GLM 5.2 (free)Zhipu AI75.70-7
Kimi K2.6Moonshot AI75.70-7
Qwen3.8 Max (0902)Alibaba75.60+120
Qwen3.7 PlusAlibaba75.60-8
o3 MiniOpenAI75.30-7
Claude Opus 4.1 (batch)Anthropic75.20-7
GLM 4.7Zhipu AI75.10+13
GLM 4.6Zhipu AI75.10+27
GLM 4.5Zhipu AI75.10-9
Qwen3.7 MaxAlibaba74.80+176
Qwen3.5 Plus 2026-04-20Alibaba74.80+187
Qwen3.6 Max PreviewAlibaba74.80-11
Hy3Tencent74.40-11
o1OpenAI74.40-10
o3 Mini (batch)OpenAI74.30-10
Qwen3.6 PlusAlibaba74.10-10
MiniMax M3MiniMax73.90-10
R1DeepSeek73.8-1-11
o1-proOpenAI73.60-10
Qwen3.8 27BAlibaba73.40-10
MiMo-V2.5Xiaomi73.00-10
Gemma 4 26B A4B Google73.00-10
Gemma 4 26B A4B (free)Google73.00-10
Inklingthinkingmachines72.90-10
Inkling (free)thinkingmachines72.90-10
GLM 5V TurboZhipu AI72.3+1-8
o4 Mini HighOpenAI72.1+1-8
GPT-4o (batch)OpenAI72.0+1-8
DeepSeek V3.1DeepSeek71.8+1+7
DeepSeek V3 0324DeepSeek71.8+1-10
Mistral Medium 3.5Mistral AI71.6+1-10
MiniMax M2.7MiniMax71.6+1+6
MiniMax M2.5MiniMax71.6+1-11
GPT-4o (2024-11-20)OpenAI71.2+1+60
GPT-4o (2024-08-06)OpenAI71.2+1-12
GPT-4oOpenAI71.2+1-12
GPT-4o (2024-05-13)OpenAI71.2+1-12
MiniMax M2MiniMax71.0+1-12
MiniMax M1MiniMax70.8+1-12
GLM 4.5 AirZhipu AI70.7+1-12
Llama 4 MaverickMeta70.7+1-12
Claude Haiku 4.5Anthropic69.9+1-9
Claude Haiku 4.5 (batch)Anthropic69.9+1-9
DeepSeek V3DeepSeek69.5+1-8
Qwen3 VL 235B A22B InstructAlibaba69.3+1-8
DeepSeek V3.1 TerminusDeepSeek69.3+1-8
GPT-4o-miniOpenAI69.3+1-8
Inkling Smallthinkingmachines68.7+1-8
Inkling Small (free)thinkingmachines68.7+1-8
Qwen3.5-FlashAlibaba68.6+1-8
Hy3 previewTencent68.4+1-8
Qwen3.5 Plus 2026-02-15Alibaba68.2+1+159
Qwen3 Max ThinkingAlibaba68.2+1-9
MiniMax M2-herMiniMax68.1+1-9
GPT-4.1OpenAI67.7+1-9
GPT-4.1 (batch)OpenAI67.7+1-9
Qwen3 MaxAlibaba67.4+1-8
Mistral Large 3 2512 (batch)Mistral AI67.0+1-8
Llama 3.3 70B InstructMeta66.8+1-8
Qwen3 Next 80B A3B ThinkingAlibaba66.7+1+6
Qwen3 Next 80B A3B InstructAlibaba66.7+1-9
GPT-4 TurboOpenAI66.7+1-9
Qwen3.5-9BAlibaba66.5+1-9
Step 3.5 FlashStepFun66.1+1-9
Mistral Large 2407Mistral AI65.9+1+23
Mistral LargeMistral AI65.9+1-10
Composer 2Cursor65.7+1-10
Composer 2 FastCursor65.7+1-10
GLM 4.6VZhipu AI65.6+1-10
Qwen3 235B A22B Thinking 2507Alibaba65.3+1-10
Llama 3.1 70B InstructMeta65.3+1-10
GPT-4OpenAI64.9+1-10
Qwen3 235B A22B Instruct 2507Alibaba64.7+1-10
Qwen3 30B A3B Thinking 2507Alibaba64.1+1-9
Qwen3 30B A3B Instruct 2507Alibaba64.1+1+170
Qwen3 30B A3BAlibaba64.1+1-12
o3 Mini HighOpenAI63.9+1-10
GLM 4.7 FlashZhipu AI63.5+1-10
Mixtral 8x22B InstructMistral AI63.4+1-10
Trinity Large Thinkingarcee-ai63.1+1-10
GPT-4o-mini (batch)OpenAI62.5+1-10
GLM 4.5VZhipu AI62.3+1-10
GPT-5 NanoOpenAI61.9+1-10
gpt-oss-120bOpenAI61.6+1-10
GPT-4 Turbo (batch)OpenAI61.5+2-9
Mercury 2.5Inception61.2+2-9
Qwen3 8BAlibaba61.0+2-9
Mercury 2Inception60.9+2-9
Nova 2 LiteAmazon60.4+2-9
Llama 4 ScoutMeta60.2+2-9
Phi 4Microsoft60.2+2-9
GPT-4.1 Mini (batch)OpenAI58.9+2-9
GPT-4.1 Nano (batch)OpenAI58.9+2-9
gpt-oss-20bOpenAI57.4+2-9
GPT-4o-mini (2024-07-18)OpenAI56.5+2-9
GPT-4.1 MiniOpenAI56.2+2-9
Qwen3 235B A22BAlibaba54.0+2-8
Granite 4.2 8BIBM53.8+2-8
GPT-5 MiniOpenAI53.8+2-8
Claude 3 HaikuAnthropic51.3+2-7
Command ACohere50.8+2-7
Command R (08-2024)Cohere48.7+3-6
Command R+ (08-2024)Cohere48.7+2-7
Kimi K2.5Moonshot AI47.5+2-7
Llama 3.1 8B InstructMeta44.5+2-7
GPT-4.1 NanoOpenAI42.1+2-7
R1 Distill Llama 70BDeepSeek40.7+2-7
Schematron V2 Turboinference-net40.00-9
Schematron V2 Smallinference-net40.00-9
GPT Astra Latest~openai40.00-9
GPT Sol Latest~openai40.00-9
GPT Terra Latest~openai40.00-9
GPT Luna Latest~openai40.00-9
Fugu Ultra v2sakana40.00-9
Fugu Maxsakana40.00-9
Ling 3.0 Flash VLinclusionai40.00-9
Ling 3.0 Flash VL (free)inclusionai40.00-9
DeepSeek V4.1 FlashDeepSeek40.00-9
Ling 3.0 Flash Sante (free)inclusionai40.00-9
Muse Spark 1.3 Contributormeta40.00-8
Hy4 previewTencent40.00-7
Ling 3.0 Flash Fininclusionai40.00-7
Ling 3.0 Flash Fin (free)inclusionai40.00-7
GLM Flash Latest~z-ai40.00-7
Qwen3.8 FlashAlibaba40.00-7
Muse Spark 1.2 Contributormeta40.00-7
DeepSeek V4 Flash Vision ExpDeepSeek40.00-7
DeepSeek V4 Flash Vision Exp (batch)DeepSeek40.00-7
Hy-MT2-1.8BTencent40.00-7
Hy-MT2-30B-A3BTencent40.00-7
GLM Latest~z-ai40.00-7
Hy-MT2-7BTencent40.00-7
Dots3-Note Preview (free)dots-studio40.00-7
Gemini 3.7 FlashGoogle40.00-7
Gemini 3.7 Flash (batch)Google40.00-7
Seed 2.1 TurboByteDance40.00-7
Qwen3.8 2.4T A95BAlibaba40.00-7
Seed-2.0-CodeByteDance40.0+1-6
DeepSeek V4 Pro 0813DeepSeek40.0+1-6
DeepSeek V4 Pro 0813 (batch)DeepSeek40.0+1-6
LFM2.5-2.6B (free)Liquid AI40.0+1-6
Nemotron 3.5 LightningNVIDIA40.0+1-6
Nemotron 3.5 Lightning (free)NVIDIA40.0+1-6
Sakana Namazusakana40.0+1-6
Solar Pro 4Upstage40.0+1-6
Muse Glimmer 30Bmeta40.0+1-6
Muse Glimmer 30B (batch)meta40.0+1-6

哪些模型嘈杂、哪些模型稳定?

有些模型天然评分稳定--即使小幅排名变化也有意义。其他模型评分波动较大--需要更大的变化才值得关注。CV%(变异系数)告诉你每个模型的波动程度。越高 = 越嘈杂。

最不稳定模型(最高CV% - 最宽显著性阈值)

模型评分CV%
Gemma 2 27BGoogle77.441.4%
Phi 4Microsoft60.237.7%
Claude Opus 5Anthropic95.136.3%
Gemini 3.6 FlashGoogle40.035.3%
Muse Spark 1.3meta80.935.3%
R1DeepSeek73.834.0%
Kimi K3Moonshot AI40.032.7%
Command ACohere50.831.7%
Qwen3.8 Max (0902)Alibaba75.631.5%
GPT-4OpenAI64.931.5%
Mixtral 8x22B InstructMistral AI63.431.0%
Llama 3.1 70B InstructMeta65.331.0%
Llama 3.3 70B InstructMeta66.830.8%
Mistral LargeMistral AI65.930.7%
Gemini 3.6 Flash (batch)Google40.030.6%
MiniMax M2-herMiniMax68.130.5%
Muse Spark 1.2meta80.930.0%
o3 MiniOpenAI75.329.8%
DeepSeek V3DeepSeek69.529.4%
GPT-6 AstraOpenAI81.829.0%

最稳定模型(最低CV% - 最窄显著性阈值)

模型评分CV%
GPT-5.5 Pro (batch)OpenAI92.70.0%
GPT-5.5 (batch)OpenAI92.70.0%
GPT-5.2 Pro (batch)OpenAI90.50.0%
GPT-5.2 (batch)OpenAI90.50.0%
GPT-5.6 Luna Pro (batch)OpenAI89.00.0%
GPT-5.6 Luna (batch)OpenAI89.00.0%
GPT-5.6 Terra Pro (batch)OpenAI89.00.0%
GPT-5.6 Terra (batch)OpenAI89.00.0%
GPT-5.6 Sol Pro (batch)OpenAI89.00.0%
GPT-5.6 Sol (batch)OpenAI89.00.0%
GPT-5 Pro (batch)OpenAI88.70.0%
GPT-5 (batch)OpenAI88.70.0%
GPT-5.1 (batch)OpenAI87.80.0%
o3 (batch)OpenAI86.70.0%
Claude Sonnet 4.6 (batch)Anthropic85.20.0%
Gemini 2.5 Pro (batch)Google83.50.0%
Grok 4.3 (batch)xAI81.00.0%
GPT-5.4 Nano (batch)OpenAI79.30.0%
GPT-5.4 Mini (batch)OpenAI79.30.0%
Gemini 3.5 Flash (batch)Google79.00.0%

如何计算显著性

了解我们显著性分析背后的统计方法,帮助您区分真实的性能变化和随机波动。

统计显著性

我们使用95%置信度阈值(|z| > 1.96)的z分数。z分数衡量模型当前评分偏离其历史基准的标准差倍数。只有超过1.96个标准差的变化才被标记为统计显著。

基准评分

基准值是根据每个模型14天波动曲线数据的算术平均值计算的。该滚动平均值平滑了每日波动,提供了检测有意义偏差的稳定参考点。

置信区间

每个模型的95%置信区间计算公式为:基准值 +/- 1.96 x 标准差。落在此范围之外的评分表示统计上有意义的变化。"置信度"列显示 +/- 阈值。

多时间维度分析

每日(24小时)和每周(7天)排名变化分别分析。每日显著性要求排名移动超过3位,每周要求超过5位。在两个时间维度上都显著的模型代表最强、最可靠的信号。

噪音与信号

变异系数(CV%)衡量相对波动性。高CV模型天然评分嘈杂,需要更大的绝对变化才能达到显著性。低CV模型更可预测,因此即使小偏差也可能代表真实变化。

相关

Frequently Asked Questions

Statistical significance indicates whether a model's rank change represents a real performance shift or is just random noise. We use z-scores with a 95% confidence threshold (|z| > 1.96), meaning a change is only flagged as significant if there is less than a 5% chance it occurred by random variation.

A z-score measures how many standard deviations a model's current score deviates from its historical baseline. It is calculated as (current score - baseline mean) / standard deviation. Values above +1.96 indicate significant improvement, while values below -1.96 indicate significant decline.

The CV% measures a model's relative score volatility. A high CV% means the model's performance fluctuates a lot, requiring larger changes to be statistically significant. A low CV% means the model is very consistent, so even small deviations may represent meaningful shifts. This helps distinguish inherently noisy models from truly changing ones.

AI Model Change Significance - Statistical Analysis | LM Market Cap