Skip to content

性能衰退追踪器

检测AI模型可能出现的性能下降。此追踪器监控排名变动(排行榜上的位置变化),并标记在24小时或7天内显著下降的模型。"衰退分"越高,意味着越多的警告信号。

存在风险的模型

276

下降中 (7天)

247

不稳定

237

持续下降

112

按性能衰退风险评分排名的模型

LMMarketCap.com

存在风险的模型

276 个模型显示性能衰退迹象,按风险评分排名。更高的风险评分表示更令人担忧的性能趋势。

衰退分模型质量24小时排名7天排名严重程度
88Claude Opus 4.1Anthropic74.4-61-11high
59Ling 3.0 Flash Sante (free)inclusionai40.0-12-21high
57Muse Spark 1.3 Contributormeta40.0-12-20high
56Ternary Bonsai 2 27Bprism-ml40.0-11-20high
56Paretounbiased40.0-11-20high
56DeepSeek Pro Latest~deepseek40.0-11-20high
56DeepSeek Flash Latest~deepseek40.0-11-20high
56Schematron V2 Turboinference-net40.0-11-20high
56Schematron V2 Smallinference-net40.0-11-20high
56GPT Astra Latest~openai40.0-11-20high
56GPT Sol Latest~openai40.0-11-20high
56GPT Terra Latest~openai40.0-11-20high
56GPT Luna Latest~openai40.0-11-20high
56Fugu Ultra v2sakana40.0-11-20high
56Fugu Maxsakana40.0-11-20high
56Ling 3.0 Flash VLinclusionai40.0-11-20high
56Ling 3.0 Flash VL (free)inclusionai40.0-11-20high
56DeepSeek V4.1 FlashDeepSeek40.0-11-20high
55Hy4 previewTencent40.0-12-19high
55Ling 3.0 Flash Fininclusionai40.0-12-19high
55Ling 3.0 Flash Fin (free)inclusionai40.0-12-19high
55GLM Flash Latest~z-ai40.0-12-19high
55Qwen3.8 FlashAlibaba40.0-12-19high
55Muse Spark 1.2 Contributormeta40.0-12-19high
55DeepSeek V4 Flash Vision ExpDeepSeek40.0-12-19high
52Hy-MT2-1.8BTencent40.0-11-18high
52Hy-MT2-30B-A3BTencent40.0-11-18high
52GLM Latest~z-ai40.0-11-18high
52Hy-MT2-7BTencent40.0-11-18high
52Dots3-Note Preview (free)dots-studio40.0-11-18high
52Gemini 3.7 FlashGoogle40.0-11-18high
52Gemini 3.7 Flash (batch)Google40.0-11-18high
52Seed 2.1 TurboByteDance40.0-11-18high
52Qwen3.8 2.4T A95BAlibaba40.0-11-18high
49Seed-2.0-CodeByteDance40.0-10-17high
49DeepSeek V4 Pro 0813DeepSeek40.0-10-17high
46LFM2.5-2.6B (free)Liquid AI40.0-9-16high
46Nemotron 3.5 LightningNVIDIA40.0-9-16high
46Nemotron 3.5 Lightning (free)NVIDIA40.0-9-16high
46Sakana Namazusakana40.0-9-16high
46Solar Pro 4Upstage40.0-9-16high
46Muse Glimmer 30Bmeta40.0-9-16high
41DeepSeek V4 Flash Latest~deepseek40.0-8-14high
41DeepSeek V4 Flash 0731DeepSeek40.0-8-14high
40Claude Sonnet 4Anthropic73.9-5-15high
38Qwen3.7 FlashAlibaba40.0-7-13high
36Claude Opus 5 (batch)Anthropic40.0-7-12high
36Ling 3.0 Flashinclusionai40.0-7-12high
36Laguna S 2.1poolside40.0-7-12high
36Laguna S 2.1 (free)poolside40.0-7-12high
36Gemini 3.6 FlashGoogle40.0-7-12high
36Gemini 3.6 Flash (batch)Google40.0-7-12high
36LongCat 2.0Meituan40.0-7-12high
36Kimi K3Moonshot AI40.0-7-12high
36Kimi K3 (batch)Moonshot AI40.0-7-12high
36KAT-Coder-Pro V2.5Kuaishou40.0-7-12high
29GPT-4o (2024-08-06)OpenAI71.2+1-12high
29GPT-4oOpenAI71.2+1-12high
29GPT-4o (2024-05-13)OpenAI71.2+1-12high
29MiniMax M2MiniMax71.0+1-12high
29MiniMax M1MiniMax70.8+1-12high
29GLM 4.5 AirZhipu AI70.7+1-12high
29Llama 4 MaverickMeta70.7+1-12high
29Qwen3 30B A3BAlibaba64.1+1-12high
28R1DeepSeek73.8-1-11high
27GPT-5 ProOpenAI88.7-2-10high
27GPT-5 Pro (batch)OpenAI88.7-2-10high
27GPT-5OpenAI88.7-2-10high
27GPT-5 (batch)OpenAI88.7-2-10high
27Gemini 3 Flash PreviewGoogle88.4-2-10high
27Gemini 3 Flash Preview (batch)Google88.4-2-10high
27Qwen3.6 Max PreviewAlibaba74.80-11high
27Hy3Tencent74.40-11high
27MiniMax M2.5MiniMax71.6+1-11high
25Grok 4.20 Multi-AgentxAI87.9-2-9high
25o1OpenAI74.40-10high
25o3 Mini (batch)OpenAI74.30-10high
25Qwen3.6 PlusAlibaba74.10-10high
25MiniMax M3MiniMax73.90-10high
25o1-proOpenAI73.60-10high
25Qwen3.8 27BAlibaba73.40-10high
25MiMo-V2.5Xiaomi73.00-10high
25Gemma 4 26B A4B Google73.00-10high
25Gemma 4 26B A4B (free)Google73.00-10high
25Qwen3.8 27B (free)Alibaba72.90-10high
25Inklingthinkingmachines72.90-10high
25Inkling (free)thinkingmachines72.90-10high
25DeepSeek V3 0324DeepSeek71.8+1-10high
25Mistral Medium 3.5Mistral AI71.6+1-10high
25Mistral LargeMistral AI65.9+1-10high
25Composer 2Cursor65.7+1-10high
25Composer 2 FastCursor65.7+1-10high
25GLM 4.6VZhipu AI65.6+1-10high
25Qwen3 235B A22B Thinking 2507Alibaba65.3+1-10high
25Llama 3.1 70B InstructMeta65.3+1-10high
25GPT-4OpenAI64.9+1-10high
25Qwen3 235B A22B Instruct 2507Alibaba64.7+1-10high
25o3 Mini HighOpenAI63.9+1-10high
25GLM 4.7 FlashZhipu AI63.5+1-10high
25Mixtral 8x22B InstructMistral AI63.4+1-10high
25Trinity Large Thinkingarcee-ai63.1+1-10high
25GPT-4o-mini (batch)OpenAI62.5+1-10high
25GLM 4.5VZhipu AI62.3+1-10high
25GPT-5 NanoOpenAI61.9+1-10high
25gpt-oss-120bOpenAI61.6+1-10high
25GPT-4o-mini (2024-07-18)OpenAI56.5+1-10high
25GPT-4.1 MiniOpenAI56.2+1-10high
23Grok 4.20xAI88.8-2-8high
23GLM 5Zhipu AI78.0+1-9high
23GLM 5.3 FlashXZhipu AI77.9+1-9high
23GLM 5.3 Flash (batch)Zhipu AI77.9+1-9high
23GLM 4.5Zhipu AI75.10-9high
23Claude Haiku 4.5Anthropic69.9+1-9high
23Claude Haiku 4.5 (batch)Anthropic69.9+1-9high
23Qwen3 Max ThinkingAlibaba68.2+1-9high
23MiniMax M2-herMiniMax68.1+1-9high
23GPT-4.1OpenAI67.7+1-9high
23GPT-4.1 (batch)OpenAI67.7+1-9high
23Qwen3 Next 80B A3B InstructAlibaba66.7+1-9high
23GPT-4 TurboOpenAI66.7+1-9high
23Qwen3.5-9BAlibaba66.5+1-9high
23Step 3.5 FlashStepFun66.1+1-9high
23Qwen3 30B A3B Thinking 2507Alibaba64.1+1-9high
23GPT-4 Turbo (batch)OpenAI61.5+2-9high
23Mercury 2.5Inception61.2+2-9high
23Qwen3 8BAlibaba61.0+2-9high
23Mercury 2Inception60.9+2-9high
23Nova 2 LiteAmazon60.4+2-9high
23Llama 4 ScoutMeta60.2+2-9high
23Phi 4Microsoft60.2+2-9high
23GPT-4.1 Mini (batch)OpenAI58.9+2-9high
23GPT-4.1 Nano (batch)OpenAI58.9+2-9high
23gpt-oss-20bOpenAI57.4+2-9high
23Qwen3 235B A22BAlibaba54.0+1-9high
23Granite 4.2 8BIBM53.8+1-9high
23GPT-5 MiniOpenAI53.8+1-9high
21GPT-5.1 (batch)OpenAI87.8-2-7high
21Claude Sonnet 4.6Anthropic85.2-2-7high
21Claude Sonnet 4.6 (batch)Anthropic85.2-2-7high
21Claude Opus 4.5Anthropic85.1-2-7high
21Claude Opus 4.5 (batch)Anthropic85.1-2-7high
21Gemini 2.5 ProGoogle83.5-2-7high
21Gemini 2.5 Pro (batch)Google83.5-2-7high
21Gemini 2.5 Pro Preview 06-05Google83.5-2-7high
21DeepSeek V3.2DeepSeek83.4-2-7high
21Claude Sonnet 4.5Anthropic82.4-2-7high
21Claude Sonnet 4.5 (batch)Anthropic82.4-2-7high
21GLM 5.3 (batch)Zhipu AI78.60-8high
21GLM 5.2Zhipu AI78.60-8high
21Qwen3.5-122B-A10BAlibaba77.7+1-8high
21Gemma 2 27BGoogle77.4+1-8high
21Qwen3.7 PlusAlibaba75.60-8high
21GLM 5V TurboZhipu AI72.3+1-8high
21o4 Mini HighOpenAI72.1+1-8high
21GPT-4o (batch)OpenAI72.0+1-8high
21DeepSeek V3DeepSeek69.5+1-8high
21Qwen3 VL 235B A22B InstructAlibaba69.3+1-8high
21DeepSeek V3.1 TerminusDeepSeek69.3+1-8high
21GPT-4o-miniOpenAI69.3+1-8high
21Inkling Smallthinkingmachines68.7+1-8high
21Inkling Small (free)thinkingmachines68.7+1-8high
21Qwen3.5-FlashAlibaba68.6+1-8high
21Hy3 previewTencent68.4+1-8high
21Qwen3 MaxAlibaba67.4+1-8high
21Mistral Large 3 2512 (batch)Mistral AI67.0+1-8high
21Llama 3.3 70B InstructMeta66.8+1-8high
21Claude 3 HaikuAnthropic51.3+1-8high
21Command ACohere50.8+1-8high
21Command R+ (08-2024)Cohere48.7+1-8high
21Kimi K2.5Moonshot AI47.5+1-8high
21Llama 3.1 8B InstructMeta44.5+1-8high
21GPT-4.1 NanoOpenAI42.1+1-8high
21R1 Distill Llama 70BDeepSeek40.7+1-8high
19GPT-5.1-Codex-MiniOpenAI87.8-2-6high
19o3 ProOpenAI86.7-2-6high
19o3OpenAI86.7-2-6high
19o3 (batch)OpenAI86.7-2-6high
19Muse Spark 1.1meta80.90-7high
19Gemma 4 31BGoogle80.50-7high
19Gemma 4 31B (free)Google80.50-7high
19Qwen3.5 397B A17BAlibaba79.40-7high
19R1 0528DeepSeek79.40-7high
19GPT-5.4 NanoOpenAI79.30-7high
19GPT-5.4 Nano (batch)OpenAI79.30-7high
19GPT-5.4 MiniOpenAI79.30-7high
19GPT-5.4 Mini (batch)OpenAI79.30-7high
19Gemini 3.1 Flash Lite PreviewGoogle79.30-7high
19Gemini 2.5 Flash LiteGoogle79.10-7high
19Gemini 2.5 Flash Lite (batch)Google79.10-7high
19Gemini 2.5 FlashGoogle79.10-7high
19Gemini 2.5 Flash (batch)Google79.10-7high
19Gemini 3.5 FlashGoogle79.00-7high
19Gemini 3.5 Flash (batch)Google79.00-7high
19GLM 5.3 FlashZhipu AI78.0+1-7high
19MiMo-V2.5-ProXiaomi76.20-7high
19Qwen3.5-35B-A3BAlibaba76.00-7high
19GLM 5.2 (free)Zhipu AI75.70-7high
19Kimi K2.6Moonshot AI75.70-7high
19o3 MiniOpenAI75.30-7high
19Claude Opus 4.1 (batch)Anthropic75.20-7high
19Command R (08-2024)Cohere48.7+2-7high
17GPT-6 AstraOpenAI81.80-6high
17GPT-6 Astra (batch)OpenAI81.80-6high
17GPT-6 Astra ProOpenAI81.80-6high
17GPT-6 Astra Pro (batch)OpenAI81.80-6high
17o4 MiniOpenAI81.40-6high
17o4 Mini (batch)OpenAI81.40-6high
17Gemini 3.8 FlashGoogle81.00-6high
17Gemini 3.8 Flash (batch)Google81.00-6high
17Qwen3.5-27BAlibaba77.0+1-6high
17GPT-5 Mini (batch)OpenAI76.8+1-6high
17GPT-5 Nano (batch)OpenAI76.8+1-6high
17Gemini 3.5 Flash LiteGoogle76.5+1-6high
17Gemini 3.5 Flash Lite (batch)Google76.5+1-6high
10Grok 4.3 (batch)xAI81.00-5high
10MiniMax M2.1MiniMax71.0+1-5high
9GPT-5.2 ProOpenAI90.5-1-4medium
9GPT-5.2 Pro (batch)OpenAI90.5-1-4medium
9GPT-5.2OpenAI90.5-1-4medium
9GPT-5.2 (batch)OpenAI90.5-1-4medium
9Claude Opus 4.6Anthropic90.4-1-4medium
9Claude Opus 4.6 (batch)Anthropic90.4-1-4medium
9GPT-5.6 Luna ProOpenAI89.0-1-4medium
9GPT-5.6 Luna Pro (batch)OpenAI89.0-1-4medium
9GPT-5.6 LunaOpenAI89.0-1-4medium
9GPT-5.6 Luna (batch)OpenAI89.0-1-4medium
9GPT-5.6 Terra ProOpenAI89.0-1-4medium
9GPT-5.6 Terra Pro (batch)OpenAI89.0-1-4medium
9GPT-5.6 TerraOpenAI89.0-1-4medium
9GPT-5.6 Terra (batch)OpenAI89.0-1-4medium
9GPT-5.6 Sol ProOpenAI89.0-1-4medium
9GPT-5.6 Sol Pro (batch)OpenAI89.0-1-4medium
9GPT-5.6 SolOpenAI89.0-1-4medium
9GPT-5.6 Sol (batch)OpenAI89.0-1-4medium
7Claude Opus 4.7Anthropic95.1-1-3medium
7Claude Opus 4.7 (batch)Anthropic95.1-1-3medium
7GPT-5.5 Pro (batch)OpenAI92.7-1-3medium
7GPT-5.5OpenAI92.7-1-3medium
7GPT-5.5 (batch)OpenAI92.7-1-3medium
7Gemini 3.1 Pro Preview Custom ToolsGoogle92.2-1-3medium
7Gemini 3.1 Pro PreviewGoogle92.2-1-3medium
7Gemini 3.1 Pro Preview (batch)Google92.2-1-3medium
7GPT-5.4 ProOpenAI91.9-1-3medium
7GPT-5.4 Pro (batch)OpenAI91.9-1-3medium
7GPT-5.4OpenAI91.9-1-3medium
7GPT-5.4 (batch)OpenAI91.9-1-3medium
7GPT-5.2-CodexOpenAI90.5-1-3medium
7Grok 4.5xAI88.8-2+56medium
7Grok 4.3xAI88.8-2+30medium
7Claude Sonnet 5Anthropic85.2-2+231medium
6Claude Opus 5Anthropic95.1-1+272medium
6GPT-5.5 ProOpenAI92.7-1+8medium
6GPT-5.3-CodexOpenAI90.5-1+18medium
6GPT-5.2 ChatOpenAI90.5-1+80medium
5Claude Opus 4.8 (batch)Anthropic94.6-1-2medium
5Muse Spark 1.3meta80.90+161medium
5Muse Spark 1.2meta80.90+189medium
5GLM 5.1Zhipu AI78.0+1+11medium
5GLM 5 TurboZhipu AI78.0+1+43medium
5Qwen3.8 Max (0902)Alibaba75.60+120medium
5GLM 4.7Zhipu AI75.10+13medium
5GLM 4.6Zhipu AI75.10+27medium
5Qwen3.7 MaxAlibaba74.80+176medium
5Qwen3.5 Plus 2026-04-20Alibaba74.80+187medium
5DeepSeek V3.1DeepSeek71.8+1+7medium
5MiniMax M2.7MiniMax71.6+1+6medium
5GPT-4o (2024-11-20)OpenAI71.2+1+60medium
5Qwen3.5 Plus 2026-02-15Alibaba68.2+1+159medium
5Qwen3 Next 80B A3B ThinkingAlibaba66.7+1+6medium
5Mistral Large 2407Mistral AI65.9+1+23medium
5Qwen3 30B A3B Instruct 2507Alibaba64.1+1+170medium
2Grok 4.6xAI88.8-2+3low
2GPT-5.1-Codex-MaxOpenAI88.7-2+1low
2GPT-5.1OpenAI88.7-2+1low
2GPT-5.1-CodexOpenAI88.7-2+2low
1Claude Opus 4.8Anthropic95.1-10low

稳定模型

7 个模型无下降且排名状态稳定。这些模型表现一致。

#模型评分24h7d状态
1Claude Fable 5.1Anthropic95.900stable
2Claude Fable 5.1 (batch)Anthropic95.900stable
3Claude Fable 5Anthropic95.900stable
4Claude Fable 5 (batch)Anthropic95.900stable
101GLM 5.3Zhipu AI78.60+4stable
151DeepSeek V3.2 ExpDeepSeek71.8+1+4stable
169Qwen3 VL 235B A22B ThinkingAlibaba69.3+1+4stable

如何检测性能衰退

我们的性能衰退检测系统使用多种信号来识别可能正在下降的模型。

下降中 (7天)

7天排名变化超过-2位的模型。一周内持续下降超过两个名次,表明该模型可能正在被竞争对手超越或出现性能问题。

脆弱状态

被评分系统标记为"脆弱"的模型。这些模型的性能指标不一致或评分处于边界,评估数据的微小变化可能导致显著波动。

持续下降

在24小时和7天两个时间维度上均下降的模型。当模型在短期和中期窗口都在失去排名时,表明这是持续的下降趋势而非暂时波动。

风险评分

性能衰退风险评分综合了多个信号:7天排名下降权重2倍,24小时排名下降权重1倍,脆弱状态额外加5分。更高的评分表示有更大的性能衰退风险。

相关

Frequently Asked Questions

The tracker uses a multi-signal approach: it monitors 7-day rank decline (weighted 2x), 24-hour rank drops (weighted 1x), and fragile state classification (+5 points). Models are scored on a degradation risk scale where higher values indicate more warning signs of performance decline.

A fragile state indicates that a model has inconsistent performance metrics or borderline scores that could shift significantly with small changes in evaluation data. Fragile models are at higher risk of further ranking drops and warrant closer monitoring.

Yes, models can recover. Degradation may be temporary due to API issues, benchmark fluctuations, or scoring recalibrations. Models that show sustained decline over multiple weeks are more concerning than those with short-term dips. The tracker monitors both 24-hour and 7-day windows to help distinguish temporary noise from real trends.

AI Model Degradation Tracker - Detect Performance Drops | LM Market Cap