评分透明度
LM Market Cap 上的每个排名都是从一个多源实时数据管道通过算法计算得出的,该管道汇集了上游服务商 API、基准测试源和价格信息。数据每小时刷新一次。没有人工干预、没有专家小组、没有编辑策划。排名完全由算法决定。
工作原理
完全自动化的流水线,没有人工决策节点。
1.
每小时数据获取
一个定时任务每小时从多个上游服务商API与基准测试源拉取最新模型数据,获取价格、上下文大小、功能和可用性信息。
2.
评分计算
每个模型在六个维度上使用确定性算法进行评分。相同的输入数据总是产生相同的评分--没有随机性,没有人工干预。
3.
缓存更新
计算出的评分写入本地JSON缓存,Web应用在运行时读取。排名在每个刷新周期自动更新。
六大评分维度
每个模型获得0到100的综合评分,由六个维度的加权总和计算得出。权重是固定的并在此公开。
功能
25% 权重模型的能力:编程、推理、指令遵循和多领域知识。基于服务商报告的基准数据和功能标志。
价格档位
25% 权重基于输入和输出令牌定价的成本效益。每质量点成本越低评分越高,便于找到最佳性价比。
上下文窗口
15% 权重模型支持的最大上下文长度。更大的上下文窗口可以处理更长的文档、代码库和对话历史。
时效性
15% 权重模型发布或最后更新的时间。较新的模型获得随时间衰减的新鲜度加分,反映AI发展的快速步伐。
输出容量
10% 权重模型在单次响应中可以生成的最大输出令牌数。更高的输出容量对代码和文章等长文本生成任务很重要。
多功能性
10% 权重模型支持的模态和任务范围,如文本、代码、函数调用和图像理解。更通用的模型评分更高。
实际意义
- 排名是确定性的。给定相同的输入数据,总是产生相同的评分。
- 没有模型服务商可以付费获得更高排名。没有赞助或推广层级。
- 数据通过定时任务每小时刷新。当上游服务商更新价格或功能时,我们的评分会自动反映变化。
- 评分权重(25/25/15/15/10/10)是硬编码的。它们在运行之间不会改变。
- 新模型在上游服务商发布后自动出现在排名中。无需人工审批。
- 所有评分逻辑在服务端运行。没有可被操纵的客户端计算。