Skip to content

评分透明度

LM Market Cap 上的每个排名都是从一个多源实时数据管道通过算法计算得出的,该管道汇集了上游服务商 API、基准测试源和价格信息。数据每小时刷新一次。没有人工干预、没有专家小组、没有编辑策划。排名完全由算法决定。

工作原理

完全自动化的流水线,没有人工决策节点。

1.

每小时数据获取

一个定时任务每小时从多个上游服务商API与基准测试源拉取最新模型数据,获取价格、上下文大小、功能和可用性信息。

2.

评分计算

每个模型在六个维度上使用确定性算法进行评分。相同的输入数据总是产生相同的评分--没有随机性,没有人工干预。

3.

缓存更新

计算出的评分写入本地JSON缓存,Web应用在运行时读取。排名在每个刷新周期自动更新。

六大评分维度

每个模型获得0到100的综合评分,由六个维度的加权总和计算得出。权重是固定的并在此公开。

功能

25% 权重

模型的能力:编程、推理、指令遵循和多领域知识。基于服务商报告的基准数据和功能标志。

价格档位

25% 权重

基于输入和输出令牌定价的成本效益。每质量点成本越低评分越高,便于找到最佳性价比。

上下文窗口

15% 权重

模型支持的最大上下文长度。更大的上下文窗口可以处理更长的文档、代码库和对话历史。

时效性

15% 权重

模型发布或最后更新的时间。较新的模型获得随时间衰减的新鲜度加分,反映AI发展的快速步伐。

输出容量

10% 权重

模型在单次响应中可以生成的最大输出令牌数。更高的输出容量对代码和文章等长文本生成任务很重要。

多功能性

10% 权重

模型支持的模态和任务范围,如文本、代码、函数调用和图像理解。更通用的模型评分更高。

实际意义

  • 排名是确定性的。给定相同的输入数据,总是产生相同的评分。
  • 没有模型服务商可以付费获得更高排名。没有赞助或推广层级。
  • 数据通过定时任务每小时刷新。当上游服务商更新价格或功能时,我们的评分会自动反映变化。
  • 评分权重(25/25/15/15/10/10)是硬编码的。它们在运行之间不会改变。
  • 新模型在上游服务商发布后自动出现在排名中。无需人工审批。
  • 所有评分逻辑在服务端运行。没有可被操纵的客户端计算。