📐 排名方法说明
一、100 分制评分体系
本站采用 100 分制 对所有大模型和智能体进行综合评分,公式如下:
综合得分 = 官方性能分 × Wofficial + 网友评分 × Wuser
当前权重配置(可从后台动态调整):
- Wofficial = 60% — 官方/第三方权威评测分权重
- Wuser = 40% — 网友评分权重
当某模型/智能体尚无网友投票时,综合得分完全由官方性能分决定;随着投票人数增加,网友评分的权重逐步提升。
二、官方性能分来源
官方性能分来自以下第三方权威榜单,各榜单原始分数统一归一化到 0-100 分制:
- LMArena (Chatbot Arena) — Elo 评分归一化公式:
round((elo - 1200) / (1520 - 1200) × 100, 2) - SuperCLUE — 中文大模型综合评测
- OpenCompass — 上海AI实验室多维度评测
- Artificial Analysis — 性能与性价比分析
- 其他公开基准测试(MMLU、HumanEval、MATH 等)
所有榜单数据均标注来源与截止时间,可在 权威榜单 页面查看完整列表与各榜单权重。
三、网友评分机制
网友评分采用 0-100 分制,用户可对任意已收录的大模型或智能体打分并留下评论。
票数置信度机制
为防止少量投票操纵排名,网友评分的实际权重随票数增长:
实际权重系数 = min(1, 投票数 / 50)
- 1 票 → 权重系数 0.02(几乎不影响综合分)
- 10 票 → 权重系数 0.20
- 25 票 → 权重系数 0.50
- 50 票及以上 → 权重系数 1.00(达到全额权重)
这意味着至少需要 50 人投票,网友评分才能对综合得分产生完整影响,有效防止刷榜。
防刷票措施
- IP 哈希限制:同一 IP 地址在冷却时间内只能投票一次
- 冷却时间:当前设置为 60 分钟
- 浏览器指纹:辅助识别重复投票行为
- 异常检测:短时间内大量相同分数会被标记审查
四、数据可信度三级标注制度
本站所有数据均标注可信度等级,确保用户清楚每条数据的可靠程度:
| 等级 | 标识 | 含义 |
|---|---|---|
| 多源确认 | (无特殊标记) | 数据经两个及以上独立来源交叉验证,可信度高 |
| 单源 | ⚠️ 单源 | 仅单一来源,未经交叉验证,可能存在偏差 |
| 暂未获取 | ⚠️ 暂未获取 | 未检索到可靠公开数据,不作推测填充 |
🔒 我们的承诺:检索不到的数据一律标注「暂未获取」,绝不推测填充、绝不编造数值。
页面上显示的每一个数字都有据可查,NULL 值统一展示为「暂未获取」而非 0 或空字符串。
五、大模型 vs 智能体的区分标准
六、排行榜分类与排序依据
本站提供多个维度的排行榜,每个分类有独立的排序字段:
| 分类名称 | 目标 | 排序字段 | 说明 |
|---|---|---|---|
| 综合排名 | 大模型 | final_score DESC |
官方性能分×权重+网友评分×权重的综合得分 |
| 官方性能排名 | 大模型 | official_score DESC |
基于权威榜单的官方性能评分 |
| 网友评选 | 大模型 | user_score DESC |
网友投票评分均值 |
| LMArena Elo | 大模型 | arena_elo DESC |
LMArena Chatbot Arena Elo评分 |
| API调用量 | 大模型 | api_calls_monthly DESC |
月度API调用量排名 |
| 私有部署量 | 大模型 | hf_downloads DESC |
HuggingFace下载量反映私有部署热度 |
| 文本能力 | 大模型 | official_score DESC |
文本理解与生成能力排名 |
| 多模态能力 | 大模型 | official_score DESC |
多模态理解与生成能力排名 |
| 图像生成 | 大模型 | official_score DESC |
图像生成模型排名 |
| 视频生成 | 大模型 | official_score DESC |
视频生成模型排名 |
| 代码能力 | 大模型 | official_score DESC |
代码生成与理解能力排名 |
| 开源模型 | 大模型 | official_score DESC |
开源/开放权重模型排名 |
| 最新发布 | 大模型 | release_date DESC |
按发布时间排序的最新模型 |
| 最新上线Agent | 智能体 | launch_date DESC |
按上线时间排序的最新智能体 |
| 智能体综合 | 智能体 | final_score DESC |
智能体综合排名 |
| 编程Agent | 智能体 | official_score DESC |
编程类智能体排名 |
| 搜索Agent | 智能体 | official_score DESC |
搜索/研究类智能体排名 |
| 自主任务Agent | 智能体 | official_score DESC |
自主任务型智能体排名 |
七、数据截止日期与更新说明
当前数据截止日期:2026-09-26
本站数据通过以下方式持续更新:
- 定期同步各权威榜单的最新发布数据
- 跟踪厂商官方公告与产品更新
- 社区贡献与数据纠错
由于 AI 领域发展迅速,模型能力与排名随时可能变化。本站尽力保持数据时效性,但无法保证绝对实时。
八、免责声明
本站所有排名、评分和数据仅供参考,不构成任何投资建议、购买推荐或使用建议。
数据来源于各厂商官方公开信息、第三方权威评测榜单及社区投票,本站不对数据的绝对准确性做出保证。
用户应结合自身需求与实际测试做出独立判断。
部分数据标注为「单源」或「暂未获取」,请在使用时注意其可信度等级。
如发现数据错误,欢迎通过站内反馈渠道告知我们。