← 返回首页

📐 排名方法说明

一、100 分制评分体系

本站采用 100 分制 对所有大模型和智能体进行综合评分,公式如下:

综合得分 = 官方性能分 × Wofficial + 网友评分 × Wuser

当前权重配置(可从后台动态调整):

  • Wofficial = 60% — 官方/第三方权威评测分权重
  • Wuser = 40% — 网友评分权重

当某模型/智能体尚无网友投票时,综合得分完全由官方性能分决定;随着投票人数增加,网友评分的权重逐步提升。

二、官方性能分来源

官方性能分来自以下第三方权威榜单,各榜单原始分数统一归一化到 0-100 分制:

  • LMArena (Chatbot Arena) — Elo 评分归一化公式:round((elo - 1200) / (1520 - 1200) × 100, 2)
  • SuperCLUE — 中文大模型综合评测
  • OpenCompass — 上海AI实验室多维度评测
  • Artificial Analysis — 性能与性价比分析
  • 其他公开基准测试(MMLU、HumanEval、MATH 等)

所有榜单数据均标注来源与截止时间,可在 权威榜单 页面查看完整列表与各榜单权重。

三、网友评分机制

网友评分采用 0-100 分制,用户可对任意已收录的大模型或智能体打分并留下评论。

票数置信度机制

为防止少量投票操纵排名,网友评分的实际权重随票数增长:

实际权重系数 = min(1, 投票数 / 50)
  • 1 票 → 权重系数 0.02(几乎不影响综合分)
  • 10 票 → 权重系数 0.20
  • 25 票 → 权重系数 0.50
  • 50 票及以上 → 权重系数 1.00(达到全额权重)

这意味着至少需要 50 人投票,网友评分才能对综合得分产生完整影响,有效防止刷榜。

防刷票措施

  • IP 哈希限制:同一 IP 地址在冷却时间内只能投票一次
  • 冷却时间:当前设置为 60 分钟
  • 浏览器指纹:辅助识别重复投票行为
  • 异常检测:短时间内大量相同分数会被标记审查

四、数据可信度三级标注制度

本站所有数据均标注可信度等级,确保用户清楚每条数据的可靠程度:

等级标识含义
多源确认 (无特殊标记) 数据经两个及以上独立来源交叉验证,可信度高
单源 ⚠️ 单源 仅单一来源,未经交叉验证,可能存在偏差
暂未获取 ⚠️ 暂未获取 未检索到可靠公开数据,不作推测填充
🔒 我们的承诺:检索不到的数据一律标注「暂未获取」,绝不推测填充、绝不编造数值。 页面上显示的每一个数字都有据可查,NULL 值统一展示为「暂未获取」而非 0 或空字符串。

五、大模型 vs 智能体的区分标准

维度大模型(基座模型)智能体(应用产品)
定义 底层 AI 引擎,如 Qwen3.8-Max、GPT-6 Astra 面向用户的应用产品,如千问助理、ChatGPT、Manus、Cursor
评估重点 参数量、基准测试成绩、Elo 分数、上下文长度 功能完整性、用户体验、工具生态、任务完成率
关系 提供基础能力 基于一个或多个基座模型构建,叠加应用层功能
排名 大模型排行榜 智能体排行榜

六、排行榜分类与排序依据

本站提供多个维度的排行榜,每个分类有独立的排序字段:

分类名称目标排序字段说明
综合排名 大模型 final_score DESC 官方性能分×权重+网友评分×权重的综合得分
官方性能排名 大模型 official_score DESC 基于权威榜单的官方性能评分
网友评选 大模型 user_score DESC 网友投票评分均值
LMArena Elo 大模型 arena_elo DESC LMArena Chatbot Arena Elo评分
API调用量 大模型 api_calls_monthly DESC 月度API调用量排名
私有部署量 大模型 hf_downloads DESC HuggingFace下载量反映私有部署热度
文本能力 大模型 official_score DESC 文本理解与生成能力排名
多模态能力 大模型 official_score DESC 多模态理解与生成能力排名
图像生成 大模型 official_score DESC 图像生成模型排名
视频生成 大模型 official_score DESC 视频生成模型排名
代码能力 大模型 official_score DESC 代码生成与理解能力排名
开源模型 大模型 official_score DESC 开源/开放权重模型排名
最新发布 大模型 release_date DESC 按发布时间排序的最新模型
最新上线Agent 智能体 launch_date DESC 按上线时间排序的最新智能体
智能体综合 智能体 final_score DESC 智能体综合排名
编程Agent 智能体 official_score DESC 编程类智能体排名
搜索Agent 智能体 official_score DESC 搜索/研究类智能体排名
自主任务Agent 智能体 official_score DESC 自主任务型智能体排名

七、数据截止日期与更新说明

当前数据截止日期:2026-09-26

本站数据通过以下方式持续更新:

  • 定期同步各权威榜单的最新发布数据
  • 跟踪厂商官方公告与产品更新
  • 社区贡献与数据纠错

由于 AI 领域发展迅速,模型能力与排名随时可能变化。本站尽力保持数据时效性,但无法保证绝对实时。

八、免责声明

本站所有排名、评分和数据仅供参考,不构成任何投资建议、购买推荐或使用建议。 数据来源于各厂商官方公开信息、第三方权威评测榜单及社区投票,本站不对数据的绝对准确性做出保证。 用户应结合自身需求与实际测试做出独立判断。
部分数据标注为「单源」或「暂未获取」,请在使用时注意其可信度等级。 如发现数据错误,欢迎通过站内反馈渠道告知我们。