排序怎么算
了解 Danbo AI资讯 评分怎么算,以及每个分数背后的公开成绩。
先看评分,再看所长。
综合榜与四类榜单最多展示 30 个模型。Danbo AI资讯 评分帮助快速比较;分项成绩说明各有所长,证据覆盖说明已有评测的范围。
评分是基于公开评测折算的综合比较指数,不是答题正确率,也不表示所有任务的绝对能力。具体用途请结合分项原始成绩和运行配置。
- 01
先核验型号与运行配置
统一模型名称、版本与推理配置,按预先确定的规则选代表运行,不挑最高分。统一固定工具且全程同一型号可以采用;多模型回退、混合模型与专属异构 Agent 系统不混排。配置未公开就保留未知,不据此断言混用了模型。
- 02
按能力分配,重复证据不加权
综合榜按八个能力维度等权分配,每维占 12.5%。维度内再分配到评测题族,同一题库的重复成绩、榜单切片与已用分项的综合指标不叠加计权。新增评测先核对题目与协议的重叠关系。
- 03
用同协议参照校准真实分差
只比较同一评测协议下双方都有的成绩,用预先固定参照组的四分位距校准连续分差,避免把微小领先和大幅领先都当成同一票。缺测不补分,未知标准误不当成零。
- 04
算成评分,方便比较
汇总共同评测的相对成绩差,寻找冲突较少的参考顺序。在保持顺序的条件下,将共同成绩分差拟合为 0–100 的 Danbo AI资讯 评分;各项原始成绩供进一步核对。
八个能力维度,各占相同份额。
编程、数学与推理、知识与事实、语言理解与指令、写作与表达、视觉理解、专业任务、中文与多语言各占 12.5%。这是均衡取向的公开选择,不是通用能力的天然权重。每个维度先分配题族份额,再处理题族内的评测;同题重复不会增加总权重。已采用分项时,包含它们的综合指标不再重复计入。缺失份额不转给其他证据。
- 编程12.5%本轮参与:DeepSWE v1.1 · LiveBench · 编程综合
- 数学与推理12.5%本轮参与:LiveBench · 推理与数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
- 知识与事实12.5%本轮参与:SimpleQA Verified · GPQA Diamond
- 语言理解与指令12.5%本轮参与:LiveBench · 语言与指令
- 写作与表达12.5%本轮参与:Creative Writing v3 · Longform Writing
- 视觉理解12.5%本轮暂无可计入证据
- 行业专业任务12.5%本轮参与:APEX-Agents 1.1 · Vals Finance Agent
- 中文与多语言12.5%本轮暂无可计入证据
编程、推理、知识、专业办公四类榜单保留独立入口,只比较对应能力的公开成绩;分类评分与参考位次不能跨分类比较。公开评测来自同一机构时,不能当成多个独立机构。更多评测只有补充不同的有效证据才有价值,数量本身不增加某个能力维度的总份额。
你可能还想知道
Danbo AI资讯 评分怎么看?+
为什么不同名次可能同分?+
参考位次能说明谁一定更强吗?+
证据覆盖百分比是什么?+
共同评测的相对成绩差是胜率吗?+
为什么不直接取每个模型的最高成绩?+
评测重复、污染和误差能全部消除吗?+
新模型什么时候会出现?+
某家榜单暂时打不开,会怎样?+
价格或速度会影响参考顺序吗?+
查看计算细节与当前版本+
方法版本:2026.10-observed-evidence-v17。模型身份、代表配置、题族归属、维度权重、参照组与计算输入均保留版本。参考顺序采用加权不完整 Kemeny 排序,最小化与共同评测相对成绩差的冲突;只发布求解达到最优且满足资格与连通条件的结果。可能存在多个同样最优的顺序,固定展示顺序不代表已精确分开所有型号,数学求解最优也不代表真实能力顺序已获证明。
每项评测先确认协议和方向,再以固定参照组在同协议下的四分位距(中间一半参照成绩的跨度)校准连续分差。参照不是当前参榜模型的动态最高分或最低分;新增极端成绩不会因此重新拉伸其他模型的尺度。至少有四个有效参照且四分位距大于零才可校准;不足时等待有效参照。方向统一后的原始分差除以冻结的四分位距,再截断到 −1 至 1。它是相对成绩差,不是天然能力单位。
评分在参考顺序确定后拟合:对每对共同评测的型号,以共同证据份额 W 加权,让分数差尽量接近标准化的平均成绩差 d,最小化 Σ W·(xᵢ−xⱼ−dᵢⱼ)²;同时约束 x 不与已发布顺序反向。本轮有效参照型号的 x 均值固定为 0,再按 100 / (1 + 9⁻ˣ) 映射为 0–100 分,参照中心为 50、相差一个拟合单位对应 90 或 10。这个尺度是公开约定,不是测得的概率。不同分类、轮次及方法版本不直接比较;新增有效证据或参评型号可改变拟合分数,筛选页面不会重新计算。
加权拟合借鉴 HodgeRank 的成对比较思路,本榜额外约束分数顺序。它会压缩冲突,不能把全部任务表现保真地浓缩成一个数字。拟合结果、实际参照和残差随计算轮次保存,未达到有效求解条件时不发布新轮次。
标准误已公开时保留其误差信息;未公开时保留未知,不设为零,也不把标准化分差说成概率。缺测不补零、不补均值;共同证据不足或不连通时,不强行编造跨组的确定顺序。覆盖比例表示已覆盖的评测权重,不能解释成对最终参考位次的精确贡献率。
综合榜至少需要三个来源、三个题族、三家机构、三个能力领域,并与至少两个固定参照有直接可比成绩。分类按其可用来源要求最多两项来源和两家机构、至少一个参照。发布超过十八个月的型号退出当前排序,已有详情页保留注明时间的历史记录。
没有逐题数据时不能把展开的模型对数量当成独立样本量。已公开的成绩不涵盖所有可能偏差,也不能替代对未知成绩的研究。评分不附带未经验证的统计置信度。
固定参照型号:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。参照组用于校准评测尺度,不指定任何厂商应排第几。与评测协议一起冻结并保留版本,协议变化时重新核验。