跳到正文

模型榜

在统一单型号口径下比较公开评测,展示 Danbo AI资讯 评分、参考位次与各项原始成绩。

14 项评测·6 家机构·10/07 23:33 更新

综合榜30 个模型

当前展示 30 个模型,可按列重排;参考位次来自原榜
参考
位次
模型
01Claude Fable 5.1Anthropic · 9月1日上线85.1覆盖 58%
02GPT-6 AstraOpenAI · 9月3日上线83.0覆盖 69%
03Claude Opus 5.5Anthropic · 9月22日上线80.8覆盖 61%
04GPT-6.1 SolOpenAI · 9月29日上线80.3覆盖 58%
05Gemini 3.8 FlashGoogle · 9月2日上线78.2覆盖 69%
06Claude Fable 5Anthropic · 6月9日上线78.2覆盖 69%
07Gemini 3.7 FlashGoogle · 8月13日上线78.2覆盖 66%
08Claude Opus 5Anthropic · 7月24日上线78.2覆盖 63%
09Claude Sonnet 5.5Anthropic · 9月28日上线74.4覆盖 55%
10GPT-5.6 SolOpenAI · 7月9日上线74.4覆盖 69%
11Muse Spark 1.3Meta · 9月2日上线74.4覆盖 52%
12GPT-6 SolOpenAI · 9月22日上线71.6覆盖 61%
13GPT-5.5OpenAI · 4月23日上线69.0覆盖 69%
14Grok 4.6xAI · 8月12日上线67.6覆盖 63%
15Kimi K3开源权重 ↗Moonshot AI · 7月16日上线67.6覆盖 69%
16Grok 4.7xAI · 9月21日上线64.8覆盖 65%
17Muse Spark 1.2Meta · 8月5日上线64.8覆盖 53%
18GPT-5.6 TerraOpenAI · 7月9日上线64.8覆盖 69%
19Qwen3.8 MaxAlibaba · 7月19日上线62.5覆盖 63%
20GLM-5.3开源权重 ↗Z.ai · 8月18日上线62.0覆盖 69%
21Claude Opus 4.8Anthropic · 5月28日上线62.0覆盖 69%
22GPT-5.4OpenAI · 3月5日上线62.0覆盖 41%
23Gemini 3.6 FlashGoogle · 7月21日上线62.0覆盖 66%
24DeepSeek V4.1 Flash开源权重 ↗DeepSeek · 9月10日上线60.4覆盖 43%
25Gemini 3.5 FlashGoogle · 5月19日上线60.4覆盖 66%
26Grok 4.5xAI · 7月8日上线56.0覆盖 63%
27Gemini 3.1 Pro PreviewGoogle · 2月19日上线56.0覆盖 69%
28DeepSeek V4 Pro 0813开源权重 ↗DeepSeek · 8月13日上线56.0覆盖 58%
29Qwen3.7 MaxAlibaba · 5月19日上线49.3覆盖 52%
30Claude Opus 4.7Anthropic · 4月16日上线49.3覆盖 65%

分类榜已有领先成绩,但综合证据尚不足:Gemini 4 Argon(已有 2 项可比评测)、MiMo-V2.6-Pro(已有 2 项可比评测)。尚无综合参考位次不等于能力较弱,仍可查看已有分类与原始成绩。

Danbo AI资讯 评分为 0–100 分,越高表示本榜综合表现越强。同分按参考位次排列;筛选后保留原榜评分与位次,每次最多展示 30 个模型。

评分用于同一榜单、同一轮内的比较,不是正确率。各项评测的原始成绩可在模型详情查看。

如何看这张榜

Danbo AI资讯 评分越高,表示本榜综合表现越强;评分不是正确率,具体能力可查看分项成绩。价格不参与排序,缺测不补分。能力表现请结合分项原始成绩与运行配置判断。

了解计算方法 →

关于价格

API 价格来自厂商官网,按每百万 Token 展示。价格目录更新至 2026-09-30,具体以厂商当前报价为准。美元报价按 2026-10-07 汇率折算成人民币。缓存价格指命中后的输入价格,缓存写入、存储及订阅费用另计。