跳到正文

AIHOT LEADERBOARD

AI 模型排行榜

终端任务、应用开发、漏洞修补、写代码、科学计算、整套程序的迁移与重建,看模型能不能把软件做出来。

9 项评测 · 3 家机构 · 10/10 08:06 更新

数据同步自 AIHOT 官方模型榜 ↗,沿用官方排名与评分。

编程榜 30 个模型

名次模型
01Claude Opus 5.5Anthropic74.3
02Claude Sonnet 5.5Anthropic73.9
03Gemini 4 ArgonGoogle71.6
04Claude Fable 5.1Anthropic71.6
05GPT-6 AstraOpenAI69.4
06Claude Fable 5Anthropic69.2
07Claude Opus 5Anthropic66.9
08GPT-6 SolOpenAI66.5
09GPT-6.1 SolOpenAI66.4
10GPT-5.6 SolOpenAI65.8
11MiMo-V2.6-ProXiaomi64.0
12GLM-5.3Z.ai开源权重 ↗63.3
13Muse Spark 1.3Meta63.3
14Claude Haiku 5.5Anthropic62.5
15Claude Opus 4.8Anthropic62.3
16Claude Opus 4.7Anthropic62.3
17Grok 4.7xAI61.6
18GPT-5.6 TerraOpenAI61.4
19Kimi K3Moonshot AI开源权重 ↗61.3
20Step 5 PreviewStepFun61.3
21Gemini 3.8 FlashGoogle60.9
22GPT-5.5OpenAI60.8
23DeepSeek V4.1 FlashDeepSeek开源权重 ↗60.5
24Gemini 3.7 FlashGoogle60.2
25GPT-6 LunaOpenAI59.5
26MiMo V 2.6 FlashXiaomi59.2
27GPT-5.6 LunaOpenAI59.1
28Muse Spark 1.2Meta58.8
29DeepSeek V4 Pro 0813DeepSeek开源权重 ↗58.5
30Grok 4.6xAI58.4

AIHOT 评分把各家评测换算到同一条能力刻度上:50 分是参照组模型的平均水平,每 15 分约是一个标准差。评分不是正确率。分类评分是模型在这个领域的能力,只列这个领域测得够多的模型。 价格为 API 参考报价,原始出处见模型详情。