跳到正文

AIHOT LEADERBOARD

AI 模型排行榜

专家难题、研究级数学与物理、逻辑、棋类、做实验反推规律与科学工作流,看模型能不能想明白新问题。

9 项评测 · 4 家机构 · 10/10 08:06 更新

数据同步自 AIHOT 官方模型榜 ↗,沿用官方排名与评分。

科研榜 30 个模型

名次模型
01GPT-6 AstraOpenAI77.6
02Claude Opus 5.5Anthropic76.8
03GPT-6.1 SolOpenAI75.7
04Gemini 4 ArgonGoogle74.7
05Claude Sonnet 5.5Anthropic74.3
06Claude Fable 5.1Anthropic74.1
07Claude Opus 5Anthropic70.8
08GPT-5.6 SolOpenAI70.1
09Claude Fable 5Anthropic69.8
10GPT-6 SolOpenAI69.2
11GPT-5.6 TerraOpenAI66.0
12GPT-5.5OpenAI66.0
13Gemini 3.8 FlashGoogle65.3
14Muse Spark 1.3Meta65.1
15Muse Spark 1.2Meta63.1
16Claude Opus 4.8Anthropic63.1
17Kimi K3Moonshot AI开源权重 ↗62.8
18Gemini 3.7 FlashGoogle62.7
19Claude Haiku 5.5Anthropic62.4
20Grok 4.6xAI62.3
21Qwen3.8 MaxAlibaba62.2
22Muse Spark 1.1Meta60.9
23MiMo-V2.6-ProXiaomi60.9
24Claude Opus 4.7Anthropic60.5
25GLM-5.3Z.ai开源权重 ↗60.3
26DeepSeek V4.1 FlashDeepSeek开源权重 ↗60.0
27Grok 4.7xAI60.0
28DeepSeek V4 Pro 0813DeepSeek开源权重 ↗59.8
29Grok 4.5xAI59.6
30Gemini 3.1 Pro PreviewGoogle59.3

AIHOT 评分把各家评测换算到同一条能力刻度上:50 分是参照组模型的平均水平,每 15 分约是一个标准差。评分不是正确率。分类评分是模型在这个领域的能力,只列这个领域测得够多的模型。 价格为 API 参考报价,原始出处见模型详情。