AIHOT LEADERBOARD
AI 模型排行榜
终端任务、应用开发、漏洞修补、写代码、科学计算、整套程序的迁移与重建,看模型能不能把软件做出来。
9 项评测 · 3 家机构 · 10/10 08:06 更新
数据同步自 AIHOT 官方模型榜 ↗,沿用官方排名与评分。
编程榜 30 个模型
| 名次 | 模型 | |||
|---|---|---|---|---|
| 01 | Claude Opus 5.5Anthropic | 2026-09-22 | 8 项评测覆盖 86% | 74.3 |
| 02 | Claude Sonnet 5.5Anthropic | 2026-09-28 | 8 项评测覆盖 100% | 73.9 |
| 03 | Gemini 4 ArgonGoogle | 2026-09-30 | 7 项评测覆盖 86% | 71.6 |
| 04 | Claude Fable 5.1Anthropic | 2026-09-01 | 9 项评测覆盖 100% | 71.6 |
| 05 | GPT-6 AstraOpenAI | 2026-09-03 | 9 项评测覆盖 100% | 69.4 |
| 06 | Claude Fable 5Anthropic | 2026-06-09 | 7 项评测覆盖 86% | 69.2 |
| 07 | Claude Opus 5Anthropic | 2026-07-24 | 9 项评测覆盖 100% | 66.9 |
| 08 | GPT-6 SolOpenAI | 2026-09-22 | 8 项评测覆盖 100% | 66.5 |
| 09 | GPT-6.1 SolOpenAI | 2026-09-29 | 8 项评测覆盖 100% | 66.4 |
| 10 | GPT-5.6 SolOpenAI | 2026-07-09 | 9 项评测覆盖 100% | 65.8 |
| 11 | MiMo-V2.6-ProXiaomi | 2026-09-21 | 7 项评测覆盖 86% | 64.0 |
| 12 | GLM-5.3Z.ai开源权重 ↗ | 2026-08-18 | 9 项评测覆盖 100% | 63.3 |
| 13 | Muse Spark 1.3Meta | 2026-09-02 | 9 项评测覆盖 100% | 63.3 |
| 14 | Claude Haiku 5.5Anthropic | 2026-10-07 | 9 项评测覆盖 100% | 62.5 |
| 15 | Claude Opus 4.8Anthropic | 2026-05-28 | 7 项评测覆盖 86% | 62.3 |
| 16 | Claude Opus 4.7Anthropic | 2026-04-16 | 4 项评测覆盖 57% | 62.3 |
| 17 | Grok 4.7xAI | 2026-09-21 | 8 项评测覆盖 100% | 61.6 |
| 18 | GPT-5.6 TerraOpenAI | 2026-07-09 | 9 项评测覆盖 100% | 61.4 |
| 19 | Kimi K3Moonshot AI开源权重 ↗ | 2026-07-16 | 8 项评测覆盖 86% | 61.3 |
| 20 | Step 5 PreviewStepFun | 2026-09-18 | 5 项评测覆盖 57% | 61.3 |
| 21 | Gemini 3.8 FlashGoogle | 2026-09-02 | 9 项评测覆盖 100% | 60.9 |
| 22 | GPT-5.5OpenAI | 2026-04-23 | 6 项评测覆盖 86% | 60.8 |
| 23 | DeepSeek V4.1 FlashDeepSeek开源权重 ↗ | 2026-09-10 | 9 项评测覆盖 100% | 60.5 |
| 24 | Gemini 3.7 FlashGoogle | 2026-08-13 | 8 项评测覆盖 100% | 60.2 |
| 25 | GPT-6 LunaOpenAI | 2026-09-22 | 8 项评测覆盖 100% | 59.5 |
| 26 | MiMo V 2.6 FlashXiaomi | 2026-09-21 | 7 项评测覆盖 86% | 59.2 |
| 27 | GPT-5.6 LunaOpenAI | 2026-07-09 | 9 项评测覆盖 100% | 59.1 |
| 28 | Muse Spark 1.2Meta | 2026-08-05 | 8 项评测覆盖 100% | 58.8 |
| 29 | DeepSeek V4 Pro 0813DeepSeek开源权重 ↗ | 2026-08-13 | 9 项评测覆盖 100% | 58.5 |
| 30 | Grok 4.6xAI | 2026-08-12 | 9 项评测覆盖 100% | 58.4 |
AIHOT 评分把各家评测换算到同一条能力刻度上:50 分是参照组模型的平均水平,每 15 分约是一个标准差。评分不是正确率。分类评分是模型在这个领域的能力,只列这个领域测得够多的模型。 价格为 API 参考报价,原始出处见模型详情。