跳到正文
← 模型榜

评测来源

官方当前登记 90 个来源,其中 35 项用于排名。

编程

Terminal-Bench 4.0 · AA ↗

在命令行环境里独立完成一整件工程任务。

Artificial Analysis · 参与排名

Terminal-Bench 4.0 · Vals ↗

Vals 用同一套 Agent 流程给所有模型复跑 Terminal-Bench 4.0。

Vals AI · 参与排名

LiveBench · 编程综合 ↗

Coding + Agentic Coding 两项均分,各占 50%。

LiveBench · 参与排名

SciCode · AA ↗

把物理、化学、生物等科研问题写成能运行的计算代码。

Artificial Analysis · 参与排名

Code Migration ↗

把整套程序从一种语言或框架迁移到另一种。

Vals AI · 参与排名

ProgramBench ↗

只给可执行文件,从零重写出行为相同的程序。

Vals AI · 参与排名

Vibe Code Bench v1.1 ↗

从需求搭建网页应用,检查实际功能。

Vals AI · 参与排名

Vibe Code Bench 1–100 ↗

在已有应用上连续开发,同时保持旧功能。

Vals AI · 参与排名

CyberBench Patch v1.1 ↗

修补真实开源项目的安全漏洞。

Vals AI · 参与排名

DeepSWE v1.1 ↗

在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。

DataCurve · 参考来源

MirrorCode ↗

长时间的软件复现

Epoch AI · 参考来源

TapTap Maker ↗

在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。

TapTap Maker · 参考来源

Terminal-Bench 4 ↗

保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。

Harbor / Terminal-Bench · 参考来源

Hyper-τ-bench ↗

根据业务资料构建并测试能工作的客户服务代理。

Sierra · 参考来源

SWE-rebench ↗

持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。

Nebius · 参考来源

LHTB ↗

在较长时间内持续使用终端,完成复杂工程与工具任务。

Tencent HY / Lehigh 等 · 参考来源

FrontierCode ↗

真实仓库任务的质量、测试与修改范围

Cognition · 参考来源

FrontierSWE v2 ↗

长时间运行的工程实现与研究任务

Proximal Labs · 参考来源

WeirdML ↗

在陌生数据上实现机器学习方案

WeirdML · 参考来源

科研

HLE · AA ↗

横跨学科的专家级难题,不用工具作答。

Artificial Analysis · 参与排名

FrontierMath v2 · Tiers 1–3 ↗

研究级数学推理

Epoch AI · 参与排名

LiveBench · 推理与数学 ↗

Reasoning + Mathematics 两项均分,各占 50%。

LiveBench · 参与排名

CritPt · AA ↗

研究级物理问题,考验专业推导。

Artificial Analysis · 参与排名

Chess Puzzles ↗

根据文字棋局寻找正确走法

Epoch AI · 参与排名

Mystery Game Puzzles ↗

从陌生规则推导正确行动

Epoch AI · 参与排名

MysteryMechanism ↗

自己设计实验,去推断一套隐藏的规律。

Vals AI · 参与排名

Terminal-Bench Science · Vals ↗

在终端完成科学工作流与分析。

Vals AI · 参与排名

Terminal-Bench Science · AA ↗

在终端完成科学工作流与分析。

Artificial Analysis · 参与排名

FrontierMath v2 · Tier 4 ↗

更高难度的数学研究题

Epoch AI · 参考来源

Humanity’s Last Exam ↗

横跨学科的高难度学术知识与推理。

CAIS / Scale AI · 参考来源

SimpleBench ↗

用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。

SimpleBench · 参考来源

MathArena · ArXivLean ↗

用 Lean 验证数学证明

MathArena / ETH Zurich · 参考来源

MathArena · BrokenArXiv ↗

发现和修复数学证明中的错误

MathArena / ETH Zurich · 参考来源

MathArena · ArXivMath ↗

从近期数学论文提炼的新题

MathArena / ETH Zurich · 参考来源

ARC-AGI-2 ↗

从陌生规则中学习和泛化

ARC Prize · 参考来源

ARC-AGI-3 ↗

从陌生规则中学习和泛化

ARC Prize · 参考来源

专业办公

GDPval-AA ↗

按真实职业交付件出题,两两比较产出质量。

Artificial Analysis · 参与排名

AA-Briefcase ↗

办公知识工作的长任务,两两比较交付结果。

Artificial Analysis · 参与排名

AutomationBench · AA ↗

跨办公软件完成一整条业务自动化流程。

Artificial Analysis · 参与排名

Vals Finance Agent ↗

金融分析师的日常办公题,看研报、建模这类工作做得怎样。

Vals AI · 参与排名

APEX-Agents 1.1 ↗

投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。

Mercor · 参与排名

Harvey Legal Agent Benchmark ↗

处理法律资料并交付 Word、Excel、幻灯片等可审阅文件。

Vals AI / Harvey · 参与排名

τ³-Banking · Mercor ↗

在统一工具环境里办理银行客服业务:查政策、找产品、改账户。

Mercor · 参与排名

LiveBench · 数据分析 ↗

表格重排、列类型标注、表连接预测等数据处理任务。

LiveBench · 参与排名

MedCode ↗

根据住院记录给出医疗诊断编码。

Vals AI · 参与排名

AA-Analyst Agent ↗

可靠地分析数据并回答专业问题。

Artificial Analysis · 参与排名

τ³-Banking ↗

在统一工具环境中办理银行业务,检验规则理解、客户沟通与任务完成。

Sierra · 参考来源

AutomationBench ↗

跨办公软件完成自动化工作

Zapier · 参考来源

OfficeQA Pro ↗

从大量真实财务文件中检索、计算并回答问题。

Databricks · 参考来源

MCP Atlas ↗

通过真实 MCP 服务检索资料、操作文档与数据库,完成跨软件任务。

Scale AI · 参考来源

FinanceBenchmark ↗

完成金融定价、资本计算和风控任务,用数值与代码执行结果核验。

FinanceBenchmark · 参考来源

PRBench · Legal ↗

回答真实法律工作中的复杂问题,检验专业判断和论证质量。

Scale AI · 参考来源

PRBench · Finance ↗

回答真实金融决策问题,检验专业判断、推导和风险说明。

Scale AI · 参考来源

SpreadsheetBench 2 ↗

完成财务建模、修复工作簿和数据可视化的整套表格工作。

SpreadsheetBench / Renmin University / AfterQuery · 参考来源

Vending-Bench 2 ↗

经营模拟商店一年,处理采购、谈判、库存与定价。

Andon Labs · 参考来源

EBR-bench ↗

在长任务中学习新规则并使用记忆

Epoch AI · 参考来源

Excel · EMB ↗

表格编辑与 Excel 办公

Vals AI · 参考来源

Legal Research ↗

法律检索和论证

Vals AI · 参考来源

TaxAgentBench ↗

税务专业问题

Vals AI · 参考来源

MedScribe ↗

临床记录整理与撰写

Vals AI · 参考来源

BioMysteryBench ↗

生物学研究推理

Vals AI · 参考来源

Terminal-Bench Science ↗

在终端里完成科研任务

Harbor · 参考来源

知识问答

真人盲选与综合指数

写作与设计

视觉理解

中文与多语言