评测来源
官方当前登记 90 个来源,其中 35 项用于排名。
编程
Terminal-Bench 4.0 · AA ↗
在命令行环境里独立完成一整件工程任务。
Artificial Analysis · 参与排名
Terminal-Bench 4.0 · Vals ↗
Vals 用同一套 Agent 流程给所有模型复跑 Terminal-Bench 4.0。
Vals AI · 参与排名
LiveBench · 编程综合 ↗
Coding + Agentic Coding 两项均分,各占 50%。
LiveBench · 参与排名
SciCode · AA ↗
把物理、化学、生物等科研问题写成能运行的计算代码。
Artificial Analysis · 参与排名
Code Migration ↗
把整套程序从一种语言或框架迁移到另一种。
Vals AI · 参与排名
ProgramBench ↗
只给可执行文件,从零重写出行为相同的程序。
Vals AI · 参与排名
Vibe Code Bench v1.1 ↗
从需求搭建网页应用,检查实际功能。
Vals AI · 参与排名
Vibe Code Bench 1–100 ↗
在已有应用上连续开发,同时保持旧功能。
Vals AI · 参与排名
CyberBench Patch v1.1 ↗
修补真实开源项目的安全漏洞。
Vals AI · 参与排名
DeepSWE v1.1 ↗
在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。
DataCurve · 参考来源
MirrorCode ↗
长时间的软件复现
Epoch AI · 参考来源
TapTap Maker ↗
在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。
TapTap Maker · 参考来源
Terminal-Bench 4 ↗
保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。
Harbor / Terminal-Bench · 参考来源
Hyper-τ-bench ↗
根据业务资料构建并测试能工作的客户服务代理。
Sierra · 参考来源
SWE-rebench ↗
持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。
Nebius · 参考来源
LHTB ↗
在较长时间内持续使用终端,完成复杂工程与工具任务。
Tencent HY / Lehigh 等 · 参考来源
FrontierCode ↗
真实仓库任务的质量、测试与修改范围
Cognition · 参考来源
FrontierSWE v2 ↗
长时间运行的工程实现与研究任务
Proximal Labs · 参考来源
WeirdML ↗
在陌生数据上实现机器学习方案
WeirdML · 参考来源
科研
HLE · AA ↗
横跨学科的专家级难题,不用工具作答。
Artificial Analysis · 参与排名
FrontierMath v2 · Tiers 1–3 ↗
研究级数学推理
Epoch AI · 参与排名
LiveBench · 推理与数学 ↗
Reasoning + Mathematics 两项均分,各占 50%。
LiveBench · 参与排名
CritPt · AA ↗
研究级物理问题,考验专业推导。
Artificial Analysis · 参与排名
Chess Puzzles ↗
根据文字棋局寻找正确走法
Epoch AI · 参与排名
Mystery Game Puzzles ↗
从陌生规则推导正确行动
Epoch AI · 参与排名
MysteryMechanism ↗
自己设计实验,去推断一套隐藏的规律。
Vals AI · 参与排名
Terminal-Bench Science · Vals ↗
在终端完成科学工作流与分析。
Vals AI · 参与排名
Terminal-Bench Science · AA ↗
在终端完成科学工作流与分析。
Artificial Analysis · 参与排名
FrontierMath v2 · Tier 4 ↗
更高难度的数学研究题
Epoch AI · 参考来源
Humanity’s Last Exam ↗
横跨学科的高难度学术知识与推理。
CAIS / Scale AI · 参考来源
SimpleBench ↗
用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。
SimpleBench · 参考来源
MathArena · ArXivLean ↗
用 Lean 验证数学证明
MathArena / ETH Zurich · 参考来源
MathArena · BrokenArXiv ↗
发现和修复数学证明中的错误
MathArena / ETH Zurich · 参考来源
MathArena · ArXivMath ↗
从近期数学论文提炼的新题
MathArena / ETH Zurich · 参考来源
ARC-AGI-2 ↗
从陌生规则中学习和泛化
ARC Prize · 参考来源
ARC-AGI-3 ↗
从陌生规则中学习和泛化
ARC Prize · 参考来源
专业办公
GDPval-AA ↗
按真实职业交付件出题,两两比较产出质量。
Artificial Analysis · 参与排名
AA-Briefcase ↗
办公知识工作的长任务,两两比较交付结果。
Artificial Analysis · 参与排名
AutomationBench · AA ↗
跨办公软件完成一整条业务自动化流程。
Artificial Analysis · 参与排名
Vals Finance Agent ↗
金融分析师的日常办公题,看研报、建模这类工作做得怎样。
Vals AI · 参与排名
APEX-Agents 1.1 ↗
投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。
Mercor · 参与排名
Harvey Legal Agent Benchmark ↗
处理法律资料并交付 Word、Excel、幻灯片等可审阅文件。
Vals AI / Harvey · 参与排名
τ³-Banking · Mercor ↗
在统一工具环境里办理银行客服业务:查政策、找产品、改账户。
Mercor · 参与排名
LiveBench · 数据分析 ↗
表格重排、列类型标注、表连接预测等数据处理任务。
LiveBench · 参与排名
MedCode ↗
根据住院记录给出医疗诊断编码。
Vals AI · 参与排名
AA-Analyst Agent ↗
可靠地分析数据并回答专业问题。
Artificial Analysis · 参与排名
τ³-Banking ↗
在统一工具环境中办理银行业务,检验规则理解、客户沟通与任务完成。
Sierra · 参考来源
AutomationBench ↗
跨办公软件完成自动化工作
Zapier · 参考来源
OfficeQA Pro ↗
从大量真实财务文件中检索、计算并回答问题。
Databricks · 参考来源
MCP Atlas ↗
通过真实 MCP 服务检索资料、操作文档与数据库,完成跨软件任务。
Scale AI · 参考来源
FinanceBenchmark ↗
完成金融定价、资本计算和风控任务,用数值与代码执行结果核验。
FinanceBenchmark · 参考来源
PRBench · Legal ↗
回答真实法律工作中的复杂问题,检验专业判断和论证质量。
Scale AI · 参考来源
PRBench · Finance ↗
回答真实金融决策问题,检验专业判断、推导和风险说明。
Scale AI · 参考来源
SpreadsheetBench 2 ↗
完成财务建模、修复工作簿和数据可视化的整套表格工作。
SpreadsheetBench / Renmin University / AfterQuery · 参考来源
Vending-Bench 2 ↗
经营模拟商店一年,处理采购、谈判、库存与定价。
Andon Labs · 参考来源
EBR-bench ↗
在长任务中学习新规则并使用记忆
Epoch AI · 参考来源
Excel · EMB ↗
表格编辑与 Excel 办公
Vals AI · 参考来源
Legal Research ↗
法律检索和论证
Vals AI · 参考来源
TaxAgentBench ↗
税务专业问题
Vals AI · 参考来源
MedScribe ↗
临床记录整理与撰写
Vals AI · 参考来源
BioMysteryBench ↗
生物学研究推理
Vals AI · 参考来源
Terminal-Bench Science ↗
在终端里完成科研任务
Harbor · 参考来源
知识问答
AA-Omniscience ↗
事实问答,答错倒扣、拒答不扣,看模型知道什么、会不会乱编。
Artificial Analysis · 参与排名
SimpleQA Verified ↗
短问题的事实准确性
Epoch AI · 参与排名
AA-LCR ↗
读很长的文档后,回答需要综合推理的问题。
Artificial Analysis · 参与排名
LiveBench · 语言与指令 ↗
Language + IF 两项均分,各占 50%。
LiveBench · 参与排名
BullshitBench · 错误前提 ↗
识别问题里的错误前提,观察模型会不会顺着错误继续编造。
Peter Gostev / BullshitBench · 参与排名
MLCR-AA ↗
准确、完整且简洁地理解医疗长记录。
Artificial Analysis · 参与排名
GPQA Diamond ↗
研究生水平的物理、化学与生物知识
Epoch AI · 参考来源
FACTS Parametric ↗
不借助搜索工具回答世界事实问题,检验模型自身知识的准确性。
Google DeepMind / Kaggle · 参考来源
真人盲选与综合指数
写作与设计
Arena 创作盲选 ↗
真人盲选故事、诗歌和其他创意表达,观察作品是否吸引读者。
LMArena · 参考来源
Creative Writing v3 ↗
短篇创作与表达
EQ-Bench · 参考来源
Longform Writing ↗
长篇故事的连贯性与完整性
EQ-Bench · 参考来源
EQ-Bench 4 · 情绪与人际理解 ↗
在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。
EQ-Bench · 参考来源
Short-Story · 短篇小说 ↗
把固定人物、情节与风格要求自然写进一篇完整短篇小说。
Lech Mazur · 参考来源
ToneBench · 文风与脚本 ↗
按指定作者文风写视频脚本,考查开场、结构、表达与口播节奏。
Towards AI · 参考来源
TubeLab · 视频脚本 ↗
面向不同视频频道写脚本,比较故事组织、文风、节奏与清晰度。
TubeLab · 参考来源
NC Bench · 作家工作流 ↗
帮助作家改写、续写、总结、翻译和整理创作想法。
Novelcrafter · 参考来源
Design Arena · 视觉设计 ↗
真人盲选网页、界面、图表和幻灯片的设计作品。
Design Arena / Intelligence · 参考来源
OpenVibeEval · 网页作品 ↗
对照网页作品、可访问性和盲选偏好,观察不同工具下的设计表现。
OpenVibeEval · 参考来源
SVGBench · 矢量图盲选 ↗
按相同提示盲选 SVG,考查视觉清晰度与图形表现。
SVGBench · 参考来源
Rapidata SVG ↗
真人比较模型生成的矢量图,直接评价视觉偏好。
Rapidata · 参考来源