返回模型榜
评测来源
每个来源测什么、怎样更新、是否进入排名,都可以在这里找到。
20本轮参与排名69已审查来源与专项
排名怎么算 综合评测与体验
17跨能力的综合测试与真人盲选。
- 参与排名AA Index把多项当前评测放到同一套环境里复跑,得到一个综合能力分。价格只作参考,不进总分。Artificial Analysis证据预算 30%
- 交叉参考LiveBench题库持续更换,答案可以自动核对。用来看模型换题之后还能不能站住。LiveBench
- 参与排名Arena Text真人匿名两两比较回答,看大家更愿意读哪一个。补上选择题看不出的整体体验。LMArena证据预算 5%
- 参与排名Arena WebDev同样是真人盲选,比的是网页好不好用、能不能交付。LMArena证据预算 2.4%
- 参与排名LiveBench · 语言与指令Language + IF 两项均分,各占 50%。LiveBench证据预算 3%
- 参与排名Arena 创作盲选真人盲选故事、诗歌和其他创意表达,观察作品是否吸引读者。LMArena证据预算 5%
- 观察中Design Arena · 视觉设计真人盲选网页、界面、图表和幻灯片的设计作品。Design Arena / Intelligence
- 观察中EQ-Bench 4 · 情绪与人际理解在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。EQ-Bench
- 观察中Short-Story · 短篇小说把固定人物、情节与风格要求自然写进一篇完整短篇小说。Lech Mazur
- 观察中ToneBench · 文风与脚本按指定作者文风写视频脚本,考查开场、结构、表达与口播节奏。Towards AI
- 观察中TubeLab · 视频脚本面向不同视频频道写脚本,比较故事组织、文风、节奏与清晰度。TubeLab
- 观察中NC Bench · 作家工作流帮助作家改写、续写、总结、翻译和整理创作想法。Novelcrafter
- 观察中OpenVibeEval · 网页作品对照网页作品、可访问性和盲选偏好,观察不同工具下的设计表现。OpenVibeEval
- 观察中SVGBench · 矢量图盲选按相同提示盲选 SVG,考查视觉清晰度与图形表现。SVGBench
- 观察中Rapidata SVG真人比较模型生成的矢量图,直接评价视觉偏好。Rapidata
- 参与排名Creative Writing v3短篇创作与表达EQ-Bench证据预算 3.6%
- 参与排名Longform Writing长篇故事的连贯性与完整性EQ-Bench证据预算 2.4%
编程
13从写代码到改仓库,看模型能不能把软件做出来。
- 参与排名DeepSWE v1.1在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。DataCurve证据预算 3.6%
- 参与排名TapTap Maker在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。TapTap Maker证据预算 3.6%
- 参与排名LiveBench · 编程综合Coding + Agentic Coding 两项均分,各占 50%。LiveBench证据预算 2.4%
- 观察中Hyper-τ-bench根据业务资料构建并测试能工作的客户服务代理。Sierra
- 观察中SWE-rebench持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。Nebius
- 观察中LHTB在较长时间内持续使用终端,完成复杂工程与工具任务。Tencent HY / Lehigh 等
- 仅供参考Terminal-Bench 4保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。Harbor / Terminal-Bench
- 仅供参考MirrorCode长时间的软件复现Epoch AI
- 观察中Code Migration软件迁移与接口改造Vals AI
- 观察中ProgramBench完整程序的实现与交付Vals AI
- 观察中FrontierCode真实仓库任务的质量、测试与修改范围Cognition
- 观察中FrontierSWE v2长时间运行的工程实现与研究任务Proximal Labs
- 观察中WeirdML在陌生数据上实现机器学习方案WeirdML
推理
11数学、逻辑与陌生规则,看模型能不能想明白新问题。
- 参与排名LiveBench · 推理与数学Reasoning + Mathematics 两项均分,各占 50%。LiveBench证据预算 4.2%
- 观察中SimpleBench用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。SimpleBench
- 参与排名FrontierMath v2 · Tiers 1–3研究级数学推理Epoch AI证据预算 3.6%
- 参与排名FrontierMath v2 · Tier 4更高难度的数学研究题Epoch AI证据预算 1.2%
- 参与排名Chess Puzzles根据文字棋局寻找正确走法Epoch AI证据预算 1.8%
- 参与排名Mystery Game Puzzles从陌生规则推导正确行动Epoch AI证据预算 1.2%
- 观察中MathArena · ArXivLean用 Lean 验证数学证明MathArena / ETH Zurich
- 观察中MathArena · BrokenArXiv发现和修复数学证明中的错误MathArena / ETH Zurich
- 观察中MathArena · ArXivMath从近期数学论文提炼的新题MathArena / ETH Zurich
- 观察中ARC-AGI-2从陌生规则中学习和泛化ARC Prize
- 观察中ARC-AGI-3从陌生规则中学习和泛化ARC Prize
知识
5事实问答与研究生级科学知识,看知识掌握与回答准确性。
专业办公
19金融分析、法律咨询与银行业务,看专业任务能否完成。
- 参与排名APEX-Agents 1.1投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。Mercor证据预算 4%
- 参与排名Vals Finance Agent金融分析师的日常办公题,看研报、建模这类工作做得怎样。Vals AI证据预算 3%
- 观察中OfficeQA Pro从大量真实财务文件中检索、计算并回答问题。Databricks
- 观察中Harvey Legal Agent Benchmark处理法律资料并交付 Word、Excel、幻灯片等可审阅文件。Vals AI / Harvey
- 观察中MCP Atlas通过真实 MCP 服务检索资料、操作文档与数据库,完成跨软件任务。Scale AI
- 观察中FinanceBenchmark完成金融定价、资本计算和风控任务,用数值与代码执行结果核验。FinanceBenchmark
- 观察中PRBench · Legal回答真实法律工作中的复杂问题,检验专业判断和论证质量。Scale AI
- 观察中PRBench · Finance回答真实金融决策问题,检验专业判断、推导和风险说明。Scale AI
- 观察中SpreadsheetBench 2完成财务建模、修复工作簿和数据可视化的整套表格工作。SpreadsheetBench / Renmin University / AfterQuery
- 观察中Vending-Bench 2经营模拟商店一年,处理采购、谈判、库存与定价。Andon Labs
- 等待成绩τ³-Banking在统一工具环境中办理银行业务,检验规则理解、客户沟通与任务完成。Sierra证据预算 2%
- 仅供参考EBR-bench在长任务中学习新规则并使用记忆Epoch AI
- 观察中Excel · EMB表格编辑与 Excel 办公Vals AI
- 观察中Legal Research法律检索和论证Vals AI
- 观察中TaxAgentBench税务专业问题Vals AI
- 观察中MedScribe临床记录整理与撰写Vals AI
- 观察中BioMysteryBench生物学研究推理Vals AI
- 观察中AutomationBench跨办公软件完成自动化工作Zapier
- 观察中Terminal-Bench Science在终端里完成科研任务Harbor
视觉理解
2理解图片的证据继续保留在综合榜;读懂图片与设计美观是不同能力。
中文与多语言
2语言基础的补充证据,不把英文写作表现当作中文能力。
“观察中”表示仍在核对数据、运行条件或使用边界,不参与综合榜和分类榜。同一评测的重复抓取和展示切片不会增加票权;不同评测之间的题库重叠仍需持续核对。