评测来源官方评测
SWE-rebench
Nebius / 编程 · 持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。
在 协同HOT 中观察中
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集
它测什么,怎么测
固定任务窗口、ReAct 环境和 text/tools 交互协议,采用多次运行的平均解决率与标准误;不把完整 Agent 产品与基础模型混为同一对象。
如何使用这份证据
候选观察:真实仓库任务值得补充,等待可验证运行日期、稳定成绩协议与再展示边界;尚未启用自动采集或计分。
评测局限与数据署名
滚动题目、运行环境和任务窗口影响可比性;网站近期维护不等于所有模型重新测试。
数据许可:官方 Hugging Face CC BY 4.0 数据集是任务题库;尚未确认网页最终成绩的稳定导出与再展示边界。
成绩由 Nebius 发布,原始分数与 协同HOT 共识分使用不同尺度,不能直接相加。