跳到正文
评测来源

FACTS Parametric

Google DeepMind / Kaggle / 知识 · 不借助搜索工具回答世界事实问题,检验模型自身知识的准确性。

官方评测
在 协同HOT 中观察中
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集

它测什么,怎么测

只考虑固定任务版本的 Score,保留公开集、私有集与置信区间供核查;不能把三个相关分数重复计票。FACTS 不在 AA v4.3 的十项底层评测中。

如何使用这份证据

观察中:官方协议与许可已确认,但没有完成题数或完整性标记;部分行区间显著宽,总分与公开集、私有集的汇总口径也存在待确认情形。等待评测方说明,不删除异常行来强行接入,不占评分预算。

评测局限与数据署名

裁判与评测发起方均来自 Google,需结合其他机构证据。导出未说明部分结果是否完成同一套题,不能把局部结果当完整评测;从区间反推的样本量不是官方确认事实。

数据许可:Apache 2.0 · 官方 benchmark 与 Score task 页面明确声明;Kaggle 文档提供公共榜单的免登录 JSON 下载。

成绩由 Google DeepMind / Kaggle 发布,原始分数与 协同HOT 共识分使用不同尺度,不能直接相加。