# Paper Table Extraction Benchmark 公开概览

> 更新日期: 2026-07-28

本 benchmark 用于评测学术论文结果表格的信息抽取与组织能力。它将表格恢复、结果抽取、目标结果筛选和跨论文组织拆分为可独立评测、也可串联评测的任务。

当前公开结果属于自动化预览，尚未完成逐条人工核验。

## 任务

| 任务 | 输入 | 输出 | 当前 v3 状态 |
| --- | --- | --- | --- |
| Task 1: 表格恢复 | 原生 HTML/LaTeX/XML 表格片段 | 严格结构化表格 | 已评测 Source-Native 范围 |
| Task 2: 全表结果抽取 | 结构化表格及上下文 | 整张表的有效结果元组 | 保留任务概念，暂不单独排名 |
| Task 3: 目标结果筛选 | 候选结果与 taxonomy | 属于目标排行榜范围的结果 | 当前与 Task 2 联合评测 |
| Task 4A: 闭集组织 | 查询与论文证据 | 论文级结果组织 | 已评测 SciLead-linked 预览范围 |
| Task 4B: 候选结果组织 | 查询与 selected-result candidates | 去重、规范化后的排行榜条目 | Oracle 与 predicted-candidate 分开评测 |
| Paper-Level Workflow | 完整 source-native 论文与冻结 taxonomy | source-grounded selected results 与跨论文组织诊断 | 533-paper 自动化预览已评测 |

Task 2+3 主任务不宣称抽取表格中的全部有效结果。当前外部金标主要标识被原排行榜收录的结果。

## 版本

v2 作为冻结历史版本永久保留。v3 扩大数据范围，并在匹配键中加入 `record_id`，使同一论文不同表格里的相同结果能够分别评测。

| 版本与范围 | 论文 | Table records | Raw gold tuples |
| --- | ---: | ---: | ---: |
| v2 Full | 77 | 172 | 1,276 |
| v2 Test | 13 | 29 | 284 |
| v3 Full | 293 | 392 | 2,044 |
| v3 Combined Test | 38 | 54 | 369 |

v3 Task 2+3 的 exact key 为:

```text
record_id + taxonomy_id + method_id + score_value
```

同一论文的全部表格保持在同一个数据划分中。v2 与 v3 不跨版本混排。

## 输入与输出

Task 2+3 输入包括严格结构化表格、表题、脚注、必要上下文、论文与表格身份，以及可用 taxonomy。输入不包含目标结果标签和其他答案字段。

每条预测需要标识 table record、taxonomy、规范化方法和分数。评测器同时报告 task/dataset/metric/value 诊断指标，便于与 AxCell 风格的 TDMS 评测对照。

Task 1 当前仅将 Source-Native 视图作为硬性范围。Visual PDF 与 OCR 配对属于后续扩展，不影响现有 v3 结果。

## 评测结果

Task 2+3 以 Paper Macro F1 排名，Micro F1 与 TDMS 指标作为辅助诊断。v3 Combined Test 的 Paper Macro F1 为:

| Rank | 方法 | Exact model | Paper Macro F1 |
| ---: | --- | --- | ---: |
| 1 | GLM taxonomy-prompt baseline | GLM-5.1 | 0.3146 |
| 2 | DeepSeek taxonomy-prompt baseline | DeepSeek-V4-Flash | 0.2880 |
| 3 | AxCell strict-best adapter | AxCell | 0.0579 |
| 4 | Structure-aware rule baseline | 不适用 | 0.0511 |
| 5 | BM25/TF-IDF linear ranker | 不适用 | 0.0219 |

多任务结果使用各自指标:

| Scope | 方法或视图 | 主要结果 |
| --- | --- | ---: |
| Task 1 | Deterministic parser reference | Paper Macro Cell F1 0.8089 |
| Task 1 | DeepSeek-V4-Flash | Paper Macro Cell F1 0.0377 |
| Task 4A | DeepSeek-V4-Flash | Query Macro Score F1 0.0470 |
| Task 4A | DeepSeek-V4-Flash | Membership F1 0.0622 |
| Task 4B | Deterministic oracle reference | Paper Macro F1 0.9978 |
| Task 4B | DeepSeek-V4-Flash, oracle candidates | Paper Macro F1 0.9932 |
| Task 4B | DeepSeek-V4-Flash, predicted candidates | Paper Macro F1 0.0090 |

Reference、oracle input 和 predicted input 会明确标注，不混入同一个排名。页面不计算跨任务综合分。

Paper-Level Workflow 从完整 source-native 论文开始，要求方法自行发现结果、链接 taxonomy/method/score identity，并提交精确 evidence。固定 Reference Organizer 只作为基础设施，不参与排名。本轮 Full 结果为:

| Rank | 方法 | Grounded Paper Macro F1 | Grounded Micro F1 | Evidence Coverage | Paper Coverage |
| ---: | --- | ---: | ---: | ---: | ---: |
| 1 | Independent source parser + structure-aware rule | 0.0218 | 0.0518 | 0.0631 | 533/533 |
| 2 | DeepSeek-V4-Flash Paper-Level End-to-End | 0.0144 | 0.0226 | 0.0180 | 533/533 |
| 3 | Independent source parser + BM25/TF-IDF | 0.0130 | 0.0174 | 0.0390 | 533/533 |

GLM-5.1、GLM-5.2 和 AxCell 本轮未运行，显示为 N/A，不参与排名。DeepSeek run 使用 `max_tokens=16384`、`temperature=0`、`top_p=1`，共记录 2,175 次 request attempts、36,610,587 tokens，列表价估算成本 USD 4.8859。

## 多任务规模

| Scope | 公开规模 |
| --- | ---: |
| Task 1 Source-Native | 381 records / 283 papers |
| Task 4A | 1,161 query-paper pairs / 43 papers |
| Task 4B | 1,833 queries / 2,044 oracle candidates |
| Shared Core | 381 records / 283 papers / 1,753 queries |

Workflow 视图登记了 32 个组合: 12 个已完成，18 个因对应 API 余额不足而跳过，2 个因所需运行环境不可用而跳过。跳过项显示为 N/A，不按 0 分处理。

## 排行榜使用

[在线排行榜](https://liaohaoliang2003.github.io/Paper-Table-Extraction-Bench/) 使用同一个结果区域和两级标签:

- v2 冻结历史
- v3 Task 2+3
- v3 多任务总览、Task 1、Task 4A、Task 4B 与 Workflow
- v3 Paper-Level Workflow 总览、主排行榜、Organizer 诊断、范围与数据、运行审计

`复制当前表格` 会将当前可见表格复制为 TSV。Task 2+3 视图还会遵循当前搜索筛选条件。

## 来源与版权

Core gold 来自 PWC leaderboard 标注，benchmark 输入从可追踪的原始论文来源恢复。Task 4A 使用 SciLead-linked 标签与论文身份。PWC、SciLead、论文内容和第三方 taxonomy 继续受各自原始许可与来源条款约束。

本公开仓库不发布 PWC/SciLead 原始数据、论文 PDF、完整 benchmark 输入或 gold、API 请求日志、凭据、模型权重和私有运行产物。详见 [NOTICE.md](../NOTICE.md)。

## 记录要求

新评测记录实际运行时间。LLM 评测同时记录 exact model 和 API 参数；harness 评测记录框架身份和配置。公开文件只保留结果解释所需信息，不发布凭据和内部运行日志。

当同一模型系列可能包含多个版本时，方法名必须包含完整模型身份，例如 `DeepSeek-V4-Flash` 和 `GLM-5.1`。

## 已知限制

- v3 是自动化预览，尚未逐条人工核验。
- 缺少完整的整表有效结果 gold，因此 Task 2 暂不单独排名。
- Task 1 Visual PDF 与 OCR 尚未进入冻结范围。
- Task 4 oracle 与 predicted-candidate 代表不同条件，不能直接混排。
- API 余额或运行环境缺失使部分 workflow 组合尚未评测。
- Paper-Level Workflow 只完成两条确定性基线与 DeepSeek-V4-Flash；其余方法保留为 N/A。
- 当前 benchmark 不属于 span-NER leaderboard。
- 复杂上下文、长文档检索、跨表推理和长程任务属于后续 v4 范围。
