☰
Tables Decoded: 从表格图像到结构化文本,DELTA 与 TARQA 的源码级拆解
2026/10/9 3:33:41 网站建设 项目流程

从今天觉醒,技术赋予每一个人数字生命


Tables Decoded: 从表格图像到结构化文本,DELTA 与 TARQA 的源码级拆解

表格理解一直是文档智能里最难啃的骨头之一。它不像纯文本 OCR 那样"读出来就行",也不像目标检测那样"框住就好"——表格同时承载物理结构(哪条线在哪个像素位置)、逻辑结构(谁是谁的表头、哪个单元格跨了几行)和语义内容(单元格里写的是"2023"还是"未披露")。更麻烦的是,同一个表格在不同语言、不同排版风格下的视觉表现千差万别。

最近读到一篇来自 cs.CV / cs.LG 的工作,标题很直白:Tables Decoded: DELTA for Structure, TARQA for Understanding。作者 Jahanvi Rajput、Dhruv Kudale、Saikiran Kasturi 等 5 人提出了一条和主流 VLM 路线不同的思路——不把表格当图像喂给视觉语言模型,而是先把它还原成一种紧凑的结构化文本表示(OTSL),再让 LLM 去理解。这篇文章我打算带着几个问题往下读:

  • 为什么"结构化文本表示"比"表格图像 + VLM"更可扩展?
  • DELTA 的三个子模块各自负责什么,边界在哪?
  • OTSL 到底长什么样,为什么它能同时编码布局和内容?
  • TARQA 在 OTSL 序列上微调,凭什么能在 WTQ 上拿到 9.3 个百分点的提升?

① 技术背景:表格理解到底在解决什么问题

表格理解通常拆成两个子任务:

  1. 表格结构识别(TSR, Table Structure Recognition):从表格图像中恢复出单元格的排布关系,输出 HTML 或类似结构。
  2. 表格视觉问答(TabVQA / TabQA):给定一张表格(或它的结构化形式),回答"2022 年 Q3 营收是多少"这类问题。

过去两年,主流做法是拿一个 VLM(如 GPT-5.5、Qwen3.6 Max、GLM 5.1 这类多模态模型)直接读表格图像。这条路在英文、印刷体、规整表格上效果不错,但有两个隐性成本:一是视觉编码器往往是语言相关的,换到印地语、阿拉伯语表格,预训练分布就偏了;二是图像 token 消耗远大于文本 token,一张复杂表格动辄上千个视觉 token,推理成本高。

DELTA + TARQA 的出发点就是绕开这两个成本:先把表格"解码"成文本,再让纯文本 LLM 去处理。

② 主流方案盘点

方案 A:端到端 VLM 读图。代表是各类多模态大模型直接 prompt 表格图像。优点是链路短、无需中间表示;缺点是成本高、对非英语表格鲁棒性差。

方案 B:检测 + 后处理流水线。先用目标检测找单元格,再靠规则或图算法推断行列。经典 TSR 项目多走这条路。优点是可控;缺点是规则脆弱,跨数据集迁移差。

方案 C:DELTA 的三段式结构化解码。这是本文的核心。DELTA 把 TSR 显式拆成三个职责清晰的模块:

  • 物理结构识别:找出表格的物理边界、行线列线;
  • 逻辑结构识别:判断表头、合并单元格、跨行列关系;
  • OCR:抽取每个单元格的文本内容。

三个模块的输出统一收敛到OTSL(Optimised Table Structure Language)——一种紧凑的、统一编码单元格排布与文本内容的格式。这一步是整个方案的关键抽象:把"结构"和"内容"压进同一条 token 序列,后续 LLM 不需要任何视觉编码器。

方案 D:TARQA。在 OTSL 序列上微调的 LLM,专门做表格问答。它不碰图像,只吃 DELTA 输出的结构化文本。

③ 对比与优劣

维度VLM 读图检测+规则流水线DELTA + TARQA
输入形态表格图像表格图像OTSL 文本序列
多语言友好度依赖视觉编码器分布依赖规则语言天然语言无关
推理成本高(视觉 token 多)中低(纯文本 token)
结构识别质量隐式、难调试显式、可控显式、可解释
代表指标—TEDS-StructureTEDS-Structure 持平 SOTA

在 TSR 上,DELTA 在 FinTabNet、PubTabNet、PubTables-1M 上的 TEDS-Structure 与当前最优方法相当;在非英语场景,作者自建了印地语基准TORQUE来验证鲁棒性。问答侧,TARQA 在 WTQ(TabQA)上提升 9.3 个百分点,在 FinTabNetQA(TabVQA)上提升 9.2 个百分点;在 TORQUE 上,该方法在所有 VLM 与 DELTA+LLM 变体中排名第二。

④ 选型建议

场景一:纯英文、表格规整、追求最短链路。直接用主流 VLM 读图即可,DELTA 的中间层反而是额外开销。

场景二:多语言文档、表格风格杂乱。优先考虑 DELTA 这类结构化解码路线。视觉编码器的语言偏见在这里是真实痛点,OTSL 把问题拉回文本域,LLM 的多语言能力可以直接复用。

场景三:需要可解释、可审计的 TSR。三段式拆分让每个模块的失败都能定位——是线没检到,还是逻辑合并判错,还是 OCR 串行。端到端 VLM 做不到这种粒度。

场景四:成本敏感的大规模批处理。OTSL 序列的 token 数通常远小于表格图像的视觉 token,适合高吞吐场景。

面试或作业里常被追问的点:OTSL 相比 HTML 表示的优势在哪?关键在"紧凑"和"统一"——HTML 有大量冗余标签,且结构和内容的编码方式不统一;OTSL 把单元格排布和文本压进同一条序列,让 LLM 的注意力机制更容易对齐行列关系。

⑤ 未来展望

DELTA + TARQA 代表了一个正在成型的趋势:把文档智能从"视觉问题"重新表述为"结构化文本问题"。这背后是对 LLM 能力的信任转移——与其训练更强的视觉编码器,不如把视觉信息尽早翻译成 LLM 已经擅长的文本形态。

仍未解决的问题也很明显:物理结构识别在极端排版(手写、严重倾斜、无边框表格)下依然脆弱;OTSL 的格式规范目前由作者定义,缺乏社区共识;TORQUE 这类非英语基准的规模还不足以支撑全面结论。代码、模型与基准已在作者公开的仓库中释出,值得后续跟进。

对在校学生来说,这是一个很好的练手方向:把"表格图像 → OTSL 序列"当作一个可写进作品集的小项目,不需要公司内部基础设施,一台机器加公开数据集就能跑通整条链路,而且能同时展示你对 CV、序列建模和 LLM 微调的理解。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询