DOC2X解析与识别

版面元素与结构化 JSON

Doc2X v3 解析结果提供文字、标题、公式、表格、图片、代码块和分组容器等版面结构,支持把文档内容与原页面位置联系起来,便于文档检索、阅读器、数据处理和教育应用集成。

DOCUMENT / STRUCTURE内容结构示意
Title识别内容,也理解结构

文字、公式、表格与上下文

Equation
E = mc²
Table
AB1.243.16
{
  "type": "Text",
  "content": "…"
}

{
  "type": "Equation",
  "content": "E=mc²"
}

图示用于说明内容结构,完整字段请查看接口文档

本页内容

不仅是一段纯文本

使用元素类型、分组和页面位置处理内容,有助于保留标题层级、表格关系、代码与图表说明。

代码块单独呈现

代码与普通正文有不同用途。解析结果提供 Code 和 CodeGroup 等类型,便于在阅读器与下游处理中保留代码语义。

结合接口文档接入

下面展示元素目录。具体字段、坐标约定和模型版本行为,以当前 v3 JSON 文档为准。

17 类版面元素,保留文档结构

Text · 文本Title · 标题Table · 表格Figure · 图片Equation · 公式Code · 代码块Caption · 图表说明EquationNumber · 公式编号Underline · 下划线EquationGroup · 公式组TableGroup · 表格组FigureGroup · 图片组CodeGroup · 代码组TOCGroup · 目录FootnoteGroup · 脚注ReferenceGroup · 参考文献SideGroup · 侧栏

另有 attributes.is_boilerplate 标记,用于识别页眉、页脚、页码等样板文字。

查看元素字段与结构说明

常见问题

页眉页脚是否也是一个普通正文块?

页眉页脚等重复版面内容可通过 boilerplate 标记识别,下游应结合该标记决定是否纳入正文检索。

内容核对:2026-10-04 · 功能条件与配额以当前产品界面为准