DOC2X集成与效率

RAG 知识库文档解析与语料准备

用 Doc2X 将 PDF、扫描件与技术文档解析为 Markdown 和结构化 JSON,作为 RAG 检索、企业知识库与语料整理的输入。保留标题层级、表格、公式和原文位置,先核对内容再进入切分与检索流程。

DOCUMENT / STRUCTURE内容结构示意
Title识别内容,也理解结构

文字、公式、表格与上下文

Equation
E = mc²
Table
AB1.243.16
{
  "type": "Text",
  "content": "…"
}

{
  "type": "Equation",
  "content": "E=mc²"
}

图示用于说明内容结构,完整字段请查看接口文档

本页内容

先把资料变成可用内容

RAG 输入质量不仅取决于文本是否提取出来,还取决于阅读顺序、标题、表格和公式有没有保留。先选择有代表性的文档检查解析结果。

按文档结构设计切分

标题和分组可以辅助切分,表格与公式不宜随意截断。需要核对引用时,保留页面和元素位置信息。

为答案保留可追溯来源

每个片段保留文件、版本、页码与对应元素位置;重复的页眉页脚可结合结构化标记处理。表格需要连同标题、单位和脚注保存,避免检索命中一个脱离语境的数字。

用真实问题验证,而不是只数切片

准备几条业务中常见的问题,检查检索是否找到正确段落、表格与原页。将漏召回、阅读顺序错误和原文缺失分别排查,再决定调整切分方式还是回到解析阶段。

批量接入与质量复核

通过开放平台组织上传、任务查询和结果获取。对失败、异常页与重要数据建立复核流程,再进入索引与检索系统;解析成功并不自动代表答案质量已经达标。

如何开始

  1. 确定资料类型与检索目标。
  2. 使用解析 API 获取 Markdown 或结构化结果。
  3. 核对并按结构切分,接入现有知识库。

按上面的步骤,继续处理你的资料。

查看解析 API

常见问题

Doc2X 解析 API 与多文档知识库有什么区别?

解析 API 交付可用文档内容,供开发者接入自己的系统;多文档 AI 对话是网页版的完整阅读与问答流程。

内容核对:2026-10-04 · 功能条件与配额以当前产品界面为准