DOC2X使用指南

RAG 文档解析:页码、图片与来源回查

把 PDF 解析结果用于知识库前,保留文件版本、页码、标题和段落对应关系。区分 Markdown 正文与 JSON 结构,检查表格单位、图片资源和切分边界,用实际检索问题验证来源回查。

你的文件
PDF、解析 JSON、Markdown 与图片资源
得到什么
可追溯来源的知识库预处理材料
操作流程示意

RAG 文档解析:页码、图片与来源回查

01

保存来源映射

02

按内容边界切分

03

用问题验证回查

操作流程示意 · 在工具中处理自己的文件后,再核对实际结果

本页内容

保存来源映射,再完成后续处理

  1. 保存原件与文件版本,解析代表性页面。
  2. 检查 JSON/MD、图片资源及实际页序映射。
  3. 按内容边界切分,将来源信息与片段一起保存。
  4. 用实际检索问题核对原页、版本、上下文与答案依据。
查看解析 API 与接入说明

用实际检索问题核对原页、版本、上下文与答案依据。

先了解这几件事

RAG 预处理不只是把 PDF 变成一串文字。应保留原文件版本与页码对应,核对标题、段落、公式和表格,再按语义切分。Doc2X 解析结果可作为输入;向量索引、检索和回答验证仍由自己的系统实现,字段以当前 API 文档为准。

输入
PDF、解析 JSON、Markdown 与图片资源
输出
可追溯来源的知识库预处理材料
核对重点
保存来源映射 → 按内容边界切分 → 用问题验证回查

先保存可复核的原件

记录源文件标识、版本、处理时间和实际页序,并保存原 PDF。正文印刷页码与文件页序可能不同,引用显示时应明确采用哪一种。

格式选择服务于用途

Markdown 便于阅读和编辑;需要页面和结构信息时,核对对应 JSON 字段。不要凭示意图自行假设字段名或坐标单位,接入时以真实响应与版本文档为准。

切分不能破坏证据

把表头与数据、公式与变量说明、图注与图片拆开,会影响检索后的理解。保留必要上下文,并在每个片段携带可回查的来源信息;长度预算不应替代内容边界。

验证检索到的材料是否足够

用实际问题检查是否命中正确版本与页面,是否遗漏单位和限定条件。能生成答案不说明来源支持答案;对缺失或矛盾资料应保留明确的不确定性。

详细操作教程

常见问题

有解析 API 就能直接得到完整 RAG 系统吗?

不能等同。索引、检索、权限与回答验证需要在自己的系统中实现。

按固定字符数切分就够了吗?

还需保护表格、公式和标题等内容边界,并实际评估检索结果。

内容核对:2026-10-09 · 功能条件与配额以当前产品界面为准