本页内容
保存来源映射,再完成后续处理
- 保存原件与文件版本,解析代表性页面。
- 检查 JSON/MD、图片资源及实际页序映射。
- 按内容边界切分,将来源信息与片段一起保存。
- 用实际检索问题核对原页、版本、上下文与答案依据。
查看解析 API 与接入说明
用实际检索问题核对原页、版本、上下文与答案依据。
先了解这几件事
RAG 预处理不只是把 PDF 变成一串文字。应保留原文件版本与页码对应,核对标题、段落、公式和表格,再按语义切分。Doc2X 解析结果可作为输入;向量索引、检索和回答验证仍由自己的系统实现,字段以当前 API 文档为准。
- 输入
- PDF、解析 JSON、Markdown 与图片资源
- 输出
- 可追溯来源的知识库预处理材料
- 核对重点
- 保存来源映射 → 按内容边界切分 → 用问题验证回查
先保存可复核的原件
记录源文件标识、版本、处理时间和实际页序,并保存原 PDF。正文印刷页码与文件页序可能不同,引用显示时应明确采用哪一种。
格式选择服务于用途
Markdown 便于阅读和编辑;需要页面和结构信息时,核对对应 JSON 字段。不要凭示意图自行假设字段名或坐标单位,接入时以真实响应与版本文档为准。
切分不能破坏证据
把表头与数据、公式与变量说明、图注与图片拆开,会影响检索后的理解。保留必要上下文,并在每个片段携带可回查的来源信息;长度预算不应替代内容边界。
验证检索到的材料是否足够
用实际问题检查是否命中正确版本与页面,是否遗漏单位和限定条件。能生成答案不说明来源支持答案;对缺失或矛盾资料应保留明确的不确定性。
详细操作教程
以当前真实响应核对结构、页面与内容字段,再接入自己的系统。
常见问题
有解析 API 就能直接得到完整 RAG 系统吗?
不能等同。索引、检索、权限与回答验证需要在自己的系统中实现。
按固定字符数切分就够了吗?
还需保护表格、公式和标题等内容边界,并实际评估检索结果。
内容核对:2026-10-09 · 功能条件与配额以当前产品界面为准