DOC2X解析与识别

代码 OCR 与代码块识别

从技术文档、论文和教材中识别代码与伪代码。Doc2X v3 结构化结果提供 Code、CodeGroup 等元素,便于区分代码与正文,接入阅读器或知识库时保留代码说明和文档上下文。

CODE / OCR内容结构示意
Code让代码回到代码里

文字、公式、表格与上下文

Equation
E = mc²
Table
AB1.243.16
function parse(document) {
  return {
    content: document,
    type: "code"
  };
}

图示用于说明内容结构,完整字段请查看接口文档

本页内容

区分代码与普通正文

技术材料中的缩进、符号和说明有特定作用。结构化块类型帮助下游展示区分代码和说明段落。

重点复核缩进和相似字符

截图中的零与字母 O、括号、引号与缩进容易影响代码含义。识别结果应核对后再用于编辑或执行。

和原文上下文一起入库

代码前后的说明、图注和章节信息能帮助检索理解。使用 JSON 块结构时,不要只保留一段脱离来源的字符串。

如何开始

  1. 上传包含代码的技术文档。
  2. 检查识别出的代码与原页。
  3. 导出 Markdown 或查看 v3 JSON 中的代码块。

按上面的步骤,继续处理你的资料。

开始处理文档

内容核对:2026-10-04 · 功能条件与配额以当前产品界面为准