跳转至

原始目录提取流程 v1

  1. 子进程开始前,在 outline_extraction_traces 创建一条 running 记录。

  2. 子进程同时提取 source_markdown 和 source_outline。

  3. PDF:读取原始版式结构 → 识别标题候选 → 归类文档内样式 → 推断层级 → 生成 Markdown 和目录树
  4. DOC/DOCX:保留现有 Word/Markdown 标题结构提取

  5. 提取成功时,在同一事务中:

  6. 覆盖 tender_contents.source_markdown
  7. 覆盖 tender_contents.source_outline
  8. 将 outline_extraction_traces.status 更新为 succeeded
  9. 将本次完整目录写入 outline_extraction_traces.outline
  10. 保存节点数、最大层级、页数和耗时

  11. 提取失败时:

  12. 将 outline_extraction_traces.status 更新为 failed
  13. 保存错误信息和耗时
  14. 不覆盖上一次成功的正文和目录

  15. 重新解析时创建新的 Trace;成功后更新当前正文和目录,同时在新 Trace 中保留本次目录快照。