原始目录提取流程 v1¶
-
子进程开始前,在
outline_extraction_traces创建一条running记录。 -
子进程同时提取
source_markdown和source_outline。 - PDF:读取原始版式结构 → 识别标题候选 → 归类文档内样式 → 推断层级 → 生成 Markdown 和目录树
-
DOC/DOCX:保留现有 Word/Markdown 标题结构提取
-
提取成功时,在同一事务中:
- 覆盖
tender_contents.source_markdown - 覆盖
tender_contents.source_outline - 将
outline_extraction_traces.status更新为succeeded - 将本次完整目录写入
outline_extraction_traces.outline -
保存节点数、最大层级、页数和耗时
-
提取失败时:
- 将
outline_extraction_traces.status更新为failed - 保存错误信息和耗时
-
不覆盖上一次成功的正文和目录
-
重新解析时创建新的 Trace;成功后更新当前正文和目录,同时在新 Trace 中保留本次目录快照。