智能标书系统核心功能¶
解析¶
输入¶
PDF、Word(DOC/DOCX)格式的招标文件
技术流程¶
- 识别文件格式,还原正文、标题和表格顺序
- 将招标原文分别送入概况与评分 LLM
- 把 LLM 结果整理为可编辑的结构化清单
- 人工检查后保存,供目录和正文生成使用
关键技术¶
- 文档解析引擎:PyMuPDF 快速提取长篇 PDF,python-docx 还原复杂 Word 的标题、正文和表格顺序
- 结构化提取:将招标原文整理为项目概况、招标要求和评分标准等可编辑字段
- 双路 LLM 解析:项目概况与评分标准分别调用 LLM、分别输出,减少漏项和混淆
- 双专用提示词:概况与评分提示词独立维护、独立发布,可持续优化解析准确性
- 大容量上下文窗口:LLM 单次可读取更多招标原文,减少文件切分造成的信息遗漏和前后文割裂
- 独立 Worker:解析任务由独立进程处理,大文件运行时不影响系统其他功能
- 专属任务队列:解析任务按顺序独立执行,避免多个大文件同时处理造成资源拥堵
- ETag 文件指纹:自动识别重复文件并复用已有结果,减少重复解析和等待时间
- 异步任务追踪:支持进度查看、任务取消、失败重试和断点恢复,避免大文件处理中断
输出¶
结构化数据(项目概况、招标要求、评分标准等可编辑清单)
生成一二级目录¶
输入¶
已完成解析的项目概况、评分标准和标书总页数;也可使用用户自定义目录
技术流程¶
- 将项目概况、评分项和总页数送入目录 LLM
- AI 生成一二级目录,或识别用户自定义目录
- 将生成结果转换为标准目录树并校验层级
- 建立评分项与章节的对应关系
- 分配章节页数和预计字数后保存
关键技术¶
- 评分点驱动生成:LLM 围绕评分项、分值和评分要求生成目录,减少套用通用模板和关键内容遗漏
- 目录专用 LLM:目录生成使用独立配置的 LLM,并采用低随机参数,生成层级更加稳定
- 目录提示词工程:通过专用提示词限定一二级层级和输出格式,减少跑题与结构混乱
- 树形目录建模:AI 生成和人工目录统一转换为标准树形结构,方便编辑、排序和逐级生成
- 评分项智能映射:将评分要求对应到具体章节,为编写思路和正文生成提供依据
- 目录规则校验:自动检查层级、编号、空节点和重复章节,不合格结果不直接保存
- 篇幅预算模型:根据标书总页数分配章节页数和预计字数,并传递给正文生成
输出¶
一二级目录树(包含章节层级、预计页数和预计字数,支持编辑、排序和下载)
生成编写思路¶
输入¶
已确认的一二级目录、项目概况、招标要求和评分标准
技术流程¶
- 汇总当前目录、项目概况、招标要求和评分标准
- 根据行业与企业角色匹配专用提示词
- 按一级章节分别调用 LLM 生成编写思路
- 将生成结果解析为二三级目录内容块
- 校验目录对应关系并绑定到原目录节点
- 流式展示并人工确认,供下级目录和正文使用
关键技术¶
- 提示词智能路由:按货物生产商、经销商、服务和工程项目自动选择专用提示词,提高内容针对性
- 章节上下文筛选:只向 LLM 提供当前章节相关的评分项和招标要求,减少无关信息干扰
- 章节级 LLM 生成:每个一级章节分别生成,内容更加聚焦,减少章节之间重复和混淆
- 大容量上下文窗口:LLM 同时参考更多项目资料、评分要求和目录内容,尽可能完整提取写作要点
- 结构化结果校验:将 LLM 文本拆成目录内容块,并检查缺失、重复和错位内容
- 目录节点精准绑定:通过目录节点唯一标识关联编写思路,目录改名、排序后内容仍能准确对应
- 流式生成预览:编写思路边生成边展示,人工确认后再用于下级目录和正文
- 提示词版本管理:提示词独立维护和发布,支持持续优化并保持生成效果稳定
输出¶
章节编写思路清单(包含写作重点、响应方向和内容要求,支持预览、修改和应用)
生成标书正文¶
输入¶
已确认的完整目录、编写思路、项目概况、招标要求和评分标准
技术流程¶
- 按目录顺序拆分待生成章节,自动跳过已有正文
- 为每章汇总项目要求、评分项、编写思路和篇幅要求
- 根据行业与企业角色匹配正文专用提示词
- 分章节调用写作 LLM,并流式返回生成内容
- 当前章节完成后立即绑定目录并保存
- 继续生成下一章节,同时更新全文进度
关键技术¶
- 章节上下文组装:自动汇总当前章节的评分项、招标要求、编写思路和篇幅要求
- 评分项精准匹配:根据目录对应关系向每章带入相关评分要求,减少漏写和写错章节
- 正文专用 LLM:使用独立写作模型分章节生成,提升长文表达的连贯性与专业度
- 大容量上下文窗口:LLM 单次可携带更多项目资料和评分要求,尽可能完整响应招标文件
- 动态篇幅控制:根据目录预设字数为每章设置生成目标,避免章节内容过短或篇幅失衡
- 正文提示词路由:按行业、企业角色匹配已发布的提示词版本,兼顾内容针对性和生成稳定性
- 流式生成展示:LLM 内容边生成边返回,可实时查看当前章节内容和全文进度
- 章节级异步任务:全文拆分为独立章节任务,按目录顺序有序生成
- 增量保存机制:每完成一个章节立即保存,任务中断也不会丢失已有正文
- 失败自动重试:单个章节出现超时或异常时自动重试,不影响其他已完成内容
- 断点续写机制:自动识别已有正文,重新启动时只生成缺失章节,减少重复等待
输出¶
按目录组织的标书正文(支持逐章查看、编辑、重新生成和全文进度追踪)
企业知识库¶
输入¶
PDF、Word(DOC/DOCX)、Excel(XLS/XLSX)格式的企业资料、历史标书、产品资料和技术方案
技术流程¶
- 上传企业资料并按知识库统一管理
- 独立 Worker 提取文档正文和标题结构
- 按标题层级和语义边界拆分内容
- 通过 Embedding 模型将文本转换为向量
- 将文本向量写入 Qdrant 建立检索索引
- 用户提问时检索相关内容,再由 LLM 生成带来源的回答
关键技术¶
- 多格式文档解析:统一处理 PDF、Word 和 Excel,提取正文、标题和表格内容
- 独立 Worker 处理:文档解析与向量化通过专属任务队列运行,大文件处理不影响系统其他功能
- 语义切块技术:按照标题层级和段落含义拆分长文,并保留少量上下文重叠,减少内容割裂
- 批量并发 Embedding:将文本分批并行转换为语义向量,提高大批量企业资料的入库速度
- Qdrant 向量索引:集中存储文本向量,快速定位与问题最相关的资料片段
- Top-K 相似度检索:按语义相似度筛选最相关的资料片段,过滤关联度较低的内容
- RAG 有依据回答:先从企业资料中查找依据,再交给 LLM 组织回答;依据不足时明确提示
- LLM 问题改写:将口语化问题转换为更准确的检索语句,提高资料命中率
- 来源追溯:回答同时返回文件名称、标题路径和原文片段,方便核对内容依据
- 索引版本管理:重新解析或重建索引时先生成新版本,完成后再切换,避免影响已有资料使用
- 异步任务追踪:实时查看解析、切块、向量化和索引进度,失败任务支持重新处理
- 企业数据隔离:知识库按用户权限独立管理,避免不同企业之间的资料混用
输出¶
可检索、可问答、可追溯来源的企业知识库(支持文件管理、项目绑定和资料复用)
企业图库¶
输入¶
PNG、JPG、JPEG、WebP、GIF 格式的图片;也可从 PDF、Word(DOC/DOCX)文档中批量提取图片
技术流程¶
- 直接上传图片,或从 PDF、Word 中批量抽取图片
- 自动过滤重复图片、空图片和过小图片
- 预览并确认需要入库的图片
- 将图片保存到对象存储并进入分析队列
- 多模态 LLM 识别图片内容和图片内文字
- 生成标题、描述、标签、分类和适用章节
- 人工检查后保存,供检索和标书项目使用
关键技术¶
- 文档智能抽图:从 PDF、Word 中批量提取原始图片,减少人工逐张截图和整理
- SHA-256 图片指纹:根据图片内容生成唯一指纹,比按文件名判断重复更加准确
- 图片质量过滤:自动跳过空图片和过小图片,减少图标、装饰线等无效素材
- 临时预览会话:文档抽图后先进入临时区域,人工确认选择后再正式写入图库
- 对象存储直传:图片直接上传到对象存储,降低主服务压力并提升大文件上传稳定性
- 多模态 LLM 理解:同时识别图片画面和文字信息,理解图片表达的业务内容
- OCR 文字识别:提取证书、设备铭牌、流程图和截图中的文字,方便后续查找与核对
- 结构化图片标签:自动生成标题、描述、标签、分类、业务场景和适用标书章节
- JSON Schema 校验:多模态 LLM 按固定字段返回结果,格式不合格的数据不直接保存
- 图库专用提示词:图片分析使用独立提示词和模型配置,支持持续优化识别结果
- 批量异步分析:独立 Worker 按批次处理图片,实时展示进度,失败任务支持重试
- 图片关键词检索:根据图片标题和描述快速查找需要的企业素材
- 项目图片绑定:将选定图片与具体标书项目关联,避免不同项目之间的素材混用
- 企业数据隔离:图库按用户权限独立管理,保障企业图片资料安全
输出¶
结构化企业图片素材(包含标题、描述、标签、分类、适用场景、适用章节和 OCR 文字,支持检索、编辑和项目绑定)
企业产品库¶
输入¶
Excel(XLS/XLSX)格式的产品清单;也可人工录入产品名称、品牌、型号、技术参数和相关资料
技术流程¶
- 上传 Excel 产品清单并进入专属解析队列
- 自动识别工作表、表头和产品数据区域
- 将不同表头名称映射为统一产品字段
- 提取产品信息和 Excel 内嵌图片
- 根据图片所在行关联对应产品
- 对产品数据进行去重、补充和保存
- 人工检查后供检索和标书项目使用
关键技术¶
- 结构化 Excel 解析:直接读取 Excel 工作表、单元格和图片结构,批量处理产品数据
- 规则解析而非 LLM 猜测:通过固定字段规则读取表格,减少大模型对产品名称和参数的误判
- 动态表头定位:自动查找 Excel 中真实的表头行,兼容顶部带标题和说明的复杂表格
- 表头智能映射:自动识别“产品名称、品名、设备名称”等不同写法,并转换为统一字段
- 多工作表识别:逐页处理 Excel 中的多个工作表,减少跨表产品遗漏
- 内嵌图片提取:自动提取 Excel 中的产品图片,并保存到对象存储
- 图片行级关联:根据图片在 Excel 中的位置,将图片准确关联到同一行产品
- 产品指纹去重:通过产品名称、型号和品牌组合识别重复产品,避免重复入库
- 幂等导入机制:相同上传任务不会重复执行,避免重复解析和重复写入产品
- Upsert 增量更新:已有产品自动补充更新,新产品自动创建,无变化产品直接跳过
- 产品字段标准化:统一保存名称、分类、型号、单位、品牌、技术参数和数量说明
- 异步任务追踪:独立 Worker 处理批量导入,实时展示进度,支持取消和失败重试
- 产品关键词检索:可按名称、分类、型号、品牌和技术参数快速查找产品
- 项目产品绑定:将选定产品关联到具体标书项目,为项目资料准备提供统一来源
- 企业数据隔离:产品库按用户权限独立管理,避免不同企业之间的产品资料混用
输出¶
结构化企业产品数据(包含名称、分类、型号、品牌、技术参数、产品图片和相关资料,支持检索、编辑和项目绑定)
系统级技术能力¶
AI 模型与提示词¶
- 多模型协同:目录规划、正文写作、AI 问答、图片理解和 Embedding 分别使用适合的模型
- Prompt 场景路由:根据功能、行业和企业角色自动选择对应提示词
- Prompt 版本发布:提示词支持草稿、发布和归档,线上只使用已发布版本
- 结构化输出约束:通过 JSON Schema 和字段校验规范 LLM 输出,减少格式错误
- 上下文工程:根据当前任务筛选、组合和压缩输入资料,让模型重点关注相关信息
- LLM 并发控制:限制同时发起的模型请求数量,避免集中调用造成服务拥堵
- 429 指数退避:模型服务触发限流时自动延迟重试,提高高峰期生成成功率
异步任务与可靠运行¶
- Redis + ARQ 异步调度:解析、生成和资料处理进入后台队列,用户无需一直停留在当前页面
- 多队列 Worker 隔离:解析、正文、知识库、产品库和图片分析使用不同队列,避免互相抢占资源
- SSE 实时推送:处理进度和生成内容实时返回前端,用户可以随时查看当前阶段
- 任务心跳与租约:持续检查 Worker 运行状态,并防止同一任务被重复执行
- 幂等任务设计:同一请求重复提交不会产生多份结果,降低重复操作风险
- 任务自动恢复:系统重启或任务异常后进行重试、恢复或状态收口
- 分阶段状态记录:记录解析、切块、向量化、生成和保存等阶段,便于定位失败位置
数据与存储¶
- 分层存储架构:PostgreSQL 保存业务数据,Redis 保存任务和会话,OSS 保存文件,Qdrant 保存向量
- PostgreSQL + JSONB:固定字段和灵活结构同时保存,适合目录树、提示词变量和解析结果
- 对象存储直传:大文件直接上传 OSS,降低主服务压力并提高上传稳定性
- 数据版本控制:提示词、知识索引和解析任务保留版本,避免新旧数据混用
- 缓存复用机制:重复文件和已有结果可以直接复用,减少重复计算和等待时间
安全与权限¶
- JWT 身份认证:通过登录令牌验证用户身份,保护系统接口和企业数据
- 多租户数据隔离:数据库查询自动限定当前用户范围,防止跨企业读取资料
- 角色权限控制:普通用户和系统管理员拥有不同的数据访问和管理权限
- 文件归属校验:上传、解析、下载和项目绑定时验证文件是否属于当前用户
- Vault 密钥管理:数据库、Redis、OSS 和模型密钥统一管理,避免敏感配置写入代码
Word 文档输出¶
- Word 渲染引擎:将目录、章节正文和项目资料组装为完整 DOCX 标书
- 文档样式模板:统一配置字体、字号、行距、页边距和标题编号
- 树形目录渲染:根据目录层级自动生成不同级别的 Word 标题
- 富文本解析:识别正文中的标题、段落、表格和文字样式,并转换为 Word 格式
- 封面与目录编排:自动生成项目封面、章节结构和目录页
- 企业模板复用:常用文档样式保存后可在不同项目中重复使用
运行监控与部署¶
- 全链路 Request ID:为解析和生成任务分配唯一编号,方便快速定位问题
- 结构化错误日志:记录错误类型、根本原因和关联任务,缩短故障排查时间
- 生成性能指标:记录首字返回时间、总耗时、生成字数、模型和 Token 使用量
- 健康检查机制:检查数据库、Redis、对象存储和 LLM 服务是否正常
- Docker 容器化部署:API 与不同 Worker 可以独立部署和扩展
- 多环境配置隔离:开发、测试和生产使用不同配置,降低错误操作对正式系统的影响
架构扩展方向¶
- AI Agent 工作流:由解析、目录、写作和审核 Agent 分工协作完成标书
- 规则引擎审核:自动检查废标条款、必填材料、格式要求和关键响应项
- 评分模拟引擎:根据评分标准检查正文覆盖情况并提示可能失分点
- 招标要求知识图谱:建立评分项、资格条件、目录和正文之间的关联关系
- Rerank 检索重排序:对知识库检索结果进行二次排序,提高资料命中准确性
- 智能素材推荐:根据当前章节推荐产品、图片、资质和历史方案
- 多模态文档编排:自动选择并插入图片、表格、流程图和产品参数
- 正文一致性审核:检查项目名称、日期、人员、参数和承诺内容是否前后一致
- 敏感信息识别:发现身份证号、手机号、报价和企业机密等敏感内容