Product Showcase

智能文档字段提取工作台

面向合同、采购公告和业务材料,按字段结构提取结果并保留证据。

12行业分类
36产品案例
142关联接口
图像/转换字段抽取结构化 JSON人工复核

智能文档字段提取工作台

面向合同、采购公告和业务材料,按字段结构提取结果并保留证据。

智能文档字段提取工作台界面预览
Product Requirements

功能需求文档

基于当前产品界面整理核心流程、功能范围、结果展示和体验验收要求。

业务问题

智能文档字段抽取工作台面向招投标、采购、合同、财务、审计和资质审核团队,把 PDF、Word、TXT、Markdown 或纯文本中的业务字段解析为经过 Schema 校验的标准 JSON。产品提供原文预览、字段模板、JSON 结果、JSON Tree、证据定位、置信度、失败原因、人工复核和异步任务管理。

截图覆盖文档队列、原始文档预览、JSON Schema 定义、JSON Tree 抽取结果、质量概览、字段级复核、OCR 与执行模式、告警、人工复核队列和多格式导出。它不是只展示一段“智能回答”的聊天页,而是让原始文档、结构定义、JSON 结果和证据链同时可核对的业务工作台。

适用用户

采购、合同、财务、审计和业务资料录入团队。

操作流程

  1. 用户上传文档,或粘贴已经完成 OCR/网页抽取的纯文本。
  2. 用户选择字段模板,或编辑 JSON Schema 和补充解析说明。
  3. 系统校验输入二选一、Schema 合法性和文件类型。
  4. 服务根据 ocrMode 抽取文本,并按 executionMode 同步处理或创建任务。
  5. 页面展示原始文档、JSON 结果、JSON Tree 和质量概览。
  6. 用户点击字段查看证据片段,对低置信度或失败字段进行复核。
  7. 复核通过后导出 JSON、Excel、CSV 或复核报告,或写入下游系统。

输入与输出

原始文档预览是复核基准,必须保留页码、缩放、下载和证据高亮。JSON Schema 编辑器显示字段 key、类型、标题、说明、必填约束和嵌套关系。JSON 结果用于复制和接口联调,JSON Tree 用于浏览复杂层级,两者来自同一份结构化结果。

字段表需要完整显示 statusvaluenormalizedValuetypeconfidencereasonevidence。成功率计算为成功字段数除以字段总数,界面不得把低置信度字段自动算作已人工确认。

失败字段按 NOT_FOUNDTYPE_MISMATCHLOW_CONFIDENCEAMBIGUOUSUNSUPPORTED_SCHEMAEXTRACTION_ERROR 分类。页面可以针对不同失败类型提供重试或人工修正,但必须保留原始返回值和修改记录。

功能与界面要求

截图可见信息组织

顶部导航包括解析工作台、任务中心、字段模板、质量复核和系统设置。左侧文档队列展示文件名、类型、大小、时间和处理状态。

中间左侧保留原始文档预览,并高亮与字段结果对应的证据。中间右侧同时展示 JSON Schema 和 JSON Tree。用户可以在“JSON 结果”和“JSON Tree”之间切换,但原始文档始终保留,不能用格式化结果替代原始资料。

下方质量概览展示字段总数、成功字段、失败字段、成功率和平均置信度。字段级复核表展示字段名、状态、原始值、规范化值、类型、置信度、证据来源和操作。

右侧配置 OCR 模式与执行模式,展示执行进度、告警、待人工复核项和导出入口。低置信度、类型不匹配或歧义字段必须进入复核,不得静默写入下游。

核心功能需求

  1. 文档输入:filetext 必须二选一,支持 PDF、DOCX、DOC、TXT、MD/Markdown 和纯文本。
  2. Schema 编辑:顶层必须为 object,支持嵌套对象、数组及常用标量类型。
  3. OCR 策略:支持 autoalwaysnever,并显示实际文本抽取方式。
  4. 执行模式:支持 autosyncasync;大文档与扫描件优先使用异步任务。
  5. 结果视图:保留原始文档,提供 JSON 结果、JSON Tree 和字段复核表。
  6. 证据定位:每个字段可查看页码、段落、表格行或章节证据片段。
  7. 质量控制:展示字段状态、置信度、失败原因、警告和总体成功率。
  8. 人工复核:允许确认、修改、驳回或重新抽取,并保留操作记录。
  9. 安全处理:凭证只保存在服务端;导出和下游写入遵守业务数据权限。

接口数据链

本案例的接口数据链以“智能文档字段抽取工作台”的操作流程为顺序:上一步返回的业务标识、规范化结果或状态进入下一步,页面同时保留来源与处理状态。接口信息按当前公开接口契约展示,文章只维护业务步骤之间的流转关系。

异常边界

未找到、类型不匹配、低置信度或结果歧义必须保留明确状态,不得猜测缺失字段。

验收标准

桌面端需要尽量同时展示原文、Schema/JSON 和字段复核表。较窄窗口可折叠文档队列或配置栏,但不能隐藏原文与证据入口。移动端以任务状态和字段复核为主,复杂 Schema 编辑建议进入桌面模式。

验收时需要确认:原始文档是否保留;JSON 结果和 JSON Tree 是否一致;字段点击能否定位证据;filetext 是否二选一;OCR 与执行模式是否正确;总体统计是否与字段表一致;低置信度字段是否进入人工复核;异步任务是否正确处理过期和失败状态。

  • 文档队列展示文件类型、状态和失败项;
  • 原文页码、缩放、证据高亮与字段结果联动;
  • Schema 编辑器可以校验类型和必填字段;
  • JSON 结果与 JSON Tree 使用同一数据源;
  • 字段表包含原值、规范化值、类型、置信度和证据;
  • 成功数、失败数和成功率计算一致;
  • 低置信度与歧义字段进入人工复核;
  • 导出结果不包含未确认的产品侧修改;
  • 访问凭证 不出现在前端代码、截图或公开文件中。

下一步

复核通过的字段可以进入采购入库、合同台账或审批流程。如需评估自己的数据、页面和业务流程,可以从当前案例的接口蓝图核对输入输出,再联系 GuGuData Engineering 讨论实现范围与验收方式。