使用 Cloud Storage 注入流水线进行批量上传

本文档介绍了如何执行批量上传,这会在后台触发 Cloud Storage 注入流水线。

预处理选项

目前,批量上传提供以下三种预处理选项:

  1. 批量上传,不进行预处理:这会触发 runPipeline API 和 GcsIngestPipeline ,而不会使用 Document AI 处理器处理文档。

  2. 使用 Document AI 处理器提取实体:这 会触发 runPipeline API 和 GcsIngestWithDocAiProcessorsPipeline。 流水线会先调用给定的 Document AI 处理器,然后注入包含处理结果的文档。

  3. 对文档类型进行分类,并提取每种类型的实体:这也会 触发 runPipeline API 和 GcsIngestWithDocAiProcessorsPipeline, 后者会先调用分类器。然后,对于每种文档 类型,您可以指定相应的架构和处理器来处理那些特定文档 类型。这些文档会连同结果一起提取,并设置为此架构。

每种预处理类型都对应于界面中的以下选项:

第 0 步

示例:使用 OCR 处理器触发批量上传

此示例说明了流水线的第二种用法。

创建 OCR 处理器并获取处理器 ID

如果您之前创建过 OCR 处理器,只需在处理器 列表中找到该处理器,然后进入 处理器的详情页面并获取处理器 ID 即可。

如果您尚未创建 OCR 处理器,请按以下步骤操作:

  1. 处理器 列表顶部,点击处理器 库

    第 4 步

  2. 在库中找到 Document OCR 处理器,然后在 卡片底部点击创建处理器

    第 5 步

  3. 输入处理器显示名称:

    第 6 步

  4. 点击创建 ,当您重定向到处理器详情 页面时,找到 ID:

    第 7 步

    您需要将此 ID 复制到批量上传视图中的输入字段。

触发批量上传

  1. 打开批量上传视图。

    点击添加新内容 旁边的批量上传

    第 1 步

  2. 找到正确的处理器。

    1. 选择第二个预处理选项。

    2. 选择架构,并指定处理器和 Cloud Storage 存储桶路径,以 JSON 格式保存提取结果。

  3. 通过说明文本中的链接找到处理器 ID:

    第 2 步

  4. 触发上传:

    1. 使用在上一步中复制的处理器 ID,指定输入字段。源文件存储桶路径可以是存储桶,也可以是存储桶中的文件夹或子文件夹。

    2. 当输入字段有效时,如需触发批量上传,请点击右上角的上传

在状态页面中查看进度

触发批量上传后,系统会将您重定向到状态跟踪页面:

第 9 步

第一个表格显示了所有待处理或已处理的文档。提取文档后,第一个表格中将不再列出该文档。上传失败的文档会显示在第二个表格中。右侧的统计信息显示了已提取、失败和待处理的文档数量。

第 10 步

作业完成后,状态页面会显示 100% 完成,且没有任何待处理的文档:

第 11 步

检查上传的文档

  1. 返回搜索视图,找到新提取的文档。点击 Document AI Warehouse 徽标或顶部导航栏中的搜索

    第 12 步

  2. 点击文档名称,打开任意新提取的文档。在文档查看器中,您可以打开 AI 视图

    第 13 步

  3. 前往文本块 标签页。OCR 结果存储在文档中:

    第 13 步

下一步

使用 Document AI 提取流水线更新现有文档。