本文档介绍了如何执行批量上传,这会在后台触发 Cloud Storage 注入流水线。
预处理选项
目前,批量上传提供以下三种预处理选项:
批量上传,不进行预处理:这会触发 runPipeline API 和 GcsIngestPipeline ,而不会使用 Document AI 处理器处理文档。
使用 Document AI 处理器提取实体:这 会触发 runPipeline API 和 GcsIngestWithDocAiProcessorsPipeline。 流水线会先调用给定的 Document AI 处理器,然后注入包含处理结果的文档。
对文档类型进行分类,并提取每种类型的实体:这也会 触发 runPipeline API 和 GcsIngestWithDocAiProcessorsPipeline, 后者会先调用分类器。然后,对于每种文档 类型,您可以指定相应的架构和处理器来处理那些特定文档 类型。这些文档会连同结果一起提取,并设置为此架构。
每种预处理类型都对应于界面中的以下选项:

示例:使用 OCR 处理器触发批量上传
此示例说明了流水线的第二种用法。
创建 OCR 处理器并获取处理器 ID
如果您之前创建过 OCR 处理器,只需在处理器 列表中找到该处理器,然后进入 处理器的详情页面并获取处理器 ID 即可。
如果您尚未创建 OCR 处理器,请按以下步骤操作:
在处理器 列表顶部,点击处理器 库:

在库中找到 Document OCR 处理器,然后在 卡片底部点击创建处理器:

输入处理器显示名称:

点击创建 ,当您重定向到处理器详情 页面时,找到 ID:

您需要将此 ID 复制到批量上传视图中的输入字段。
触发批量上传
打开批量上传视图。
点击添加新内容 旁边的批量上传:

找到正确的处理器。
选择第二个预处理选项。
选择架构,并指定处理器和 Cloud Storage 存储桶路径,以 JSON 格式保存提取结果。
通过说明文本中的链接找到处理器 ID:

触发上传:
使用在上一步中复制的处理器 ID,指定输入字段。源文件存储桶路径可以是存储桶,也可以是存储桶中的文件夹或子文件夹。
当输入字段有效时,如需触发批量上传,请点击右上角的上传 。
在状态页面中查看进度
触发批量上传后,系统会将您重定向到状态跟踪页面:

第一个表格显示了所有待处理或已处理的文档。提取文档后,第一个表格中将不再列出该文档。上传失败的文档会显示在第二个表格中。右侧的统计信息显示了已提取、失败和待处理的文档数量。

作业完成后,状态页面会显示 100% 完成,且没有任何待处理的文档:

检查上传的文档
返回搜索视图,找到新提取的文档。点击 Document AI Warehouse 徽标或顶部导航栏中的搜索 :

点击文档名称,打开任意新提取的文档。在文档查看器中,您可以打开 AI 视图 。

前往文本块 标签页。OCR 结果存储在文档中:

下一步
使用 Document AI 提取流水线更新现有文档。