使用 Cloud Storage 擷取管道大量上傳

本文說明如何執行大量上傳作業,這項作業會在幕後觸發 Cloud Storage 擷取管道。

預先處理選項

目前,大量上傳功能提供三種前處理選項:

  1. 大量上傳,不需預先處理:這會觸發 runPipeline API,並使用 GcsIngestPipeline,不需使用 Document AI 處理器處理文件。

  2. 使用 Document AI 處理器擷取實體:這會觸發 runPipeline API,並使用 GcsIngestWithDocAiProcessorsPipeline。管道會先呼叫指定的 Document AI 處理器,然後擷取處理結果中的文件。

  3. 分類文件類型並擷取每種型別的實體:這也會觸發 runPipeline API,並使用 GcsIngestWithDocAiProcessorsPipeline,這會先呼叫分類器。然後,您可以為每個文件類型指定對應的結構定義和處理器,以處理這些特定文件類型。系統會連同結果一併擷取這些資料,並設為這個結構定義。

每種前處理類型都對應 UI 中的下列選項:

步驟 0

範例:使用 OCR 處理器觸發大量上傳作業

這個範例說明管道的第二種用途。

建立 OCR 處理器並取得處理器 ID

如果您先前已建立 OCR 處理器,只要在處理器清單中找到該處理器,然後前往處理器的詳細資料頁面,即可取得處理器 ID。

如果尚未建立,請按照下列步驟操作:

  1. 處理器清單頂端,按一下「處理器庫」

    步驟 4

  2. 在圖庫中找到 Document OCR 處理器,然後點按資訊卡底部的「建立處理器」

    步驟 5

  3. 輸入處理器顯示名稱:

    步驟 6

  4. 按一下「建立」,系統會將您重新導向至「處理器詳細資料」頁面,請找出 ID:

    步驟 7

    您需要將這項資訊複製到大量上傳檢視畫面中的輸入欄位。

觸發大量上傳

  1. 開啟大量上傳檢視畫面。

    按一下「新增」旁的「大量上傳」

    步驟 1

  2. 找出正確的處理器。

    1. 選取第二個前處理選項。

    2. 選擇結構定義,並指定處理器和 Cloud Storage bucket 路徑,以 JSON 格式儲存擷取結果。

  3. 透過說明文字中的連結尋找處理器 ID:

    步驟 2

  4. 觸發上傳:

    1. 複製上一個步驟的處理器 ID,然後指定輸入欄位。來源檔案值區路徑可以是值區、資料夾,或值區中的子資料夾。

    2. 輸入欄位有效時,如要觸發大量上傳,請按一下右上方的「上傳」

在狀態頁面查看進度

觸發大量上傳後,系統會將你重新導向至狀態追蹤頁面:

步驟 9

第一個表格會顯示所有待處理或已處理的文件。擷取完畢後,文件就不會再列於第一個表格中。第二個表格會顯示上傳失敗的文件。右側的統計資料會顯示已擷取、失敗和待處理的文件數量。

步驟 10

工作完成後,狀態頁面會顯示 100% 完成,且沒有任何待處理文件:

步驟 11

檢查上傳的文件

  1. 返回搜尋檢視畫面,即可找到新擷取的文件。按一下頂端導覽列的 Document AI 倉儲標誌或「搜尋」

    步驟 12

  2. 按一下文件名稱,開啟任何新擷取的文件。在文件檢視器中,您可以開啟 AI 檢視畫面

    步驟 13

  3. 前往「文字區塊」分頁。OCR 結果會儲存在文件中:

    步驟 13

下一步

使用「extract with Document AI」管道更新現有文件。