本文說明如何執行大量上傳作業,這項作業會在幕後觸發 Cloud Storage 擷取管道。
預先處理選項
目前,大量上傳功能提供三種前處理選項:
大量上傳,不需預先處理:這會觸發 runPipeline API,並使用 GcsIngestPipeline,不需使用 Document AI 處理器處理文件。
使用 Document AI 處理器擷取實體:這會觸發 runPipeline API,並使用 GcsIngestWithDocAiProcessorsPipeline。管道會先呼叫指定的 Document AI 處理器,然後擷取處理結果中的文件。
分類文件類型並擷取每種型別的實體:這也會觸發 runPipeline API,並使用 GcsIngestWithDocAiProcessorsPipeline,這會先呼叫分類器。然後,您可以為每個文件類型指定對應的結構定義和處理器,以處理這些特定文件類型。系統會連同結果一併擷取這些資料,並設為這個結構定義。
每種前處理類型都對應 UI 中的下列選項:

範例:使用 OCR 處理器觸發大量上傳作業
這個範例說明管道的第二種用途。
建立 OCR 處理器並取得處理器 ID
如果您先前已建立 OCR 處理器,只要在處理器清單中找到該處理器,然後前往處理器的詳細資料頁面,即可取得處理器 ID。
如果尚未建立,請按照下列步驟操作:
在處理器清單頂端,按一下「處理器庫」:

在圖庫中找到 Document OCR 處理器,然後點按資訊卡底部的「建立處理器」:

輸入處理器顯示名稱:

按一下「建立」,系統會將您重新導向至「處理器詳細資料」頁面,請找出 ID:

您需要將這項資訊複製到大量上傳檢視畫面中的輸入欄位。
觸發大量上傳
開啟大量上傳檢視畫面。
按一下「新增」旁的「大量上傳」:

找出正確的處理器。
選取第二個前處理選項。
選擇結構定義,並指定處理器和 Cloud Storage bucket 路徑,以 JSON 格式儲存擷取結果。
透過說明文字中的連結尋找處理器 ID:

觸發上傳:
複製上一個步驟的處理器 ID,然後指定輸入欄位。來源檔案值區路徑可以是值區、資料夾,或值區中的子資料夾。
輸入欄位有效時,如要觸發大量上傳,請按一下右上方的「上傳」。
在狀態頁面查看進度
觸發大量上傳後,系統會將你重新導向至狀態追蹤頁面:

第一個表格會顯示所有待處理或已處理的文件。擷取完畢後,文件就不會再列於第一個表格中。第二個表格會顯示上傳失敗的文件。右側的統計資料會顯示已擷取、失敗和待處理的文件數量。

工作完成後,狀態頁面會顯示 100% 完成,且沒有任何待處理文件:

檢查上傳的文件
返回搜尋檢視畫面,即可找到新擷取的文件。按一下頂端導覽列的 Document AI 倉儲標誌或「搜尋」:

按一下文件名稱,開啟任何新擷取的文件。在文件檢視器中,您可以開啟 AI 檢視畫面。

前往「文字區塊」分頁。OCR 結果會儲存在文件中:

下一步
使用「extract with Document AI」管道更新現有文件。