將文件匯出至 Document AI Workbench

本文說明如何將文件從 Document AI Warehouse 匯出至 Document AI Workbench 中自訂文件擷取器 (CDE) 的資料集。

CDE 可讓使用者建立文件擷取器。他們會將文件匯入處理器資料集,然後加上標籤,再訓練模型。使用者將選取的文件匯出至 CDE 的資料集後,即可管理或搜尋 Document AI 倉儲中的文件,藉此建立資料集。

在 Document AI Workbench 中建立 CDE

如需建立 CDE 的完整操作說明,請參閱這份官方指南。本指南會重點說明幾個重要步驟。

從處理器清單建立 CDE

  1. 前往「我的處理器」頁面,然後點選「建立自訂處理器」

    步驟 1

  2. 在「Custom Document Extractor」(自訂文件擷取器) 資訊卡上,選擇「Create Processor」(建立處理器)

    步驟 2

  3. 輸入顯示名稱,然後按一下「建立」

    步驟 3

CDE 應快速建立。

設定 CDE 的資料集

  1. 在處理器詳細資料頁面,按一下「設定資料集位置」

    步驟 4

  2. 指定用來儲存資料集中文件的 bucket 路徑:

    步驟 5

    完成設定需要幾分鐘。之後,您可以在詳細資料頁面中查看 bucket 路徑和計數:

    步驟 6

    您需要上述處理器 ID,才能觸發匯出至 Workbench 的管道。

觸發匯出至 Workbench 的管道

  1. 選取要匯出的文件,然後按一下動作列上的「Export to Document AI Workbench」(匯出至 Document AI Workbench)

    步驟 7

  2. 輸入參數,然後從 CDE 複製處理器 ID,並貼到對話方塊中,即可觸發管道。

    您需要暫存 bucket 路徑,才能在匯出文件前暫時儲存文件。資料分割功能可讓使用者隨機將文件放入訓練集或測試集。系統會根據這個值計算分潤比例。

    步驟 8

    按一下「匯出」,即可觸發管道工作。

  3. 追蹤狀態。

    觸發管道後,系統會顯示狀態追蹤頁面。目前,這個頁面沒有進行中的追蹤作業。工作完成前,狀態頁面會顯示「Pending」(待處理)。

    步驟 9

  4. 查看結果。

    1. 工作完成後,您會看到成功和失敗的文件。

      步驟 10

    2. 如要檢查文件是否正確匯出,請返回 CDE 的詳細資料頁面:

      步驟 11

    3. 如果您在管道執行前開啟頁面,請重新整理頁面,查看更新後的統計資料。訓練集和測試集的分佈情況取決於資料分割比例。

    4. 如要查看文件詳細資料,請前往「訓練」分頁:

      步驟 12

下一步

進一步瞭解 runPipeline API