本文說明如何將文件從 Document AI Warehouse 匯出至 Document AI Workbench 中自訂文件擷取器 (CDE) 的資料集。
CDE 可讓使用者建立文件擷取器。他們會將文件匯入處理器資料集,然後加上標籤,再訓練模型。使用者將選取的文件匯出至 CDE 的資料集後,即可管理或搜尋 Document AI 倉儲中的文件,藉此建立資料集。
在 Document AI Workbench 中建立 CDE
如需建立 CDE 的完整操作說明,請參閱這份官方指南。本指南會重點說明幾個重要步驟。
從處理器清單建立 CDE
-

在「Custom Document Extractor」(自訂文件擷取器) 資訊卡上,選擇「Create Processor」(建立處理器):

輸入顯示名稱,然後按一下「建立」:

CDE 應快速建立。
設定 CDE 的資料集
在處理器詳細資料頁面,按一下「設定資料集位置」:

指定用來儲存資料集中文件的 bucket 路徑:

完成設定需要幾分鐘。之後,您可以在詳細資料頁面中查看 bucket 路徑和計數:

您需要上述處理器 ID,才能觸發匯出至 Workbench 的管道。
觸發匯出至 Workbench 的管道
選取要匯出的文件,然後按一下動作列上的「Export to Document AI Workbench」(匯出至 Document AI Workbench):

輸入參數,然後從 CDE 複製處理器 ID,並貼到對話方塊中,即可觸發管道。
您需要暫存 bucket 路徑,才能在匯出文件前暫時儲存文件。資料分割功能可讓使用者隨機將文件放入訓練集或測試集。系統會根據這個值計算分潤比例。

按一下「匯出」,即可觸發管道工作。
追蹤狀態。
觸發管道後,系統會顯示狀態追蹤頁面。目前,這個頁面沒有進行中的追蹤作業。工作完成前,狀態頁面會顯示「Pending」(待處理)。

查看結果。
工作完成後,您會看到成功和失敗的文件。

如要檢查文件是否正確匯出,請返回 CDE 的詳細資料頁面:

如果您在管道執行前開啟頁面,請重新整理頁面,查看更新後的統計資料。訓練集和測試集的分佈情況取決於資料分割比例。
如要查看文件詳細資料,請前往「訓練」分頁:

下一步
進一步瞭解 runPipeline API。