אתם יכולים להעביר מסמכים מ-Document AI Warehouse אל Document AI Workbench באמצעות צינור הייצוא אל Workbench. צינור הנתונים מייצא את המסמכים לתיקייה ב-Cloud Storage, ואז מייבא אותם למערך נתונים של Document AI. אתם מספקים את התיקייה ב-Cloud Storage ואת מערך הנתונים של Document AI.
דרישות מוקדמות
לפני שמתחילים, צריך:
- באותו Google Cloud פרויקט, פועלים לפי השלבים ליצירת מעבד.
מקדישים תיקייה ריקה ב-Cloud Storage לאחסון המסמכים המיוצאים.
בדף של מעבד הנתונים בהתאמה אישית, לוחצים על הגדרת קבוצת הנתונים ואז על המשך כדי לאתחל את קבוצת הנתונים.
הרצת צינור עיבוד הנתונים
REST
curl --location --request POST 'https://contentwarehouse.googleapis.com/v1/projects/PROJECT_NUMBER/locations/LOCATION:runPipeline' \ --header 'Content-Type: application/json' \ --header "Authorization: Bearer ${AUTH_TOKEN}" \ --data '{ "name": "projects/PROJECT_NUMBER/locations/LOCATION", "export_cdw_pipeline": { "documents": [ "projects/PROJECT_NUMBER/locations/LOCATION/documents/DOCUMENT", ], "export_folder_path": "gs://CLOUD STORAGE FOLDER", "doc_ai_dataset": "projects/PROJECT_NUMBER/locations/LOCATION/processors/PROCESSOR/dataset", "training_split_ratio": RATIO, }, "request_metadata": { "user_info": { "id": "user:USER EMAIL ADDRESS", } }}'
אפשר לציין את יחס החלוקה של נתוני האימון והבדיקה בשדה training_split_ratio כמספר נקודה צפה. לדוגמה, אם יש קבוצה של 10 מסמכים והיחס שצוין הוא 0.8, 8 מסמכים יתווספו לקבוצת נתונים לאימון ו-2 המסמכים הנותרים יתווספו לקבוצת נתונים לבדיקה.
הפקודה הזו מחזירה שם משאב של פעולה ממושכת. בשלב הבא תוכלו להשתמש בו כדי לעקוב אחרי ההתקדמות של הצינור.
קבלת תוצאה של פעולה ממושכת
REST
curl --location --request GET 'https://contentwarehouse.googleapis.com/v1/projects/PROJECT_NUMBER/locations/LOCATION/operations/OPERATION' \
--header "Authorization: Bearer ${AUTH_TOKEN}"השלב הבא
- כדי לבדוק את המסמכים המיוצאים, עוברים אל Document AI.