ייצוא תוצאות של שאילתות ל-Blob Storage

במאמר הזה מוסבר איך לייצא את התוצאה של שאילתה שמופעלת על טבלת BigLake אל Azure Blob Storage.

מידע על זרימת הנתונים בין BigQuery לבין Azure Blob Storage זמין במאמר זרימת נתונים במהלך ייצוא נתונים.

מגבלות

רשימה מלאה של המגבלות שחלות על טבלאות BigLake שמבוססות על Amazon S3 ו-Blob Storage מופיעה במאמר בנושא מגבלות.

לפני שמתחילים

ודאו שיש לכם את המקורות הבאים:

  • חיבור לגישה ל-Blob Storage. במסגרת החיבור, צריך ליצור מדיניות עבור נתיב מאגר ה-Blob שרוצים לייצא אליו. לאחר מכן, במדיניות הזו, יוצרים תפקיד עם ההרשאה Microsoft.Storage/storageAccounts/blobServices/containers/write.
  • טבלת BigLake של Blob Storage.

ייצוא תוצאות של שאילתה

‫BigQuery Omni כותב למיקום שצוין ב-Blob Storage בלי קשר לתוכן קיים. שאילתת הייצוא יכולה לדרוס נתונים קיימים או לערבב את תוצאת השאילתה עם נתונים קיימים. מומלץ לייצא את תוצאת השאילתה למאגר Blob Storage ריק.

  1. במסוף Google Cloud , עוברים לדף BigQuery.

    כניסה ל-BigQuery

  2. בשדה Query editor (עורך השאילתות), מזינים שאילתת ייצוא ב-GoogleSQL:

    EXPORT DATA WITH CONNECTION \`CONNECTION_REGION.CONNECTION_NAME\`
    OPTIONS(
      uri="azure://AZURE_STORAGE_ACCOUNT_NAME.blob.core.windows.net/CONTAINER_NAME/FILE_PATH/*",
      format="FORMAT"
    )
    AS QUERY

    מחליפים את מה שכתוב בשדות הבאים:

    • CONNECTION_REGION: האזור שבו נוצר החיבור.
    • CONNECTION_NAME: שם החיבור שיצרתם עם ההרשאה הנדרשת לכתיבה לקונטיינר.
    • AZURE_STORAGE_ACCOUNT_NAME: השם של חשבון Blob Storage שאליו רוצים לכתוב את תוצאת השאילתה.
    • CONTAINER_NAME: השם של הקונטיינר שאליו רוצים לכתוב את תוצאת השאילתה.
    • FILE_PATH: הנתיב שבו רוצים לכתוב את הקובץ המיוצא. הוא חייב להכיל בדיוק תו כללי אחד לחיפוש * בכל מקום בספריית העלים של מחרוזת הנתיב, למשל ../aa/*,‏ ../aa/b*c,‏ ../aa/*bc ו-../aa/bc*. ‫BigQuery מחליף את * ב-0000..N בהתאם למספר הקבצים שמיוצאים. מערכת BigQuery קובעת את מספר הקבצים ואת הגדלים שלהם. אם BigQuery מחליט לייצא שני קבצים, המחרוזת * בשם הקובץ הראשון מוחלפת ב-000000000000, והמחרוזת * בשם הקובץ השני מוחלפת ב-000000000001.
    • FORMAT: הפורמטים הנתמכים הם JSON,‏ AVRO,‏ CSV ו-PARQUET.
    • QUERY: השאילתה לניתוח הנתונים שמאוחסנים בטבלת BigLake.

פתרון בעיות

אם מופיעה שגיאה שקשורה ל-quota failure, צריך לבדוק אם הזמנתם קיבולת לשאילתות. מידע נוסף על הזמנת משבצות זמין בקטע לפני שמתחילים במאמר הזה.

המאמרים הבאים