קטלוג זמן הריצה של Lakehouse הוא metastore מאוחד ללא שרתים, שמפשט את הניהול של metastore של Hive באירוח עצמי. שכבת המטא-נתונים היחידה והמנוהלת הזו מבטלת את הצורך במאגרי מטא-נתונים נפרדים לעומסי עבודה בקוד פתוח. הוא מאפשר לכם לשתף נתונים בצורה חלקה בין Apache Spark, Apache Hive ו-BigQuery.
השילוב הזה עבר אופטימיזציה לתאימות ל-Apache Spark ExternalCatalog, והוא תומך בקבוצת משנה של ממשק Hive Metastore. כדי לבדוק אם עומסי העבודה שלכם תלויים בתכונות שלא נתמכות כמו עסקאות, דחיסות או Kerberos, כדאי לעיין בהשוואת התכונות ובהגבלות.
איך Hive משתלב עם קטלוג זמן הריצה של Lakehouse
נקודת הקצה של Hive metastore מנהלת טבלאות רגילות של Apache Hive ו-Spark (באמצעות Hive SerDes או מקורות נתונים של Spark) ולא טבלאות של Apache Iceberg. כדי לפשט את החיבור של משימות Spark לנקודת הקצה הזו, תמונות של Managed Service for Apache Spark מוגדרות מראש עם ספריות הלקוח והתלות הדרושות.
הרצף הבא מתאר איך Spark מתחבר למאגר המטא-נתונים:
- Apache Spark מתחבר לקטלוגים חיצוניים של מטא-נתונים באמצעות הממשק הרגיל של Apache Hive
IMetastoreClient. - קטלוג זמן הריצה של Lakehouse מטמיע
IMetastoreClientמותאם אישית כדי לספק שירות metastore מנוהל למטא-נתונים של Spark ו-Hive. - סביבות זמן ריצה מוגדרות מראש של Managed Service for Apache Spark משתמשות אוטומטית בלקוח המותאם אישית הזה כדי לנתב פעולות של מטא-נתונים ישירות אל ה-metastore.
אחרי ההגדרה, אפשר להריץ שאילתות על הטבלאות שנוצרו ב-Spark ישירות ב-BigQuery. השילוב הזה תומך בפורמטים שונים של אחסון, כמו Parquet, ORC ו-Avro, וגם במיפויים ספציפיים של סוגי נתונים בין Spark ל-BigQuery.
איך קטלוג Hive משתלב עם Google Cloud שירותים
כדי להבין איך Lakehouse for Apache Iceberg מנהל את הנתונים שלכם, כדאי לעיין במידע על האופן שבו ארכיטקטורת קטלוג Hive משולבת עם Google Cloud שירותים. במקום לתחזק מאגרי מטא-נתונים באירוח עצמי, עומסי העבודה שלכם בקוד פתוח מתחברים לקטלוג של Lakehouse בזמן הריצה כדי לנהל את ההגדרות של מסדי הנתונים והטבלאות של Hive, תוך אחסון קובצי הנתונים הבסיסיים ישירות בספריות של מחסן הנתונים ב-Cloud Storage.
בתרשים הבא מוצג איך מנועי חישוב כמו Managed Service for Apache Spark משתמשים בקטלוג של זמן הריצה של Lakehouse כדי לנהל מטא-נתונים של טבלאות בזמן קריאה וכתיבה של קובצי נתונים בסיסיים ישירות ב-Hive.
השוואה בין תכונות של Hive Metastore
בטבלה הבאה מוצגת השוואה בין ישויות ופעולות ב-Hive Metastore וב-Lakehouse.
| ישות או פעולה | Hive Metastore | קטלוג של סביבת זמן ריצה של Lakehouse |
|---|---|---|
| קטלוג | ✅ | ✅ |
| מסד נתונים (יצירה, מחיקה, עדכון) | ✅ | ✅ |
| טבלה (יצירה, מחיקה, עדכון) | ✅ | ✅ |
| מחיצה (הוספה, הסרה, עדכון) | ✅ | ✅ |
| הרשאות לטבלה | ✅ | ✅ (דרך ניהול הזהויות והרשאות הגישה (IAM)) |
| הרשאות למחיצה | ✅ | ✅ (באמצעות IAM) |
| פונקציות בהגדרת המשתמש | ✅ | לא נתמך |
| עמודות שלפיהן יתבצע הפילוח | ✅ | לא נתמך |
| נתונים סטטיסטיים של עמודות בטבלה ובמחיצה | ✅ | לא נתמך |
| מגבלות על מפתחות | ✅ | לא נתמך |
| טוקנים של הענקת הרשאות (Kerberos) | ✅ | לא נתמך |
| הרשאות לעמודות | ✅ | לא נתמך |
| תפקידים | ✅ | לא נתמך |
| תוכניות משאבים ב-Workload Manager | ✅ | לא נתמך |
| עסקאות ודחיסות | ✅ | לא נתמך |