Katalog runtime Lakehouse adalah metastore terpadu tanpa server yang menyederhanakan pengelolaan metastore Hive yang dihosting sendiri. Lapisan metadata tunggal yang terkelola sepenuhnya ini menghilangkan kebutuhan akan penyimpanan metadata terpisah untuk workload open source. Katalog ini memungkinkan Anda berbagi data dengan lancar di Apache Spark, Apache Hive, dan BigQuery.
Dioptimalkan untuk kompatibilitas ExternalCatalog Apache Spark, integrasi ini mendukung subset antarmuka Hive Metastore. Untuk melihat apakah workload Anda
bergantung pada fitur yang tidak didukung seperti transaksi, pemadatan, atau Kerberos,
tinjau perbandingan fitur dan batasan.
Cara Hive terintegrasi dengan katalog runtime Lakehouse
Endpoint metastore Hive mengelola tabel Apache Hive dan Spark standar (menggunakan sumber data Hive SerDes atau Spark), bukan tabel Apache Iceberg. Untuk menyederhanakan koneksi tugas Spark ke endpoint ini, image Managed Service untuk Apache Spark telah dikonfigurasi sebelumnya dengan library dan dependensi klien yang diperlukan.
Urutan berikut menjelaskan cara Spark terhubung ke metastore:
- Apache Spark terhubung ke katalog metadata eksternal menggunakan antarmuka
IMetastoreClientApache Hive standar. - Katalog runtime Lakehouse mengimplementasikan
IMetastoreClientkustom untuk menyediakan layanan metastore yang terkelola sepenuhnya untuk metadata Spark dan Hive Anda. - Runtime Managed Service untuk Apache Spark yang telah dikonfigurasi sebelumnya secara otomatis menggunakan klien kustom ini untuk merutekan operasi metadata langsung ke metastore.
Setelah penyiapan, Anda dapat mengkueri tabel yang dibuat Spark langsung di BigQuery. Integrasi ini mendukung berbagai format penyimpanan—seperti Parquet, ORC, dan Avro—beserta pemetaan jenis data tertentu antara Spark dan BigQuery.
Cara katalog Hive terintegrasi dengan Google Cloud layanan
Untuk memahami cara Lakehouse untuk Apache Iceberg mengelola data Anda, lihat cara arsitektur katalog Hive terintegrasi dengan Google Cloud layanan. Daripada mempertahankan metastore yang dihosting sendiri, workload open source Anda terhubung ke katalog runtime Lakehouse untuk mengelola definisi database dan tabel Hive, sekaligus menyimpan file data yang mendasarinya langsung di direktori warehouse Cloud Storage.
Diagram berikut menggambarkan cara mesin komputasi seperti Managed Service untuk Apache Spark menggunakan katalog runtime Lakehouse untuk mengelola metadata tabel saat membaca dan menulis file data yang mendasarinya langsung di Hive.
Perbandingan fitur dengan Hive Metastore
Tabel berikut membandingkan entity dan operasi di Hive Metastore dan Lakehouse.
| Entity atau operasi | Hive Metastore | Katalog runtime Lakehouse |
|---|---|---|
| Katalog | ✅ | ✅ |
| Database (buat, hapus, update) | ✅ | ✅ |
| Tabel (buat, hapus, update) | ✅ | ✅ |
| Partisi (tambah, hapus, update) | ✅ | ✅ |
| Hak istimewa tabel | ✅ | ✅ (melalui Identity and Access Management (IAM)) |
| Hak istimewa partisi | ✅ | ✅ (melalui IAM) |
| Fungsi yang ditentukan pengguna (UDF) | ✅ | Tidak didukung |
| Kolom Bucketing / Skewing | ✅ | Tidak didukung |
| Statistik kolom tabel dan partisi | ✅ | Tidak didukung |
| Batasan kunci | ✅ | Tidak didukung |
| Token delegasi (Kerberos) | ✅ | Tidak didukung |
| Hak istimewa kolom | ✅ | Tidak didukung |
| Peran | ✅ | Tidak didukung |
| Paket resource pengelola workload | ✅ | Tidak didukung |
| Transaksi dan pemadatan | ✅ | Tidak didukung |