Tentang Katalog Hive di katalog runtime Lakehouse

Katalog runtime Lakehouse adalah metastore terpadu tanpa server yang menyederhanakan pengelolaan metastore Hive yang dihosting sendiri. Lapisan metadata tunggal yang terkelola sepenuhnya ini menghilangkan kebutuhan akan penyimpanan metadata terpisah untuk workload open source. Katalog ini memungkinkan Anda berbagi data dengan lancar di Apache Spark, Apache Hive, dan BigQuery.

Dioptimalkan untuk kompatibilitas ExternalCatalog Apache Spark, integrasi ini mendukung subset antarmuka Hive Metastore. Untuk melihat apakah workload Anda bergantung pada fitur yang tidak didukung seperti transaksi, pemadatan, atau Kerberos, tinjau perbandingan fitur dan batasan.

Cara Hive terintegrasi dengan katalog runtime Lakehouse

Endpoint metastore Hive mengelola tabel Apache Hive dan Spark standar (menggunakan sumber data Hive SerDes atau Spark), bukan tabel Apache Iceberg. Untuk menyederhanakan koneksi tugas Spark ke endpoint ini, image Managed Service untuk Apache Spark telah dikonfigurasi sebelumnya dengan library dan dependensi klien yang diperlukan.

Urutan berikut menjelaskan cara Spark terhubung ke metastore:

  1. Apache Spark terhubung ke katalog metadata eksternal menggunakan antarmuka IMetastoreClient Apache Hive standar.
  2. Katalog runtime Lakehouse mengimplementasikan IMetastoreClient kustom untuk menyediakan layanan metastore yang terkelola sepenuhnya untuk metadata Spark dan Hive Anda.
  3. Runtime Managed Service untuk Apache Spark yang telah dikonfigurasi sebelumnya secara otomatis menggunakan klien kustom ini untuk merutekan operasi metadata langsung ke metastore.

Setelah penyiapan, Anda dapat mengkueri tabel yang dibuat Spark langsung di BigQuery. Integrasi ini mendukung berbagai format penyimpanan—seperti Parquet, ORC, dan Avro—beserta pemetaan jenis data tertentu antara Spark dan BigQuery.

Cara katalog Hive terintegrasi dengan Google Cloud layanan

Untuk memahami cara Lakehouse untuk Apache Iceberg mengelola data Anda, lihat cara arsitektur katalog Hive terintegrasi dengan Google Cloud layanan. Daripada mempertahankan metastore yang dihosting sendiri, workload open source Anda terhubung ke katalog runtime Lakehouse untuk mengelola definisi database dan tabel Hive, sekaligus menyimpan file data yang mendasarinya langsung di direktori warehouse Cloud Storage.

Diagram berikut menggambarkan cara mesin komputasi seperti Managed Service untuk Apache Spark menggunakan katalog runtime Lakehouse untuk mengelola metadata tabel saat membaca dan menulis file data yang mendasarinya langsung di Hive.

Komponen arsitektur Lakehouse, termasuk Managed Service untuk Apache Spark, Cloud Storage, dan katalog Apache Hive.
Diagram arsitektur katalog Hive Lakehouse.

Perbandingan fitur dengan Hive Metastore

Tabel berikut membandingkan entity dan operasi di Hive Metastore dan Lakehouse.

Entity atau operasi Hive Metastore Katalog runtime Lakehouse
Katalog
Database (buat, hapus, update)
Tabel (buat, hapus, update)
Partisi (tambah, hapus, update)
Hak istimewa tabel ✅ (melalui Identity and Access Management (IAM))
Hak istimewa partisi ✅ (melalui IAM)
Fungsi yang ditentukan pengguna (UDF) Tidak didukung
Kolom Bucketing / Skewing Tidak didukung
Statistik kolom tabel dan partisi Tidak didukung
Batasan kunci Tidak didukung
Token delegasi (Kerberos) Tidak didukung
Hak istimewa kolom Tidak didukung
Peran Tidak didukung
Paket resource pengelola workload Tidak didukung
Transaksi dan pemadatan Tidak didukung

Langkah berikutnya