Panoramica delle tabelle Apache Iceberg

Le tabelle Apache Iceberg, gestite dal catalogo di runtime Lakehouse e dall'endpoint del catalogo REST Iceberg, sono tabelle Iceberg aperte e interoperabili che rispettano la specifica della tabella Apache Iceberg open source e possono essere lette e scritte utilizzando qualsiasi motore di elaborazione compatibile con Iceberg o BigQuery.

In questo documento, queste tabelle sono denominate "tabelle Lakehouse Iceberg" o "tabelle Iceberg".

Puoi attivare e abilitare le seguenti funzionalità configurando le opzioni della tabella: :

  1. Interoperabilità di lettura/scrittura (anteprima): supporto di lettura e scrittura senza interruzioni per più motori, tra cui BigQuery, Managed Service per Apache Spark, motori compatibili con Iceberg come motori open source (Apache Spark, Apache Flink e Trino) e motori di terze parti (come Snowflake).
  2. Gestione automatica delle tabelle (anteprima): gestione automatica delle tabelle (ottimizzazione dello spazio di archiviazione) come compattazione e garbage collection.

Oltre alle funzionalità precedenti, le seguenti funzionalità sono supportate per impostazione predefinita anche per le tabelle Lakehouse Iceberg (anteprima).

  1. Linguaggio di definizione dei dati (DDL) di BigQuery (anteprima): oltre a creare o aggiornare le tabelle utilizzando motori compatibili con Iceberg come Spark, Flink, e Trino, puoi anche creare o aggiornare le tabelle Iceberg utilizzando le istruzioni DDL di BigQuery (ad esempio CREATE TABLE, ALTER TABLE, e DROP TABLE). Una volta create, le tabelle sono disponibili per le operazioni di lettura e scrittura in questi motori e in BigQuery e fanno parte della stessa struttura di catalogo e spazio dei nomi, gestita dal catalogo di runtime Lakehouse.
  2. Supporto per la distribuzione delle credenziali per BigQuery (anteprima): BigQuery supporta l'utilizzo della distribuzione delle credenziali per l' autenticazione durante la lettura o la scrittura delle tabelle Iceberg nel catalogo di runtime Lakehouse. Puoi impostare la distribuzione delle credenziali a livello di catalogo.

Azioni di gestione

Puoi eseguire le seguenti azioni di gestione sulle tabelle Apache Iceberg:

  • Crea una tabella: crea una tabella Apache Iceberg all'interno di uno spazio dei nomi del catalogo utilizzando la Google Cloud console, Spark, Trino, gcloud, BigQuery (anteprima) o l'API del catalogo REST Iceberg (CreateIcebergTable).
  • Registra una tabella: registra una tabella Apache Iceberg esistente all'interno di uno spazio dei nomi del catalogo utilizzando gcloud o l'API del catalogo REST Iceberg (RegisterIcebergTable).
  • Elenca le tabelle: visualizza gli identificatori delle tabelle all'interno di uno spazio dei nomi utilizzando la Google Cloud console, Spark, Trino, gcloud, BigQuery (anteprima) o l'API del catalogo REST Iceberg (ListIcebergTableIdentifiers).
  • Visualizza i dettagli della tabella: esamina lo schema, le proprietà e le credenziali della tabella utilizzando la Google Cloud console, Spark, Trino, gcloud, BigQuery (anteprima) o l'API del catalogo REST Iceberg (GetIcebergTable, LoadIcebergTableCredentials).
  • Inserisci dati: aggiungi righe di dati alle tue tabelle Iceberg utilizzando Spark, Trino o BigQuery (anteprima).
  • Esegui query su una tabella: esegui query sulle tabelle Iceberg da Spark, Trino o BigQuery (anteprima) utilizzando la denominazione delle tabelle in quattro parti.
  • Modifica i dati con DML: aggiorna, elimina o unisci le righe di dati nelle tabelle Iceberg utilizzando le istruzioni DML di BigQuery (anteprima), Spark o Trino.
  • Modifica una tabella: fai evolvere lo schema della tabella e aggiorna le proprietà dei metadati utilizzando la Google Cloud console, Spark, Trino, gcloud, BigQuery (anteprima) o l'API del catalogo REST Iceberg (UpdateIcebergTable).
  • Configura le opzioni della tabella: configura le proprietà per abilitare DML di BigQuery (anteprima) e la gestione automatica delle tabelle.
  • Gestisci gli ACL delle tabelle: visualizza e aggiorna i criteri IAM sulle tabelle Iceberg per controllare l'accesso per entità specifiche (get-iam-policy, set-iam-policy).
  • Esegui l'upgrade delle tabelle Iceberg V1 a V2: esegui l'upgrade delle tabelle Iceberg V1 esistenti al formato V2 supportato.
  • Utilizza i vettori di eliminazione binari nelle tabelle Iceberg V3: abilita i vettori di eliminazione binari per prestazioni di eliminazione ottimizzate nelle tabelle Iceberg V3.
  • Elimina una tabella: elimina la registrazione di una tabella dal catalogo senza eliminare i file di archiviazione sottostanti utilizzando la Google Cloud console, Spark, Trino, gcloud, BigQuery (anteprima) o l'API del catalogo REST Iceberg (DeleteIcebergTable).

Passaggi successivi