借助无边界 Lakehouse,您可以直接从查询存储在其他 云提供商中的数据,而无需迁移文件 或构建复杂的 ETL 流水线。 Google Cloud
作为 Lakehouse for Apache Iceberg 的一部分,此功能可让您使用 BigQuery、 独立 Apache Spark 环境或 Managed Service for Apache Spark 对分布式数据集执行统一 分析并应用 AI。
除了分析查询之外,您还可以将联合数据用于 AI 驱动的洞见和治理:
- 对话分析: 构建基于确切数据源(包括 跨云表)的专用代理,以便通过一次 对话分析跨云数据。
- Knowledge Catalog: 使用 Knowledge Catalog 功能,通过 联合数据源进行数据分析和洞见分析。
使用场景
无边界 Lakehouse 支持多个关键使用场景,以便跨多个云提供商访问数据:
- 减少数据移动 :让您可以直接查询存储在其他云环境中的数据,从而简化数据访问和处理。
- 统一分析 :让您可以对所有数据执行高级分析,无论数据位于何处,都可以使用一致的功能和硬件优化。
- 无边界 AI 和机器学习 :让您可以将 AI 模型、自主代理和机器学习直接应用于远程数据,而无需迁移数据。
无边界 Lakehouse 的工作原理
无边界 Lakehouse 使用以下流程查询远程数据:
- 元数据发现: Google Cloud的 Lakehouse 连接到远程 Apache Iceberg REST 目录,例如 Databricks Unity 或 AWS Glue。Lakehouse 会发现数据,而无需复制任何文件。Lakehouse 会根据远程目录提供商,通过 Secret Manager 或 OpenID Connect 令牌联合(以 Google 作为身份提供商)安全地进行身份验证(OIDC 令牌联合)。
- 安全传输 :与公共互联网相比,选择通过专用互连(例如专用 CCI 或合作伙伴互连)路由流量可显著降低数据传输费用,并使延迟时间具有高度可预测性。
- 优化执行:当查询从远程云读取数据时, Lakehouse 会在专用存储空间中暂时将这些数据段缓存在本地 。 Google Cloud 后续查询会使用本地缓存,从而避免了大部分跨云出站流量费用。
支持的目录
无边界 Lakehouse 支持查询来自以下远程目录提供商的数据:
- Databricks Unity Catalog:在 Amazon Web Services (AWS) 和 Google Cloud上受支持。
- AWS Glue :在 Amazon Web Services (AWS) 上受支持。
- Snowflake:在 Amazon Web Services (AWS) 和上受支持 Google Cloud。
- SAP Business Data Cloud (BDC) :使用 SAP BDC 连接器受支持。
核心概念
本部分介绍了使用无边界 Lakehouse 必不可少的关键组件。
远程 Apache Iceberg REST 目录
这是元数据层。您可以连接到远程 Apache Iceberg REST 目录。 Lakehouse 会发现数据,而无需复制任何文件。通过 OIDC 令牌联合或 OAuth 凭据,Lakehouse 可以安全地进行身份验证,而无需长期有效的访问密钥。
无边界 Lakehouse 联合目录会根据刷新间隔同步来自远程 Apache Iceberg REST 目录的元数据。目录的后台元数据刷新时间可能会随着命名空间和表资源的增加而延长。如果之前的刷新超出时间限制,则当前刷新将被跳过,但下一次刷新将在下一个间隔按计划进行。
传输层
这是传输层。您可以将 Lakehouse 配置为通过公共互联网或专用互连查询存储在远程云提供商中的数据。本部分不适用于 SAP Business Data Cloud (BDC) 连接。
选择符合您的架构和安全要求的传输方法:
客户拥有的 (CCI)
您可以将 BigQuery 配置为通过专用 跨云互连查询存储在 Amazon Web Services (AWS) Amazon S3 存储分区中的数据,方法是使用 专用 Cross-Cloud Interconnect 或 合作伙伴 Cross-Cloud Interconnect。
使用专用互连具有以下优势:
- 增强的安全性:数据通过 和 AWS 之间的专用网络连接传输,避免了公共 互联网。 Google Cloud
- 降低费用 :与互联网出站流量相比,AWS 的出站流量费用可能会更低,尤其是在与专用互连容量相结合时。
- 一致的性能 :与公共互联网相比,网络延迟时间和带宽更可预测。
架构概览
如需启用专用查询,您可以通过专用互连配置从 BigQuery 到 AWS Amazon S3 存储桶的路径。虚拟私有云 (VPC) 中的一个关键组件是内部负载平衡器 (ILB)。 Google CloudILB 将来自 BigQuery 的请求分发到 AWS VPC 中 Amazon S3 的专用端点,这些端点使用 AWS PrivateLink 进行预配。
使用以多个弹性网络接口 (ENI) 作为后端的 ILB 对于负载均衡、可伸缩性和高可用性至关重要。无论您使用专用 CCI 还是合作伙伴互连,都是如此。
专用查询工作流遵循以下流程:
- BigQuery 使用配置了 Service Directory 服务的连接。
- Service Directory 将服务名称解析为 the Google Cloud ILB 的内部 IP 地址。
- ILB 接收来自 BigQuery 的请求,并将其分发到配置的后端。
- ILB 后端是混合连接网络端点组 (NEG),每个 NEG 都指向 AWS VPC 中 ENI 的专用 IP 地址。
- 流量从 ILB 流经 NEG,跨专用互连,到达 AWS ENI。
- AWS ENI 是 Amazon S3 VPC 接口端点 (AWS PrivateLink) 的一部分,可提供对 Amazon S3 服务的专用访问权限。
公共互联网(无 CCI)
如果您未配置专用互连,则对远程目录的查询默认通过公共互联网传输。
通过公共互联网查询数据时,请考虑以下影响:
- 标准加密 :数据访问请求和数据传输在公共互联网上使用标准 TLS 协议进行传输时加密。
- 出站流量费用 :数据传输会产生来自远程云提供商(例如 AWS)的标准互联网出站流量费用,这些费用通常高于专用互连出站流量费率。
- 可变延迟时间 :网络性能、带宽和延迟时间取决于公共互联网路由和拥塞情况,与专用互连相比,查询执行时间的可预测性较低。
- 设置简单:无需在 或 远程云提供商中添加网络基础架构、 VPC 对等互连或 Service Directory 配置。 Google Cloud
架构概览
通过公共互联网查询数据时,Lakehouse 会直接连接到远程目录和对象存储端点,而无需专用或远程云网络基础架构。 Google Cloud
公共互联网查询工作流遵循以下流程:
- BigQuery 针对 Lakehouse 目录中定义的联合表启动查询。
- Lakehouse 使用存储在 Secret Manager 中的凭据或 OIDC 令牌联合安全地对远程 Apache Iceberg 目录进行身份验证。
- Lakehouse 通过公共互联网检索表元数据和清单文件,以识别相关的底层数据文件(例如,在 AWS Amazon S3 中)。
- 底层对象的数据访问权限请求通过公共互联网使用标准 TLS 加密直接从 Google Cloud 发送。
- 远程存储服务使用 Lakehouse 提供的临时范围 凭据验证请求,并通过公共互联网将请求的 数据块返回给 Google Cloud。
后续步骤
- 为 AWS Glue 设置无边界 Lakehouse。
- 为 Databricks Unity Catalog 设置无边界 Lakehouse。
- 为 Snowflake设置无边界 Lakehouse。