Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 31 · Lección

Lakehouse Federation y connections

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 4 de 5

Lakehouse Federation y connections

Diferencia query federation de catalog federation y entiende dónde se ejecuta cada parte, qué se empuja y por qué ambas son read-only.

Duración
17 min aprox.
Objetivo
Diferencia query federation de catalog federation y entiende dónde se ejecuta cada parte, qué se empuja y por qué ambas son read-only.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

OpenSharing (antes Delta Sharing) y Federation

Comparte o consulta datos externos con el mínimo movimiento y un perímetro gobernado.

Al terminar podrás
  • Comparar Databricks-to-Databricks y Databricks-to-Open
  • Configurar federation con pushdown
  • Elegir compartir, federar o ingerir
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Professional
Ruta relacionada
delivery
Dominios blueprint
Data Sharing and Federation
Estado
Revisión editorial interna
Fuentes principales
What is OpenSharing? · Share data and AI assets securely
Reportar un error
04
Diagnóstico

Lakehouse Federation y connections

Diferencia query federation de catalog federation y entiende dónde se ejecuta cada parte, qué se empuja y por qué ambas son read-only.

Mostrar prerrequisitos
Dificultad
Professional
Prerrequisitos
m30
Reportar un error en esta lección

Lakehouse Federation ofrece acceso gobernado mediante foreign catalogs. Query federation conecta bases relacionales por JDBC: Databricks empuja filtros/agregaciones compatibles y parte de la consulta se ejecuta en el sistema remoto. Catalog federation conecta catálogos externos como Hive Metastore, AWS Glue o plataformas compatibles y Databricks lee datos del object storage con su propio compute.

Ambas rutas son read-only y sirven exploración, BI o migración gradual, no sustituyen una ingesta para cargas intensivas repetidas. Comprueba pushdown con `EXPLAIN`, latencia de red, límites del origen y concurrencia. Una consulta que extrae millones de filas sin filtro puede saturar la base operacional aunque el warehouse Databricks tenga capacidad.

Modelo mental

Lakehouse Federation consulta datos donde viven, pero hay dos arquitecturas diferentes. Query federation conecta mediante JDBC a una base operacional; parte del plan se empuja al motor remoto y el resto se ejecuta en Databricks. Catalog federation integra metadatos de un catálogo externo y Databricks lee directamente sus archivos de object storage con su propio compute. Ambas se presentan como foreign catalogs gobernados por Unity Catalog y son normalmente read-only, pero el lugar de ejecución, coste y límites no coinciden. El pushdown no es todo o nada: depende del conector y operación. Una consulta que devuelve demasiadas filas puede saturar la base remota o un executor aunque el SQL parezca simple.

Query federation

Acceso read-only a bases externas mediante JDBC, con pushdown compatible y ejecución repartida entre sistema remoto y Databricks.

Permite análisis in situ rápido, pero puede trasladar carga a un sistema operacional y limitar throughput.
Catalog federation

Integración de metadatos de un catálogo externo mientras Databricks lee directamente los archivos subyacentes con su propio compute.

Facilita modelos híbridos y migraciones sin JDBC, siempre que almacenamiento, credenciales y formatos sean compatibles.
Pushdown

Traducción de filtros, proyecciones o agregaciones para ejecutarlos en la fuente antes de transferir el resultado a Databricks.

Reduce movimiento cuando es compatible, pero debe verificarse porque operadores no soportados se ejecutan localmente.
SQLCrear un foreign catalog sobre una conexión existente
CREATE FOREIGN CATALOG finance_postgres
USING CONNECTION finance_pg
OPTIONS (database 'finance');

EXPLAIN FORMATTED
SELECT region, SUM(amount) AS revenue
FROM finance_postgres.public.invoices
WHERE invoice_date >= current_date() - INTERVAL 7 DAYS
GROUP BY region;

La conexión debe usar secretos y red privada/permitida; revisa el plan para verificar qué predicados se empujan.

Puntos clave

  • Query federation usa JDBC y compute remoto con pushdown.
  • Catalog federation lee object storage usando compute Databricks.
  • Para transformación frecuente o escritura, ingiere y materializa en lakehouse.

Evita

  • Tratar un foreign catalog como destino escribible de ETL.
  • Lanzar scans completos contra una base OLTP en horario de máxima carga.

Recuerdo activo

¿Dónde se ejecuta una consulta de query federation?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

Unity Catalog · Fabric mirror

Azure Databricks Integration Demos · commit 2fcc3db

06-unity-catalog-fabric-mirror/notebooks/01-prepare-unity-catalog-tables.py