Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.
Lección 1 de 5
Lake, warehouse y lakehouse sin simplificaciones
Un lakehouse combina la flexibilidad de un data lake con controles y rendimiento propios de un warehouse, manteniendo los datos en formatos abiertos.
- Duración
- 17 min aprox.
- Objetivo
- Un lakehouse combina la flexibilidad de un data lake con controles y rendimiento propios de un warehouse, manteniendo los datos en formatos abiertos.
- Siguiente paso
- Continuar con la siguiente lección
Ver detalles del módulo
Data Intelligence Platform y arquitectura lakehouse
Construye un modelo mental preciso de almacenamiento, cómputo, gobierno y superficies de trabajo.
- Explicar la separación entre storage y compute
- Relacionar Delta Lake, Unity Catalog y motores de ejecución
- Elegir la superficie adecuada para cada carga
01Modelo mentalLake, warehouse y lakehouse sin simplificaciones
Un lakehouse combina la flexibilidad de un data lake con controles y rendimiento propios de un warehouse, manteniendo los datos en formatos abiertos.
+
Lake, warehouse y lakehouse sin simplificaciones
Un lakehouse combina la flexibilidad de un data lake con controles y rendimiento propios de un warehouse, manteniendo los datos en formatos abiertos.
Mostrar prerrequisitos
- Dificultad
- Associate
- Prerrequisitos
- Ninguno obligatorio
La separación entre almacenamiento y cómputo permite conservar una única copia gobernada de los datos y asignar motores distintos a ETL, BI o streaming. El object storage aporta durabilidad y elasticidad; el cómputo se crea, escala y termina según la carga.
Delta Lake añade un registro transaccional sobre archivos Parquet. Así, una tabla puede ofrecer ACID, evolución controlada del esquema e historial sin abandonar un formato accesible por varios motores. El valor no está en juntar productos, sino en reducir copias y fronteras operativas.
Modelo mental
Piensa en un lakehouse como un sistema de tablas confiables construido sobre almacenamiento de objetos, no como una mezcla superficial de data lake y warehouse. El almacenamiento conserva archivos baratos y durables; Delta Lake convierte conjuntos de esos archivos en snapshots transaccionales; Unity Catalog asigna nombres, propietarios y permisos; y distintos recursos de compute leen el mismo estado lógico. Este desacoplamiento evita que la copia física pertenezca a un motor concreto. Para razonar correctamente, separa siempre cuatro preguntas: dónde persisten los bytes, qué protocolo define una tabla válida, quién puede usarla y qué motor ejecuta la consulta. Esa separación explica simultáneamente elasticidad, interoperabilidad, gobierno y recuperación.
Vista inmutable y coherente de los archivos activos de una tabla en una versión concreta del transaction log.
Permite explicar por qué lectores concurrentes ven estados completos y reproducibles.Representación documentada de datos y transacciones que no depende exclusivamente de una aplicación propietaria para interpretarse.
Reduce copias y facilita que distintos motores trabajen sobre una fuente común.Diseño en el que persistencia y capacidad de ejecución tienen ciclos de vida y escalado independientes.
Permite elegir rendimiento, aislamiento y coste por workload sin trasladar los datos.DESCRIBE DETAIL main.learning.events;Comprueba format, location y propiedades antes de asumir cómo está almacenada una tabla.
Puntos clave
- Storage y compute tienen ciclos de vida independientes
- Delta conserva datos y transacciones en formatos abiertos
- Una única capa gobernada sirve a ETL, BI y streaming
Evita
- Describir lakehouse como un simple data lake con SQL
- Duplicar datos por cada motor sin justificar latencia o aislamiento
Recuerdo activo