Saltar al contenido

Plataforma

Menú

Puedes leer sin crear un espacio. Créalo solo cuando quieras guardar.

Guardar progreso

Lección 1 de 5

Lake, warehouse y lakehouse sin simplificaciones

Un lakehouse combina la flexibilidad de un data lake con controles y rendimiento propios de un warehouse, manteniendo los datos en formatos abiertos.

17 min aprox.

Detalles

Data Intelligence Platform y arquitectura lakehouse

Construye un modelo mental preciso de almacenamiento, cómputo, gobierno y superficies de trabajo.

Reto observable

Ante un caso de negocio, dibuja una arquitectura lakehouse que separe almacenamiento, cómputo y gobierno, y justifica cada superficie con una decisión verificable.

Al terminar podrás
  • Explicar la separación entre storage y compute
  • Relacionar Delta Lake, Unity Catalog y motores de ejecución
  • Elegir la superficie adecuada para cada carga
Prerrequisitos
Ninguno obligatorio
Última revisión
25 ago 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Databricks Intelligence Platform · Arquitectura
Estado
Revisión editorial interna
Fuentes principales
Data engineering with Databricks · Arquitectura lakehouse
Reportar un error
01
Modelo mental

Lake, warehouse y lakehouse sin simplificaciones

Un lakehouse combina la flexibilidad de un data lake con controles y rendimiento propios de un warehouse, manteniendo los datos en formatos abiertos.

La separación entre almacenamiento y cómputo permite conservar una única copia gobernada de los datos y asignar motores distintos a ETL, BI o streaming. El object storage aporta durabilidad y elasticidad; el cómputo se crea, escala y termina según la carga.

Delta Lake añade un registro transaccional sobre archivos Parquet. Así, una tabla puede ofrecer ACID, evolución controlada del esquema e historial sin abandonar un formato accesible por varios motores. El valor no está en juntar productos, sino en reducir copias y fronteras operativas.

SQLInspeccionar una tabla Delta
DESCRIBE DETAIL main.learning.events;

Comprueba format, location y propiedades antes de asumir cómo está almacenada una tabla.

¿Qué componente conserva el historial ACID de una tabla Delta?

Profundiza

Piensa en un lakehouse como un sistema de tablas confiables construido sobre almacenamiento de objetos, no como una mezcla superficial de data lake y warehouse. El almacenamiento conserva archivos baratos y durables; Delta Lake convierte conjuntos de esos archivos en snapshots transaccionales; Unity Catalog asigna nombres, propietarios y permisos; y distintos recursos de compute leen el mismo estado lógico. Este desacoplamiento evita que la copia física pertenezca a un motor concreto. Para razonar correctamente, separa siempre cuatro preguntas: dónde persisten los bytes, qué protocolo define una tabla válida, quién puede usarla y qué motor ejecuta la consulta. Esa separación explica simultáneamente elasticidad, interoperabilidad, gobierno y recuperación.

Snapshot

Vista inmutable y coherente de los archivos activos de una tabla en una versión concreta del transaction log.

Permite explicar por qué lectores concurrentes ven estados completos y reproducibles.
Formato abierto

Representación documentada de datos y transacciones que no depende exclusivamente de una aplicación propietaria para interpretarse.

Reduce copias y facilita que distintos motores trabajen sobre una fuente común.
Separación storage-compute

Diseño en el que persistencia y capacidad de ejecución tienen ciclos de vida y escalado independientes.

Permite elegir rendimiento, aislamiento y coste por workload sin trasladar los datos.
Resumen

Puntos clave

  • Storage y compute tienen ciclos de vida independientes
  • Delta conserva datos y transacciones en formatos abiertos
  • Una única capa gobernada sirve a ETL, BI y streaming

Evita

  • Describir lakehouse como un simple data lake con SQL
  • Duplicar datos por cada motor sin justificar latencia o aislamiento

Vista de lectura · sin ejecución

Learn Databricks

Learn Databricks · commit 08c378c

README.md

Módulo 01

Contenido del módulo