Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 09 · Lección

Matriz de decisión por volumen, frescura y gobierno

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 5 de 5

Matriz de decisión por volumen, frescura y gobierno

Evolución y estado deben aislarse por pipeline y ambiente.

Duración
17 min aprox.
Objetivo
Evolución y estado deben aislarse por pipeline y ambiente.
Siguiente paso
Continuar con el laboratorio
Ver detalles del módulo

Auto Loader y Lakeflow Connect

Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.

Al terminar podrás
  • Configurar schemaLocation y checkpointLocation
  • Gestionar evolución y rescued data
  • Elegir Lakeflow Connect, Auto Loader o partner connector
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate + Professional
Ruta relacionada
core
Dominios blueprint
Data Ingestion and Loading · Lakeflow Connect
Estado
Revisión editorial interna
Fuentes principales
Auto Loader · Lakeflow Connect
Reportar un error
05
Decisión de diseño

Matriz de decisión por volumen, frescura y gobierno

Evolución y estado deben aislarse por pipeline y ambiente.

Mostrar prerrequisitos
Dificultad
Associate + Professional
Prerrequisitos
m08
Reportar un error en esta lección

Checkpoint codifica offsets y estado compatible con la consulta; cambios de fuente, claves o estado pueden exigir nueva ubicación y backfill.

Dev y prod no comparten schemaLocation ni checkpoint. La tabla objetivo se gobierna en UC y la identidad tiene mínimo privilegio.

Modelo mental

El checkpoint y el schema location son parte de la identidad de un pipeline, igual que su código y destino. Dev, test, prod, backfill y una nueva lógica no deben compartirlos accidentalmente. El checkpoint afirma qué unidades se confirmaron y puede contener estado de operadores; reutilizarlo con otra consulta puede omitir datos, rechazar cambios incompatibles o mezclar semánticas. El schema location conserva evolución inferida y también debe corresponder a una fuente y contrato. Para reprocesar, se crea una identidad nueva y un destino o estrategia idempotente; borrar un checkpoint productivo no es un botón de retry. Las rutas se nombran, gobiernan y retienen con la misma disciplina que una tabla.

Identidad de pipeline

Conjunto estable de fuente, transformación, destino y estado durable que define una carga incremental concreta.

Impide tratar checkpoints como archivos intercambiables entre ambientes o lógicas con significados diferentes.
Estado de operador

Datos intermedios persistidos para ventanas, agregaciones, deduplicación u otras operaciones que dependen de eventos anteriores.

Hace que ciertos cambios de código sean incompatibles con un checkpoint existente y requieran migración planificada.
Backfill aislado

Reprocesamiento histórico con estado y ámbito propios que integra resultados mediante una escritura controlada e idempotente.

Evita alterar progreso productivo o duplicar datos mientras continúa la ingesta ordinaria.
PySparkEscritura durable
(stream.writeStream
 .option("checkpointLocation", checkpoint_path)
 .trigger(availableNow=True)
 .toTable("main.bronze.orders"))

availableNow procesa lo disponible y se detiene conservando progreso.

Puntos clave

  • Checkpoint es parte del contrato
  • Entornos aislados
  • Backfill se planifica

Evita

  • Reutilizar checkpoint con otra query
  • Guardar checkpoint en ruta temporal

Recuerdo activo

¿Qué ocurre al borrar checkpoint?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

crdb_to_dbx

crdb_to_dbx · commit 042cb96

crdb_to_dbx/cockroachdb-cdc-tutorial.ipynb