Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 10 · Lección

Jobs, runs y task graph

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 1 de 5

Jobs, runs y task graph

Lakeflow Jobs expresa workflows como DAG de tareas con dependencias observables.

Duración
17 min aprox.
Objetivo
Lakeflow Jobs expresa workflows como DAG de tareas con dependencias observables.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Lakeflow Jobs: DAG, tareas y triggers

Convierte ejecuciones manuales en workflows parametrizados, idempotentes y observables.

Al terminar podrás
  • Diseñar un DAG con paralelismo seguro
  • Configurar tareas, parámetros y dependencias
  • Elegir triggers temporales o dirigidos por datos
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate + Professional
Ruta relacionada
core
Dominios blueprint
Working with Lakeflow Jobs · Orchestration
Estado
Revisión editorial interna
Fuentes principales
Lakeflow Jobs · Control flow
Reportar un error
01
Modelo mental

Jobs, runs y task graph

Lakeflow Jobs expresa workflows como DAG de tareas con dependencias observables.

Mostrar prerrequisitos
Dificultad
Associate + Professional
Prerrequisitos
m09
Reportar un error en esta lección

Cada tarea define tipo, compute, identidad y resultado; dependencias permiten paralelismo cuando no existe relación de datos.

Divide por unidades reintentables e idempotentes, no por cada línea de código.

Modelo mental

Lakeflow Jobs modela un workflow como un grafo dirigido acíclico de tareas. Cada nodo tiene tipo, compute, parámetros, identidad, timeout y política de retry; cada arista expresa una dependencia y condición de ejecución. El DAG no transporta automáticamente DataFrames ni garantiza idempotencia: coordina unidades que deben publicar resultados durables o valores pequeños. Las dependencias permiten paralelismo cuando no existe relación causal y bloquean downstream cuando una precondición falla. Un buen grafo refleja fronteras operativas: una tarea debe poder reintentarse, observarse y repararse sin repetir todo. El nombre Lakeflow Jobs es la superficie de orquestación; no debe confundirse con Spark Declarative Pipelines, framework para declarar datasets.

DAG

Grafo dirigido sin ciclos que representa tareas y dependencias causales dentro de un workflow ejecutable.

Permite planificar paralelismo, propagación de fallos y recuperación selectiva de manera explícita.
Task

Unidad observable de trabajo con entrada, compute, parámetros, resultado y política operacional propios dentro de un Job.

Define el nivel al que se reintenta, alerta, mide y repara una parte del proceso.
Dependencia

Relación que condiciona la elegibilidad de una tarea al estado o salida de otra tarea anterior.

Evita ejecutar consumidores antes de que sus precondiciones durables y verificadas estén disponibles.
YAMLDAG mínimo
tasks:
  - task_key: bronze
  - task_key: silver
    depends_on: [{task_key: bronze}]
  - task_key: gold
    depends_on: [{task_key: silver}]

Asigna compute y código en la definición completa.

Puntos clave

  • DAG dirige orden
  • Tareas independientes paralelizan
  • Cada tarea debe ser reintentable

Evita

  • DAG totalmente serial
  • Estado oculto entre notebooks

Recuerdo activo

¿Qué permite ejecutar dos tareas a la vez?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

Learn Databricks

Learn Databricks · commit 08c378c

README.md