Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.
Lección 4 de 5
Schedule, file arrival y table update
Schedule, file arrival y table update disparan Jobs por tiempo o disponibilidad del dato.
- Duración
- 17 min aprox.
- Objetivo
- Schedule, file arrival y table update disparan Jobs por tiempo o disponibilidad del dato.
- Siguiente paso
- Continuar con la siguiente lección
Ver detalles del módulo
Lakeflow Jobs: DAG, tareas y triggers
Convierte ejecuciones manuales en workflows parametrizados, idempotentes y observables.
- Diseñar un DAG con paralelismo seguro
- Configurar tareas, parámetros y dependencias
- Elegir triggers temporales o dirigidos por datos
04DiagnósticoSchedule, file arrival y table update
Schedule, file arrival y table update disparan Jobs por tiempo o disponibilidad del dato.
+
Schedule, file arrival y table update
Schedule, file arrival y table update disparan Jobs por tiempo o disponibilidad del dato.
Mostrar prerrequisitos
- Dificultad
- Associate + Professional
- Prerrequisitos
- m09
Schedule usa calendario y zona horaria; file arrival observa nuevas llegadas; table update reacciona a cambios de tablas compatibles.
Elige señal de datos cuando evita espera o runs vacíos; usa calendario cuando la obligación es temporal.
Modelo mental
Los triggers responden a dos clases de obligación: tiempo y disponibilidad de datos. Un schedule declara cuándo debe comenzar un run según cron y zona horaria. File arrival reacciona a nuevos archivos en una ubicación soportada y evita polling frecuente. Table update responde a actualizaciones de tablas compatibles y puede coordinar downstream a partir de cambios publicados. Elegir data-driven reduce ejecuciones vacías y latencia cuando la llegada es irregular; elegir calendario es correcto cuando el compromiso es un cierre temporal aunque no haya datos nuevos. Ningún trigger prueba que la entrada sea completa: el Job todavía necesita validación, idempotencia, concurrencia y política para múltiples eventos.
Disparador temporal que crea runs mediante una expresión cron interpretada en una zona horaria declarada.
Es apropiado cuando la obligación de proceso o cierre depende del reloj y no solo de datos nuevos.Disparador dirigido por datos que inicia un Job al detectar archivos nuevos en una ubicación compatible.
Reduce polling y runs vacíos para fuentes de archivos con llegadas irregulares o impredecibles.Disparador que responde a actualizaciones observadas en una o varias tablas soportadas por la plataforma.
Permite desacoplar productor y consumidor usando una publicación gobernada como señal operacional.schedule:
quartz_cron_expression: '0 0 2 * * ?'
timezone_id: UTC
pause_status: UNPAUSEDDocumenta cómo afecta horario de verano si no usas UTC.
Puntos clave
- Cron depende de zona horaria
- File arrival es data-driven
- Table update sigue tablas
Evita
- Cron sin timezone
- File trigger sobre ruta inestable
Recuerdo activo