Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.
Lección 4 de 5
Pruebas, operación y documentación
Operación combina run history, Spark UI, alertas y runbook.
- Duración
- 30 min aprox.
- Objetivo
- Operación combina run history, Spark UI, alertas y runbook.
- Siguiente paso
- Continuar con la siguiente lección
Ver detalles del módulo
Proyecto Associate y simulacro de 45 preguntas
Integra ingesta, transformación, gobierno, Jobs y CI/CD en una solución defendible.
- Entregar un pipeline Associate completo
- Justificar decisiones de arquitectura
- Medir preparación con un simulacro original
04DiagnósticoPruebas, operación y documentación
Operación combina run history, Spark UI, alertas y runbook.
+
Pruebas, operación y documentación
Operación combina run history, Spark UI, alertas y runbook.
Run history localiza tarea; Spark UI diagnostica ejecución.
Runbook define owner, reparación y escalado.
Modelo mental
Operar exige distinguir estado del workflow, ejecución del motor y salud del producto de datos. Run history muestra qué tarea, intento y parámetro falló; Spark UI y Query Profile explican planes, stages y recursos; métricas de calidad y freshness muestran si una ejecución técnicamente exitosa sirvió datos válidos. Las alertas dirigen a un owner con impacto y acción. El runbook decide pausar, reparar, hacer rollback o backfill según evidencia. Repair run evita repetir tareas correctas, pero solo cuando las salidas son durables y compatibles. Una operación madura define SLI, umbral y respuesta antes del incidente, y conserva postmortem para eliminar la causa, no solo restaurar el color verde.
Indicador cuantitativo del servicio, como freshness, tasa de éxito, duración o ratio de calidad observado en producción.
Proporciona la señal objetiva que se compara con el objetivo y activa una respuesta operacional proporcional.Proceso inicial de acotar impacto, fase, evidencia y urgencia antes de modificar sistemas o relanzar trabajos.
Evita cambios simultáneos y dirige al equipo hacia la superficie de diagnóstico que contiene la causa probable.Conjunto verificable de condiciones de datos, servicio y prevención que permite declarar resuelto un incidente.
Impide cerrar únicamente porque una tarea aparece verde mientras consumidores o controles siguen degradados.SELECT * FROM system.lakeflow.job_run_timeline
ORDER BY period_start_time DESC LIMIT 20;Filtra workspace y job.
Puntos clave
- Señal correcta
- Repair selectivo
- Owner
Evita
- Reejecutar todo
- Alerta sin acción
Recuerdo activo