Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 12 · Lección

Pruebas, operación y documentación

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 4 de 5

Pruebas, operación y documentación

Operación combina run history, Spark UI, alertas y runbook.

Duración
30 min aprox.
Objetivo
Operación combina run history, Spark UI, alertas y runbook.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Proyecto Associate y simulacro de 45 preguntas

Integra ingesta, transformación, gobierno, Jobs y CI/CD en una solución defendible.

Al terminar podrás
  • Entregar un pipeline Associate completo
  • Justificar decisiones de arquitectura
  • Medir preparación con un simulacro original
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Todos los dominios Associate
Estado
Revisión editorial interna
Fuentes principales
Blueprint Associate 4-May-2026 · Data engineering
Reportar un error
04
Diagnóstico

Pruebas, operación y documentación

Operación combina run history, Spark UI, alertas y runbook.

Mostrar prerrequisitos
Dificultad
Associate
Prerrequisitos
m11
Reportar un error en esta lección

Run history localiza tarea; Spark UI diagnostica ejecución.

Runbook define owner, reparación y escalado.

Modelo mental

Operar exige distinguir estado del workflow, ejecución del motor y salud del producto de datos. Run history muestra qué tarea, intento y parámetro falló; Spark UI y Query Profile explican planes, stages y recursos; métricas de calidad y freshness muestran si una ejecución técnicamente exitosa sirvió datos válidos. Las alertas dirigen a un owner con impacto y acción. El runbook decide pausar, reparar, hacer rollback o backfill según evidencia. Repair run evita repetir tareas correctas, pero solo cuando las salidas son durables y compatibles. Una operación madura define SLI, umbral y respuesta antes del incidente, y conserva postmortem para eliminar la causa, no solo restaurar el color verde.

SLI

Indicador cuantitativo del servicio, como freshness, tasa de éxito, duración o ratio de calidad observado en producción.

Proporciona la señal objetiva que se compara con el objetivo y activa una respuesta operacional proporcional.
Triage

Proceso inicial de acotar impacto, fase, evidencia y urgencia antes de modificar sistemas o relanzar trabajos.

Evita cambios simultáneos y dirige al equipo hacia la superficie de diagnóstico que contiene la causa probable.
Criterio de cierre

Conjunto verificable de condiciones de datos, servicio y prevención que permite declarar resuelto un incidente.

Impide cerrar únicamente porque una tarea aparece verde mientras consumidores o controles siguen degradados.
SQLRuns recientes
SELECT * FROM system.lakeflow.job_run_timeline
ORDER BY period_start_time DESC LIMIT 20;

Filtra workspace y job.

Puntos clave

  • Señal correcta
  • Repair selectivo
  • Owner

Evita

  • Reejecutar todo
  • Alerta sin acción

Recuerdo activo

¿Dónde investigas skew?

Borrador privado · solo en este navegador
5 lecciones pendientes

Fuente revisada · vista externa

Azure Databricks Hands-on

Azure Databricks Hands-on · commit a91650b

HandsOn.dbc

Archivo importable

Este notebook se abre desde su fuente revisada

El repositorio no permite republicar su contenido dentro de Lakehouse Lab. Conservamos la misma experiencia lateral, la ruta exacta y el commit auditado, y dejamos la lectura en GitHub para respetar la autoría.

Autor
Tsuyoshi Matsuzaki
Licencia
No verificada
Formato
dbc
Abrir / descargar .dbc