Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 26 · Lección

CLI, REST APIs y automatización

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 5 de 5

CLI, REST APIs y automatización

Automatiza una captura mínima con CLI y APIs, manteniendo autenticación segura, paginación y trazabilidad de cada artefacto.

Duración
17 min aprox.
Objetivo
Automatiza una captura mínima con CLI y APIs, manteniendo autenticación segura, paginación y trazabilidad de cada artefacto.
Siguiente paso
Continuar con el laboratorio
Ver detalles del módulo

Spark UI, Query Profile y system tables

Combina señales de ejecución, plataforma y datos para reducir el tiempo de diagnóstico.

Al terminar podrás
  • Localizar cuellos en Spark UI y Query Profile
  • Consultar historial de Jobs y auditoría
  • Usar CLI y REST para automatizar diagnóstico
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Professional
Ruta relacionada
performance
Dominios blueprint
Monitoring and Alerting · Debugging
Estado
Revisión editorial interna
Fuentes principales
Query profile · System tables reference
Reportar un error
05
Decisión de diseño

CLI, REST APIs y automatización

Automatiza una captura mínima con CLI y APIs, manteniendo autenticación segura, paginación y trazabilidad de cada artefacto.

Mostrar prerrequisitos
Dificultad
Professional
Prerrequisitos
m25
Reportar un error en esta lección

La CLI ofrece comandos `jobs get-run`, `get-run-output`, `list-runs` y `repair-run`; el grupo `api` sirve para endpoints aún no envueltos. Una captura de incidente debe conservar run ID, estado, timestamps, configuración efectiva y enlaces a perfiles, no ejecutar reparaciones en el mismo paso. Usa OAuth para automatización y perfiles separados, nunca tokens pegados en scripts o notebooks.

Las respuestas pueden paginarse y algunos outputs de tareas tienen límites. Diseña el script como lectura idempotente, almacena JSON en un volumen gobernado con retención y redacta campos sensibles. Después de formular una hipótesis, la reparación se convierte en una acción aprobada con evidencia antes/después.

Modelo mental

Una captura de diagnóstico automatizada debe ser una caja negra mínima, no una copia indiscriminada de la cuenta. Parte de un identificador de incidente y un intervalo, obtiene metadatos reproducibles mediante CLI o REST, sigue paginación y registra qué petición produjo cada artefacto. La autenticación representa una identidad de servicio con privilegios mínimos; el token nunca se imprime ni se almacena junto a la evidencia. Las APIs son eventualmente consistentes, versionadas y sujetas a límites, por lo que reintentos con backoff y marcadores de página son parte del mecanismo. El objetivo es preservar contexto suficiente para reconstruir la causa sin ampliar innecesariamente exposición de consultas, usuarios o datos.

Paginación

División de una colección API en respuestas enlazadas mediante tokens, offsets o indicadores de continuación.

No recorrer todas las páginas crea diagnósticos incompletos y sesga recuentos o timelines.
Backoff con jitter

Espera creciente y ligeramente aleatoria antes de repetir errores transitorios.

Reduce presión sobre el servicio y evita que múltiples clientes reintenten simultáneamente.
Manifest de evidencia

Índice que registra origen, tiempo, parámetros y checksum de cada artefacto capturado.

Aporta trazabilidad e integridad sin depender de nombres de archivo informales.
CLICaptura read-only de un run
databricks jobs get-run 987654321 --output json > run-987654321.json
databricks jobs get-run-output 987654321 --output json > output-987654321.json

# Inspecciona antes de cualquier repair-run.
# La autenticación procede de OAuth o de un perfil seguro, no del script.

Guarda los ficheros en un destino gobernado y aplica redacción si el output contiene parámetros sensibles.

Puntos clave

  • Separa captura read-only de acciones de reparación.
  • Usa OAuth/service principal y perfiles de entorno.
  • Gestiona paginación, límites y redacción de datos sensibles.

Evita

  • Ejecutar `repair-run` automáticamente al detectar cualquier fallo y borrar la evidencia causal.
  • Guardar un PAT junto al script de diagnóstico o en el historial del shell.

Recuerdo activo

¿Por qué conviene separar la captura de `repair-run`?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

databricks-finops-system-tables

databricks-finops-system-tables · commit 7834d5d

README.md