Saltar al contenido
Lakehouse LabIngeniería de datos con DatabricksEntrar

Certificación objetivo

Databricks Data Engineer Professional

Amplía Associate con streaming, CDC, Lakeflow, observabilidad, rendimiento, costes, gobierno avanzado, despliegue y defensa técnica de arquitecturas lakehouse.

Temario32 módulos

Incluye el tramo Associate y añade dominios avanzados de operación, streaming y entrega.

PrácticaLaboratorios y capstone

Las prácticas obligan a justificar decisiones, evidencias y recuperación ante fallos.

MediciónSimulacro Professional

El desglose por dominio ayuda a decidir qué repasar antes del examen oficial.

Plan Professional

Todo el itinerario.

Professional se apoya en los fundamentos Associate y añade práctica transversal de producción.

  1. 01
    Data Intelligence Platform y arquitectura lakehouse

    Construye un modelo mental preciso de almacenamiento, cómputo, gobierno y superficies de trabajo.

  2. 02
    Compute clásico, serverless y SQL warehouses

    Selecciona recursos por patrón de carga, aislamiento, latencia, gobernanza y coste total.

  3. 03
    Notebooks, SQL, Python y PySpark en el workspace

    Trabaja con notebooks y archivos como código mantenible, reproducible y parametrizable.

  4. 04
    DataFrames, transformaciones y datos complejos

    Domina las operaciones que aparecen en ETL real: joins, arrays, structs, ventanas y deduplicación.

  5. 05
    Catalyst, particiones, joins y shuffles

    Razona sobre el plan lógico y físico antes de ajustar configuraciones o añadir cómputo.

  6. 06
    Delta Lake: ACID, esquema, historial y DML

    Usa el transaction log para construir tablas fiables, auditables e idempotentes.

  7. 07
    Arquitectura medallion, calidad y modelado

    Diseña capas y contratos desde las necesidades de consumo, trazabilidad y reejecución.

  8. 08
    Ingesta batch, formatos, COPY INTO, JDBC y REST

    Elige una vía de entrada reproducible para archivos, bases de datos y APIs.

  9. 09
    Auto Loader y Lakeflow Connect

    Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.

  10. 10
    Lakeflow Jobs: DAG, tareas y triggers

    Convierte ejecuciones manuales en workflows parametrizados, idempotentes y observables.

  11. 11
    Unity Catalog, Git folders y CI/CD esencial

    Une gobierno de datos con una entrega de código revisable y promocionable entre entornos.

  12. 12
    Proyecto Associate y simulacro de 45 preguntas

    Integra ingesta, transformación, gobierno, Jobs y CI/CD en una solución defendible.

  13. 13
    Structured Streaming, triggers y checkpoints

    Construye consultas incrementales con estado durable y semántica de recuperación clara.

  14. 14
    Estado, ventanas, watermarks y datos tardíos

    Controla el crecimiento de estado y la corrección temporal con eventos fuera de orden.

  15. 15
    Kafka, buses de eventos y garantías de entrega

    Integra sistemas de eventos sin confundir offsets, claves, orden y garantías end-to-end.

  16. 16
    Change Data Feed, CDC, AUTO CDC y SCD

    Procesa inserciones, actualizaciones y borrados respetando clave, secuencia y retención.

  17. 17
    Proyecto de streaming con SLA

    Entrega un flujo operable que soporte datos tardíos, recuperación e incidentes reproducibles.

  18. 18
    Spark Declarative Pipelines en Lakeflow

    Declara datasets y dependencias para que Lakeflow gestione el grafo y la ejecución incremental sobre el framework actual de Spark.

  19. 19
    Expectations, cuarentena y event logs

    Haz visibles las decisiones de calidad y separa observación, descarte, fallo y remediación.

  20. 20
    Lakeflow Jobs avanzado: control flow y repairs

    Orquesta decisiones, bucles y recuperaciones sin convertir el DAG en lógica opaca.

  21. 21
    Triggers, alertas, backfills y operación

    Opera pipelines según disponibilidad real del dato y recupera ventanas históricas sin romper producción.

  22. 22
    Proyecto de pipeline declarativo

    Construye una cadena declarativa con calidad, CDC, orquestación y operación documentada.

  23. 23
    Tuning avanzado de Spark

    Optimiza con evidencia del plan y las métricas, no con recetas globales ni más cómputo por defecto.

  24. 24
    Photon, data skipping y liquid clustering

    Diseña layout y mantenimiento de tablas según patrones de consulta que cambian con el tiempo.

  25. 25
    Compute, políticas, etiquetas y costes

    Atribuye consumo, controla guardrails y optimiza coste sin degradar el valor del workload.

  26. 26
    Spark UI, Query Profile y system tables

    Combina señales de ejecución, plataforma y datos para reducir el tiempo de diagnóstico.

  27. 27
    Proyecto de fiabilidad y coste

    Recupera un workload degradado equilibrando SLA, capacidad, layout, código y presupuesto.

  28. 28
    Proyectos Python, dependencias y pruebas

    Convierte notebooks en un paquete comprobable con límites claros y entornos reproducibles.

  29. 29
    Declarative Automation Bundles y CI/CD

    Define recursos como código y promociona el mismo artefacto validado entre targets.

  30. 30
    Unity Catalog avanzado y privacidad

    Aplica controles centralizados a datos sensibles y demuestra cumplimiento mediante auditoría.

  31. 31
    OpenSharing (antes Delta Sharing) y Federation

    Comparte o consulta datos externos con el mínimo movimiento y un perímetro gobernado.

  32. 32
    Proyecto Professional y simulacro de 59 preguntas

    Converge las cuatro ramas en una solución production-grade y mide la preparación final.