Incluye el tramo Associate y añade dominios avanzados de operación, streaming y entrega.
Certificación objetivo
Databricks Data Engineer Professional
Amplía Associate con streaming, CDC, Lakeflow, observabilidad, rendimiento, costes, gobierno avanzado, despliegue y defensa técnica de arquitecturas lakehouse.
Las prácticas obligan a justificar decisiones, evidencias y recuperación ante fallos.
El desglose por dominio ayuda a decidir qué repasar antes del examen oficial.
Plan Professional
Todo el itinerario.
Professional se apoya en los fundamentos Associate y añade práctica transversal de producción.
- 01Data Intelligence Platform y arquitectura lakehouse
Construye un modelo mental preciso de almacenamiento, cómputo, gobierno y superficies de trabajo.
- 02Compute clásico, serverless y SQL warehouses
Selecciona recursos por patrón de carga, aislamiento, latencia, gobernanza y coste total.
- 03Notebooks, SQL, Python y PySpark en el workspace
Trabaja con notebooks y archivos como código mantenible, reproducible y parametrizable.
- 04DataFrames, transformaciones y datos complejos
Domina las operaciones que aparecen en ETL real: joins, arrays, structs, ventanas y deduplicación.
- 05Catalyst, particiones, joins y shuffles
Razona sobre el plan lógico y físico antes de ajustar configuraciones o añadir cómputo.
- 06Delta Lake: ACID, esquema, historial y DML
Usa el transaction log para construir tablas fiables, auditables e idempotentes.
- 07Arquitectura medallion, calidad y modelado
Diseña capas y contratos desde las necesidades de consumo, trazabilidad y reejecución.
- 08Ingesta batch, formatos, COPY INTO, JDBC y REST
Elige una vía de entrada reproducible para archivos, bases de datos y APIs.
- 09Auto Loader y Lakeflow Connect
Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.
- 10Lakeflow Jobs: DAG, tareas y triggers
Convierte ejecuciones manuales en workflows parametrizados, idempotentes y observables.
- 11Unity Catalog, Git folders y CI/CD esencial
Une gobierno de datos con una entrega de código revisable y promocionable entre entornos.
- 12Proyecto Associate y simulacro de 45 preguntas
Integra ingesta, transformación, gobierno, Jobs y CI/CD en una solución defendible.
- 13Structured Streaming, triggers y checkpoints
Construye consultas incrementales con estado durable y semántica de recuperación clara.
- 14Estado, ventanas, watermarks y datos tardíos
Controla el crecimiento de estado y la corrección temporal con eventos fuera de orden.
- 15Kafka, buses de eventos y garantías de entrega
Integra sistemas de eventos sin confundir offsets, claves, orden y garantías end-to-end.
- 16Change Data Feed, CDC, AUTO CDC y SCD
Procesa inserciones, actualizaciones y borrados respetando clave, secuencia y retención.
- 17Proyecto de streaming con SLA
Entrega un flujo operable que soporte datos tardíos, recuperación e incidentes reproducibles.
- 18Spark Declarative Pipelines en Lakeflow
Declara datasets y dependencias para que Lakeflow gestione el grafo y la ejecución incremental sobre el framework actual de Spark.
- 19Expectations, cuarentena y event logs
Haz visibles las decisiones de calidad y separa observación, descarte, fallo y remediación.
- 20Lakeflow Jobs avanzado: control flow y repairs
Orquesta decisiones, bucles y recuperaciones sin convertir el DAG en lógica opaca.
- 21Triggers, alertas, backfills y operación
Opera pipelines según disponibilidad real del dato y recupera ventanas históricas sin romper producción.
- 22Proyecto de pipeline declarativo
Construye una cadena declarativa con calidad, CDC, orquestación y operación documentada.
- 23Tuning avanzado de Spark
Optimiza con evidencia del plan y las métricas, no con recetas globales ni más cómputo por defecto.
- 24Photon, data skipping y liquid clustering
Diseña layout y mantenimiento de tablas según patrones de consulta que cambian con el tiempo.
- 25Compute, políticas, etiquetas y costes
Atribuye consumo, controla guardrails y optimiza coste sin degradar el valor del workload.
- 26Spark UI, Query Profile y system tables
Combina señales de ejecución, plataforma y datos para reducir el tiempo de diagnóstico.
- 27Proyecto de fiabilidad y coste
Recupera un workload degradado equilibrando SLA, capacidad, layout, código y presupuesto.
- 28Proyectos Python, dependencias y pruebas
Convierte notebooks en un paquete comprobable con límites claros y entornos reproducibles.
- 29Declarative Automation Bundles y CI/CD
Define recursos como código y promociona el mismo artefacto validado entre targets.
- 30Unity Catalog avanzado y privacidad
Aplica controles centralizados a datos sensibles y demuestra cumplimiento mediante auditoría.
- 31OpenSharing (antes Delta Sharing) y Federation
Comparte o consulta datos externos con el mínimo movimiento y un perímetro gobernado.
- 32Proyecto Professional y simulacro de 59 preguntas
Converge las cuatro ramas en una solución production-grade y mide la preparación final.