Data Intelligence Platform y arquitectura lakehouse
Construye un modelo mental preciso de almacenamiento, cómputo, gobierno y superficies de trabajo.
Escribe al menos dos caracteres.
Temario de preparación
Busca por nivel, dominio o fase. Cada módulo conecta con objetivos Associate o Professional.
Construye un modelo mental preciso de almacenamiento, cómputo, gobierno y superficies de trabajo.
Selecciona recursos por patrón de carga, aislamiento, latencia, gobernanza y coste total.
Trabaja con notebooks y archivos como código mantenible, reproducible y parametrizable.
Domina las operaciones que aparecen en ETL real: joins, arrays, structs, ventanas y deduplicación.
Razona sobre el plan lógico y físico antes de ajustar configuraciones o añadir cómputo.
Usa el transaction log para construir tablas fiables, auditables e idempotentes.
Diseña capas y contratos desde las necesidades de consumo, trazabilidad y reejecución.
Elige una vía de entrada reproducible para archivos, bases de datos y APIs.
Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.
Convierte ejecuciones manuales en workflows parametrizados, idempotentes y observables.
Une gobierno de datos con una entrega de código revisable y promocionable entre entornos.
Integra ingesta, transformación, gobierno, Jobs y CI/CD en una solución defendible.
Construye consultas incrementales con estado durable y semántica de recuperación clara.
Controla el crecimiento de estado y la corrección temporal con eventos fuera de orden.
Integra sistemas de eventos sin confundir offsets, claves, orden y garantías end-to-end.
Procesa inserciones, actualizaciones y borrados respetando clave, secuencia y retención.
Entrega un flujo operable que soporte datos tardíos, recuperación e incidentes reproducibles.
Declara datasets y dependencias para que Lakeflow gestione el grafo y la ejecución incremental sobre el framework actual de Spark.
Haz visibles las decisiones de calidad y separa observación, descarte, fallo y remediación.
Orquesta decisiones, bucles y recuperaciones sin convertir el DAG en lógica opaca.
Opera pipelines según disponibilidad real del dato y recupera ventanas históricas sin romper producción.
Construye una cadena declarativa con calidad, CDC, orquestación y operación documentada.
Optimiza con evidencia del plan y las métricas, no con recetas globales ni más cómputo por defecto.
Diseña layout y mantenimiento de tablas según patrones de consulta que cambian con el tiempo.
Atribuye consumo, controla guardrails y optimiza coste sin degradar el valor del workload.
Combina señales de ejecución, plataforma y datos para reducir el tiempo de diagnóstico.
Recupera un workload degradado equilibrando SLA, capacidad, layout, código y presupuesto.
Convierte notebooks en un paquete comprobable con límites claros y entornos reproducibles.
Define recursos como código y promociona el mismo artefacto validado entre targets.
Aplica controles centralizados a datos sensibles y demuestra cumplimiento mediante auditoría.
Comparte o consulta datos externos con el mínimo movimiento y un perímetro gobernado.
Converge las cuatro ramas en una solución production-grade y mide la preparación final.