Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 05 · Lección

Lazy evaluation y DAG de Spark

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 1 de 5

Lazy evaluation y DAG de Spark

El plan físico y sus métricas indican dónde se mueve y procesa el dato.

Duración
17 min aprox.
Objetivo
El plan físico y sus métricas indican dónde se mueve y procesa el dato.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Catalyst, particiones, joins y shuffles

Razona sobre el plan lógico y físico antes de ajustar configuraciones o añadir cómputo.

Al terminar podrás
  • Leer explain formatted
  • Detectar Exchange, skew y spill
  • Elegir broadcast, repartition o coalesce con evidencia
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate + Professional
Ruta relacionada
core
Dominios blueprint
Troubleshooting and Optimization · Spark execution
Estado
Revisión editorial interna
Fuentes principales
Optimización en Databricks · Debugging con Spark UI
Reportar un error
01
Modelo mental

Lazy evaluation y DAG de Spark

El plan físico y sus métricas indican dónde se mueve y procesa el dato.

Mostrar prerrequisitos
Dificultad
Associate + Professional
Prerrequisitos
m04
Reportar un error en esta lección

explain formatted separa plan lógico y físico; Exchange suele indicar shuffle, y el tipo de join muestra la estrategia elegida.

Spark UI confirma con bytes, duración y distribución por tarea. Optimiza una hipótesis cada vez y conserva una línea base.

Modelo mental

Un plan de Spark es una explicación ejecutable de cómo una intención relacional se convierte en trabajo distribuido. El plan lógico conserva operaciones como filtro, proyección y join; Catalyst lo analiza y optimiza; el plan físico elige scans, algoritmos de join, exchanges y agregaciones concretas. explain formatted muestra estructura y estimaciones, pero no sustituye métricas reales. Spark UI revela stages, tareas, bytes, shuffle, spill y distribución temporal después de ejecutar. La lectura competente conecta ambos: un Exchange anticipa redistribución, mientras las métricas confirman su volumen y equilibrio. Optimizar significa formular una hipótesis causal, cambiar una sola variable y comparar contra una línea base semánticamente equivalente.

Catalyst

Optimizador de consultas de Spark que analiza expresiones y transforma planes lógicos en alternativas físicas.

Permite razonar sobre por qué código distinto puede producir ejecución equivalente.
Exchange

Operador físico que redistribuye datos entre executors y suele crear una frontera de stage.

Señala un shuffle potencialmente costoso que debe confirmarse con métricas.
Plan adaptativo

Plan que AQE puede revisar durante ejecución usando estadísticas observadas en runtime.

Explica cambios de estrategia y particiones que no aparecen en el plan inicial.
PySparkPlan físico
result.explain("formatted")

Busca Exchange, Scan y el operador de join; después contrasta en Spark UI.

Puntos clave

  • Exchange señala redistribución
  • Plan y métricas se complementan
  • Mide antes y después

Evita

  • Ajustar configuraciones sin línea base
  • Interpretar solo el plan lógico

Recuerdo activo

¿Qué operador suele delimitar un shuffle?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

Learn Databricks

Learn Databricks · commit 08c378c

README.md