Saltar al contenido

Spark

Menú

Puedes leer sin crear un espacio. Créalo solo cuando quieras guardar.

Guardar progreso

Lección 1 de 5

Lazy evaluation y DAG de Spark

El plan físico y sus métricas indican dónde se mueve y procesa el dato.

17 min aprox.

Detalles

Catalyst, particiones, joins y shuffles

Razona sobre el plan lógico y físico antes de ajustar configuraciones o añadir cómputo.

Reto observable

Ante una consulta con shuffle o skew, localiza la causa en plan y métricas, aplica un único cambio y demuestra una mejora sin alterar el resultado.

Al terminar podrás
  • Leer explain formatted
  • Detectar Exchange, skew y spill
  • Elegir broadcast, repartition o coalesce con evidencia
Prerrequisitos
m04
Última revisión
25 ago 2026
Nivel
Associate + Professional
Ruta relacionada
core
Dominios blueprint
Troubleshooting and Optimization · Spark execution
Estado
Revisión editorial interna
Fuentes principales
Optimización en Databricks · Debugging con Spark UI
Reportar un error
01
Modelo mental

Lazy evaluation y DAG de Spark

El plan físico y sus métricas indican dónde se mueve y procesa el dato.

explain formatted separa plan lógico y físico; Exchange suele indicar shuffle, y el tipo de join muestra la estrategia elegida.

Spark UI confirma con bytes, duración y distribución por tarea. Optimiza una hipótesis cada vez y conserva una línea base.

PySparkPlan físico
result.explain("formatted")

Busca Exchange, Scan y el operador de join; después contrasta en Spark UI.

¿Qué operador suele delimitar un shuffle?

Profundiza

Un plan de Spark es una explicación ejecutable de cómo una intención relacional se convierte en trabajo distribuido. El plan lógico conserva operaciones como filtro, proyección y join; Catalyst lo analiza y optimiza; el plan físico elige scans, algoritmos de join, exchanges y agregaciones concretas. explain formatted muestra estructura y estimaciones, pero no sustituye métricas reales. Spark UI revela stages, tareas, bytes, shuffle, spill y distribución temporal después de ejecutar. La lectura competente conecta ambos: un Exchange anticipa redistribución, mientras las métricas confirman su volumen y equilibrio. Optimizar significa formular una hipótesis causal, cambiar una sola variable y comparar contra una línea base semánticamente equivalente.

Catalyst

Optimizador de consultas de Spark que analiza expresiones y transforma planes lógicos en alternativas físicas.

Permite razonar sobre por qué código distinto puede producir ejecución equivalente.
Exchange

Operador físico que redistribuye datos entre executors y suele crear una frontera de stage.

Señala un shuffle potencialmente costoso que debe confirmarse con métricas.
Plan adaptativo

Plan que AQE puede revisar durante ejecución usando estadísticas observadas en runtime.

Explica cambios de estrategia y particiones que no aparecen en el plan inicial.
Resumen

Puntos clave

  • Exchange señala redistribución
  • Plan y métricas se complementan
  • Mide antes y después

Evita

  • Ajustar configuraciones sin línea base
  • Interpretar solo el plan lógico

Vista de lectura · sin ejecución

Learn Databricks

Learn Databricks · commit 08c378c

README.md

Módulo 05

Contenido del módulo