Saltar al contenido

Desarrollo

Menú

Puedes leer sin crear un espacio. Créalo solo cuando quieras guardar.

Guardar progreso

Lección 4 de 5

Librerías y entornos reproducibles

Databricks Connect permite ejecutar y depurar código Spark desde un IDE local contra compute de Databricks.

17 min aprox.

Detalles

Notebooks, SQL, Python y PySpark en el workspace

Trabaja con notebooks y archivos como código mantenible, reproducible y parametrizable.

Reto observable

Dado un notebook con estado oculto, refactorízalo en código parametrizado y demuestra que una ejecución limpia reproduce la misma salida.

Al terminar podrás
  • Distinguir SQL, Python y PySpark por carga
  • Gestionar parámetros y dependencias
  • Evitar estado oculto en notebooks
Prerrequisitos
m02
Última revisión
25 ago 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Workspace · PySpark
Estado
Revisión editorial interna
Fuentes principales
Databricks notebooks · Databricks Connect
Reportar un error
04
Diagnóstico

Librerías y entornos reproducibles

Databricks Connect permite ejecutar y depurar código Spark desde un IDE local contra compute de Databricks.

Databricks Connect implementa Spark Connect: el proceso local construye planes que se ejecutan remotamente. Esto permite usar depurador, tests e integración del IDE sin descargar el dataset completo al portátil.

La versión del cliente debe ser compatible con el runtime o serverless seleccionado y la autenticación debe configurarse mediante un perfil, OAuth u otro mecanismo soportado. Código que depende de APIs exclusivas del driver o del filesystem local puede necesitar adaptación.

PythonSesión con Databricks Connect
from databricks.connect import DatabricksSession

spark = DatabricksSession.builder.profile("dev").serverless().getOrCreate()
print(spark.range(10).count())

El perfil dev se configura fuera del repositorio; serverless requiere soporte en el workspace.

¿Dónde se ejecuta spark.range(10).count() con Connect?

Profundiza

Databricks Connect separa la experiencia de edición local del lugar donde Spark ejecuta. El IDE mantiene código, depurador y pruebas; una sesión remota envía planes a compute de Databricks y utiliza datos gobernados allí. No es un Spark local que copie automáticamente tablas al portátil. La compatibilidad depende de la versión de Databricks Connect, runtime y capacidades soportadas; la autenticación identifica al desarrollador o principal. El modelo mental evita dos errores: asumir que el procesamiento grande ocurre localmente o creer que depurar autoriza datos adicionales. La productividad mejora cuando lógica pura se prueba localmente y las integraciones Spark se verifican contra un entorno remoto acotado.

Spark Connect

Arquitectura cliente-servidor usada para construir planes en un cliente y ejecutarlos en un backend Spark remoto.

Explica la separación entre IDE local y procesamiento de Databricks.
Compatibilidad de versión

Correspondencia soportada entre cliente Databricks Connect y runtime o compute remoto.

Evita errores de protocolo y funciones inexistentes durante desarrollo.
Prueba de integración

Comprobación que ejercita dependencias reales como Spark remoto, catálogo y almacenamiento en un entorno controlado.

Detecta problemas que una prueba puramente local no puede representar.
Resumen

Puntos clave

  • El procesamiento Spark ocurre en Databricks
  • Cliente y runtime deben ser compatibles
  • La autenticación no se incrusta en el código

Evita

  • Creer que Spark procesa los datos en el portátil
  • Guardar un personal access token en el repositorio

Vista de lectura · sin ejecución

notebook-best-practices

notebook-best-practices · commit b4f55c1

notebooks/covid_eda_modular.py

Módulo 03

Contenido del módulo