Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 03 · Lección

Librerías y entornos reproducibles

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 4 de 5

Librerías y entornos reproducibles

Databricks Connect permite ejecutar y depurar código Spark desde un IDE local contra compute de Databricks.

Duración
17 min aprox.
Objetivo
Databricks Connect permite ejecutar y depurar código Spark desde un IDE local contra compute de Databricks.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Notebooks, SQL, Python y PySpark en el workspace

Trabaja con notebooks y archivos como código mantenible, reproducible y parametrizable.

Al terminar podrás
  • Distinguir SQL, Python y PySpark por carga
  • Gestionar parámetros y dependencias
  • Evitar estado oculto en notebooks
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Workspace · PySpark
Estado
Revisión editorial interna
Fuentes principales
Databricks notebooks · Databricks Connect
Reportar un error
04
Diagnóstico

Librerías y entornos reproducibles

Databricks Connect permite ejecutar y depurar código Spark desde un IDE local contra compute de Databricks.

Mostrar prerrequisitos
Dificultad
Associate
Prerrequisitos
m02
Reportar un error en esta lección

Databricks Connect implementa Spark Connect: el proceso local construye planes que se ejecutan remotamente. Esto permite usar depurador, tests e integración del IDE sin descargar el dataset completo al portátil.

La versión del cliente debe ser compatible con el runtime o serverless seleccionado y la autenticación debe configurarse mediante un perfil, OAuth u otro mecanismo soportado. Código que depende de APIs exclusivas del driver o del filesystem local puede necesitar adaptación.

Modelo mental

Databricks Connect separa la experiencia de edición local del lugar donde Spark ejecuta. El IDE mantiene código, depurador y pruebas; una sesión remota envía planes a compute de Databricks y utiliza datos gobernados allí. No es un Spark local que copie automáticamente tablas al portátil. La compatibilidad depende de la versión de Databricks Connect, runtime y capacidades soportadas; la autenticación identifica al desarrollador o principal. El modelo mental evita dos errores: asumir que el procesamiento grande ocurre localmente o creer que depurar autoriza datos adicionales. La productividad mejora cuando lógica pura se prueba localmente y las integraciones Spark se verifican contra un entorno remoto acotado.

Spark Connect

Arquitectura cliente-servidor usada para construir planes en un cliente y ejecutarlos en un backend Spark remoto.

Explica la separación entre IDE local y procesamiento de Databricks.
Compatibilidad de versión

Correspondencia soportada entre cliente Databricks Connect y runtime o compute remoto.

Evita errores de protocolo y funciones inexistentes durante desarrollo.
Prueba de integración

Comprobación que ejercita dependencias reales como Spark remoto, catálogo y almacenamiento en un entorno controlado.

Detecta problemas que una prueba puramente local no puede representar.
PythonSesión con Databricks Connect
from databricks.connect import DatabricksSession

spark = DatabricksSession.builder.profile("dev").serverless().getOrCreate()
print(spark.range(10).count())

El perfil dev se configura fuera del repositorio; serverless requiere soporte en el workspace.

Puntos clave

  • El procesamiento Spark ocurre en Databricks
  • Cliente y runtime deben ser compatibles
  • La autenticación no se incrusta en el código

Evita

  • Creer que Spark procesa los datos en el portátil
  • Guardar un personal access token en el repositorio

Recuerdo activo

¿Dónde se ejecuta spark.range(10).count() con Connect?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

notebook-best-practices

notebook-best-practices · commit b4f55c1

notebooks/covid_eda_modular.py