Saltar al contenido

Desarrollo

Menú

Puedes leer sin crear un espacio. Créalo solo cuando quieras guardar.

Guardar progreso

Lección 1 de 5

Notebooks y archivos de workspace

Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.

17 min aprox.

Detalles

Notebooks, SQL, Python y PySpark en el workspace

Trabaja con notebooks y archivos como código mantenible, reproducible y parametrizable.

Reto observable

Dado un notebook con estado oculto, refactorízalo en código parametrizado y demuestra que una ejecución limpia reproduce la misma salida.

Al terminar podrás
  • Distinguir SQL, Python y PySpark por carga
  • Gestionar parámetros y dependencias
  • Evitar estado oculto en notebooks
Prerrequisitos
m02
Última revisión
25 ago 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Workspace · PySpark
Estado
Revisión editorial interna
Fuentes principales
Databricks notebooks · Databricks Connect
Reportar un error
01
Modelo mental

Notebooks y archivos de workspace

Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.

Las celdas admiten SQL, Python y visualizaciones, pero el estado del proceso permite ejecutar fuera de orden. Para que otra persona reproduzca el resultado, la ejecución desde cero debe crear las mismas variables, tablas temporales y salidas.

Los archivos de workspace y módulos Python facilitan separar lógica reutilizable del relato exploratorio. Un notebook de entrada debería coordinar funciones comprobables, no concentrar transformaciones y efectos secundarios en decenas de celdas.

PythonNotebook como punto de entrada
from commerce.transforms import clean_orders

source = spark.table("main.bronze.orders")
result = clean_orders(source)
display(result.limit(20))

clean_orders puede probarse fuera del notebook con DataFrames pequeños.

¿Qué prueba rápida detecta estado oculto?

Profundiza

Un notebook es simultáneamente documento, cliente de ejecución y estado interactivo. Esa combinación acelera el aprendizaje, pero dificulta reproducibilidad cuando las celdas se ejecutan fuera de orden o dependen de variables, tablas temporales y librerías instaladas manualmente. El modelo autosuficiente separa narración de lógica: el notebook recibe parámetros, invoca funciones importables, muestra evidencia pequeña y termina con salidas gobernadas. Debe poder ejecutarse desde un estado limpio de principio a fin. Los archivos de workspace y paquetes Python guardan lógica comprobable; Jobs aporta el contrato productivo. La pregunta clave no es si una celda funcionó una vez, sino qué dependencias explican exactamente su resultado.

Estado de sesión

Variables, imports, vistas temporales y cachés que sobreviven entre comandos de una sesión activa.

Es la causa principal de notebooks que funcionan solo para su autor.
Efecto secundario

Cambio observable fuera del valor devuelto, como escribir una tabla o modificar configuración.

Debe aislarse para que reintentos y pruebas sean predecibles.
Reproducibilidad

Capacidad de obtener la misma salida desde entradas, código, parámetros y dependencias declarados.

Es el criterio que permite promover un notebook a operación confiable.
Resumen

Puntos clave

  • Ejecutar desde cero revela estado oculto
  • La lógica reusable pertenece a módulos
  • La salida debe depender de parámetros explícitos

Evita

  • Depender de una celda ejecutada horas antes
  • Instalar librerías manualmente sin fijar versión

Vista de lectura · sin ejecución

notebook-best-practices

notebook-best-practices · commit b4f55c1

notebooks/covid_eda_modular.py

Módulo 03

Contenido del módulo