Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 03 · Lección

Notebooks y archivos de workspace

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 1 de 5

Notebooks y archivos de workspace

Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.

Duración
17 min aprox.
Objetivo
Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Notebooks, SQL, Python y PySpark en el workspace

Trabaja con notebooks y archivos como código mantenible, reproducible y parametrizable.

Al terminar podrás
  • Distinguir SQL, Python y PySpark por carga
  • Gestionar parámetros y dependencias
  • Evitar estado oculto en notebooks
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Workspace · PySpark
Estado
Revisión editorial interna
Fuentes principales
Databricks notebooks · Databricks Connect
Reportar un error
01
Modelo mental

Notebooks y archivos de workspace

Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.

Mostrar prerrequisitos
Dificultad
Associate
Prerrequisitos
m02
Reportar un error en esta lección

Las celdas admiten SQL, Python y visualizaciones, pero el estado del proceso permite ejecutar fuera de orden. Para que otra persona reproduzca el resultado, la ejecución desde cero debe crear las mismas variables, tablas temporales y salidas.

Los archivos de workspace y módulos Python facilitan separar lógica reutilizable del relato exploratorio. Un notebook de entrada debería coordinar funciones comprobables, no concentrar transformaciones y efectos secundarios en decenas de celdas.

Modelo mental

Un notebook es simultáneamente documento, cliente de ejecución y estado interactivo. Esa combinación acelera el aprendizaje, pero dificulta reproducibilidad cuando las celdas se ejecutan fuera de orden o dependen de variables, tablas temporales y librerías instaladas manualmente. El modelo autosuficiente separa narración de lógica: el notebook recibe parámetros, invoca funciones importables, muestra evidencia pequeña y termina con salidas gobernadas. Debe poder ejecutarse desde un estado limpio de principio a fin. Los archivos de workspace y paquetes Python guardan lógica comprobable; Jobs aporta el contrato productivo. La pregunta clave no es si una celda funcionó una vez, sino qué dependencias explican exactamente su resultado.

Estado de sesión

Variables, imports, vistas temporales y cachés que sobreviven entre comandos de una sesión activa.

Es la causa principal de notebooks que funcionan solo para su autor.
Efecto secundario

Cambio observable fuera del valor devuelto, como escribir una tabla o modificar configuración.

Debe aislarse para que reintentos y pruebas sean predecibles.
Reproducibilidad

Capacidad de obtener la misma salida desde entradas, código, parámetros y dependencias declarados.

Es el criterio que permite promover un notebook a operación confiable.
PythonNotebook como punto de entrada
from commerce.transforms import clean_orders

source = spark.table("main.bronze.orders")
result = clean_orders(source)
display(result.limit(20))

clean_orders puede probarse fuera del notebook con DataFrames pequeños.

Puntos clave

  • Ejecutar desde cero revela estado oculto
  • La lógica reusable pertenece a módulos
  • La salida debe depender de parámetros explícitos

Evita

  • Depender de una celda ejecutada horas antes
  • Instalar librerías manualmente sin fijar versión

Recuerdo activo

¿Qué prueba rápida detecta estado oculto?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

notebook-best-practices

notebook-best-practices · commit b4f55c1

notebooks/covid_eda_modular.py