Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.
Lección 1 de 5
Notebooks y archivos de workspace
Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.
- Duración
- 17 min aprox.
- Objetivo
- Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.
- Siguiente paso
- Continuar con la siguiente lección
Ver detalles del módulo
Notebooks, SQL, Python y PySpark en el workspace
Trabaja con notebooks y archivos como código mantenible, reproducible y parametrizable.
- Distinguir SQL, Python y PySpark por carga
- Gestionar parámetros y dependencias
- Evitar estado oculto en notebooks
01Modelo mentalNotebooks y archivos de workspace
Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.
+
Notebooks y archivos de workspace
Un notebook es útil para desarrollo interactivo cuando sus dependencias, parámetros y orden de ejecución son explícitos.
Las celdas admiten SQL, Python y visualizaciones, pero el estado del proceso permite ejecutar fuera de orden. Para que otra persona reproduzca el resultado, la ejecución desde cero debe crear las mismas variables, tablas temporales y salidas.
Los archivos de workspace y módulos Python facilitan separar lógica reutilizable del relato exploratorio. Un notebook de entrada debería coordinar funciones comprobables, no concentrar transformaciones y efectos secundarios en decenas de celdas.
Modelo mental
Un notebook es simultáneamente documento, cliente de ejecución y estado interactivo. Esa combinación acelera el aprendizaje, pero dificulta reproducibilidad cuando las celdas se ejecutan fuera de orden o dependen de variables, tablas temporales y librerías instaladas manualmente. El modelo autosuficiente separa narración de lógica: el notebook recibe parámetros, invoca funciones importables, muestra evidencia pequeña y termina con salidas gobernadas. Debe poder ejecutarse desde un estado limpio de principio a fin. Los archivos de workspace y paquetes Python guardan lógica comprobable; Jobs aporta el contrato productivo. La pregunta clave no es si una celda funcionó una vez, sino qué dependencias explican exactamente su resultado.
Variables, imports, vistas temporales y cachés que sobreviven entre comandos de una sesión activa.
Es la causa principal de notebooks que funcionan solo para su autor.Cambio observable fuera del valor devuelto, como escribir una tabla o modificar configuración.
Debe aislarse para que reintentos y pruebas sean predecibles.Capacidad de obtener la misma salida desde entradas, código, parámetros y dependencias declarados.
Es el criterio que permite promover un notebook a operación confiable.from commerce.transforms import clean_orders
source = spark.table("main.bronze.orders")
result = clean_orders(source)
display(result.limit(20))clean_orders puede probarse fuera del notebook con DataFrames pequeños.
Puntos clave
- Ejecutar desde cero revela estado oculto
- La lógica reusable pertenece a módulos
- La salida debe depender de parámetros explícitos
Evita
- Depender de una celda ejecutada horas antes
- Instalar librerías manualmente sin fijar versión
Recuerdo activo