Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 09 · Lección

Directory listing y file notification

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 2 de 5

Directory listing y file notification

Directory listing simplifica; file notification reduce listados a gran escala.

Duración
17 min aprox.
Objetivo
Directory listing simplifica; file notification reduce listados a gran escala.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Auto Loader y Lakeflow Connect

Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.

Al terminar podrás
  • Configurar schemaLocation y checkpointLocation
  • Gestionar evolución y rescued data
  • Elegir Lakeflow Connect, Auto Loader o partner connector
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate + Professional
Ruta relacionada
core
Dominios blueprint
Data Ingestion and Loading · Lakeflow Connect
Estado
Revisión editorial interna
Fuentes principales
Auto Loader · Lakeflow Connect
Reportar un error
02
Implementación

Directory listing y file notification

Directory listing simplifica; file notification reduce listados a gran escala.

Mostrar prerrequisitos
Dificultad
Associate + Professional
Prerrequisitos
m08
Reportar un error en esta lección

El modo de descubrimiento se elige por volumen y configuración cloud; ambos necesitan permisos correctos.

rescuedDataColumn conserva campos que no encajan y permite estudiar evolución sin perder payload.

Modelo mental

Directory listing y file notification son estrategias para encontrar archivos, no formatos de entrada ni garantías de entrega final. El listado consulta la jerarquía de object storage y compara resultados con estado; es sencillo y funciona sin infraestructura de eventos, pero su coste de enumeración crece con rutas enormes. Las notificaciones aprovechan eventos cloud y colas para señalar objetos nuevos, reduciendo listados a escala, a cambio de permisos y componentes adicionales. Auto Loader administra el estado de archivos en ambos casos. La elección depende de número total de objetos, tasa de llegada, SLA, restricciones de red y capacidad operativa. Un evento de notificación no sustituye la validación del objeto ni el commit del sink.

Directory listing

Descubrimiento que enumera objetos bajo una ruta y compara sus metadatos con el estado incremental previamente conservado.

Ofrece menor complejidad inicial, pero puede convertirse en el coste dominante cuando la jerarquía acumula millones de archivos.
File notification

Descubrimiento basado en eventos cloud que anuncian la creación de objetos mediante una cola o servicio equivalente.

Reduce enumeraciones masivas, aunque añade configuración de identidad, eventos y operación de la infraestructura asociada.
File event

Señal potencialmente duplicada o desordenada que identifica un objeto candidato, no una confirmación de procesamiento completo.

Obliga a conservar estado y verificar el archivo antes de considerar que los datos llegaron correctamente al destino.
PySparkRescatar cambios
stream = (spark.readStream.format("cloudFiles")
 .option("cloudFiles.format", "json")
 .option("rescuedDataColumn", "_rescued_data")
 .load(landing_path))

Alerta si crece _rescued_data.

Puntos clave

  • Listing requiere menos infraestructura
  • Notifications escalan descubrimiento
  • Rescued data preserva anomalías

Evita

  • Ignorar rescued data
  • Cambiar esquema sin probar checkpoint

Recuerdo activo

¿Para qué sirve _rescued_data?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

crdb_to_dbx

crdb_to_dbx · commit 042cb96

crdb_to_dbx/cockroachdb-cdc-tutorial.ipynb