Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.
Lección 2 de 5
Directory listing y file notification
Directory listing simplifica; file notification reduce listados a gran escala.
- Duración
- 17 min aprox.
- Objetivo
- Directory listing simplifica; file notification reduce listados a gran escala.
- Siguiente paso
- Continuar con la siguiente lección
Ver detalles del módulo
Auto Loader y Lakeflow Connect
Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.
- Configurar schemaLocation y checkpointLocation
- Gestionar evolución y rescued data
- Elegir Lakeflow Connect, Auto Loader o partner connector
02ImplementaciónDirectory listing y file notification
Directory listing simplifica; file notification reduce listados a gran escala.
+
Directory listing y file notification
Directory listing simplifica; file notification reduce listados a gran escala.
Mostrar prerrequisitos
- Dificultad
- Associate + Professional
- Prerrequisitos
- m08
El modo de descubrimiento se elige por volumen y configuración cloud; ambos necesitan permisos correctos.
rescuedDataColumn conserva campos que no encajan y permite estudiar evolución sin perder payload.
Modelo mental
Directory listing y file notification son estrategias para encontrar archivos, no formatos de entrada ni garantías de entrega final. El listado consulta la jerarquía de object storage y compara resultados con estado; es sencillo y funciona sin infraestructura de eventos, pero su coste de enumeración crece con rutas enormes. Las notificaciones aprovechan eventos cloud y colas para señalar objetos nuevos, reduciendo listados a escala, a cambio de permisos y componentes adicionales. Auto Loader administra el estado de archivos en ambos casos. La elección depende de número total de objetos, tasa de llegada, SLA, restricciones de red y capacidad operativa. Un evento de notificación no sustituye la validación del objeto ni el commit del sink.
Descubrimiento que enumera objetos bajo una ruta y compara sus metadatos con el estado incremental previamente conservado.
Ofrece menor complejidad inicial, pero puede convertirse en el coste dominante cuando la jerarquía acumula millones de archivos.Descubrimiento basado en eventos cloud que anuncian la creación de objetos mediante una cola o servicio equivalente.
Reduce enumeraciones masivas, aunque añade configuración de identidad, eventos y operación de la infraestructura asociada.Señal potencialmente duplicada o desordenada que identifica un objeto candidato, no una confirmación de procesamiento completo.
Obliga a conservar estado y verificar el archivo antes de considerar que los datos llegaron correctamente al destino.stream = (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "json")
.option("rescuedDataColumn", "_rescued_data")
.load(landing_path))Alerta si crece _rescued_data.
Puntos clave
- Listing requiere menos infraestructura
- Notifications escalan descubrimiento
- Rescued data preserva anomalías
Evita
- Ignorar rescued data
- Cambiar esquema sin probar checkpoint
Recuerdo activo