Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.
Lección 1 de 5
Auto Loader y cloudFiles
Auto Loader descubre archivos incrementalmente mediante cloudFiles.
- Duración
- 17 min aprox.
- Objetivo
- Auto Loader descubre archivos incrementalmente mediante cloudFiles.
- Siguiente paso
- Continuar con la siguiente lección
Ver detalles del módulo
Auto Loader y Lakeflow Connect
Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.
- Configurar schemaLocation y checkpointLocation
- Gestionar evolución y rescued data
- Elegir Lakeflow Connect, Auto Loader o partner connector
01Modelo mentalAuto Loader y cloudFiles
Auto Loader descubre archivos incrementalmente mediante cloudFiles.
+
Auto Loader y cloudFiles
Auto Loader descubre archivos incrementalmente mediante cloudFiles.
Mostrar prerrequisitos
- Dificultad
- Associate + Professional
- Prerrequisitos
- m08
readStream.format('cloudFiles') conserva estado de archivos y escala sin listar todo repetidamente.
Necesita formato de origen, checkpoint durable y, según el caso, schemaLocation o esquema proporcionado.
Modelo mental
Auto Loader es una fuente incremental de Structured Streaming llamada cloudFiles que transforma un directorio creciente en una secuencia de archivos descubiertos y procesados con estado. No observa filas nuevas dentro de un archivo mutable ni convierte automáticamente duplicados de negocio en eventos únicos. Su unidad de progreso es el archivo identificado durante descubrimiento. Un checkpoint conserva avance de streaming y el schema location mantiene la historia usada para inferencia y evolución; cumplen funciones distintas y ambos pertenecen a una única carga lógica. Auto Loader puede ejecutarse directamente con Structured Streaming o dentro de Spark Declarative Pipelines, el framework actual que sustenta la oferta gestionada Lakeflow pipelines, denominación todavía visible en materiales anteriores.
Nombre de la fuente de Structured Streaming de Auto Loader que descubre y procesa incrementalmente archivos en almacenamiento cloud.
Distingue el mecanismo de descubrimiento del formato real, como JSON, CSV o Parquet, contenido en cada archivo.Directorio durable que conserva offsets, commits y estado necesario para reanudar una consulta de streaming identificable.
Permite continuar después de un fallo sin olvidar el progreso confirmado por esa carga lógica concreta.Ubicación durable donde Auto Loader registra el esquema inferido y su evolución a través de lotes sucesivos.
Separa la historia del contrato estructural del progreso de datos guardado en el checkpoint.stream = (spark.readStream.format("cloudFiles")
.option("cloudFiles.format", "json")
.option("cloudFiles.schemaLocation", schema_path)
.load(landing_path))Usa rutas distintas de schema y checkpoint por workload.
Puntos clave
- cloudFiles es la fuente
- Checkpoint conserva progreso
- Esquema debe gobernarse
Evita
- Compartir checkpoint
- Borrarlo para reintentar
Recuerdo activo