Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 09 · Lección

Auto Loader y cloudFiles

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 1 de 5

Auto Loader y cloudFiles

Auto Loader descubre archivos incrementalmente mediante cloudFiles.

Duración
17 min aprox.
Objetivo
Auto Loader descubre archivos incrementalmente mediante cloudFiles.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Auto Loader y Lakeflow Connect

Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.

Al terminar podrás
  • Configurar schemaLocation y checkpointLocation
  • Gestionar evolución y rescued data
  • Elegir Lakeflow Connect, Auto Loader o partner connector
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate + Professional
Ruta relacionada
core
Dominios blueprint
Data Ingestion and Loading · Lakeflow Connect
Estado
Revisión editorial interna
Fuentes principales
Auto Loader · Lakeflow Connect
Reportar un error
01
Modelo mental

Auto Loader y cloudFiles

Auto Loader descubre archivos incrementalmente mediante cloudFiles.

Mostrar prerrequisitos
Dificultad
Associate + Professional
Prerrequisitos
m08
Reportar un error en esta lección

readStream.format('cloudFiles') conserva estado de archivos y escala sin listar todo repetidamente.

Necesita formato de origen, checkpoint durable y, según el caso, schemaLocation o esquema proporcionado.

Modelo mental

Auto Loader es una fuente incremental de Structured Streaming llamada cloudFiles que transforma un directorio creciente en una secuencia de archivos descubiertos y procesados con estado. No observa filas nuevas dentro de un archivo mutable ni convierte automáticamente duplicados de negocio en eventos únicos. Su unidad de progreso es el archivo identificado durante descubrimiento. Un checkpoint conserva avance de streaming y el schema location mantiene la historia usada para inferencia y evolución; cumplen funciones distintas y ambos pertenecen a una única carga lógica. Auto Loader puede ejecutarse directamente con Structured Streaming o dentro de Spark Declarative Pipelines, el framework actual que sustenta la oferta gestionada Lakeflow pipelines, denominación todavía visible en materiales anteriores.

cloudFiles

Nombre de la fuente de Structured Streaming de Auto Loader que descubre y procesa incrementalmente archivos en almacenamiento cloud.

Distingue el mecanismo de descubrimiento del formato real, como JSON, CSV o Parquet, contenido en cada archivo.
Checkpoint

Directorio durable que conserva offsets, commits y estado necesario para reanudar una consulta de streaming identificable.

Permite continuar después de un fallo sin olvidar el progreso confirmado por esa carga lógica concreta.
Schema location

Ubicación durable donde Auto Loader registra el esquema inferido y su evolución a través de lotes sucesivos.

Separa la historia del contrato estructural del progreso de datos guardado en el checkpoint.
PySparkAuto Loader
stream = (spark.readStream.format("cloudFiles")
 .option("cloudFiles.format", "json")
 .option("cloudFiles.schemaLocation", schema_path)
 .load(landing_path))

Usa rutas distintas de schema y checkpoint por workload.

Puntos clave

  • cloudFiles es la fuente
  • Checkpoint conserva progreso
  • Esquema debe gobernarse

Evita

  • Compartir checkpoint
  • Borrarlo para reintentar

Recuerdo activo

¿Qué opción indica formato de los archivos?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

crdb_to_dbx

crdb_to_dbx · commit 042cb96

crdb_to_dbx/cockroachdb-cdc-tutorial.ipynb