Saltar al contenido

Ingesta managed

Menú

Puedes leer sin crear un espacio. Créalo solo cuando quieras guardar.

Guardar progreso

Lección 1 de 5

Auto Loader y cloudFiles

Auto Loader descubre archivos incrementalmente mediante cloudFiles.

17 min aprox.

Detalles

Auto Loader y Lakeflow Connect

Selecciona entre descubrimiento de archivos, conectores gestionados y alternativas de integración.

Reto observable

Implementa una ingesta incremental con estado y evolución controlados, y justifica Auto Loader o Lakeflow Connect mediante volumen, frescura y operación.

Al terminar podrás
  • Configurar schemaLocation y checkpointLocation
  • Gestionar evolución y rescued data
  • Elegir Lakeflow Connect, Auto Loader o partner connector
Prerrequisitos
m08
Última revisión
25 ago 2026
Nivel
Associate + Professional
Ruta relacionada
core
Dominios blueprint
Data Ingestion and Loading · Lakeflow Connect
Estado
Revisión editorial interna
Fuentes principales
Auto Loader · Lakeflow Connect
Reportar un error
01
Modelo mental

Auto Loader y cloudFiles

Auto Loader descubre archivos incrementalmente mediante cloudFiles.

readStream.format('cloudFiles') conserva estado de archivos y escala sin listar todo repetidamente.

Necesita formato de origen, checkpoint durable y, según el caso, schemaLocation o esquema proporcionado.

PySparkAuto Loader
stream = (spark.readStream.format("cloudFiles")
 .option("cloudFiles.format", "json")
 .option("cloudFiles.schemaLocation", schema_path)
 .load(landing_path))

Usa rutas distintas de schema y checkpoint por workload.

¿Qué opción indica formato de los archivos?

Profundiza

Auto Loader es una fuente incremental de Structured Streaming llamada cloudFiles que transforma un directorio creciente en una secuencia de archivos descubiertos y procesados con estado. No observa filas nuevas dentro de un archivo mutable ni convierte automáticamente duplicados de negocio en eventos únicos. Su unidad de progreso es el archivo identificado durante descubrimiento. Un checkpoint conserva avance de streaming y el schema location mantiene la historia usada para inferencia y evolución; cumplen funciones distintas y ambos pertenecen a una única carga lógica. Auto Loader puede ejecutarse directamente con Structured Streaming o dentro de Spark Declarative Pipelines, el framework actual que sustenta la oferta gestionada Lakeflow pipelines, denominación todavía visible en materiales anteriores.

cloudFiles

Nombre de la fuente de Structured Streaming de Auto Loader que descubre y procesa incrementalmente archivos en almacenamiento cloud.

Distingue el mecanismo de descubrimiento del formato real, como JSON, CSV o Parquet, contenido en cada archivo.
Checkpoint

Directorio durable que conserva offsets, commits y estado necesario para reanudar una consulta de streaming identificable.

Permite continuar después de un fallo sin olvidar el progreso confirmado por esa carga lógica concreta.
Schema location

Ubicación durable donde Auto Loader registra el esquema inferido y su evolución a través de lotes sucesivos.

Separa la historia del contrato estructural del progreso de datos guardado en el checkpoint.
Resumen

Puntos clave

  • cloudFiles es la fuente
  • Checkpoint conserva progreso
  • Esquema debe gobernarse

Evita

  • Compartir checkpoint
  • Borrarlo para reintentar

Vista de lectura · sin ejecución

crdb_to_dbx

crdb_to_dbx · commit 042cb96

crdb_to_dbx/cockroachdb-cdc-tutorial.ipynb

Módulo 09

Contenido del módulo