Saltar al contenido

Ingesta batch

Menú

Puedes leer sin crear un espacio. Créalo solo cuando quieras guardar.

Guardar progreso

Lección 2 de 5

CSV, JSON, Parquet, Avro, ORC y binary

Formato y compresión afectan esquema, pushdown, tamaño y coste.

17 min aprox.

Detalles

Ingesta batch, formatos, COPY INTO, JDBC y REST

Elige una vía de entrada reproducible para archivos, bases de datos y APIs.

Reto observable

Carga dos veces el mismo lote gobernado, conserva procedencia y cuarentena, y demuestra que el segundo run no duplica entidades ni archivos.

Al terminar podrás
  • Comparar cargas completas e incrementales
  • Usar COPY INTO de forma idempotente
  • Controlar formatos, compresión y metadatos de origen
Prerrequisitos
m07
Última revisión
25 ago 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Data Ingestion and Loading · File formats
Estado
Revisión editorial interna
Fuentes principales
Ingestion · COPY INTO
Reportar un error
02
Implementación

CSV, JSON, Parquet, Avro, ORC y binary

Formato y compresión afectan esquema, pushdown, tamaño y coste.

Parquet y Delta son columnares; JSON/CSV requieren parseo y contratos; XML, text y binary cubren fuentes no tabulares.

Bronze puede conservar payload y metadatos, pero debe fijar encoding, delimitador y tratamiento de registros corruptos.

PySparkLectura con esquema
raw = (spark.read.schema(order_schema)
  .option("mode", "PERMISSIVE")
  .json("/Volumes/main/landing/orders/incoming"))

Mide la columna de registros corruptos si la configuras.

¿Qué añade Delta a Parquet?

Profundiza

El formato determina qué información estructural puede usar el motor antes de leer cada valor. CSV es texto sin tipos embebidos y exige delimitador, escape, locale y esquema externo. JSON conserva jerarquía, pero su verbosidad y variabilidad complican análisis masivo. Parquet es columnar, tipado y comprimido; permite poda de columnas y pushdown de filtros según metadatos. Delta usa Parquet para datos y añade transaction log, versiones y DML. La compresión reduce bytes a costa de CPU con algoritmos distintos. Elegir no es solo comparar tamaño: se valora interoperabilidad, evolución, patrones de lectura, calidad y necesidad de transacciones.

Formato columnar

Organización física que almacena valores de una misma columna juntos y conserva metadatos por grupos.

Favorece poda, compresión y análisis de subconjuntos de columnas.
Predicate pushdown

Aplicación de filtros en el lector para evitar materializar datos que no pueden cumplirlos.

Reduce I/O cuando el formato y la expresión lo permiten.
Codec

Algoritmo que comprime y descomprime bloques de datos con trade-offs de tamaño y CPU.

Afecta coste de storage, red y tiempo de proceso.
Resumen

Puntos clave

  • Parquet es columnar
  • Delta añade transacciones
  • Semiestructurado exige esquema

Evita

  • Inferir CSV en cada run
  • Confundir Parquet con Delta

Vista de lectura · sin ejecución

File operations and ELT notebooks

databricks-notebooks · commit 51e8e4b

notebooks/file-operations-python.ipynb

Módulo 08

Contenido del módulo