Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 08 · Lección

CSV, JSON, Parquet, Avro, ORC y binary

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 2 de 5

CSV, JSON, Parquet, Avro, ORC y binary

Formato y compresión afectan esquema, pushdown, tamaño y coste.

Duración
17 min aprox.
Objetivo
Formato y compresión afectan esquema, pushdown, tamaño y coste.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Ingesta batch, formatos, COPY INTO, JDBC y REST

Elige una vía de entrada reproducible para archivos, bases de datos y APIs.

Al terminar podrás
  • Comparar cargas completas e incrementales
  • Usar COPY INTO de forma idempotente
  • Controlar formatos, compresión y metadatos de origen
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Data Ingestion and Loading · File formats
Estado
Revisión editorial interna
Fuentes principales
Ingestion · COPY INTO
Reportar un error
02
Implementación

CSV, JSON, Parquet, Avro, ORC y binary

Formato y compresión afectan esquema, pushdown, tamaño y coste.

Mostrar prerrequisitos
Dificultad
Associate
Prerrequisitos
m07
Reportar un error en esta lección

Parquet y Delta son columnares; JSON/CSV requieren parseo y contratos; XML, text y binary cubren fuentes no tabulares.

Bronze puede conservar payload y metadatos, pero debe fijar encoding, delimitador y tratamiento de registros corruptos.

Modelo mental

El formato determina qué información estructural puede usar el motor antes de leer cada valor. CSV es texto sin tipos embebidos y exige delimitador, escape, locale y esquema externo. JSON conserva jerarquía, pero su verbosidad y variabilidad complican análisis masivo. Parquet es columnar, tipado y comprimido; permite poda de columnas y pushdown de filtros según metadatos. Delta usa Parquet para datos y añade transaction log, versiones y DML. La compresión reduce bytes a costa de CPU con algoritmos distintos. Elegir no es solo comparar tamaño: se valora interoperabilidad, evolución, patrones de lectura, calidad y necesidad de transacciones.

Formato columnar

Organización física que almacena valores de una misma columna juntos y conserva metadatos por grupos.

Favorece poda, compresión y análisis de subconjuntos de columnas.
Predicate pushdown

Aplicación de filtros en el lector para evitar materializar datos que no pueden cumplirlos.

Reduce I/O cuando el formato y la expresión lo permiten.
Codec

Algoritmo que comprime y descomprime bloques de datos con trade-offs de tamaño y CPU.

Afecta coste de storage, red y tiempo de proceso.
PySparkLectura con esquema
raw = (spark.read.schema(order_schema)
  .option("mode", "PERMISSIVE")
  .json("/Volumes/main/landing/orders/incoming"))

Mide la columna de registros corruptos si la configuras.

Puntos clave

  • Parquet es columnar
  • Delta añade transacciones
  • Semiestructurado exige esquema

Evita

  • Inferir CSV en cada run
  • Confundir Parquet con Delta

Recuerdo activo

¿Qué añade Delta a Parquet?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

File operations and ELT notebooks

databricks-notebooks · commit 51e8e4b

notebooks/file-operations-python.ipynb