Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 08 · Lección

COPY INTO e historial de archivos

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 3 de 5

COPY INTO e historial de archivos

COPY INTO carga archivos nuevos de object storage de forma reintentable.

Duración
17 min aprox.
Objetivo
COPY INTO carga archivos nuevos de object storage de forma reintentable.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Ingesta batch, formatos, COPY INTO, JDBC y REST

Elige una vía de entrada reproducible para archivos, bases de datos y APIs.

Al terminar podrás
  • Comparar cargas completas e incrementales
  • Usar COPY INTO de forma idempotente
  • Controlar formatos, compresión y metadatos de origen
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Data Ingestion and Loading · File formats
Estado
Revisión editorial interna
Fuentes principales
Ingestion · COPY INTO
Reportar un error
03
Operación

COPY INTO e historial de archivos

COPY INTO carga archivos nuevos de object storage de forma reintentable.

Mostrar prerrequisitos
Dificultad
Associate
Prerrequisitos
m07
Reportar un error en esta lección

Mantiene historial de archivos ya procesados para evitar recarga en ejecuciones normales y permite opciones de formato y transformación limitada.

Es apropiado para ingesta incremental SQL sencilla; Auto Loader escala mejor para descubrimiento continuo y evolución avanzada.

Modelo mental

COPY INTO es una carga SQL incremental de archivos que registra qué entradas se procesaron para una tabla y permite reejecutar sin cargar normalmente los mismos archivos. Es apropiado para lotes simples o periódicos desde object storage cuando no se necesita el control streaming de Auto Loader. La idempotencia se basa en identidad de archivos y estado de carga, no en la clave de negocio; si el productor publica el mismo contenido con otro nombre, puede volver a entrar. FILEFORMAT, FORMAT_OPTIONS y COPY_OPTIONS separan cómo leer de cómo cargar. Validación, esquema y errores deben configurarse conscientemente antes de convertir COPY INTO en una promesa de exactamente una fila por evento.

COPY INTO

Comando SQL que carga archivos nuevos en una tabla y mantiene estado de archivos procesados.

Ofrece una ruta batch simple y reintentable para object storage.
FILEFORMAT

Declaración del formato de origen que selecciona el lector de los archivos.

Debe corresponder a la representación física y no sustituye opciones de parseo.
Identidad de archivo

Metadatos usados para distinguir entradas ya procesadas de candidatas nuevas.

Aclara por qué renombrar contenido puede provocar una nueva carga.
SQLCOPY INTO gobernado
COPY INTO main.bronze.orders
FROM '/Volumes/main/landing/orders/incoming'
FILEFORMAT = JSON
FORMAT_OPTIONS ('inferSchema' = 'false');

Crea previamente la tabla con esquema explícito.

Puntos clave

  • Rastrea archivos
  • Es SQL declarativo
  • No sustituye CDC de filas

Evita

  • Renombrar contenido y esperar deduplicación de filas
  • Usar force sin entender recarga

Recuerdo activo

¿COPY INTO deduplica por order_id?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

File operations and ELT notebooks

databricks-notebooks · commit 51e8e4b

notebooks/file-operations-python.ipynb