Saltar al contenido
Lakehouse LabLakehouse LabPreparación Databricks Data Engineer
Módulo 08 · Lección

Matriz de patrones de ingesta

Contenido abierto

Puedes leer todo sin registrarte. Solo crearemos un perfil anónimo cuando decidas guardar tu progreso.

Lección 1 de 5

Matriz de patrones de ingesta

La ingesta se elige por origen, volumen, frescura, cambios y gobierno.

Duración
17 min aprox.
Objetivo
La ingesta se elige por origen, volumen, frescura, cambios y gobierno.
Siguiente paso
Continuar con la siguiente lección
Ver detalles del módulo

Ingesta batch, formatos, COPY INTO, JDBC y REST

Elige una vía de entrada reproducible para archivos, bases de datos y APIs.

Al terminar podrás
  • Comparar cargas completas e incrementales
  • Usar COPY INTO de forma idempotente
  • Controlar formatos, compresión y metadatos de origen
Ver fuentes y revisión

Metadatos editoriales

Última revisión
21 jul 2026
Nivel
Associate
Ruta relacionada
core
Dominios blueprint
Data Ingestion and Loading · File formats
Estado
Revisión editorial interna
Fuentes principales
Ingestion · COPY INTO
Reportar un error
01
Modelo mental

Matriz de patrones de ingesta

La ingesta se elige por origen, volumen, frescura, cambios y gobierno.

Mostrar prerrequisitos
Dificultad
Associate
Prerrequisitos
m07
Reportar un error en esta lección

Carga completa simplifica fuentes pequeñas; incremental reduce movimiento pero necesita cursor, archivos descubiertos o CDC.

Antes de seleccionar herramienta define reintento, borrados, esquema y límite de responsabilidad.

Modelo mental

Seleccionar ingesta significa traducir propiedades de la fuente a garantías de destino. Un conjunto finito de archivos puede cargarse en batch; una ruta creciente necesita descubrimiento incremental; una base operacional puede requerir snapshot, consultas JDBC o CDC; una API exige paginación y control de límites. Volumen, velocidad, esquema, orden, borrados, autenticación, replay y SLA determinan la herramienta. COPY INTO, Auto Loader y Lakeflow Connect no son sinónimos de pequeño, mediano y grande: ofrecen modelos de estado y operación distintos. La decisión autosuficiente identifica primero qué constituye un dato nuevo y cómo se demuestra que no se perdió ni se procesó dos veces.

Unidad incremental

Elemento cuya identidad permite reconocer progreso, como archivo, offset o versión de cambio.

Define cómo reanudar y evitar reprocesamiento accidental.
Replay

Capacidad de volver a procesar una entrada durable desde un punto conocido.

Es esencial para corregir lógica sin depender de la disponibilidad de la fuente.
CDC

Captura de inserciones, actualizaciones y borrados de una fuente con orden o secuencia asociados.

Conserva cambios que un snapshot periódico podría perder.
YAMLContrato de ingesta
source: orders_api
mode: incremental
cursor: updated_at
replay: true
deletes: tombstone

El cursor debe ser estable y soportar desempates.

Puntos clave

  • Full e incremental tienen trade-offs
  • Idempotencia es requisito
  • El origen condiciona el patrón

Evita

  • Incremental sin cursor fiable
  • Full load que borra historia útil

Recuerdo activo

¿Qué exige una carga incremental desde API?

Borrador privado · solo en este navegador
5 lecciones pendientes

Vista de lectura · sin ejecución

File operations and ELT notebooks

databricks-notebooks · commit 51e8e4b

notebooks/file-operations-python.ipynb