Saltar al contenido
Lakehouse Lab
Idioma
Entrar

Glosario Databricks

Conceptos para leer el temario sin perder contexto.

Definiciones breves de conceptos comunes en Databricks, agrupadas por área y conectadas con la documentación oficial. Usa el buscador del navegador o los anclajes para volver rápido a un término.

46

Términos revisados

Plataforma, gobierno, almacenamiento, ingesta, streaming, orquestación, rendimiento, desarrollo, seguridad y coste.

Áreas cubiertas

Definiciones

A

PlataformaAccount#

También: cuenta Databricks

Entidad de nivel superior que agrupa workspaces, usuarios, facturacion y configuracion comun de la organizacion.

Por qué importa: Aclara que algunas decisiones, como identidad, Unity Catalog o facturacion, se administran por encima de un workspace concreto.

Relacionado
Workspace · Unity Catalog · Metastore
Revisión
2026-07-24
IngestaAuto Loader#

También: cloudFiles

Funcionalidad para ingerir archivos nuevos desde cloud storage de forma incremental y escalable.

Por qué importa: Evita listar grandes directorios manualmente y simplifica cargas continuas de ficheros con evolucion de esquema.

Relacionado
Structured Streaming · Checkpoint · Bronze
Revisión
2026-07-24

B

AlmacenamientoBronze, Silver y Gold#

También: capas medallion

Capas logicas donde bronze conserva datos de origen, silver depura y conforma, y gold publica modelos de consumo.

Por qué importa: Da vocabulario comun para discutir calidad, contratos, consumidores y responsabilidades de cada tabla.

Relacionado
Medallion architecture · Delta table · Data quality
Revisión
2026-07-24

C

GobiernoCatalog#

También: catalogo

Primer nivel del namespace de Unity Catalog; contiene schemas con tablas, vistas, volumenes, modelos y funciones.

Por qué importa: Ordena dominios de datos y ayuda a separar productos, entornos o areas de negocio con permisos claros.

Relacionado
Schema · Table · Volume
Revisión
2026-07-24
StreamingChange Data Feed#

También: CDF

Funcion de Delta Lake que expone cambios fila a fila entre versiones de una tabla para consumo incremental.

Por qué importa: Permite propagar inserts, updates y deletes sin releer toda la tabla, especialmente en pipelines CDC.

Relacionado
CDC · Delta Lake · MERGE
Revisión
2026-07-24
PlataformaCompute#

También: cluster, classic compute

Recursos de procesamiento que ejecutan notebooks, jobs, librerias y workloads Spark o SQL en Databricks.

Por qué importa: Influye en rendimiento, coste, permisos, librerias disponibles y modo de ejecucion de cada practica.

Relacionado
Databricks Runtime · Job cluster · Serverless compute
Fuente
Compute
Revisión
2026-07-24
IngestaCOPY INTO#

También: carga incremental SQL

Comando SQL para cargar datos desde archivos hacia una tabla Delta de forma incremental e idempotente.

Por qué importa: Es util para ingesta batch simple cuando no hace falta mantener una consulta streaming activa.

Relacionado
Delta table · Auto Loader · Ingestion
Fuente
COPY INTO
Revisión
2026-07-24
StreamingCheckpoint#

También: checkpoint location

Estado persistente que guarda progreso, offsets y metadatos necesarios para reanudar una consulta streaming.

Por qué importa: Sin checkpoint estable no hay recuperacion fiable ni garantias practicas de procesamiento incremental.

Relacionado
Structured Streaming · Auto Loader · Stateful processing
Revisión
2026-07-24

D

AlmacenamientoDelta Lake#

También: Delta

Capa de almacenamiento optimizada que extiende Parquet con log transaccional, transacciones ACID y metadatos escalables.

Por qué importa: Es la base de las tablas lakehouse en Databricks y permite batch, streaming, historial y operaciones DML fiables.

Relacionado
Delta table · Transaction log · Time travel
Revisión
2026-07-24
AlmacenamientoDelta table#

También: tabla Delta

Tabla almacenada en formato Delta Lake con datos Parquet y un log que registra versiones, operaciones y metadatos.

Por qué importa: Es el objeto sobre el que se aplican MERGE, OPTIMIZE, time travel, streaming reads y control de calidad.

Relacionado
Delta Lake · MERGE · OPTIMIZE
Revisión
2026-07-24
PlataformaDatabricks Runtime#

También: DBR, Runtime

Imagen de software que incluye Apache Spark, Delta Lake, conectores, librerias y optimizaciones de Databricks.

Por qué importa: La version del runtime determina APIs, compatibilidad, rendimiento y comportamiento reproducible de notebooks y jobs.

Relacionado
Compute · Apache Spark · Delta Lake
Revisión
2026-07-24
DesarrolloDeclarative Automation Bundles#

También: Databricks Asset Bundles, DAB

Formato declarativo para describir y desplegar proyectos Databricks con codigo, metadatos, jobs, pipelines y configuracion.

Por qué importa: Lleva buenas practicas de IaC, revision y CI/CD a recursos de datos y analitica.

Relacionado
Git folders · Lakeflow Jobs · CI/CD
Revisión
2026-07-24
RendimientoData skipping#

También: saltado de datos

Optimizacion que usa estadisticas de archivos para no leer datos que no pueden satisfacer un filtro.

Por qué importa: Explica por que el layout fisico, clustering y estadisticas afectan de forma directa al coste de consulta.

Relacionado
Liquid clustering · OPTIMIZE · Query Profile
Revisión
2026-07-24
CosteDBU#

También: Databricks Unit

Unidad de procesamiento usada por Databricks para medir y facturar capacidad consumida por determinados recursos.

Por qué importa: Permite comparar coste entre tipos de compute, workloads y configuraciones junto al coste de infraestructura cloud.

Relacionado
Compute · SQL warehouse · System tables
Revisión
2026-07-24

E

AlmacenamientoExternal table#

También: tabla externa

Tabla cuyos datos residen en una ubicacion externa de cloud storage mientras Databricks gobierna sus metadatos.

Por qué importa: Se usa cuando el equipo necesita conservar control explicito sobre la ruta fisica o compartir datos con otros sistemas.

Relacionado
Managed table · External location · Unity Catalog
Revisión
2026-07-24
OrquestacionExpectations#

También: expectativas

Reglas de calidad declaradas en Lakeflow pipelines para validar, descartar, fallar o monitorizar registros.

Por qué importa: Hacen visible la calidad de datos y convierten supuestos del pipeline en comportamiento verificable.

Relacionado
Lakeflow Declarative Pipelines · Data quality · Quarantine
Revisión
2026-07-24

G

DesarrolloGit folders#

También: Repos

Cliente Git integrado en el workspace para versionar notebooks y archivos con repositorios remotos.

Por qué importa: Conecta trabajo interactivo con revision de codigo, colaboracion y despliegues reproducibles.

Relacionado
Notebook · Declarative Automation Bundles · CI/CD
Revisión
2026-07-24

J

OrquestacionJob cluster#

También: cluster de job

Compute efimero creado para ejecutar una tarea o job y terminado al finalizar la carga configurada.

Por qué importa: Mejora aislamiento y control de coste frente a clusters compartidos de larga vida.

Relacionado
Lakeflow Jobs · Compute · Task
Revisión
2026-07-24

L

OrquestacionLakeflow Jobs#

También: Jobs, workflows

Servicio de orquestacion para ejecutar workloads de produccion compuestos por una o varias tareas con dependencias.

Por qué importa: Permite programar, reintentar, encadenar y observar notebooks, scripts, SQL, pipelines y otros trabajos.

Relacionado
Task · Job cluster · Declarative Automation Bundles
Revisión
2026-07-24
OrquestacionLakeflow Declarative Pipelines#

También: Lakeflow pipelines, Delta Live Tables, DLT

Marco declarativo para crear pipelines ETL con tablas, vistas, dependencias, expectativas y operacion gestionada.

Por qué importa: Reduce codigo de orquestacion manual y hace explicitas las relaciones y reglas de calidad del pipeline.

Relacionado
Expectations · Streaming table · Materialized view
Revisión
2026-07-24
IngestaLakeflow Connect#

También: managed connectors

Conectores gestionados para ingerir datos desde aplicaciones empresariales y bases de datos hacia el lakehouse.

Por qué importa: Acelera integraciones comunes y reduce mantenimiento de conectores propios cuando el origen esta soportado.

Relacionado
Lakeflow · Ingestion · Unity Catalog
Revisión
2026-07-24
RendimientoLiquid clustering#

También: clustering liquido

Tecnica de layout para tablas Delta que organiza datos segun columnas de clustering sin particionamiento rigido.

Por qué importa: Ayuda a acelerar filtros habituales y evita algunos problemas de particiones fijas en tablas que evolucionan.

Relacionado
OPTIMIZE · Data skipping · Delta Lake
Revisión
2026-07-24

M

GobiernoMetastore#

También: Unity Catalog metastore

Contenedor regional de metadatos de Unity Catalog que registra catalogos, permisos y objetos gobernados.

Por qué importa: Define el limite administrativo de muchos objetos gobernados y condiciona como se comparten datos entre workspaces.

Relacionado
Unity Catalog · Catalog · Workspace
Revisión
2026-07-24
AlmacenamientoManaged table#

También: tabla gestionada

Tabla cuyo almacenamiento y metadatos se administran desde Databricks, normalmente como Delta Lake en ubicaciones gobernadas.

Por qué importa: Reduce gestion manual de rutas y facilita permisos, optimizaciones, lineage y limpieza gobernada.

Relacionado
External table · Delta Lake · Unity Catalog
Revisión
2026-07-24
AlmacenamientoMERGE#

También: upsert

Operacion Delta para insertar, actualizar o eliminar filas de una tabla destino comparandolas con una fuente.

Por qué importa: Es el patron central para upserts, sincronizacion incremental, SCD y cargas idempotentes.

Relacionado
Delta table · Change Data Feed · SCD
Revisión
2026-07-24
AlmacenamientoMedallion architecture#

También: arquitectura medallion

Patron lakehouse que organiza datos en capas progresivas, normalmente bronze, silver y gold.

Por qué importa: Ayuda a separar ingesta cruda, datos depurados y productos analiticos listos para consumo.

Relacionado
Bronze · Silver · Gold · Delta Lake
Revisión
2026-07-24

N

DesarrolloNotebook#

También: cuaderno

Documento interactivo que combina codigo, Markdown, visualizaciones y resultados ejecutados contra compute de Databricks.

Por qué importa: Es la interfaz habitual para explorar, explicar y prototipar transformaciones antes de llevarlas a jobs o pipelines.

Relacionado
Workspace · Git folders · Job
Revisión
2026-07-24

O

RendimientoOPTIMIZE#

También: compactacion

Operacion Delta que reorganiza archivos para mejorar el rendimiento de lectura, especialmente tras muchas escrituras pequenas.

Por qué importa: Reduce overhead de archivos pequeños y puede combinarse con tecnicas de layout como liquid clustering.

Relacionado
Delta Lake · Liquid clustering · Data skipping
Fuente
OPTIMIZE
Revisión
2026-07-24

P

RendimientoPhoton#

También: motor Photon

Motor de ejecucion vectorizado de Databricks que acelera consultas SQL y cargas compatibles sobre el lakehouse.

Por qué importa: Puede reducir latencia y coste efectivo, pero conviene verificar planes y compatibilidad del workload.

Relacionado
SQL warehouse · Query Profile · Delta Lake
Revisión
2026-07-24
SeguridadPersonal access token#

También: PAT

Token usado para autenticar llamadas a APIs y herramientas; Databricks lo considera un mecanismo heredado en varios flujos.

Por qué importa: Debe tratarse como secreto, rotarse y sustituirse por OAuth o identidades de servicio cuando sea posible.

Relacionado
Service principal · OAuth · Secret
Revisión
2026-07-24

Q

RendimientoQuery Profile#

También: perfil de consulta

Vista de diagnostico que muestra el plan y metricas de ejecucion de una consulta en Databricks SQL.

Por qué importa: Permite detectar cuellos de botella, scans innecesarios, shuffles, skew y oportunidades de optimizacion.

Relacionado
SQL warehouse · Photon · Data skipping
Revisión
2026-07-24

S

GobiernoSchema#

También: database, esquema

Segundo nivel del namespace catalog.schema.objeto; agrupa tablas, vistas, funciones, modelos y volumenes relacionados.

Por qué importa: Es la unidad habitual para organizar datos por dominio, capa medallion o entorno dentro de un catalogo.

Relacionado
Catalog · Table · View
Revisión
2026-07-24
PlataformaServerless compute#

También: serverless

Modo de compute gestionado por Databricks donde la plataforma aprovisiona y escala recursos sin gestionar clusters manualmente.

Por qué importa: Reduce operacion y arranque manual, pero cambia limites, coste y compatibilidad de algunas configuraciones.

Relacionado
SQL warehouse · Lakeflow · Compute
Revisión
2026-07-24
PlataformaSQL warehouse#

También: warehouse, Databricks SQL warehouse

Compute especializado para ejecutar consultas SQL, dashboards, alertas y cargas BI sobre datos del lakehouse.

Por qué importa: Separa analitica SQL de clusters generales y permite dimensionar latencia, concurrencia y coste para consumidores.

Relacionado
Databricks SQL · Photon · Serverless compute
Revisión
2026-07-24
StreamingStructured Streaming#

También: streaming Spark

API de Apache Spark para procesar flujos continuos con el mismo modelo logico que DataFrames batch.

Por qué importa: Sostiene ingesta incremental, transformaciones con estado y pipelines near real time en Databricks.

Relacionado
Checkpoint · Watermark · Auto Loader
Revisión
2026-07-24
GobiernoSystem tables#

También: tablas de sistema

Tablas gobernadas por Databricks que exponen datos operativos de auditoria, facturacion, lineage y uso.

Por qué importa: Son la base para observabilidad, FinOps, seguridad y analisis de actividad sin exportar logs manualmente.

Relacionado
Unity Catalog · Audit logs · DBU
Revisión
2026-07-24
SeguridadService principal#

También: principal de servicio

Identidad no humana usada por jobs, automatizaciones, aplicaciones y procesos CI/CD para acceder a Databricks.

Por qué importa: Evita automatizar con credenciales personales y facilita permisos minimos, rotacion y auditoria.

Relacionado
OAuth · PAT · Lakeflow Jobs
Revisión
2026-07-24
SeguridadSecret scope#

También: secrets

Contenedor para almacenar secretos y referenciarlos desde notebooks o jobs sin escribirlos en codigo.

Por qué importa: Reduce exposicion accidental de tokens, contrasenas y cadenas de conexion en notebooks, logs o repositorios.

Relacionado
PAT · Service principal · Job
Revisión
2026-07-24

T

AlmacenamientoTransaction log#

También: _delta_log, log de Delta

Registro ordenado de commits que describe los cambios de una tabla Delta y permite reconstruir sus versiones.

Por qué importa: Hace posibles las transacciones ACID, time travel, auditoria de cambios y lectura incremental fiable.

Relacionado
Delta Lake · Time travel · Change Data Feed
Revisión
2026-07-24
AlmacenamientoTime travel#

También: viaje temporal

Capacidad de consultar versiones anteriores de una tabla Delta por numero de version o marca temporal.

Por qué importa: Sirve para depurar cambios, reproducir resultados, recuperar datos y explicar auditorias sin duplicar tablas.

Relacionado
Delta Lake · Transaction log · VACUUM
Revisión
2026-07-24
OrquestacionTask#

También: tarea

Unidad ejecutable dentro de un job, como un notebook, script, consulta SQL, pipeline o tarea condicional.

Por qué importa: Diseñar tareas pequeñas y dependencias explicitas mejora reintentos, observabilidad y recuperacion.

Relacionado
Lakeflow Jobs · Job cluster · DAG
Revisión
2026-07-24

U

GobiernoUnity Catalog#

También: UC

Capa de gobierno para datos y activos de IA que centraliza catalogo, permisos, lineage, discovery y auditoria.

Por qué importa: Permite aplicar control de acceso y trazabilidad de forma consistente entre workspaces y cargas de trabajo.

Relacionado
Catalog · Schema · Metastore · Lineage
Revisión
2026-07-24

V

AlmacenamientoVolume#

También: volumen

Objeto de Unity Catalog para gobernar archivos no tabulares como JSON, CSV, modelos, imagenes o artefactos.

Por qué importa: Evita tratar todo como tabla y permite permisos consistentes para ficheros usados por notebooks, jobs o aplicaciones.

Relacionado
Unity Catalog · External location · Workspace files
Revisión
2026-07-24
AlmacenamientoVACUUM#

También: retencion Delta

Operacion que elimina archivos de datos no referenciados por versiones vigentes de una tabla Delta.

Por qué importa: Controla coste de almacenamiento, pero puede limitar time travel si se reduce demasiado la retencion.

Relacionado
Time travel · Delta Lake · OPTIMIZE
Revisión
2026-07-24

W

PlataformaWorkspace#

También: entorno de trabajo

Despliegue de Databricks en una nube donde un equipo accede a notebooks, jobs, compute, datos y otros activos.

Por qué importa: Es el contexto operativo diario; muchas rutas, permisos y recursos se interpretan dentro de un workspace.

Relacionado
Account · Git folders · Compute
Revisión
2026-07-24
StreamingWatermark#

También: marca de agua

Umbral temporal que permite a Spark descartar estado antiguo y manejar datos tardios en consultas streaming.

Por qué importa: Controla memoria, latencia y exactitud cuando hay ventanas, agregaciones o eventos fuera de orden.

Relacionado
Structured Streaming · Stateful processing · Window
Revisión
2026-07-24