Glosario Databricks
Conceptos para leer el temario sin perder contexto.
Definiciones breves de conceptos comunes en Databricks, agrupadas por área y conectadas con la documentación oficial. Usa el buscador del navegador o los anclajes para volver rápido a un término.
Términos revisados
Plataforma, gobierno, almacenamiento, ingesta, streaming, orquestación, rendimiento, desarrollo, seguridad y coste.
Áreas cubiertas
Definiciones
A
PlataformaAccount#
También: cuenta Databricks
Entidad de nivel superior que agrupa workspaces, usuarios, facturacion y configuracion comun de la organizacion.
Por qué importa: Aclara que algunas decisiones, como identidad, Unity Catalog o facturacion, se administran por encima de un workspace concreto.
- Relacionado
- Workspace · Unity Catalog · Metastore
- Fuente
- Databricks components
- Revisión
- 2026-07-24
IngestaAuto Loader#
También: cloudFiles
Funcionalidad para ingerir archivos nuevos desde cloud storage de forma incremental y escalable.
Por qué importa: Evita listar grandes directorios manualmente y simplifica cargas continuas de ficheros con evolucion de esquema.
- Relacionado
- Structured Streaming · Checkpoint · Bronze
- Fuente
- What is Auto Loader?
- Revisión
- 2026-07-24
B
AlmacenamientoBronze, Silver y Gold#
También: capas medallion
Capas logicas donde bronze conserva datos de origen, silver depura y conforma, y gold publica modelos de consumo.
Por qué importa: Da vocabulario comun para discutir calidad, contratos, consumidores y responsabilidades de cada tabla.
- Relacionado
- Medallion architecture · Delta table · Data quality
- Revisión
- 2026-07-24
C
GobiernoCatalog#
También: catalogo
Primer nivel del namespace de Unity Catalog; contiene schemas con tablas, vistas, volumenes, modelos y funciones.
Por qué importa: Ordena dominios de datos y ayuda a separar productos, entornos o areas de negocio con permisos claros.
- Relacionado
- Schema · Table · Volume
- Revisión
- 2026-07-24
StreamingChange Data Feed#
También: CDF
Funcion de Delta Lake que expone cambios fila a fila entre versiones de una tabla para consumo incremental.
Por qué importa: Permite propagar inserts, updates y deletes sin releer toda la tabla, especialmente en pipelines CDC.
- Relacionado
- CDC · Delta Lake · MERGE
- Revisión
- 2026-07-24
PlataformaCompute#
También: cluster, classic compute
Recursos de procesamiento que ejecutan notebooks, jobs, librerias y workloads Spark o SQL en Databricks.
Por qué importa: Influye en rendimiento, coste, permisos, librerias disponibles y modo de ejecucion de cada practica.
- Relacionado
- Databricks Runtime · Job cluster · Serverless compute
- Fuente
- Compute
- Revisión
- 2026-07-24
IngestaCOPY INTO#
También: carga incremental SQL
Comando SQL para cargar datos desde archivos hacia una tabla Delta de forma incremental e idempotente.
Por qué importa: Es util para ingesta batch simple cuando no hace falta mantener una consulta streaming activa.
- Relacionado
- Delta table · Auto Loader · Ingestion
- Fuente
- COPY INTO
- Revisión
- 2026-07-24
StreamingCheckpoint#
También: checkpoint location
Estado persistente que guarda progreso, offsets y metadatos necesarios para reanudar una consulta streaming.
Por qué importa: Sin checkpoint estable no hay recuperacion fiable ni garantias practicas de procesamiento incremental.
- Relacionado
- Structured Streaming · Auto Loader · Stateful processing
- Revisión
- 2026-07-24
D
AlmacenamientoDelta Lake#
También: Delta
Capa de almacenamiento optimizada que extiende Parquet con log transaccional, transacciones ACID y metadatos escalables.
Por qué importa: Es la base de las tablas lakehouse en Databricks y permite batch, streaming, historial y operaciones DML fiables.
- Relacionado
- Delta table · Transaction log · Time travel
- Revisión
- 2026-07-24
AlmacenamientoDelta table#
También: tabla Delta
Tabla almacenada en formato Delta Lake con datos Parquet y un log que registra versiones, operaciones y metadatos.
Por qué importa: Es el objeto sobre el que se aplican MERGE, OPTIMIZE, time travel, streaming reads y control de calidad.
- Relacionado
- Delta Lake · MERGE · OPTIMIZE
- Revisión
- 2026-07-24
PlataformaDatabricks Runtime#
También: DBR, Runtime
Imagen de software que incluye Apache Spark, Delta Lake, conectores, librerias y optimizaciones de Databricks.
Por qué importa: La version del runtime determina APIs, compatibilidad, rendimiento y comportamiento reproducible de notebooks y jobs.
- Relacionado
- Compute · Apache Spark · Delta Lake
- Revisión
- 2026-07-24
DesarrolloDeclarative Automation Bundles#
También: Databricks Asset Bundles, DAB
Formato declarativo para describir y desplegar proyectos Databricks con codigo, metadatos, jobs, pipelines y configuracion.
Por qué importa: Lleva buenas practicas de IaC, revision y CI/CD a recursos de datos y analitica.
- Relacionado
- Git folders · Lakeflow Jobs · CI/CD
- Revisión
- 2026-07-24
RendimientoData skipping#
También: saltado de datos
Optimizacion que usa estadisticas de archivos para no leer datos que no pueden satisfacer un filtro.
Por qué importa: Explica por que el layout fisico, clustering y estadisticas afectan de forma directa al coste de consulta.
- Relacionado
- Liquid clustering · OPTIMIZE · Query Profile
- Revisión
- 2026-07-24
CosteDBU#
También: Databricks Unit
Unidad de procesamiento usada por Databricks para medir y facturar capacidad consumida por determinados recursos.
Por qué importa: Permite comparar coste entre tipos de compute, workloads y configuraciones junto al coste de infraestructura cloud.
- Relacionado
- Compute · SQL warehouse · System tables
- Fuente
- Databricks components
- Revisión
- 2026-07-24
E
AlmacenamientoExternal table#
También: tabla externa
Tabla cuyos datos residen en una ubicacion externa de cloud storage mientras Databricks gobierna sus metadatos.
Por qué importa: Se usa cuando el equipo necesita conservar control explicito sobre la ruta fisica o compartir datos con otros sistemas.
- Relacionado
- Managed table · External location · Unity Catalog
- Fuente
- Tables in Databricks
- Revisión
- 2026-07-24
OrquestacionExpectations#
También: expectativas
Reglas de calidad declaradas en Lakeflow pipelines para validar, descartar, fallar o monitorizar registros.
Por qué importa: Hacen visible la calidad de datos y convierten supuestos del pipeline en comportamiento verificable.
- Relacionado
- Lakeflow Declarative Pipelines · Data quality · Quarantine
- Revisión
- 2026-07-24
G
DesarrolloGit folders#
También: Repos
Cliente Git integrado en el workspace para versionar notebooks y archivos con repositorios remotos.
Por qué importa: Conecta trabajo interactivo con revision de codigo, colaboracion y despliegues reproducibles.
- Relacionado
- Notebook · Declarative Automation Bundles · CI/CD
- Fuente
- Databricks Git folders
- Revisión
- 2026-07-24
J
OrquestacionJob cluster#
También: cluster de job
Compute efimero creado para ejecutar una tarea o job y terminado al finalizar la carga configurada.
Por qué importa: Mejora aislamiento y control de coste frente a clusters compartidos de larga vida.
- Relacionado
- Lakeflow Jobs · Compute · Task
- Fuente
- Lakeflow Jobs
- Revisión
- 2026-07-24
L
OrquestacionLakeflow Jobs#
También: Jobs, workflows
Servicio de orquestacion para ejecutar workloads de produccion compuestos por una o varias tareas con dependencias.
Por qué importa: Permite programar, reintentar, encadenar y observar notebooks, scripts, SQL, pipelines y otros trabajos.
- Relacionado
- Task · Job cluster · Declarative Automation Bundles
- Fuente
- Lakeflow Jobs
- Revisión
- 2026-07-24
OrquestacionLakeflow Declarative Pipelines#
También: Lakeflow pipelines, Delta Live Tables, DLT
Marco declarativo para crear pipelines ETL con tablas, vistas, dependencias, expectativas y operacion gestionada.
Por qué importa: Reduce codigo de orquestacion manual y hace explicitas las relaciones y reglas de calidad del pipeline.
- Relacionado
- Expectations · Streaming table · Materialized view
- Revisión
- 2026-07-24
IngestaLakeflow Connect#
También: managed connectors
Conectores gestionados para ingerir datos desde aplicaciones empresariales y bases de datos hacia el lakehouse.
Por qué importa: Acelera integraciones comunes y reduce mantenimiento de conectores propios cuando el origen esta soportado.
- Relacionado
- Lakeflow · Ingestion · Unity Catalog
- Revisión
- 2026-07-24
RendimientoLiquid clustering#
También: clustering liquido
Tecnica de layout para tablas Delta que organiza datos segun columnas de clustering sin particionamiento rigido.
Por qué importa: Ayuda a acelerar filtros habituales y evita algunos problemas de particiones fijas en tablas que evolucionan.
- Relacionado
- OPTIMIZE · Data skipping · Delta Lake
- Revisión
- 2026-07-24
M
GobiernoMetastore#
También: Unity Catalog metastore
Contenedor regional de metadatos de Unity Catalog que registra catalogos, permisos y objetos gobernados.
Por qué importa: Define el limite administrativo de muchos objetos gobernados y condiciona como se comparten datos entre workspaces.
- Relacionado
- Unity Catalog · Catalog · Workspace
- Revisión
- 2026-07-24
AlmacenamientoManaged table#
También: tabla gestionada
Tabla cuyo almacenamiento y metadatos se administran desde Databricks, normalmente como Delta Lake en ubicaciones gobernadas.
Por qué importa: Reduce gestion manual de rutas y facilita permisos, optimizaciones, lineage y limpieza gobernada.
- Relacionado
- External table · Delta Lake · Unity Catalog
- Fuente
- Tables in Databricks
- Revisión
- 2026-07-24
AlmacenamientoMERGE#
También: upsert
Operacion Delta para insertar, actualizar o eliminar filas de una tabla destino comparandolas con una fuente.
Por qué importa: Es el patron central para upserts, sincronizacion incremental, SCD y cargas idempotentes.
- Relacionado
- Delta table · Change Data Feed · SCD
- Revisión
- 2026-07-24
AlmacenamientoMedallion architecture#
También: arquitectura medallion
Patron lakehouse que organiza datos en capas progresivas, normalmente bronze, silver y gold.
Por qué importa: Ayuda a separar ingesta cruda, datos depurados y productos analiticos listos para consumo.
- Relacionado
- Bronze · Silver · Gold · Delta Lake
- Revisión
- 2026-07-24
N
DesarrolloNotebook#
También: cuaderno
Documento interactivo que combina codigo, Markdown, visualizaciones y resultados ejecutados contra compute de Databricks.
Por qué importa: Es la interfaz habitual para explorar, explicar y prototipar transformaciones antes de llevarlas a jobs o pipelines.
- Relacionado
- Workspace · Git folders · Job
- Fuente
- Databricks notebooks
- Revisión
- 2026-07-24
O
RendimientoOPTIMIZE#
También: compactacion
Operacion Delta que reorganiza archivos para mejorar el rendimiento de lectura, especialmente tras muchas escrituras pequenas.
Por qué importa: Reduce overhead de archivos pequeños y puede combinarse con tecnicas de layout como liquid clustering.
- Relacionado
- Delta Lake · Liquid clustering · Data skipping
- Fuente
- OPTIMIZE
- Revisión
- 2026-07-24
P
RendimientoPhoton#
También: motor Photon
Motor de ejecucion vectorizado de Databricks que acelera consultas SQL y cargas compatibles sobre el lakehouse.
Por qué importa: Puede reducir latencia y coste efectivo, pero conviene verificar planes y compatibilidad del workload.
- Relacionado
- SQL warehouse · Query Profile · Delta Lake
- Fuente
- What is Photon?
- Revisión
- 2026-07-24
SeguridadPersonal access token#
También: PAT
Token usado para autenticar llamadas a APIs y herramientas; Databricks lo considera un mecanismo heredado en varios flujos.
Por qué importa: Debe tratarse como secreto, rotarse y sustituirse por OAuth o identidades de servicio cuando sea posible.
- Relacionado
- Service principal · OAuth · Secret
- Fuente
- Databricks components
- Revisión
- 2026-07-24
Q
RendimientoQuery Profile#
También: perfil de consulta
Vista de diagnostico que muestra el plan y metricas de ejecucion de una consulta en Databricks SQL.
Por qué importa: Permite detectar cuellos de botella, scans innecesarios, shuffles, skew y oportunidades de optimizacion.
- Relacionado
- SQL warehouse · Photon · Data skipping
- Fuente
- Query profile
- Revisión
- 2026-07-24
S
GobiernoSchema#
También: database, esquema
Segundo nivel del namespace catalog.schema.objeto; agrupa tablas, vistas, funciones, modelos y volumenes relacionados.
Por qué importa: Es la unidad habitual para organizar datos por dominio, capa medallion o entorno dentro de un catalogo.
- Relacionado
- Catalog · Table · View
- Revisión
- 2026-07-24
PlataformaServerless compute#
También: serverless
Modo de compute gestionado por Databricks donde la plataforma aprovisiona y escala recursos sin gestionar clusters manualmente.
Por qué importa: Reduce operacion y arranque manual, pero cambia limites, coste y compatibilidad de algunas configuraciones.
- Relacionado
- SQL warehouse · Lakeflow · Compute
- Fuente
- Serverless compute
- Revisión
- 2026-07-24
PlataformaSQL warehouse#
También: warehouse, Databricks SQL warehouse
Compute especializado para ejecutar consultas SQL, dashboards, alertas y cargas BI sobre datos del lakehouse.
Por qué importa: Separa analitica SQL de clusters generales y permite dimensionar latencia, concurrencia y coste para consumidores.
- Relacionado
- Databricks SQL · Photon · Serverless compute
- Fuente
- SQL warehouses
- Revisión
- 2026-07-24
StreamingStructured Streaming#
También: streaming Spark
API de Apache Spark para procesar flujos continuos con el mismo modelo logico que DataFrames batch.
Por qué importa: Sostiene ingesta incremental, transformaciones con estado y pipelines near real time en Databricks.
- Relacionado
- Checkpoint · Watermark · Auto Loader
- Revisión
- 2026-07-24
GobiernoSystem tables#
También: tablas de sistema
Tablas gobernadas por Databricks que exponen datos operativos de auditoria, facturacion, lineage y uso.
Por qué importa: Son la base para observabilidad, FinOps, seguridad y analisis de actividad sin exportar logs manualmente.
- Relacionado
- Unity Catalog · Audit logs · DBU
- Fuente
- System tables
- Revisión
- 2026-07-24
SeguridadService principal#
También: principal de servicio
Identidad no humana usada por jobs, automatizaciones, aplicaciones y procesos CI/CD para acceder a Databricks.
Por qué importa: Evita automatizar con credenciales personales y facilita permisos minimos, rotacion y auditoria.
- Relacionado
- OAuth · PAT · Lakeflow Jobs
- Fuente
- Databricks components
- Revisión
- 2026-07-24
SeguridadSecret scope#
También: secrets
Contenedor para almacenar secretos y referenciarlos desde notebooks o jobs sin escribirlos en codigo.
Por qué importa: Reduce exposicion accidental de tokens, contrasenas y cadenas de conexion en notebooks, logs o repositorios.
- Relacionado
- PAT · Service principal · Job
- Fuente
- Secret management
- Revisión
- 2026-07-24
T
AlmacenamientoTransaction log#
También: _delta_log, log de Delta
Registro ordenado de commits que describe los cambios de una tabla Delta y permite reconstruir sus versiones.
Por qué importa: Hace posibles las transacciones ACID, time travel, auditoria de cambios y lectura incremental fiable.
- Relacionado
- Delta Lake · Time travel · Change Data Feed
- Revisión
- 2026-07-24
AlmacenamientoTime travel#
También: viaje temporal
Capacidad de consultar versiones anteriores de una tabla Delta por numero de version o marca temporal.
Por qué importa: Sirve para depurar cambios, reproducir resultados, recuperar datos y explicar auditorias sin duplicar tablas.
- Relacionado
- Delta Lake · Transaction log · VACUUM
- Revisión
- 2026-07-24
OrquestacionTask#
También: tarea
Unidad ejecutable dentro de un job, como un notebook, script, consulta SQL, pipeline o tarea condicional.
Por qué importa: Diseñar tareas pequeñas y dependencias explicitas mejora reintentos, observabilidad y recuperacion.
- Relacionado
- Lakeflow Jobs · Job cluster · DAG
- Fuente
- Lakeflow Jobs
- Revisión
- 2026-07-24
U
GobiernoUnity Catalog#
También: UC
Capa de gobierno para datos y activos de IA que centraliza catalogo, permisos, lineage, discovery y auditoria.
Por qué importa: Permite aplicar control de acceso y trazabilidad de forma consistente entre workspaces y cargas de trabajo.
- Relacionado
- Catalog · Schema · Metastore · Lineage
- Revisión
- 2026-07-24
V
AlmacenamientoVolume#
También: volumen
Objeto de Unity Catalog para gobernar archivos no tabulares como JSON, CSV, modelos, imagenes o artefactos.
Por qué importa: Evita tratar todo como tabla y permite permisos consistentes para ficheros usados por notebooks, jobs o aplicaciones.
- Relacionado
- Unity Catalog · External location · Workspace files
- Revisión
- 2026-07-24
AlmacenamientoVACUUM#
También: retencion Delta
Operacion que elimina archivos de datos no referenciados por versiones vigentes de una tabla Delta.
Por qué importa: Controla coste de almacenamiento, pero puede limitar time travel si se reduce demasiado la retencion.
- Relacionado
- Time travel · Delta Lake · OPTIMIZE
- Revisión
- 2026-07-24
W
PlataformaWorkspace#
También: entorno de trabajo
Despliegue de Databricks en una nube donde un equipo accede a notebooks, jobs, compute, datos y otros activos.
Por qué importa: Es el contexto operativo diario; muchas rutas, permisos y recursos se interpretan dentro de un workspace.
- Relacionado
- Account · Git folders · Compute
- Fuente
- Databricks components
- Revisión
- 2026-07-24
StreamingWatermark#
También: marca de agua
Umbral temporal que permite a Spark descartar estado antiguo y manejar datos tardios en consultas streaming.
Por qué importa: Controla memoria, latencia y exactitud cuando hay ventanas, agregaciones o eventos fuera de orden.
- Relacionado
- Structured Streaming · Stateful processing · Window
- Fuente
- Watermarks
- Revisión
- 2026-07-24