Almacenamiento de Datos ArchiTecnología, componentes y diagrama. Concepts

⚡ Resumen inteligente

Almacenamiento de Datos ArchiLa arquitectura define cómo se organizan los datos históricos y acumulativos de múltiples fuentes en capas escalonadas y componentes conectados, lo que permite generar informes fiables, realizar análisis y disponer de una única versión veraz para la toma de decisiones y la previsión en la organización.

  • 🏛️ Propósito principal: Un almacén de datos almacena datos orientados a temas específicos, integrados, variables en el tiempo y no volátiles para respaldar el análisis, en lugar del procesamiento de transacciones diarias.
  • 🧱 Diseño escalonado: ArchiLas arquitecturas van desde una sola capa hasta el modelo de tres capas, ampliamente utilizado, que consta de una base de datos inferior, un servidor OLAP intermedio y una capa de cliente superior.
  • 🗄️ Base de datos principal: El repositorio central se ejecuta en un sistema de gestión de bases de datos relacionales (RDBMS), a menudo ampliado con bases de datos paralelas, nuevas estructuras de índices y bases de datos multidimensionales para lograr escalabilidad y velocidad.
  • 🔄 Componentes ETL: Las herramientas de abastecimiento, adquisición, limpieza y transformación consolidan los datos en un formato unificado y mantienen el almacén de datos actualizado.
  • 🏷️ Función de metadatos: Los metadatos técnicos y comerciales describen el origen, el significado y el procesamiento de los datos, transformando los valores brutos en conocimiento útil.
  • 📊 Herramientas de consulta y OLAP: Las herramientas de generación de informes, consultas gestionadas, desarrollo de aplicaciones, minería de datos y OLAP permiten a los usuarios explorar el almacén de datos desde múltiples perspectivas.
  • Mejores Prácticas: Optimice el modelo de datos para su recuperación, consolide la información en una única versión veraz y considere un modelo ODS o 3NF cuando sea necesario.

Almacenamiento de Datos ArchiDiagrama de arquitectura que muestra los niveles y componentes principales de un almacén de datos.

Almacenamiento de Datos Concepts

A almacenamiento de datos Su propósito es brindar a la empresa una única versión de la verdad para la toma de decisiones y la previsión. Se trata de un sistema de información que almacena datos históricos y acumulativos provenientes de una o varias fuentes.

Al organizar esos datos para su análisis en lugar de para transacciones, un almacén de datos simplifica el trabajo de elaboración de informes y análisis de toda una organización.

Características del almacén de datos

Un almacén de datos tiene cuatro características definitorias que lo distinguen de una base de datos operativa rutinaria:

  • Orientado al sujeto
  • Incluye un
  • Variante de tiempo
  • No volátil

Orientado al sujeto

Un almacén de datos está orientado a temas específicos porque proporciona información sobre un tema en particular, en lugar de sobre las operaciones habituales de una empresa. Los temas típicos incluyen ventas, marketing y distribución.

En lugar de centrarse en el procesamiento diario, el almacén de datos prioriza el modelado y el análisis para la toma de decisiones. Ofrece una visión simple y concisa de cada tema y omite los datos que no contribuyen al proceso de decisión.

Incluye un

La integración está estrechamente ligada a la orientación temática. En un almacén de datos, la integración implica establecer una unidad de medida común para todos los datos similares procedentes de bases de datos distintas, y almacenar esos datos de forma común y universalmente aceptable.

Un almacén de datos se construye integrando información de diversas fuentes, como un sistema central, bases de datos relacionales y archivos planos. Además, debe mantener convenciones de nomenclatura, formatos y codificación consistentes.

Esta coherencia en la nomenclatura, las medidas de los atributos y la estructura de codificación es lo que hace posible un análisis eficaz. Considere el siguiente ejemplo:

Ejemplo de integración de almacén de datos que estandariza los campos de género, fecha y saldo de tres aplicaciones.

En el ejemplo anterior, tres aplicaciones denominadas A, B y C almacenan información sobre género, fecha y saldo, pero cada una la almacena de una manera diferente:

  • La aplicación A almacena el campo de género como valores lógicos como M o F.
  • La aplicación B almacena el campo de género como un valor numérico.
  • La aplicación C almacena el campo de género como un valor de carácter.
  • La misma variación se aplica a los campos Fecha y Saldo.

Tras el proceso de transformación y limpieza, todos estos datos se almacenan en un formato común dentro del almacén de datos.

Variante de tiempo

El horizonte temporal de un almacén de datos es mucho más amplio que el de un sistema operativo. Los datos se identifican con un período específico y ofrecen una perspectiva histórica, por lo que siempre conllevan un elemento temporal, ya sea de forma explícita o implícita.

Un ejemplo de esta variación temporal se observa en la estructura de la clave de registro. Cada clave primaria del almacén de datos debe contener un elemento temporal, como el día, la semana o el mes.

Otro aspecto de la variación temporal es que, una vez que los datos se insertan en el almacén de datos, no se pueden actualizar ni modificar.

No volátil

Un almacén de datos es no volátil, lo que significa que los datos anteriores no se borran cuando llegan datos nuevos. Los datos son de solo lectura y se actualizan periódicamente, lo que ayuda a los analistas a estudiar datos históricos y comprender qué sucedió y cuándo.

Debido a que no necesita procesamiento de transacciones, recuperación ni control de concurrencia, un almacén de datos omite las actividades de eliminación, actualización e inserción comunes en una aplicación operativa. En el almacenamiento de datos solo se realizan dos operaciones de datos:

  1. Carga de datos
  2. Acceso a los datos

La siguiente tabla destaca algunas de las principales diferencias entre una aplicación operativa y un almacén de datos:

OperaAplicación opcional Almacenamiento de Datos
Se debe codificar un programa complejo para garantizar que los procesos de actualización de datos mantengan la alta integridad del producto final. Este tipo de problema no ocurre porque no se realiza ninguna actualización de datos.
Los datos se colocan en un formato normalizado para garantizar una redundancia mínima. Los datos no se almacenan en forma normalizada.
La tecnología necesaria para dar soporte a cuestiones relacionadas con transacciones, recuperación de datos, reversión y resolución de interbloqueos es bastante compleja. Ofrece relativa simplicidad en tecnología.

Almacenamiento de Datos Architectura

Almacenamiento de Datos ArchiLa arquitectura es compleja porque el sistema almacena datos históricos y acumulativos de múltiples fuentes. Existen tres enfoques para la construcción de las capas del almacén de datos: de una, dos y tres capas.

Arquitectura de un solo nivel Su objetivo es minimizar la cantidad de datos almacenados eliminando la redundancia. En la práctica, rara vez se utiliza.

Arquitectura de dos niveles Separa las fuentes físicamente disponibles del almacén de datos. No es fácilmente ampliable, admite menos usuarios finales y puede presentar problemas de conectividad debido a limitaciones de red.

Arquitectura de tres niveles Es el diseño de almacén de datos más utilizado.

Consta de tres niveles: superior, medio e inferior:

  1. Nivel inferior: La base de datos del almacén de datos constituye la capa inferior. Generalmente se trata de un sistema de base de datos relacional, y los datos se limpian, transforman y cargan en esta capa mediante herramientas de back-end.
  2. Nivel medio: La capa intermedia es un servidor OLAP implementado utilizando el modelo ROLAP o MOLAP. Presenta una abstracofrece una visión integral de la base de datos y actúa como mediador entre el usuario final y la base de datos.
  3. Nivel superior: La capa superior es la capa de cliente frontal. Contiene las herramientas y las API que se utilizan para conectarse y extraer datos del almacén, como herramientas de consulta, herramientas de generación de informes, herramientas de consulta administrada, herramientas de análisis y herramientas de minería de datos.

Componentes del almacén de datos

Los componentes y la arquitectura general de un almacén de datos funcionan conjuntamente como se muestra en el siguiente diagrama.

Componentes de la arquitectura del almacén de datos, incluyendo base de datos, herramientas ETL, metadatos, herramientas de consulta y data marts.

El almacén de datos se basa en un servidor RDBMS, un repositorio central de información rodeado de componentes clave que mantienen todo el entorno funcional, gestionable y accesible.

Un almacén de datos tiene cinco componentes principales, que se describen a continuación.

Base de datos de almacenamiento de datos

La base de datos central es la base del entorno de almacenamiento y se implementa en RDBMS tecnología. Debido a que un RDBMS tradicional está optimizado para el procesamiento de transacciones en lugar del almacenamiento de datos, las operaciones que consumen muchos recursos, como las consultas ad hoc, las uniones de varias tablas y las agregaciones, pueden ralentizarlo.

Por ese motivo, se utilizan enfoques alternativos de bases de datos:

  • Las bases de datos relacionales se implementan en paralelo para permitir la escalabilidad, utilizando modelos de memoria compartida o de arquitectura sin recursos compartidos en diversas configuraciones multiprocesador o de procesamiento masivamente paralelo.
  • Se utilizan nuevas estructuras de índice para evitar los escaneos de tablas relacionales y mejorar la velocidad.
  • Las bases de datos multidimensionales (MDDB) se utilizan para superar las limitaciones de los modelos de almacenes relacionales. Un ejemplo es Essbase. Oracle.

Herramientas de abastecimiento, adquisición, limpieza y transformación (ETL)

Las herramientas de obtención, transformación y migración de datos realizan todas las conversiones, resúmenes y cambios necesarios para convertir los datos a un formato de almacén unificado. También se denominan ExtracHerramientas de transformación, carga y transferencia de datos (ETL).

Su funcionalidad incluye lo siguiente:

  • Anonimizar los datos según las estipulaciones reglamentarias.
  • Elimine los datos no deseados de las bases de datos operativas antes de cargarlos en el almacén de datos.
  • Busque y reemplace nombres y definiciones comunes para los datos que llegan de diferentes fuentes.
  • Calcular resúmenes y datos derivados.
  • Rellene los datos faltantes con valores predeterminados.
  • Eliminar los datos duplicados que llegan de múltiples fuentes.

Estos Herramientas ETL Puede generar tareas programadas (cron jobs), tareas en segundo plano, programas Cobol y scripts de shell que actualizan periódicamente el almacén de datos y ayudan a mantener los metadatos.

Debido a que se nutren de muchos sistemas, las herramientas ETL también deben hacer frente a la heterogeneidad de las bases de datos y de los datos.

metadatos

Los metadatos pueden sonar complejos, pero en realidad son simplemente datos sobre datos que definen el almacén de datos. Se utilizan para construir, mantener y gestionar dicho almacén.

Dentro de la arquitectura, los metadatos especifican el origen, el uso, los valores y las características de los datos, y definen cómo se pueden modificar y procesar, de modo que permanezcan estrechamente conectados al almacén de datos.

Por ejemplo, una línea en una base de datos de ventas puede contener:

4030 KJ732 299.90

Esto no tiene sentido hasta que los metadatos expliquen que representa un número de modelo 4030, un ID de agente de ventas KJ732 y un importe total de ventas de 299.90 dólares.

Por lo tanto, los metadatos son un ingrediente esencial para convertir los datos en conocimiento y ayudan a responder preguntas como:

  • ¿Qué tablas, atributos y claves contiene el almacén de datos?
  • ¿De dónde vinieron los datos?
  • ¿Cuántas veces se recargan los datos?
  • ¿Qué transformaciones y procesos de purificación se aplicaron?

Los metadatos se dividen en dos categorías:

  1. Metadatos técnicos: Esto describe el entorno de trabajo para los diseñadores y administradores que lo construyen y lo gestionan.
  2. Metadatos comerciales: Esto ofrece a los usuarios finales una forma sencilla de comprender la información almacenada en el almacén de datos.

Herramientas de consulta

Uno de los objetivos principales del almacenamiento de datos es proporcionar a las empresas la información que necesitan para tomar decisiones estratégicas, y las herramientas de consulta son la forma en que los usuarios interactúan con el sistema.

Estas herramientas se dividen en cuatro categorías:

  1. Herramientas de consulta y reporte.
  2. Herramientas de desarrollo de aplicaciones
  3. herramientas de minería de datos
  4. Herramientas OLAP

Herramientas de consulta y generación de informes

Las herramientas de consulta e informes se dividen en dos grupos: herramientas de informes y herramientas de consulta gestionadas.

Herramientas de informes Se dividen además en herramientas de generación de informes de producción y generadores de informes de escritorio:

  1. Autores del informe: Están diseñados para usuarios finales que elaboran sus propios análisis.
  2. Informes de producción: Estos permiten a las organizaciones generar informes operativos regulares y admitir trabajos por lotes de alto volumen, como impresión y cálculo. Algunos ejemplos populares incluyen Brio, Business Objects, Oracle, PowerSoft y SAS Institute.

Herramientas de consulta administradas Ayudamos a los usuarios finales insertando una metacapa entre el usuario y la base de datos, que oculta la complejidad de SQL y la estructura de la base de datos.

Herramientas de desarrollo de aplicaciones

Cuando las herramientas gráficas y analíticas integradas no pueden satisfacer las necesidades analíticas de una organización, se crean informes personalizados con herramientas de desarrollo de aplicaciones.

Herramientas de minería de datos

La minería de datos descubre nuevas correlaciones, patrones y tendencias significativas dentro de grandes volúmenes de datos, y las herramientas de minería de datos automatizan ese descubrimiento.

Herramientas OLAP

OLAP Las herramientas se basan en una base de datos multidimensional y permiten a los usuarios analizar los datos mediante vistas multidimensionales elaboradas.

Almacén de datos Bus Architectura

El bus del almacén de datos determina cómo fluyen los datos a través del almacén. Ese flujo se puede clasificar como entrada, subida, bajada, salida y metaflujo.

Al diseñar el bus, debe tener en cuenta las dimensiones y los hechos compartidos que abarcan los almacenes de datos.

Data marts

A data mart Es una capa de acceso que se utiliza para entregar datos a los usuarios. Es adecuada para grandes almacenes de datos porque su construcción requiere menos tiempo y dinero, aunque no existe una definición única y consensuada de un data mart.

En términos sencillos, un data mart es una filial de un almacén de datos. Particiona los datos para un grupo específico de usuarios y puede residir en la misma base de datos que el almacén o en una base de datos físicamente separada.

Almacenamiento de Datos Architecture Mejores Prácticas

Para diseñar una arquitectura de almacén de datos sólida, siga las siguientes mejores prácticas:

  • Utilice modelos de almacén de datos que estén optimizados para la recuperación de información, ya sea un dimensional, enfoque desnormalizado o híbrido.
  • Elija un enfoque de diseño apropiado, ya sea de arriba hacia abajo o de abajo hacia arriba.
  • Asegúrese de que los datos se procesen de forma rápida y precisa, consolidándolos en una única versión fidedigna.
  • Diseñe cuidadosamente el proceso de adquisición y limpieza de datos para el almacén de datos.
  • Diseñar una arquitectura de metadatos que permita compartir metadatos entre los componentes del almacén de datos.
  • Considera un Operamodelo de Almacén de Datos Orgánico (ODS) cuando las necesidades de recuperación están cerca de la parte inferior del resumen de datos.tracpirámide de ción o cuando se debe acceder a múltiples fuentes operativas.
  • Asegúrese de que el modelo de datos esté integrado en lugar de simplemente consolidado; en ese caso, utilice un modelo de datos 3NF, que también es ideal al adquirir herramientas ETL y de limpieza de datos.

Preguntas Frecuentes

Una base de datos operativa gestiona inserciones, actualizaciones y eliminaciones frecuentes mediante tablas normalizadas para el procesamiento de transacciones. Un almacén de datos es de solo lectura y no volátil, almacena datos históricos en estructuras desnormalizadas y está optimizado para consultas, informes y análisis, en lugar de para las operaciones diarias.

Un almacén de datos es un repositorio empresarial que contiene datos integrados de muchas fuentes. data mart Es un subconjunto más pequeño centrado en un departamento o tema específico, como ventas o finanzas, lo que hace que su creación sea más rápida y económica, y que las consultas sean más sencillas.

Ambos son diseños dimensionales. Un esquema en estrella coloca una tabla de hechos central vinculada directamente a tablas de dimensiones desnormalizadas, con forma de estrella. Un esquema en copo de nieve normaliza esas dimensiones en subtablas relacionadas. Véase modelado dimensional sobre cómo se organizan los hechos y las dimensiones.

Un almacén de datos en la nube es una base de datos analítica administrada y alojada por un proveedor, como por ejemplo: Amazon corrimiento al rojo, Google BigQuery o Snowflake. Escala el almacenamiento y la capacidad de procesamiento bajo demanda, reduce el mantenimiento del hardware y admite la misma arquitectura por niveles y los mismos flujos de trabajo ETL que los almacenes de datos locales.

Una única versión de la verdad implica que cada usuario e informe se basa en un conjunto de datos coherente e integrado. Al consolidar y estandarizar valores de diferentes fuentes, un almacén de datos elimina las cifras contradictorias, de modo que las decisiones se fundamentan en datos fiables.

ETL extracts datos, los transforma en un área de preparación y luego los carga en el almacén. ELT carga primero los datos sin procesar y los transforma dentro del almacén utilizando su capacidad de procesamiento. Obtenga más información en el Proceso ETL explicación.

Las herramientas de IA y aprendizaje automático sugieren diseños de esquemas y automatizan el mapeo ETL.pingDetectan anomalías en la calidad de los datos y recomiendan índices o particiones que aceleren las consultas. También pueden predecir el crecimiento del almacenamiento. Un ingeniero debe revisar cada recomendación antes de aplicarla a un almacén de datos en producción.

Sí. ChatGPT puede elaborar SQL, modelos dimensionales y lógica ETL a partir de una descripción, mientras que Copiloto de GitHub Completa automáticamente los scripts de transformación en tu editor. Valida siempre los esquemas y consultas generados, ya que la IA puede hacer referencia a sintaxis o valores predeterminados obsoletos.

Resumir este post con: