Almacenamiento de Datos ArchiTecnología, componentes y diagrama. Concepts
⚡ Resumen inteligente
Almacenamiento de Datos ArchiLa arquitectura define cómo se organizan los datos históricos y acumulativos de múltiples fuentes en capas escalonadas y componentes conectados, lo que permite generar informes fiables, realizar análisis y disponer de una única versión veraz para la toma de decisiones y la previsión en la organización.

Almacenamiento de Datos Concepts
A almacenamiento de datos Su propósito es brindar a la empresa una única versión de la verdad para la toma de decisiones y la previsión. Se trata de un sistema de información que almacena datos históricos y acumulativos provenientes de una o varias fuentes.
Al organizar esos datos para su análisis en lugar de para transacciones, un almacén de datos simplifica el trabajo de elaboración de informes y análisis de toda una organización.
Características del almacén de datos
Un almacén de datos tiene cuatro características definitorias que lo distinguen de una base de datos operativa rutinaria:
- Orientado al sujeto
- Incluye un
- Variante de tiempo
- No volátil
Orientado al sujeto
Un almacén de datos está orientado a temas específicos porque proporciona información sobre un tema en particular, en lugar de sobre las operaciones habituales de una empresa. Los temas típicos incluyen ventas, marketing y distribución.
En lugar de centrarse en el procesamiento diario, el almacén de datos prioriza el modelado y el análisis para la toma de decisiones. Ofrece una visión simple y concisa de cada tema y omite los datos que no contribuyen al proceso de decisión.
Incluye un
La integración está estrechamente ligada a la orientación temática. En un almacén de datos, la integración implica establecer una unidad de medida común para todos los datos similares procedentes de bases de datos distintas, y almacenar esos datos de forma común y universalmente aceptable.
Un almacén de datos se construye integrando información de diversas fuentes, como un sistema central, bases de datos relacionales y archivos planos. Además, debe mantener convenciones de nomenclatura, formatos y codificación consistentes.
Esta coherencia en la nomenclatura, las medidas de los atributos y la estructura de codificación es lo que hace posible un análisis eficaz. Considere el siguiente ejemplo:
En el ejemplo anterior, tres aplicaciones denominadas A, B y C almacenan información sobre género, fecha y saldo, pero cada una la almacena de una manera diferente:
- La aplicación A almacena el campo de género como valores lógicos como M o F.
- La aplicación B almacena el campo de género como un valor numérico.
- La aplicación C almacena el campo de género como un valor de carácter.
- La misma variación se aplica a los campos Fecha y Saldo.
Tras el proceso de transformación y limpieza, todos estos datos se almacenan en un formato común dentro del almacén de datos.
Variante de tiempo
El horizonte temporal de un almacén de datos es mucho más amplio que el de un sistema operativo. Los datos se identifican con un período específico y ofrecen una perspectiva histórica, por lo que siempre conllevan un elemento temporal, ya sea de forma explícita o implícita.
Un ejemplo de esta variación temporal se observa en la estructura de la clave de registro. Cada clave primaria del almacén de datos debe contener un elemento temporal, como el día, la semana o el mes.
Otro aspecto de la variación temporal es que, una vez que los datos se insertan en el almacén de datos, no se pueden actualizar ni modificar.
No volátil
Un almacén de datos es no volátil, lo que significa que los datos anteriores no se borran cuando llegan datos nuevos. Los datos son de solo lectura y se actualizan periódicamente, lo que ayuda a los analistas a estudiar datos históricos y comprender qué sucedió y cuándo.
Debido a que no necesita procesamiento de transacciones, recuperación ni control de concurrencia, un almacén de datos omite las actividades de eliminación, actualización e inserción comunes en una aplicación operativa. En el almacenamiento de datos solo se realizan dos operaciones de datos:
- Carga de datos
- Acceso a los datos
La siguiente tabla destaca algunas de las principales diferencias entre una aplicación operativa y un almacén de datos:
| OperaAplicación opcional | Almacenamiento de Datos |
|---|---|
| Se debe codificar un programa complejo para garantizar que los procesos de actualización de datos mantengan la alta integridad del producto final. | Este tipo de problema no ocurre porque no se realiza ninguna actualización de datos. |
| Los datos se colocan en un formato normalizado para garantizar una redundancia mínima. | Los datos no se almacenan en forma normalizada. |
| La tecnología necesaria para dar soporte a cuestiones relacionadas con transacciones, recuperación de datos, reversión y resolución de interbloqueos es bastante compleja. | Ofrece relativa simplicidad en tecnología. |
Almacenamiento de Datos Architectura
Almacenamiento de Datos ArchiLa arquitectura es compleja porque el sistema almacena datos históricos y acumulativos de múltiples fuentes. Existen tres enfoques para la construcción de las capas del almacén de datos: de una, dos y tres capas.
Arquitectura de un solo nivel Su objetivo es minimizar la cantidad de datos almacenados eliminando la redundancia. En la práctica, rara vez se utiliza.
Arquitectura de dos niveles Separa las fuentes físicamente disponibles del almacén de datos. No es fácilmente ampliable, admite menos usuarios finales y puede presentar problemas de conectividad debido a limitaciones de red.
Arquitectura de tres niveles Es el diseño de almacén de datos más utilizado.
Consta de tres niveles: superior, medio e inferior:
- Nivel inferior: La base de datos del almacén de datos constituye la capa inferior. Generalmente se trata de un sistema de base de datos relacional, y los datos se limpian, transforman y cargan en esta capa mediante herramientas de back-end.
- Nivel medio: La capa intermedia es un servidor OLAP implementado utilizando el modelo ROLAP o MOLAP. Presenta una abstracofrece una visión integral de la base de datos y actúa como mediador entre el usuario final y la base de datos.
- Nivel superior: La capa superior es la capa de cliente frontal. Contiene las herramientas y las API que se utilizan para conectarse y extraer datos del almacén, como herramientas de consulta, herramientas de generación de informes, herramientas de consulta administrada, herramientas de análisis y herramientas de minería de datos.
Componentes del almacén de datos
Los componentes y la arquitectura general de un almacén de datos funcionan conjuntamente como se muestra en el siguiente diagrama.
El almacén de datos se basa en un servidor RDBMS, un repositorio central de información rodeado de componentes clave que mantienen todo el entorno funcional, gestionable y accesible.
Un almacén de datos tiene cinco componentes principales, que se describen a continuación.
Base de datos de almacenamiento de datos
La base de datos central es la base del entorno de almacenamiento y se implementa en RDBMS tecnología. Debido a que un RDBMS tradicional está optimizado para el procesamiento de transacciones en lugar del almacenamiento de datos, las operaciones que consumen muchos recursos, como las consultas ad hoc, las uniones de varias tablas y las agregaciones, pueden ralentizarlo.
Por ese motivo, se utilizan enfoques alternativos de bases de datos:
- Las bases de datos relacionales se implementan en paralelo para permitir la escalabilidad, utilizando modelos de memoria compartida o de arquitectura sin recursos compartidos en diversas configuraciones multiprocesador o de procesamiento masivamente paralelo.
- Se utilizan nuevas estructuras de índice para evitar los escaneos de tablas relacionales y mejorar la velocidad.
- Las bases de datos multidimensionales (MDDB) se utilizan para superar las limitaciones de los modelos de almacenes relacionales. Un ejemplo es Essbase. Oracle.
Herramientas de abastecimiento, adquisición, limpieza y transformación (ETL)
Las herramientas de obtención, transformación y migración de datos realizan todas las conversiones, resúmenes y cambios necesarios para convertir los datos a un formato de almacén unificado. También se denominan ExtracHerramientas de transformación, carga y transferencia de datos (ETL).
Su funcionalidad incluye lo siguiente:
- Anonimizar los datos según las estipulaciones reglamentarias.
- Elimine los datos no deseados de las bases de datos operativas antes de cargarlos en el almacén de datos.
- Busque y reemplace nombres y definiciones comunes para los datos que llegan de diferentes fuentes.
- Calcular resúmenes y datos derivados.
- Rellene los datos faltantes con valores predeterminados.
- Eliminar los datos duplicados que llegan de múltiples fuentes.
Estos Herramientas ETL Puede generar tareas programadas (cron jobs), tareas en segundo plano, programas Cobol y scripts de shell que actualizan periódicamente el almacén de datos y ayudan a mantener los metadatos.
Debido a que se nutren de muchos sistemas, las herramientas ETL también deben hacer frente a la heterogeneidad de las bases de datos y de los datos.
metadatos
Los metadatos pueden sonar complejos, pero en realidad son simplemente datos sobre datos que definen el almacén de datos. Se utilizan para construir, mantener y gestionar dicho almacén.
Dentro de la arquitectura, los metadatos especifican el origen, el uso, los valores y las características de los datos, y definen cómo se pueden modificar y procesar, de modo que permanezcan estrechamente conectados al almacén de datos.
Por ejemplo, una línea en una base de datos de ventas puede contener:
4030 KJ732 299.90
Esto no tiene sentido hasta que los metadatos expliquen que representa un número de modelo 4030, un ID de agente de ventas KJ732 y un importe total de ventas de 299.90 dólares.
Por lo tanto, los metadatos son un ingrediente esencial para convertir los datos en conocimiento y ayudan a responder preguntas como:
- ¿Qué tablas, atributos y claves contiene el almacén de datos?
- ¿De dónde vinieron los datos?
- ¿Cuántas veces se recargan los datos?
- ¿Qué transformaciones y procesos de purificación se aplicaron?
Los metadatos se dividen en dos categorías:
- Metadatos técnicos: Esto describe el entorno de trabajo para los diseñadores y administradores que lo construyen y lo gestionan.
- Metadatos comerciales: Esto ofrece a los usuarios finales una forma sencilla de comprender la información almacenada en el almacén de datos.
Herramientas de consulta
Uno de los objetivos principales del almacenamiento de datos es proporcionar a las empresas la información que necesitan para tomar decisiones estratégicas, y las herramientas de consulta son la forma en que los usuarios interactúan con el sistema.
Estas herramientas se dividen en cuatro categorías:
- Herramientas de consulta y reporte.
- Herramientas de desarrollo de aplicaciones
- herramientas de minería de datos
- Herramientas OLAP
Herramientas de consulta y generación de informes
Las herramientas de consulta e informes se dividen en dos grupos: herramientas de informes y herramientas de consulta gestionadas.
Herramientas de informes Se dividen además en herramientas de generación de informes de producción y generadores de informes de escritorio:
- Autores del informe: Están diseñados para usuarios finales que elaboran sus propios análisis.
- Informes de producción: Estos permiten a las organizaciones generar informes operativos regulares y admitir trabajos por lotes de alto volumen, como impresión y cálculo. Algunos ejemplos populares incluyen Brio, Business Objects, Oracle, PowerSoft y SAS Institute.
Herramientas de consulta administradas Ayudamos a los usuarios finales insertando una metacapa entre el usuario y la base de datos, que oculta la complejidad de SQL y la estructura de la base de datos.
Herramientas de desarrollo de aplicaciones
Cuando las herramientas gráficas y analíticas integradas no pueden satisfacer las necesidades analíticas de una organización, se crean informes personalizados con herramientas de desarrollo de aplicaciones.
Herramientas de minería de datos
La minería de datos descubre nuevas correlaciones, patrones y tendencias significativas dentro de grandes volúmenes de datos, y las herramientas de minería de datos automatizan ese descubrimiento.
Herramientas OLAP
OLAP Las herramientas se basan en una base de datos multidimensional y permiten a los usuarios analizar los datos mediante vistas multidimensionales elaboradas.
Almacén de datos Bus Architectura
El bus del almacén de datos determina cómo fluyen los datos a través del almacén. Ese flujo se puede clasificar como entrada, subida, bajada, salida y metaflujo.
Al diseñar el bus, debe tener en cuenta las dimensiones y los hechos compartidos que abarcan los almacenes de datos.
Data marts
A data mart Es una capa de acceso que se utiliza para entregar datos a los usuarios. Es adecuada para grandes almacenes de datos porque su construcción requiere menos tiempo y dinero, aunque no existe una definición única y consensuada de un data mart.
En términos sencillos, un data mart es una filial de un almacén de datos. Particiona los datos para un grupo específico de usuarios y puede residir en la misma base de datos que el almacén o en una base de datos físicamente separada.
Almacenamiento de Datos Architecture Mejores Prácticas
Para diseñar una arquitectura de almacén de datos sólida, siga las siguientes mejores prácticas:
- Utilice modelos de almacén de datos que estén optimizados para la recuperación de información, ya sea un dimensional, enfoque desnormalizado o híbrido.
- Elija un enfoque de diseño apropiado, ya sea de arriba hacia abajo o de abajo hacia arriba.
- Asegúrese de que los datos se procesen de forma rápida y precisa, consolidándolos en una única versión fidedigna.
- Diseñe cuidadosamente el proceso de adquisición y limpieza de datos para el almacén de datos.
- Diseñar una arquitectura de metadatos que permita compartir metadatos entre los componentes del almacén de datos.
- Considera un Operamodelo de Almacén de Datos Orgánico (ODS) cuando las necesidades de recuperación están cerca de la parte inferior del resumen de datos.tracpirámide de ción o cuando se debe acceder a múltiples fuentes operativas.
- Asegúrese de que el modelo de datos esté integrado en lugar de simplemente consolidado; en ese caso, utilice un modelo de datos 3NF, que también es ideal al adquirir herramientas ETL y de limpieza de datos.


