¿Qué es el modelado dimensional en el almacén de datos? Tipos de aprendizaje

⚡ Resumen inteligente

El modelo dimensional en el diseño de almacenes de datos organiza la información en tablas de hechos y dimensiones para que los analistas puedan recuperar y resumir rápidamente las medidas numéricas, siguiendo el método Kimball de cinco pasos que identifica el proceso de negocio, la granularidad, las dimensiones, los hechos y el esquema final.

  • 🎯 Propósito principal: Un modelo dimensional optimiza un almacén de datos para lecturas e informes rápidos, a diferencia de los modelos relacionales diseñados para transacciones en tiempo real.
  • 🧱 Bloques de construcción: Los hechos contienen medidas numéricas, mientras que las dimensiones y sus atributos proporcionan el contexto de quién, qué y dónde en torno a cada hecho.
  • 🔑 Tablas de hechos y dimensiones: Una tabla de hechos almacena medidas y claves foráneas; las tablas de dimensiones desnormalizadas almacenan atributos descriptivos y jerarquías.
  • 🪜 Método de cinco pasos: Identifique el proceso de negocio, defina el nivel de detalle, elija las dimensiones, elija los hechos y, a continuación, construya el esquema.
  • Elección de esquema: Los esquemas de estrella mantienen las dimensiones desnormalizadas para mayor velocidad, mientras que los esquemas de copo de nieve las normalizan para ahorrar espacio de almacenamiento.
  • 🚀 Beneficio clave: Las dimensiones estandarizadas y fáciles de usar para las empresas mejoran el rendimiento de las consultas y permiten agregar nuevas dimensiones con mínimas interrupciones.

Modelo dimensional en un almacén de datos que muestra tablas de hechos y dimensiones.

¿Qué es el Modelado Dimensional?

Modelado dimensional (DM) Es una técnica de estructura de datos optimizada para el almacenamiento de datos en un almacén de datos. Su propósito es optimizar la base de datos para una recuperación de datos más rápida. El concepto fue desarrollado por Ralph Kimball y se basa en dos tipos de tablas: tablas de hechos y tablas de dimensiones.

En un almacén de datos, un modelo dimensional está diseñado para leer, resumir y analizar información numérica como valores, saldos, recuentos y pesos. Los modelos relacionales, por el contrario, están optimizados para agregar, actualizar y eliminar datos en un sistema de procesamiento de transacciones en línea en tiempo real.

Cada uno de estos enfoques almacena los datos a su manera, y cada uno ofrece ventajas distintas.

En un modelo relacional, la normalización y los modelos ER reducen la redundancia de datos. Un modelo dimensional, en cambio, organiza los datos de manera que la información sea más fácil de recuperar y los informes más fáciles de generar.

Por esta razón, los modelos dimensionales son adecuados almacenamiento de datos sistemas en lugar de sistemas relacionales con gran cantidad de transacciones. Porque el modelo sustenta el modelo más amplio. arquitectura del almacén de datosLas secciones siguientes desglosan sus elementos, tipos y pasos de diseño.

Elementos del modelo de datos dimensionales

Hecho

Los hechos son las mediciones o métricas extraídas de un proceso empresarial. En un proceso de ventas, por ejemplo, la cifra de ventas trimestrales es un hecho: el valor numérico que la empresa desea analizar.

Dimensión

Una dimensión proporciona el contexto que rodea un evento de un proceso de negocio. En términos sencillos, las dimensiones proporcionan el quién, el qué y el dónde de un hecho. Para el hecho "cifra de ventas trimestrales", las dimensiones serían:

  • Quién – Nombres de los clientes
  • Dónde – Ubicación
  • Qué – Nombre del producto

En otras palabras, una dimensión es una ventana a través de la cual se puede ver la información contenida en los hechos.

Atributos

Los atributos son las diversas características de una dimensión dentro de un modelo de datos dimensional.

En una dimensión de ubicación, los atributos pueden ser:

  • Estado
  • País
  • Código postal

Los atributos se utilizan para buscar, filtrar y clasificar datos, y las tablas de dimensiones son donde residen esos atributos.

Tabla de hechos

Una tabla de hechos es la tabla principal en un modelo dimensional.

Una tabla de hechos contiene:

  1. Medidas o hechos
  2. Claves foráneas a tablas de dimensiones

Tabla de dimensiones

Una tabla de dimensiones almacena las dimensiones de un hecho y se une a la tabla de hechos mediante una clave externa. Sus principales características se enumeran a continuación:

  • Las tablas de dimensiones son tablas desnormalizadas.
  • Los atributos de dimensión forman las columnas de la tabla.
  • Las dimensiones ofrecen características descriptivas de los hechos a través de sus atributos.
  • No existe un límite fijo en el número de dimensiones.
  • Una dimensión puede contener una o más relaciones jerárquicas.

Tipos de dimensiones en el almacén de datos

El modelado dimensional utiliza varios tipos de dimensiones, cada una adecuada a una necesidad de diseño particular. La principal tipos de dimensiones en un almacén de datos son:

  • Dimensión conformada
  • Dimensión del estabilizador
  • Dimensión reducida
  • Dimensión de juego de roles
  • Tabla de dimensión a dimensión
  • Dimensión basura
  • Dimensión degenerada
  • Dimensión intercambiable
  • Dimensión de paso

Pasos del modelado dimensional

La precisión de su modelado dimensional determina el éxito de la implementación del almacén de datos. Hay cinco pasos para construir un modelo dimensional:

  1. Identificar el proceso de negocio.
  2. Identificar el grano (nivel de detalle)
  3. Identificar las dimensiones
  4. Identifica los hechos
  5. Construir el esquema

En resumen, el modelo final debe describir el por qué, cuánto, cuándo, dónde, quién y qué de su proceso empresarial.

Los cinco pasos del modelado dimensional en un almacén de datos

Paso 1) Identificar el proceso de negocio

La primera tarea es identificar el proceso de negocio que debe cubrir el almacén (marketing, ventas, recursos humanos, etc.) en función de la organización. análisis de los datos necesidades y la calidad de los datos disponibles. Este es el paso más importante, porque un error aquí produce defectos en cascada difíciles de corregir.

Para describir el proceso de negocio, puede utilizar texto plano, la Notación de Modelado de Procesos de Negocio (BPMN) o el Lenguaje Unificado de Modelado (UML).

Paso 2) Identificar el grano

El nivel de detalle (grano) define el nivel de información del problema empresarial: el nivel más bajo de información almacenada en cualquier tabla.

Si una tabla almacena las ventas de cada día, tiene granularidad diaria; si almacena los totales mensuales, tiene granularidad mensual.

Durante esta etapa, usted responde preguntas como:

  1. ¿Debe el almacén guardar todos los productos disponibles o solo algunos tipos de productos? Esto depende de los procesos comerciales seleccionados.
  2. ¿Deben almacenarse las ventas de productos mensualmente, semanalmente, diariamente o por hora? Esto depende de los informes que soliciten los ejecutivos.
  3. ¿Cómo afectan estas dos opciones al tamaño de la base de datos?

Ejemplo de grano: Imagina que el director general de una empresa multinacional quiere ver las ventas de productos específicos en diferentes ubicaciones, medidas cada día.

En ese caso, el grano se convierte en "información sobre las ventas del producto por ubicación y por día".

Paso 3) Identificar las dimensiones

Las dimensiones son sustantivos como fecha, tienda e inventario, y contienen los datos descriptivos.

Por ejemplo, una dimensión de fecha puede contener un año, un mes y un día de la semana.

Ejemplo de dimensiones: El mismo requisito de ventas diarias determina la elección de las dimensiones.

Para este escenario, las dimensiones son Producto, Ubicación y Tiempo.

La dimensión Producto contiene atributos como la clave de producto (una clave externa), el nombre, el tipo y las especificaciones.

La dimensión Ubicación está organizada jerárquicamente: país, estado, ciudad, dirección postal y nombre.

Paso 4) Identificar los hechos

Este paso está estrechamente vinculado a los usuarios de negocio del sistema, ya que define las cifras que consumen del almacén de datos.

La mayoría de las filas de la tabla de hechos contienen valores numéricos, como el precio o el coste por unidad.

Ejemplo de hechos: El requisito de ventas diarias vuelve a establecer el contexto.

En este caso, el dato relevante es la suma de las ventas por producto, por ubicación y por tiempo.

Paso 5) Construir esquema

En este último paso, se implementa el modelo dimensional. Un esquema es simplemente la estructura de la base de datos (la disposición de las tablas), y es especialmente común utilizar dos esquemas.

El primero es el esquema de estrella, que es fácil de diseñar y recibe su nombre por su forma: una tabla de hechos central con tablas de dimensiones que irradian hacia afuera como las puntas de una estrella.

En un esquema de estrella, la tabla de hechos está en tercera forma normal, mientras que las tablas de dimensiones están desnormalizadas; Esquema en estrella en el modelado de almacenes de datos La guía explica el resultado a través de un ejemplo completo.

El segundo es el esquema de copo de nieve, una extensión del esquema de estrella en el que cada dimensión se normaliza y se vincula a tablas de dimensiones adicionales, como se explica en este documento. Esquema de copo de nieve en el modelo de almacén de datos guía.

Reglas para el modelado dimensional

Las siguientes reglas y principios guían la modelización dimensional eficaz:

  • Cargar datos atómicos en las estructuras dimensionales.
  • Construya modelos dimensionales en torno a procesos de negocio.
  • Asegúrese de que cada tabla de hechos tenga asociada una tabla de dimensiones de fecha.
  • Mantenga todos los datos en una única tabla de datos con el mismo nivel de detalle.
  • Almacene las etiquetas de los informes y los valores de los dominios de filtro en las tablas de dimensiones.
  • Asigne una clave subrogada a cada tabla de dimensiones.
  • Equilibrar continuamente los requisitos con la realidad para ofrecer una solución que respalde la toma de decisiones empresariales.

Beneficios del modelado dimensional

El modelado dimensional ofrece una serie de beneficios prácticos:

  • Las dimensiones estandarizadas permiten generar informes de forma sencilla y coherente en todas las áreas de la empresa.
  • Las tablas de dimensiones almacenan el historial de la información dimensional.
  • Se pueden introducir nuevas dimensiones sin alterar significativamente la tabla de hechos.
  • Los datos se almacenan de forma que, una vez en la base de datos, resulte más fácil recuperarlos.
  • En comparación con el modelo normalizado, las tablas dimensionales son más fáciles de entender porque la información se agrupa en categorías comerciales claras.
  • El modelo se basa en términos empresariales, por lo que la empresa sabe qué significa cada dato, dimensión o atributo.
  • Debido a que el modelo está desnormalizado, está optimizado para realizar consultas rápidas, y muchas plataformas relacionales optimizan sus planes de ejecución para él.
  • Este esquema ofrece un alto rendimiento con menos uniones y una redundancia de datos minimizada.
  • Los modelos dimensionales se adaptan fácilmente a los cambios, ya que se pueden agregar columnas a las tablas de dimensiones sin afectar las aplicaciones de inteligencia empresarial existentes.

¿Qué es el modelo de datos multidimensional en el almacén de datos?

A modelo de datos multidimensional representa los datos como cubos de datos, lo que le permite modelar y visualizar datos a través de varias dimensiones definidas por dimensiones y hechos. Este modelo generalmente se organiza en torno a un tema central y se representa mediante una tabla de hechos, y constituye la base de OLAP análisis.

Preguntas Frecuentes

Una tabla de hechos almacena medidas numéricas de un proceso de negocio junto con claves foráneas a dimensiones. Una tabla de dimensiones almacena atributos descriptivos y desnormalizados, como producto, ubicación o fecha, que proporcionan a esas medidas el contexto necesario para filtrar y agrupar.ping.

Los datos pueden ser aditivos, semiaditivos o no aditivos. Los datos aditivos, como el importe de las ventas, se suman en todas las dimensiones. Los datos semiaditivos, como los saldos de las cuentas, se suman en algunas dimensiones, pero no en el tiempo. Los datos no aditivos, como las razones o los porcentajes, no se pueden sumar de forma significativa.

A esquema de estrella Un esquema de copo de nieve normaliza cada dimensión en una tabla desnormalizada, lo que simplifica las uniones y acelera las consultas. Un esquema de copo de nieve normaliza las dimensiones en subtablas relacionadas, ahorrando espacio de almacenamiento pero aumentando la complejidad y las uniones. Los esquemas de estrella son la opción analítica más común.

Una clave subrogada es un entero generado por el sistema que se utiliza como clave primaria de una dimensión en lugar de una clave de negocio natural. Mantiene el almacén independiente de los cambios del sistema de origen, acelera las uniones y permite track cambios históricos dentro de una dimensión.

Una dimensión de cambio lento es aquella cuyos valores de atributo cambian con el tiempo, como la dirección de un cliente. Las estrategias comunes consisten en sobrescribir el valor anterior (Tipo 1), agregar una nueva fila para conservar el historial (Tipo 2) o almacenar el valor anterior en una columna separada (Tipo 3).

El modelo dimensional de Ralph Kimball construye el almacén de datos de abajo hacia arriba a partir de almacenes de datos con esquema de estrella optimizados para la generación de informes. Bill El enfoque de Inmon consiste en construir primero un almacén de datos empresarial normalizado de arriba hacia abajo, para luego derivar los almacenes de datos. Kimball ofrece una entrega más rápida, mientras que Inmon hace hincapié en la coherencia en toda la empresa.

Las herramientas de IA pueden perfilar los datos de origen, sugerir hechos y dimensiones potenciales, recomendar el nivel de detalle y señalar atributos redundantes. Agilizan el diseño y la documentación, pero un ingeniero de datos debe validar cada hecho, dimensión y jerarquía antes de que el modelo llegue a producción.

Sí. ChatGPT pueden elaborar diseños de esquemas en estrella y explicar las ventajas y desventajas, mientras que Copiloto de GitHub Autocompleta SQL para tablas de hechos y dimensiones. RevRevise su salida para verificar que el grano, las claves y las uniones sean correctas antes de ejecutarlo.

Resumir este post con: