데이터 웨어하우스의 데이터 마트란 무엇입니까? 유형 및 예

⚡ 스마트 요약

데이터 마트 설계는 세 가지 데이터 마트 유형, 설계부터 관리까지의 다섯 단계, 그리고 신속하고 안전하며 비용 효율적인 제공을 위한 모범 사례를 아우르며, 데이터 웨어하우스 정보의 핵심 하위 집합을 특정 부서에 제공합니다.

  • 🎯 정의: 데이터 마트는 데이터 웨어하우스의 주제 중심적인 하위 집합으로, 영업, 마케팅, 인사 또는 재무와 같은 특정 부서를 위해 구축됩니다.
  • 🧩 마트 유형: 종속형 마트는 중앙 창고에서 제품을 공급받고, 독립형 마트는 운영 시스템에서 직접 제품을 가져오며, 하이브리드 마트는 이 두 가지 방식을 모두 결합합니다.
  • ⚙️ 구현 단계: 데이터 마트 구축은 설계, 구성, 데이터 입력, 접근 및 관리의 단계를 거칩니다.
  • 🔌 ETL 및 RDBMS: RDBMS는 마트를 저장하고 ETL 도구는 매핑합니다. 예를 들어tracts는 소스 데이터와 메타데이터를 변환, 정제 및 로드합니다.
  • 📊 차원 디자인: 스타 스키마를 기반으로 데이터를 모델링하면 쿼리 속도가 향상되고 비즈니스 사용자를 위한 보고서 작성이 간소화됩니다.
  • 💡 비즈니스 영향: 규모가 작다는 것은 대규모 창고보다 더 빠른 조회, 더 낮은 비용, 더 엄격한 접근 제어 및 더 빠른 배송을 의미합니다.
  • 🧭 최고의 연습: 납기 주기를 몇 주 이내로 유지하고, 하드웨어 및 네트워크 예산을 책정하며, 모든 이해관계자를 초기 단계부터 참여시키십시오.

데이터 웨어하우스의 데이터 마트, 종속 데이터 마트, 독립 데이터 마트 및 하이브리드 데이터 마트를 보여줍니다.

데이터 마트는 분석 기능을 제공합니다. 데이터웨어 하우스 데이터 마트는 단일 팀에 집중할 수 있도록 설계되었습니다. 특정 주제 영역에 집중함으로써, 부서는 전사적인 업무량에 쫓기지 않고 자체 데이터를 신속하게 분석할 수 있습니다. 아래 섹션에서는 데이터 마트란 무엇인지, 조직에서 데이터 마트를 사용하는 이유, 세 가지 유형, 그리고 데이터 마트를 구현하고 관리하는 방법을 설명합니다.

데이터마트란?

데이터 마트는 조직의 특정 기능 영역에 초점을 맞추고 있으며, 전체 시스템에 저장된 데이터의 일부를 포함합니다. 데이터웨어 하우스이는 특정 부서, 단위 또는 사용자 그룹(예: 마케팅, 영업, 인사 또는 재무)에서 사용하도록 설계된 데이터 웨어하우스의 축소 버전입니다.

데이터 마트는 단일 기능만을 수행하기 때문에 일반적으로 조직 내 단일 부서에서 관리합니다. 이러한 집중 덕분에 데이터 마트의 범위는 좁아지고 소유권은 명확해집니다.

데이터 마트는 여러 소스를 통합하는 데이터 웨어하우스와 달리 소수의 소스에서만 데이터를 가져옵니다. 결과적으로 데이터 마트는 규모가 작고 완전한 데이터 웨어하우스보다 훨씬 유연합니다.

왜 데이터 마트가 필요한가요?

조직이 데이터 마트를 활용하는 데에는 여러 가지 실질적인 이유가 있습니다.

  • 데이터 마트는 사용자가 조회하는 데이터 양을 줄여 응답 시간을 향상시킵니다.
  • 자주 요청되는 데이터에 쉽게 액세스할 수 있습니다.
  • 데이터 마트는 기업 데이터 웨어하우스보다 구현이 더 간단하고 비용도 저렴합니다.
  • 민첩성이 뛰어납니다. 모델이 변경될 경우, 더 작은 데이터 마트를 신속하게 재구축할 수 있습니다.
  • 데이터 마트는 특정 분야의 전문가 한 명에 의해 정의되는 반면, 데이터 웨어하우스는 여러 분야의 전문가로 구성된 팀에 의해 정의되므로 데이터 마트는 변화에 더 개방적입니다.
  • 데이터는 분할되어 있어 매우 세분화된 접근 제어 권한이 가능합니다.
  • 데이터는 분할하여 서로 다른 하드웨어 또는 소프트웨어 플랫폼에 저장할 수 있습니다.

요약하자면, 데이터 마트는 규모가 작고 잘 정의된 데이터 조각을 처리하기 때문에 엔터프라이즈 데이터 웨어하우스보다 구축 속도가 빠르고 운영 비용이 저렴하며 보안도 더 용이합니다.

하지만 데이터 마트는 모두 같은 방식으로 구축되는 것은 아닙니다. 데이터 마트가 데이터를 가져오는 소스에 따라 세 가지 유형 중 어떤 유형인지 결정됩니다.

데이터 마트의 종류

데이터 마트는 데이터 소스에 따라 크게 세 가지 유형으로 구분됩니다.

  1. 매달린: 종속 데이터 마트는 운영 소스, 외부 소스 또는 둘 다에서 직접 데이터를 가져옵니다.
  2. 독립 : 중앙 데이터 웨어하우스 없이 독립적인 데이터 마트가 생성됩니다.
  3. 잡종: 하이브리드 데이터 마트는 데이터 웨어하우스 또는 운영 시스템에서 데이터를 가져올 수 있습니다.

종속 데이터 마트

종속 데이터 마트는 조직의 데이터를 단일 데이터 웨어하우스에서 가져오므로 중앙 집중화의 이점을 누릴 수 있습니다. 하나 이상의 물리적 데이터 마트를 구축해야 하는 경우, 이를 종속 데이터 마트로 구성하면 됩니다.

종속 데이터 마트는 두 가지 방식으로 구축할 수 있습니다. 하나는 사용자가 필요에 따라 데이터 마트와 데이터 웨어하우스 모두에 접근할 수 있도록 하는 방식이고, 다른 하나는 데이터 마트에만 접근이 제한되는 방식입니다. 두 번째 방식은 최적의 방법이 아닙니다. 공통된 소스에서 시작되었지만 결국 폐기되고 대부분 사용되지 않는 데이터, 즉 "데이터 쓰레기장"이 생성될 수 있기 때문입니다.

단일 데이터 웨어하우스에서 데이터를 가져오는 종속 데이터 마트
종속 데이터 마트

독립 데이터 마트

중앙 데이터 웨어하우스 없이 독립적인 데이터 마트를 구축합니다. 이러한 유형의 데이터 마트는 조직 내 소규모 그룹에 이상적인 옵션입니다.

독립형 데이터 마트는 엔터프라이즈 데이터 웨어하우스나 다른 어떤 데이터 마트와도 연관이 없습니다. 데이터는 자체적으로 로드되고 분석됩니다. 이러한 접근 방식은 애초에 데이터 웨어하우스를 구축한 주된 이유, 즉 다양한 이해관계를 가진 여러 사용자가 분석할 수 있는 일관되고 중앙 집중화된 엔터프라이즈 데이터 저장소라는 목적에 어긋납니다.

중앙 데이터 웨어하우스 없이 생성된 독립형 데이터 마트

독립 데이터 마트

하이브리드 데이터 마트

하이브리드 데이터 마트는 데이터 웨어하우스 외부 소스의 입력을 결합합니다. 이는 예를 들어 조직에 새로운 그룹이나 제품이 추가된 후와 같이 임시 통합이 필요할 때 유용합니다.

하이브리드 데이터 마트는 다중 데이터베이스 환경에 매우 적합하며, 최소한의 데이터 정제 작업으로 빠른 구현이 가능합니다. 또한 대규모 스토리지 구조를 지원하며, 데이터 중심의 소규모 애플리케이션에 적합합니다.

데이터 웨어하우스와 다른 소스를 결합한 하이브리드 데이터 마트

하이브리드 데이터 마트

데이터마트 구현 단계

데이터마트 구현의 5단계

데이터마트 구현 단계

데이터 마트 구축은 보람 있는 작업이지만, 세부적인 사항들이 많이 요구되는 과정입니다. 설계, 구축, 데이터 입력, 접근, 관리의 다섯 단계를 거치며, 각 단계는 아래에 설명되어 있습니다.

설계

설계는 데이터 마트 구현의 첫 번째 단계입니다. 데이터 마트에 대한 초기 요청부터 요구 사항 수집, 그리고 논리적 및 물리적 데이터 마트 설계에 이르기까지 모든 작업을 포함합니다.

설계 단계에는 다음과 같은 작업이 포함됩니다.

  • 비즈니스 및 기술 요구사항을 수집하고 데이터 소스를 파악합니다.
  • 적절한 데이터 하위 집합을 선택합니다.
  • 데이터 마트의 논리적, 물리적 구조를 설계합니다.

데이터는 다음과 같은 기준에 따라 분할할 수 있습니다.

  • 날짜
  • 사업부 또는 기능부
  • 지리학
  • 위의 조합

데이터는 애플리케이션 또는 DBMS 수준에서 파티셔닝할 수 있지만, 비즈니스 환경 변화에 따라 매년 다른 데이터 모델을 사용할 수 있으므로 애플리케이션 수준에서 파티셔닝하는 것이 좋습니다. 대부분의 데이터 마트는 DBMS를 기반으로 구축됩니다. 차원 모델쿼리 속도를 유지하기 위해 스타 스키마와 같은 구조를 사용합니다.

어떤 제품과 기술이 필요하신가요?

이 단계에서는 간단한 펜과 종이면 충분합니다. UML 다이어그램이나 엔티티-관계 다이어그램을 작성하는 데 도움이 되는 도구를 사용하면 논리적 및 물리적 설계에 메타데이터를 추가할 수도 있습니다.

구축

구축은 구현의 두 번째 단계입니다. 이 단계에서는 물리적 데이터베이스와 논리적 구조를 생성합니다.

이 단계에는 다음과 같은 작업이 포함됩니다.

  • 이전 단계에서 설계한 물리적 데이터베이스를 구현합니다. 예를 들어 테이블, 인덱스, 뷰와 같은 스키마 객체를 생성합니다.

어떤 제품과 기술이 필요하신가요?

데이터 마트를 구축하려면 관계형 데이터베이스 관리 시스템(RDBMS)이 필요합니다. RDBMS는 데이터 마트의 성공에 필수적인 여러 기능을 제공합니다.

  • 스토리지 관리 : 관계형 데이터베이스 관리 시스템(RDBMS)은 데이터를 저장하고 관리하며, 레코드를 생성, 추가 및 삭제할 수 있도록 해줍니다.
  • 빠른 데이터 액세스: SQL 쿼리를 사용하면 특정 조건이나 필터에 따라 데이터를 쉽게 검색할 수 있습니다.
  • 데이터 보호 : 관계형 데이터베이스 관리 시스템(RDBMS)은 정전과 같은 시스템 장애로부터 복구할 수 있으며, 디스크 오류가 발생할 경우 백업에서 데이터를 복원할 수 있습니다.
  • 다중 사용자 지원: 이 기능은 동시 접속을 제공하므로 여러 사용자가 서로의 변경 사항을 덮어쓰지 않고 데이터를 읽고 수정할 수 있습니다.
  • 보안 : 이는 어떤 사용자가 어떤 객체에 접근할 수 있는지, 그리고 어떤 작업을 수행할 수 있는지를 규정합니다.

인구

세 번째 단계에서는 데이터가 데이터 마트에 입력됩니다.

채우기 단계에는 다음과 같은 작업이 포함됩니다.

  • 지도ping 원본 데이터에서 대상 데이터로.
  • Extrac원본 데이터를 분석합니다.
  • 데이터 정리 및 변환.
  • 데이터를 데이터마트에 로드하는 중입니다.
  • 메타데이터 생성 및 저장.

어떤 제품과 기술이 필요하신가요?

ETL(Extended Transparency)을 사용하여 이러한 작업을 수행합니다.tract, Transform, Load) 도구입니다. 데이터 소스를 검사하고 소스-대상 매핑을 수행합니다.ping그리고 나서 extracts는 데이터를 변환, 정제한 후 데이터 마트로 로드합니다.

이 과정에서 해당 도구는 데이터의 출처, 최신성, 변경 사항, 적용된 요약 수준과 같은 메타데이터를 생성합니다.

액세스

접근은 네 번째 단계로, 데이터를 활용하는 단계입니다. 데이터 조회, 보고서 및 차트 작성, 게시 등이 포함됩니다. 최종 사용자는 쿼리를 제출하고 결과를 확인하는데, 대개 다음과 같은 방법을 사용합니다. 올랩 도구를 제공합니다.

접근 권한 부여 단계에는 다음과 같은 작업이 포함됩니다.

  • 데이터베이스 구조와 객체 이름을 비즈니스 용어로 변환하는 메타 레이어를 설정하여 비전문가 사용자도 데이터 마트에 쉽게 접근할 수 있도록 합니다.
  • 데이터베이스 구조 설정 및 유지 관리.
  • 필요한 경우 API 및 인터페이스를 설정합니다.

어떤 제품과 기술이 필요하신가요?

명령줄 또는 GUI를 사용하여 데이터 마트에 접근할 수 있습니다. 일반적으로 GUI는 그래프를 쉽게 생성할 수 있고 명령줄보다 사용자 친화적이므로 선호됩니다.

관리

관리 단계는 데이터 마트 구현 프로세스의 최종 단계입니다. 팀은 GUI 또는 명령줄을 사용하여 다음과 같은 지속적인 관리 작업을 처리합니다.

  • 지속적인 사용자 액세스 관리.
  • 시스템 최적화 및 미세 조정을 통해 성능을 향상시킵니다.
  • 데이터마트에 새로운 데이터를 추가하고 관리합니다.
  • 시스템 장애 발생 시에도 시스템을 계속 사용할 수 있도록 복구 시나리오를 계획합니다.
  • 데이터를 보존하면서 하드웨어 및 소프트웨어 오류로부터 복구합니다.

데이터 마트 구현 우수 사례

데이터 마트 구현 과정 전반에 걸쳐 다음과 같은 모범 사례를 따르십시오.

  • 부서별로 데이터 마트의 소스를 구성하십시오.
  • 구현 주기를 월이나 년이 아닌 주 단위로 측정하십시오.
  • 데이터 마트 구현은 복잡할 수 있으므로 계획 및 설계 단계에 모든 이해 관계자를 참여시켜야 합니다.
  • 데이터 마트 하드웨어, 소프트웨어, 네트워킹 및 구현 비용에 대한 예산을 정확하게 책정하십시오.
  • 데이터 마트가 하드웨어를 공유하더라도 사용자 쿼리를 처리하기 위해 서로 다른 소프트웨어가 필요할 수 있습니다. 빠른 응답을 위해 필요한 추가 처리 능력과 저장 공간을 평가해야 합니다.
  • 데이터 마트가 데이터 웨어하우스와 다른 위치에 있는 경우, 필요한 데이터 용량을 이동할 수 있도록 충분한 네트워크 용량을 확보해야 합니다.
  • 변환의 복잡성이 증가함에 따라 로딩 시간도 증가하므로, 이를 고려하여 예산을 책정하십시오.

데이터 마트의 장점과 단점

다른 아키텍처 선택과 마찬가지로 데이터 마트는 몇 가지 단점과 함께 분명한 이점을 제공합니다.

장점

  • 데이터 마트는 조직 전체 데이터 중 특정 사용자 그룹에게 유용한 하위 집합을 저장합니다.
  • 이는 구축 비용이 많이 드는 데이터 웨어하우스에 비해 비용 효율적인 대안입니다.
  • 데이터 마트는 데이터에 더 빠르게 접근할 수 있도록 해줍니다.
  • 이 소프트웨어는 사용자의 특정 요구 사항에 맞춰 설계되었기 때문에 사용하기 쉽고, 비즈니스 프로세스를 가속화할 수 있습니다.
  • 데이터 마트는 전체 데이터의 일부에만 집중하기 때문에 데이터 웨어하우스보다 구현 시간이 적게 소요됩니다.
  • 여기에는 분석가들이 추세를 파악하는 데 도움이 되는 과거 데이터가 포함되어 있습니다.

단점

  • 기업들은 때때로 서로 관련 없는 다양한 데이터 마트를 너무 많이 생성하여 유지 관리가 어려워지는 경우가 있습니다.
  • 데이터 마트는 데이터 세트가 제한적이기 때문에 회사 전체에 대한 데이터 분석을 제공할 수 없습니다.

자주 묻는 질문

A 데이터웨어 하우스 데이터 저장소는 모든 주제를 포괄하는 전사적인 규모인 반면, 데이터 마트는 특정 부서에 특화된 소규모 데이터 집합을 저장합니다. 데이터 마트는 구축 비용이 저렴하고, 구축 속도가 빠르며, 쿼리 속도도 빠르지만, 전사적인 분석을 제공할 수는 없습니다.

데이터 마트는 특정 비즈니스 기능을 위해 모델링된 구조화되고 처리된 데이터를 저장합니다. 데이터 레이크는 구조화된 데이터, 반구조화된 데이터, 비구조화된 데이터 등 모든 유형의 원시 데이터를 대규모로 저장합니다. 데이터 마트는 빠른 보고를 지원하고, 데이터 레이크는 탐색적 데이터 과학 및 머신 러닝을 지원합니다.

대부분의 데이터 마트는 다음을 사용합니다. 차원 모델일반적으로 하나의 중앙 팩트 테이블이 차원 테이블과 조인된 스타 스키마를 사용합니다. 스노우플레이크 스키마는 이러한 차원 테이블을 더욱 정규화합니다. 두 스키마 모두 쿼리 속도를 높이고 비즈니스 사용자를 위한 보고서 작성을 간소화합니다.

영업 데이터 마트는 영업팀을 위한 고객 거래, 매출 및 파이프라인 지표를 저장합니다. 마케팅, 재무 및 인사 데이터 마트도 마찬가지로, 각 부서에서 전체 기업 데이터 웨어하우스를 조회하지 않고도 사전 집계된 데이터를 얻을 수 있도록 지원합니다.

데이터 마트는 지원합니다 올랩OLTP가 아닙니다. 트랜잭션 기반 OLTP 시스템에서 처리하는 빠른 삽입 및 업데이트보다는 보고서 및 대시보드를 위한 과거 데이터를 읽고, 집계하고, 분석하는 데 최적화되어 있습니다.

클라우드 데이터 마트는 온프레미스 서버 대신 관리형 클라우드 데이터 웨어하우스 플랫폼에서 실행됩니다. 하드웨어 관리가 필요 없어지고, 필요에 따라 스토리지와 컴퓨팅 리소스를 확장할 수 있으며, 일반적으로 쿼리당 요금이 부과되므로 비용이 절감되고 배포 속도가 빨라집니다.

AI 및 머신러닝 도구는 소스 데이터를 프로파일링하고, 스키마 및 차원을 추천하고, ETL 맵을 생성하여 데이터 마트 작업 속도를 높입니다.ping또한 데이터 품질 문제를 지적하고, 파티셔닝 및 인덱싱 전략을 제안합니다. 단, 엔지니어는 모든 권장 사항을 프로덕션 환경에 배포하기 전에 검토해야 합니다.

예. ChatGPT GitHub 부조종사 간단한 프롬프트만으로 SQL 쿼리, 스타 스키마 DDL 및 ETL 스크립트를 작성할 수 있습니다. Rev생성된 코드에 비즈니스 규칙이 누락될 수 있으므로 실행하기 전에 테이블 이름, 조인 및 그레인이 올바른지 출력을 확인하십시오.

이 게시물을 요약하면 다음과 같습니다.