데이터웨어 하우스 Archi강의, 구성 요소 및 다이어그램 Concepts

⚡ 스마트 요약

데이터웨어 하우스 Archi구조는 여러 소스에서 수집된 과거 및 누적 데이터를 계층적 구조와 연결된 구성 요소로 구성하는 방식을 정의하여 조직의 의사 결정 및 예측을 위한 신뢰할 수 있는 보고, 분석 및 단일 정보 소스를 가능하게 합니다.

  • 🏛️ 핵심 목적: 데이터 웨어하우스는 일상적인 거래 처리보다는 분석을 지원하기 위해 주제 중심적이고 통합적이며 시간에 따라 변하고 휘발성이 없는 데이터를 저장합니다.
  • 🧱 계층형 디자인: Archi구조는 단일 계층부터 가장 하위의 데이터베이스, 중간의 OLAP 서버, 그리고 최상위의 클라이언트 계층으로 구성된 널리 사용되는 3계층 모델까지 다양합니다.
  • 🗄️ 핵심 데이터베이스: 중앙 저장소는 관계형 데이터베이스 관리 시스템(RDBMS)에서 실행되며, 확장성과 속도 향상을 위해 병렬 데이터베이스, 새로운 인덱스 구조 및 다차원 데이터베이스로 확장되는 경우가 많습니다.
  • 🔄 ETL 구성 요소: 소싱, 획득, 정리 및 변환 도구는 데이터를 하나의 통합된 형식으로 통합하고 데이터 웨어하우스를 최신 상태로 유지합니다.
  • 🏷️ 메타데이터 역할: 기술 및 비즈니스 메타데이터는 데이터의 출처, 의미 및 처리 방식을 설명하여 원시 값을 사용 가능한 지식으로 변환합니다.
  • 📊 쿼리 및 OLAP 도구: 보고, 관리형 쿼리, 애플리케이션 개발, 데이터 마이닝 및 OLAP 도구를 통해 사용자는 다양한 관점에서 데이터 웨어하우스를 탐색할 수 있습니다.
  • 모범 사례: 데이터 검색을 위해 데이터 모델을 최적화하고, 단일 진실 버전으로 통합하며, 필요한 경우 ODS 또는 3NF 모델을 고려하십시오.

데이터웨어 하우스 Archi데이터 웨어하우스의 계층 및 핵심 구성 요소를 보여주는 구조도

데이터웨어 하우스 Concepts

A 데이터웨어 하우스 기업의 의사 결정 및 예측을 위해 단일화된 정보 소스를 제공하는 것이 목적입니다. 이는 하나 이상의 소스에서 가져온 과거 및 누적 데이터를 저장하는 정보 시스템입니다.

데이터 웨어하우스는 거래가 아닌 분석을 위해 데이터를 구성함으로써 조직 전체의 보고 및 분석 작업을 간소화합니다.

데이터 웨어하우스의 특징

데이터 웨어하우스는 일반적인 운영 데이터베이스와 구별되는 네 가지 특징을 가지고 있습니다.

  • 주제 중심
  • 통합
  • 시간에 따른 변화
  • 비 휘발성

주제 중심

데이터 웨어하우스는 기업의 지속적인 운영보다는 특정 주제에 대한 정보를 제공하기 때문에 주제 중심적입니다. 대표적인 주제로는 판매, 마케팅, 유통 등이 있습니다.

이 데이터 웨어하우스는 일상적인 데이터 처리보다는 의사결정을 위한 모델링 및 분석에 중점을 둡니다. 각 주제에 대한 간결하고 명확한 관점을 제공하며, 의사결정 과정을 지원하지 않는 데이터는 제외합니다.

통합

통합은 주제 중심성과 밀접하게 관련되어 있습니다. 데이터 웨어하우스에서 통합이란 서로 다른 데이터베이스에서 가져온 유사한 모든 데이터에 대해 공통 측정 단위를 설정하고, 해당 데이터를 공통적이고 보편적으로 수용 가능한 방식으로 저장하는 것을 의미합니다.

데이터 웨어하우스는 메인프레임, 관계형 데이터베이스, 플랫 파일 등 다양한 소스의 데이터를 통합하여 구축됩니다. 또한 일관된 명명 규칙, 형식 및 코딩을 유지해야 합니다.

명명법, 속성 측정 방식, 인코딩 구조의 일관성이 효과적인 분석을 가능하게 합니다. 다음 예를 살펴보세요.

세 가지 애플리케이션의 성별, 날짜 및 잔액 필드를 표준화하는 데이터 웨어하우스 통합 예시

위 예시에서 A, B, C로 표시된 세 개의 애플리케이션은 각각 성별, 날짜, 잔액 정보를 저장하지만, 각 애플리케이션은 서로 다른 방식으로 정보를 저장합니다.

  • 애플리케이션 A는 성별 필드를 M 또는 F와 같은 논리값으로 저장합니다.
  • 애플리케이션 B는 성별 필드를 숫자 값으로 저장합니다.
  • 애플리케이션 C는 성별 필드를 문자 값으로 저장합니다.
  • 날짜 및 잔액 필드에도 동일한 변형이 적용됩니다.

변환 및 정제 과정을 거친 후, 이 모든 데이터는 데이터 웨어하우스 내부에 공통 형식으로 저장됩니다.

시간에 따른 변화

데이터 웨어하우스의 시간 범위는 운영 시스템보다 훨씬 넓습니다. 데이터는 특정 기간별로 인식되어 이력적 관점을 제공하므로 명시적이든 암묵적이든 항상 시간적 요소를 내포합니다.

이러한 시간 변동성이 나타나는 한 가지 예는 레코드 키의 구조입니다. 데이터 웨어하우스의 모든 기본 키에는 일, 주 또는 월과 같은 시간 요소가 포함되어야 합니다.

시간적 변동성의 또 다른 측면은 데이터가 데이터 웨어하우스에 입력되면 업데이트하거나 변경할 수 없다는 것입니다.

비 휘발성

데이터 웨어하우스는 비휘발성 데이터 저장소이므로 새로운 데이터가 도착해도 이전 데이터가 삭제되지 않습니다. 데이터는 읽기 전용이며 주기적으로 갱신되므로 분석가가 과거 데이터를 연구하고 어떤 일이 언제 발생했는지 파악하는 데 도움이 됩니다.

데이터 웨어하우징은 트랜잭션 처리, 복구 또는 동시성 제어가 필요하지 않으므로 운영 애플리케이션에서 흔히 발생하는 삭제, 업데이트 및 삽입 작업을 생략합니다. 데이터 웨어하우징에서는 단 두 가지 데이터 작업만 수행됩니다.

  1. 데이터 로딩
  2. 데이터 접근

아래 표는 운영 애플리케이션과 데이터 웨어하우스 간의 주요 차이점을 보여줍니다.

Opera선택적 적용 데이터웨어 하우스
복잡한 프로그램은 최종 제품의 높은 무결성을 유지하는 데이터 업그레이드 프로세스를 보장하기 위해 코딩되어야 합니다. 이러한 문제는 데이터 업데이트가 수행되지 않기 때문에 발생하는 것이 아닙니다.
데이터는 최소한의 중복성을 보장하기 위해 정규화된 형식으로 배치됩니다. 데이터는 정규화된 형식으로 저장되지 않습니다.
거래, 데이터 복구, 롤백 및 교착 상태 해결과 같은 문제를 지원하는 데 필요한 기술은 상당히 복잡합니다. 이는 상대적인 기술 단순성을 제공합니다.

데이터웨어 하우스 Archi강의

데이터웨어 하우스 Archi시스템이 여러 소스에서 가져온 과거 및 누적 데이터를 저장하기 때문에 구조가 복잡합니다. 데이터 웨어하우스 계층을 구축하는 방법에는 단일 계층, 2계층, 3계층 세 가지가 있습니다.

단일 계층 아키텍처 데이터 중복을 제거하여 저장되는 데이터 양을 최소화하는 것을 목표로 합니다. 하지만 실제로는 거의 사용되지 않습니다.

2계층 아키텍처 물리적으로 사용 가능한 소스와 데이터 웨어하우스를 분리합니다. 확장성이 떨어지고 지원하는 최종 사용자 수가 적으며 네트워크 제약으로 인해 연결 문제가 발생할 수 있습니다.

3계층 아키텍처 이는 데이터 웨어하우스에서 가장 널리 사용되는 설계 방식입니다.

이는 최상위, 중간, 최하위 계층으로 구성됩니다.

  1. 최하위 계층: 데이터 웨어하우스의 데이터베이스는 최하위 계층 역할을 합니다. 일반적으로 관계형 데이터베이스 시스템이며, 백엔드 도구를 사용하여 데이터를 정제, 변환 및 로드합니다.
  2. 중간 계층: 미들 티어는 ROLAP 또는 MOLAP 모델을 사용하여 구현된 OLAP 서버입니다. 이는 절대적인 성능을 제공합니다.trac데이터베이스에 대한 포괄적인 관점을 제공하며 최종 사용자와 데이터베이스 사이의 중개자 역할을 합니다.
  3. 최상위 계층: 최상위 계층은 프런트엔드 클라이언트 계층입니다. 여기에는 쿼리 도구, 보고 도구, 관리형 쿼리 도구, 분석 도구 및 데이터 마이닝 도구와 같이 데이터 웨어하우스에 연결하고 데이터를 가져오는 데 사용되는 도구와 API가 포함됩니다.

데이터웨어하우스 구성요소

데이터 웨어하우스의 구성 요소와 전체 아키텍처는 아래 다이어그램에 표시된 것처럼 서로 연동하여 작동합니다.

데이터 웨어하우스 아키텍처 구성 요소에는 데이터베이스, ETL 도구, 메타데이터, 쿼리 도구 및 데이터 마트가 포함됩니다.

데이터 웨어하우스는 RDBMS 서버를 기반으로 하며, 이 서버는 전체 환경을 기능적이고 관리 가능하며 접근 가능하게 유지하는 주요 구성 요소들로 둘러싸인 중앙 정보 저장소입니다.

데이터 웨어하우스는 아래에 설명된 다섯 가지 주요 구성 요소로 이루어져 있습니다.

데이터 웨어하우스 데이터베이스

중앙 데이터베이스는 데이터 웨어하우징 환경의 기반이며, 다음 플랫폼에 구현됩니다. RDBMS 기술적 한계로 인해 기존 RDBMS는 데이터 웨어하우징보다는 트랜잭션 처리에 최적화되어 있기 때문에, 임시 쿼리, 다중 테이블 조인, 집계와 같은 리소스 집약적인 작업으로 인해 속도가 저하될 수 있습니다.

이러한 이유로 대안적인 데이터베이스 접근 방식이 사용됩니다.

  • 관계형 데이터베이스는 확장성을 확보하기 위해 병렬로 배포되며, 다양한 멀티프로세서 또는 대규모 병렬 구성에서 공유 메모리 또는 공유 없음 모델을 사용합니다.
  • 새로운 인덱스 구조는 관계형 테이블 스캔을 우회하고 속도를 향상시키는 데 사용됩니다.
  • 다차원 데이터베이스(MDDB)는 관계형 데이터 웨어하우스 모델의 한계를 극복하기 위해 사용됩니다. Essbase가 그 예입니다. Oracle.

소싱, 획득, 정리 및 변환 도구(ETL)

데이터 소싱, 변환 및 마이그레이션 도구는 데이터를 통합된 데이터 웨어하우스 형식으로 변환하는 데 필요한 모든 변환, 요약 및 변경 작업을 수행합니다. 이러한 도구는 Ex라고도 합니다.tracETL(추출, 변환 및 로드) 도구.

이들의 기능은 다음과 같습니다.

  • 규제 규정에 따라 데이터를 익명화합니다.
  • 창고에 적재하기 전에 운영 데이터베이스에서 불필요한 데이터를 제거하십시오.
  • 다양한 소스에서 도착하는 데이터에 대한 일반 이름과 정의를 검색하고 바꿉니다.
  • 요약 및 파생 데이터를 계산합니다.
  • 누락된 데이터는 기본값으로 채웁니다.
  • 여러 소스에서 들어오는 중복 데이터를 제거합니다.

Bowman의 ETL 도구 크론 작업, 백그라운드 작업, 코볼 프로그램 및 셸 스크립트를 생성하여 데이터 웨어하우스를 정기적으로 새로 고치고 메타데이터를 유지 관리할 수 있습니다.

ETL 도구는 여러 시스템에서 데이터를 가져오기 때문에 데이터베이스 및 데이터의 이질성에도 대처해야 합니다.

메타 데이터

메타데이터는 복잡해 보일 수 있지만, 간단히 말해 데이터 웨어하우스를 정의하는 데이터에 대한 데이터입니다. 메타데이터는 웨어하우스를 구축, 유지 및 관리하는 데 사용됩니다.

아키텍처 내에서 메타데이터는 데이터의 출처, 용도, 값 및 특징을 명시하고 데이터가 어떻게 변경되고 처리될 수 있는지 정의하여 데이터가 데이터 웨어하우스와 긴밀하게 연결되도록 합니다.

예를 들어, 판매 데이터베이스의 한 줄에는 다음과 같은 내용이 포함될 수 있습니다.

4030 KJ732 299.90

메타데이터에 해당 정보가 모델 번호 4030, 판매 담당자 ID KJ732, 총 판매 금액 299.90달러를 나타낸다는 내용이 추가되기 전까지는 이 정보는 무의미합니다.

따라서 메타데이터는 데이터를 지식으로 바꾸는 데 필수적인 요소이며, 다음과 같은 질문에 답하는 데 도움이 됩니다.

  • 데이터 웨어하우스에는 어떤 테이블, 속성 및 키가 포함되어 있습니까?
  • 데이터는 어디서 왔나요?
  • 데이터는 몇 번 새로고침되나요?
  • 어떤 변화와 정화 과정이 적용되었습니까?

메타데이터는 두 가지 범주로 나뉩니다.

  1. 기술 메타데이터: 이것은 해당 프로젝트를 구축하고 운영하는 디자이너와 관리자를 위한 자료실에 대한 설명입니다.
  2. 비즈니스 메타데이터: 이를 통해 최종 사용자는 데이터 웨어하우스에 저장된 정보를 쉽게 이해할 수 있습니다.

쿼리 도구

데이터 웨어하우징의 주요 목표는 기업이 전략적 결정을 내리는 데 필요한 정보를 제공하는 것이며, 쿼리 도구는 사용자가 시스템과 상호 작용하는 방식입니다.

이러한 도구들은 네 가지 범주로 나뉩니다.

  1. 쿼리 및 보고 도구
  2. 애플리케이션 개발 도구
  3. 데이터 마이닝 도구
  4. OLAP 도구

쿼리 및 보고 도구

쿼리 및 보고 도구는 보고 도구와 관리형 쿼리 도구의 두 그룹으로 나뉩니다.

보고 도구 생산 보고 도구와 데스크톱 보고서 작성 도구로 더 세분화됩니다.

  1. 보고서 작성자: 이러한 도구는 자체 분석을 수행하는 최종 사용자를 위해 설계되었습니다.
  2. 생산 보고: 이러한 도구를 통해 조직은 정기적인 운영 보고서를 생성하고 인쇄 및 계산과 같은 대용량 배치 작업을 지원할 수 있습니다. 대표적인 예로는 Brio, Business Objects 등이 있습니다. OraclePowerSoft 및 SAS Institute.

관리형 쿼리 도구 사용자와 데이터베이스 사이에 메타 레이어를 삽입하여 SQL 및 데이터베이스 구조의 복잡성을 숨김으로써 최종 사용자를 지원합니다.

애플리케이션 개발 도구

내장된 그래픽 및 분석 도구가 조직의 분석 요구 사항을 충족하지 못할 경우, 애플리케이션 개발 도구를 사용하여 맞춤형 보고서를 제작합니다.

데이터 마이닝 도구

데이터 마이닝은 방대한 데이터 속에서 의미 있는 새로운 상관관계, 패턴 및 추세를 발견하는 기술이며, 데이터 마이닝 도구는 이러한 발견 과정을 자동화합니다.

OLAP 도구

올랩 이러한 도구는 다차원 데이터베이스를 기반으로 구축되었으며, 사용자가 정교한 다차원적 관점을 통해 데이터를 분석할 수 있도록 해줍니다.

데이터 웨어하우스 버스 Archi강의

데이터 웨어하우스 버스는 데이터가 웨어하우스를 통해 흐르는 방식을 결정합니다. 이러한 흐름은 유입, 상향 흐름, 하향 흐름, 유출 및 메타 흐름으로 분류할 수 있습니다.

버스를 설계할 때는 데이터 마트 전반에 걸쳐 공유되는 차원과 사실을 고려해야 합니다.

데이터 마트

A 데이터 마트 데이터 마트는 사용자에게 데이터를 제공하는 데 사용되는 액세스 계층입니다. 구축 시간과 비용이 적게 들기 때문에 대규모 데이터 웨어하우스에 적합하지만, 데이터 마트에 대한 단일한 합의된 정의는 없습니다.

간단히 말해, 데이터 마트는 데이터 웨어하우스의 하위 개념입니다. 특정 사용자 그룹을 위해 데이터를 분할하며, 웨어하우스와 동일한 데이터베이스에 저장될 수도 있고 물리적으로 분리된 별도의 데이터베이스에 저장될 수도 있습니다.

데이터웨어 하우스 Archi구조 모범 사례

견고한 데이터 웨어하우스 아키텍처를 설계하려면 다음과 같은 모범 사례를 따르십시오.

  • 데이터 검색에 최적화된 데이터 웨어하우스 모델을 사용하십시오. 차원의비정규화 또는 하이브리드 접근 방식.
  • 상향식 또는 하향식 설계 방식 중 적절한 방식을 선택하십시오.
  • 데이터를 신속하고 정확하게 처리하는 동시에 단일화된 정보로 통합해야 합니다.
  • 데이터 웨어하우스의 데이터 수집 및 정제 프로세스를 신중하게 설계하십시오.
  • 데이터 웨어하우스의 구성 요소 간에 메타데이터를 공유할 수 있는 메타데이터 아키텍처를 설계하십시오.
  • 고려 Opera데이터 추상화의 하위 계층에서 검색 요구 사항이 발생할 때 사용하는 ODS(종합 데이터 저장소) 모델trac피라미드 구조이거나 여러 운영 소스에 액세스해야 하는 경우입니다.
  • 데이터 모델이 단순히 통합되는 것이 아니라 완전히 통합되도록 해야 합니다. 이를 위해서는 3NF 데이터 모델을 사용하는 것이 좋으며, 이는 ETL 및 데이터 정제 도구를 도입할 때도 이상적입니다.

자주 묻는 질문

운영 데이터베이스는 트랜잭션 처리를 위해 정규화된 테이블을 사용하여 빈번한 삽입, 업데이트 및 삭제 작업을 처리합니다. 데이터 웨어하우스는 읽기 전용이며 비휘발성으로, 비정규화된 구조에 과거 데이터를 저장하고, 일상적인 운영보다는 쿼리, 보고 및 분석에 최적화되어 있습니다.

데이터 웨어하우스는 여러 소스에서 가져온 통합 데이터를 저장하는 기업 전체의 저장소입니다. 데이터 마트 이는 영업이나 재무와 같은 특정 부서 또는 주제에 초점을 맞춘 더 작은 하위 집합으로, 구축 속도가 빠르고 비용이 저렴하며 쿼리하기도 쉽습니다.

둘 다 차원형 설계 방식입니다. 스타 스키마는 별 모양을 닮아 하나의 중앙 팩트 테이블을 비정규화된 차원 테이블에 직접 연결합니다. 스노우플레이크 스키마는 이러한 차원 테이블을 관련 하위 테이블로 정규화합니다. 자세한 내용은 다음을 참조하십시오. 차원 모델링 사실과 차원이 어떻게 구성되는지에 대한 것입니다.

클라우드 데이터 웨어하우스는 공급업체(예: 클라우드 서비스 제공업체)가 호스팅하는 관리형 분석 데이터베이스입니다. Amazon 레드시프트, Google BigQuery 또는 Snowflake는 필요에 따라 스토리지와 컴퓨팅을 확장하고 하드웨어 유지 관리를 줄이며 온프레미스 웨어하우스와 동일한 계층형 아키텍처 및 ETL 파이프라인을 지원합니다.

단일화된 진실이란 모든 사용자와 보고서가 일관되고 통합된 데이터 세트를 활용한다는 것을 의미합니다. 데이터 웨어하우스는 서로 다른 소스의 값을 통합하고 표준화함으로써 상충되는 수치를 제거하고 의사 결정이 동일하고 신뢰할 수 있는 수치에 기반하도록 합니다.

ETL extracELT는 원시 데이터를 먼저 로드하고 자체 컴퓨팅 성능을 활용하여 데이터 웨어하우스 내부에서 변환합니다. 자세한 내용은 다음을 참조하세요. ETL 프로세스 설명.

AI 및 머신러닝 도구는 스키마 설계를 제안하고 ETL 맵 생성을 자동화합니다.ping데이터 품질 이상을 감지하고 쿼리 속도를 향상시키는 인덱스 또는 파티션을 권장합니다. 또한 스토리지 증가를 예측할 수도 있습니다. 엔지니어는 프로덕션 데이터 웨어하우스에 적용하기 전에 각 권장 사항을 검토해야 합니다.

예. ChatGPT 설명을 바탕으로 SQL, 차원 모델 및 ETL 로직을 작성할 수 있습니다. GitHub 부조종사 편집기에서 변환 스크립트를 자동 완성합니다. AI가 오래된 구문이나 기본값을 참조할 수 있으므로 생성된 스키마와 쿼리를 항상 검증하십시오.

이 게시물을 요약하면 다음과 같습니다.