데이터웨어 하우스 Archi강의, 구성 요소 및 다이어그램 Concepts
⚡ 스마트 요약
데이터웨어 하우스 Archi구조는 여러 소스에서 수집된 과거 및 누적 데이터를 계층적 구조와 연결된 구성 요소로 구성하는 방식을 정의하여 조직의 의사 결정 및 예측을 위한 신뢰할 수 있는 보고, 분석 및 단일 정보 소스를 가능하게 합니다.

데이터웨어 하우스 Concepts
A 데이터웨어 하우스 기업의 의사 결정 및 예측을 위해 단일화된 정보 소스를 제공하는 것이 목적입니다. 이는 하나 이상의 소스에서 가져온 과거 및 누적 데이터를 저장하는 정보 시스템입니다.
데이터 웨어하우스는 거래가 아닌 분석을 위해 데이터를 구성함으로써 조직 전체의 보고 및 분석 작업을 간소화합니다.
데이터 웨어하우스의 특징
데이터 웨어하우스는 일반적인 운영 데이터베이스와 구별되는 네 가지 특징을 가지고 있습니다.
- 주제 중심
- 통합
- 시간에 따른 변화
- 비 휘발성
주제 중심
데이터 웨어하우스는 기업의 지속적인 운영보다는 특정 주제에 대한 정보를 제공하기 때문에 주제 중심적입니다. 대표적인 주제로는 판매, 마케팅, 유통 등이 있습니다.
이 데이터 웨어하우스는 일상적인 데이터 처리보다는 의사결정을 위한 모델링 및 분석에 중점을 둡니다. 각 주제에 대한 간결하고 명확한 관점을 제공하며, 의사결정 과정을 지원하지 않는 데이터는 제외합니다.
통합
통합은 주제 중심성과 밀접하게 관련되어 있습니다. 데이터 웨어하우스에서 통합이란 서로 다른 데이터베이스에서 가져온 유사한 모든 데이터에 대해 공통 측정 단위를 설정하고, 해당 데이터를 공통적이고 보편적으로 수용 가능한 방식으로 저장하는 것을 의미합니다.
데이터 웨어하우스는 메인프레임, 관계형 데이터베이스, 플랫 파일 등 다양한 소스의 데이터를 통합하여 구축됩니다. 또한 일관된 명명 규칙, 형식 및 코딩을 유지해야 합니다.
명명법, 속성 측정 방식, 인코딩 구조의 일관성이 효과적인 분석을 가능하게 합니다. 다음 예를 살펴보세요.
위 예시에서 A, B, C로 표시된 세 개의 애플리케이션은 각각 성별, 날짜, 잔액 정보를 저장하지만, 각 애플리케이션은 서로 다른 방식으로 정보를 저장합니다.
- 애플리케이션 A는 성별 필드를 M 또는 F와 같은 논리값으로 저장합니다.
- 애플리케이션 B는 성별 필드를 숫자 값으로 저장합니다.
- 애플리케이션 C는 성별 필드를 문자 값으로 저장합니다.
- 날짜 및 잔액 필드에도 동일한 변형이 적용됩니다.
변환 및 정제 과정을 거친 후, 이 모든 데이터는 데이터 웨어하우스 내부에 공통 형식으로 저장됩니다.
시간에 따른 변화
데이터 웨어하우스의 시간 범위는 운영 시스템보다 훨씬 넓습니다. 데이터는 특정 기간별로 인식되어 이력적 관점을 제공하므로 명시적이든 암묵적이든 항상 시간적 요소를 내포합니다.
이러한 시간 변동성이 나타나는 한 가지 예는 레코드 키의 구조입니다. 데이터 웨어하우스의 모든 기본 키에는 일, 주 또는 월과 같은 시간 요소가 포함되어야 합니다.
시간적 변동성의 또 다른 측면은 데이터가 데이터 웨어하우스에 입력되면 업데이트하거나 변경할 수 없다는 것입니다.
비 휘발성
데이터 웨어하우스는 비휘발성 데이터 저장소이므로 새로운 데이터가 도착해도 이전 데이터가 삭제되지 않습니다. 데이터는 읽기 전용이며 주기적으로 갱신되므로 분석가가 과거 데이터를 연구하고 어떤 일이 언제 발생했는지 파악하는 데 도움이 됩니다.
데이터 웨어하우징은 트랜잭션 처리, 복구 또는 동시성 제어가 필요하지 않으므로 운영 애플리케이션에서 흔히 발생하는 삭제, 업데이트 및 삽입 작업을 생략합니다. 데이터 웨어하우징에서는 단 두 가지 데이터 작업만 수행됩니다.
- 데이터 로딩
- 데이터 접근
아래 표는 운영 애플리케이션과 데이터 웨어하우스 간의 주요 차이점을 보여줍니다.
| Opera선택적 적용 | 데이터웨어 하우스 |
|---|---|
| 복잡한 프로그램은 최종 제품의 높은 무결성을 유지하는 데이터 업그레이드 프로세스를 보장하기 위해 코딩되어야 합니다. | 이러한 문제는 데이터 업데이트가 수행되지 않기 때문에 발생하는 것이 아닙니다. |
| 데이터는 최소한의 중복성을 보장하기 위해 정규화된 형식으로 배치됩니다. | 데이터는 정규화된 형식으로 저장되지 않습니다. |
| 거래, 데이터 복구, 롤백 및 교착 상태 해결과 같은 문제를 지원하는 데 필요한 기술은 상당히 복잡합니다. | 이는 상대적인 기술 단순성을 제공합니다. |
데이터웨어 하우스 Archi강의
데이터웨어 하우스 Archi시스템이 여러 소스에서 가져온 과거 및 누적 데이터를 저장하기 때문에 구조가 복잡합니다. 데이터 웨어하우스 계층을 구축하는 방법에는 단일 계층, 2계층, 3계층 세 가지가 있습니다.
단일 계층 아키텍처 데이터 중복을 제거하여 저장되는 데이터 양을 최소화하는 것을 목표로 합니다. 하지만 실제로는 거의 사용되지 않습니다.
2계층 아키텍처 물리적으로 사용 가능한 소스와 데이터 웨어하우스를 분리합니다. 확장성이 떨어지고 지원하는 최종 사용자 수가 적으며 네트워크 제약으로 인해 연결 문제가 발생할 수 있습니다.
3계층 아키텍처 이는 데이터 웨어하우스에서 가장 널리 사용되는 설계 방식입니다.
이는 최상위, 중간, 최하위 계층으로 구성됩니다.
- 최하위 계층: 데이터 웨어하우스의 데이터베이스는 최하위 계층 역할을 합니다. 일반적으로 관계형 데이터베이스 시스템이며, 백엔드 도구를 사용하여 데이터를 정제, 변환 및 로드합니다.
- 중간 계층: 미들 티어는 ROLAP 또는 MOLAP 모델을 사용하여 구현된 OLAP 서버입니다. 이는 절대적인 성능을 제공합니다.trac데이터베이스에 대한 포괄적인 관점을 제공하며 최종 사용자와 데이터베이스 사이의 중개자 역할을 합니다.
- 최상위 계층: 최상위 계층은 프런트엔드 클라이언트 계층입니다. 여기에는 쿼리 도구, 보고 도구, 관리형 쿼리 도구, 분석 도구 및 데이터 마이닝 도구와 같이 데이터 웨어하우스에 연결하고 데이터를 가져오는 데 사용되는 도구와 API가 포함됩니다.
데이터웨어하우스 구성요소
데이터 웨어하우스의 구성 요소와 전체 아키텍처는 아래 다이어그램에 표시된 것처럼 서로 연동하여 작동합니다.
데이터 웨어하우스는 RDBMS 서버를 기반으로 하며, 이 서버는 전체 환경을 기능적이고 관리 가능하며 접근 가능하게 유지하는 주요 구성 요소들로 둘러싸인 중앙 정보 저장소입니다.
데이터 웨어하우스는 아래에 설명된 다섯 가지 주요 구성 요소로 이루어져 있습니다.
데이터 웨어하우스 데이터베이스
중앙 데이터베이스는 데이터 웨어하우징 환경의 기반이며, 다음 플랫폼에 구현됩니다. RDBMS 기술적 한계로 인해 기존 RDBMS는 데이터 웨어하우징보다는 트랜잭션 처리에 최적화되어 있기 때문에, 임시 쿼리, 다중 테이블 조인, 집계와 같은 리소스 집약적인 작업으로 인해 속도가 저하될 수 있습니다.
이러한 이유로 대안적인 데이터베이스 접근 방식이 사용됩니다.
- 관계형 데이터베이스는 확장성을 확보하기 위해 병렬로 배포되며, 다양한 멀티프로세서 또는 대규모 병렬 구성에서 공유 메모리 또는 공유 없음 모델을 사용합니다.
- 새로운 인덱스 구조는 관계형 테이블 스캔을 우회하고 속도를 향상시키는 데 사용됩니다.
- 다차원 데이터베이스(MDDB)는 관계형 데이터 웨어하우스 모델의 한계를 극복하기 위해 사용됩니다. Essbase가 그 예입니다. Oracle.
소싱, 획득, 정리 및 변환 도구(ETL)
데이터 소싱, 변환 및 마이그레이션 도구는 데이터를 통합된 데이터 웨어하우스 형식으로 변환하는 데 필요한 모든 변환, 요약 및 변경 작업을 수행합니다. 이러한 도구는 Ex라고도 합니다.tracETL(추출, 변환 및 로드) 도구.
이들의 기능은 다음과 같습니다.
- 규제 규정에 따라 데이터를 익명화합니다.
- 창고에 적재하기 전에 운영 데이터베이스에서 불필요한 데이터를 제거하십시오.
- 다양한 소스에서 도착하는 데이터에 대한 일반 이름과 정의를 검색하고 바꿉니다.
- 요약 및 파생 데이터를 계산합니다.
- 누락된 데이터는 기본값으로 채웁니다.
- 여러 소스에서 들어오는 중복 데이터를 제거합니다.
Bowman의 ETL 도구 크론 작업, 백그라운드 작업, 코볼 프로그램 및 셸 스크립트를 생성하여 데이터 웨어하우스를 정기적으로 새로 고치고 메타데이터를 유지 관리할 수 있습니다.
ETL 도구는 여러 시스템에서 데이터를 가져오기 때문에 데이터베이스 및 데이터의 이질성에도 대처해야 합니다.
메타 데이터
메타데이터는 복잡해 보일 수 있지만, 간단히 말해 데이터 웨어하우스를 정의하는 데이터에 대한 데이터입니다. 메타데이터는 웨어하우스를 구축, 유지 및 관리하는 데 사용됩니다.
아키텍처 내에서 메타데이터는 데이터의 출처, 용도, 값 및 특징을 명시하고 데이터가 어떻게 변경되고 처리될 수 있는지 정의하여 데이터가 데이터 웨어하우스와 긴밀하게 연결되도록 합니다.
예를 들어, 판매 데이터베이스의 한 줄에는 다음과 같은 내용이 포함될 수 있습니다.
4030 KJ732 299.90
메타데이터에 해당 정보가 모델 번호 4030, 판매 담당자 ID KJ732, 총 판매 금액 299.90달러를 나타낸다는 내용이 추가되기 전까지는 이 정보는 무의미합니다.
따라서 메타데이터는 데이터를 지식으로 바꾸는 데 필수적인 요소이며, 다음과 같은 질문에 답하는 데 도움이 됩니다.
- 데이터 웨어하우스에는 어떤 테이블, 속성 및 키가 포함되어 있습니까?
- 데이터는 어디서 왔나요?
- 데이터는 몇 번 새로고침되나요?
- 어떤 변화와 정화 과정이 적용되었습니까?
메타데이터는 두 가지 범주로 나뉩니다.
- 기술 메타데이터: 이것은 해당 프로젝트를 구축하고 운영하는 디자이너와 관리자를 위한 자료실에 대한 설명입니다.
- 비즈니스 메타데이터: 이를 통해 최종 사용자는 데이터 웨어하우스에 저장된 정보를 쉽게 이해할 수 있습니다.
쿼리 도구
데이터 웨어하우징의 주요 목표는 기업이 전략적 결정을 내리는 데 필요한 정보를 제공하는 것이며, 쿼리 도구는 사용자가 시스템과 상호 작용하는 방식입니다.
이러한 도구들은 네 가지 범주로 나뉩니다.
- 쿼리 및 보고 도구
- 애플리케이션 개발 도구
- 데이터 마이닝 도구
- OLAP 도구
쿼리 및 보고 도구
쿼리 및 보고 도구는 보고 도구와 관리형 쿼리 도구의 두 그룹으로 나뉩니다.
보고 도구 생산 보고 도구와 데스크톱 보고서 작성 도구로 더 세분화됩니다.
- 보고서 작성자: 이러한 도구는 자체 분석을 수행하는 최종 사용자를 위해 설계되었습니다.
- 생산 보고: 이러한 도구를 통해 조직은 정기적인 운영 보고서를 생성하고 인쇄 및 계산과 같은 대용량 배치 작업을 지원할 수 있습니다. 대표적인 예로는 Brio, Business Objects 등이 있습니다. OraclePowerSoft 및 SAS Institute.
관리형 쿼리 도구 사용자와 데이터베이스 사이에 메타 레이어를 삽입하여 SQL 및 데이터베이스 구조의 복잡성을 숨김으로써 최종 사용자를 지원합니다.
애플리케이션 개발 도구
내장된 그래픽 및 분석 도구가 조직의 분석 요구 사항을 충족하지 못할 경우, 애플리케이션 개발 도구를 사용하여 맞춤형 보고서를 제작합니다.
데이터 마이닝 도구
데이터 마이닝은 방대한 데이터 속에서 의미 있는 새로운 상관관계, 패턴 및 추세를 발견하는 기술이며, 데이터 마이닝 도구는 이러한 발견 과정을 자동화합니다.
OLAP 도구
올랩 이러한 도구는 다차원 데이터베이스를 기반으로 구축되었으며, 사용자가 정교한 다차원적 관점을 통해 데이터를 분석할 수 있도록 해줍니다.
데이터 웨어하우스 버스 Archi강의
데이터 웨어하우스 버스는 데이터가 웨어하우스를 통해 흐르는 방식을 결정합니다. 이러한 흐름은 유입, 상향 흐름, 하향 흐름, 유출 및 메타 흐름으로 분류할 수 있습니다.
버스를 설계할 때는 데이터 마트 전반에 걸쳐 공유되는 차원과 사실을 고려해야 합니다.
데이터 마트
A 데이터 마트 데이터 마트는 사용자에게 데이터를 제공하는 데 사용되는 액세스 계층입니다. 구축 시간과 비용이 적게 들기 때문에 대규모 데이터 웨어하우스에 적합하지만, 데이터 마트에 대한 단일한 합의된 정의는 없습니다.
간단히 말해, 데이터 마트는 데이터 웨어하우스의 하위 개념입니다. 특정 사용자 그룹을 위해 데이터를 분할하며, 웨어하우스와 동일한 데이터베이스에 저장될 수도 있고 물리적으로 분리된 별도의 데이터베이스에 저장될 수도 있습니다.
데이터웨어 하우스 Archi구조 모범 사례
견고한 데이터 웨어하우스 아키텍처를 설계하려면 다음과 같은 모범 사례를 따르십시오.
- 데이터 검색에 최적화된 데이터 웨어하우스 모델을 사용하십시오. 차원의비정규화 또는 하이브리드 접근 방식.
- 상향식 또는 하향식 설계 방식 중 적절한 방식을 선택하십시오.
- 데이터를 신속하고 정확하게 처리하는 동시에 단일화된 정보로 통합해야 합니다.
- 데이터 웨어하우스의 데이터 수집 및 정제 프로세스를 신중하게 설계하십시오.
- 데이터 웨어하우스의 구성 요소 간에 메타데이터를 공유할 수 있는 메타데이터 아키텍처를 설계하십시오.
- 고려 Opera데이터 추상화의 하위 계층에서 검색 요구 사항이 발생할 때 사용하는 ODS(종합 데이터 저장소) 모델trac피라미드 구조이거나 여러 운영 소스에 액세스해야 하는 경우입니다.
- 데이터 모델이 단순히 통합되는 것이 아니라 완전히 통합되도록 해야 합니다. 이를 위해서는 3NF 데이터 모델을 사용하는 것이 좋으며, 이는 ETL 및 데이터 정제 도구를 도입할 때도 이상적입니다.


