データウェアハウスとは?種類

⚡ スマートサマリー

データウェアハウスとは、分析、レポート作成、意思決定支援のために、多くの情報源から情報を集約する集中型リポジトリのことです。このチュートリアルでは、データウェアハウジングの歴史、動作モデル、種類、段階、構成要素、実装手順、利点、欠点、そして現代のビジネスインテリジェンスの基盤となる主要なツールについて解説します。

  • 🏛️ コア定義: データウェアハウスとは、トランザクション処理ではなく分析クエリのために設計された、主題指向型で統合された、時系列変動型で非揮発性のデータストアである。
  • 🧱 XNUMX つのタイプ: エンタープライズデータウェアハウス、 Operaナショナルデータストアとデータマートは、それぞれ企業全体、リアルタイム、および事業部門別のレポート作成に利用されます。
  • ⚙️ 4 つのコンポーネント: ロードマネージャー、ウェアハウスマネージャー、クエリマネージャー、およびエンドユーザーアクセスツールは、データの取り込み、ガバナンス、クエリルーティング、および分析を処理します。
  • 📈 成熟段階: 倉庫はオフラインから進化する OperaオフラインDW、リアルタイムDW、およびトランザクションをソースシステムにフィードバックする統合DWに相当します。
  • 🛠️ 実装戦略: エンタープライズ戦略、段階的デリバリー、反復プロトタイプを組み合わせるping リスクを管理し、早期に価値を提供する。

データウェアハウスとは何か - 種類、定義、例

データ ウェアハウジングとは

データウェアハウジング(DW) ビジネスインテリジェンス(BI)とは、さまざまなソースからデータを収集・管理し、有意義なビジネスインサイトを提供するプロセスです。データウェアハウスは通常、異種ソースからのビジネスデータを接続・分析するために使用され、データ分析とレポート作成のために構築されたあらゆるBIシステムの核となるものです。

データウェアハウジングは、データの戦略的な活用を支援する様々な技術とコンポーネントを組み合わせたものです。これは、トランザクション処理ではなく、クエリと分析を目的として設計された、大量のビジネス情報を電子的に保存するシステムです。データウェアハウスは、生データを使いやすい情報に変換し、重要な意思決定を行うために必要なタイミングでユーザーに提供します。

意思決定支援データベース(データウェアハウス)は、組織の運用データベースとは別に管理されます。データウェアハウスは製品ではなく環境であり、情報システムのアーキテクチャ構造です。これにより、従来の運用データストアではアクセスや表示が困難な、現在および過去の意思決定支援情報をユーザーに提供します。

在庫管理システム用の第3正規形(3NF)データベースは、通常、相互に関連する多数のテーブルで構成されています。例えば、現在の在庫状況に関するレポートでは、12個以上の結合条件が必要になる場合があり、クエリやレポートの応答時間が遅くなります。データウェアハウスは、非正規化された設計を採用することで、応答時間を短縮し、レポート作成や分析のパフォーマンスを向上させます。

データウェアハウスシステムは、以下の名称でも知られています。

  • 意思決定支援システム (DSS)
  • 経営情報システム
  • 経営情報システム
  • ビジネスインテリジェンスソリューション
  • 分析アプリケーション
  • データウェアハウス

データウェアハウジングの概念図

データウェアハウスの歴史

データウェアハウスは、ユーザーが組織のパフォーマンスを理解し、改善するのに役立ちます。コンピュータシステムが複雑化し、処理する情報量がますます増加するにつれて、データの保管の必要性が高まりました。データウェアハウジングは新しい概念ではなく、長い進化の歴史を持っています。

データウェアハウスの進化における主な出来事をいくつかご紹介します。

  • 1960 ―ダートマス大学とゼネラル・ミルズ社は、共同研究プロジェクトにおいて、「次元」と「事実」という用語を開発した。
  • 1970 ― ACニールセンとIRIが、小売売上高向けのディメンショナルデータマートを発表。
  • 1983 ― テラデータ社は、意思決定支援のために特別に設計されたデータベース管理システムを発表した。
  • 1980年代後半 - IBM 研究者のポール・マーフィーとバリー・デブリンは、ビジネスデータウェアハウスの概念を開発した。
  • 現代のデータウェアハウスのビジョンは、 Bill インモン「データウェアハウスの父」と呼ばれることも多い。彼は、データウェアハウスと企業情報ファクトリーの構築、利用、保守に関する基礎的な著作を執筆した。

データウェアハウスはどのように機能するのか?

データウェアハウスは、1つまたは複数のデータソースから情報が集まる中央リポジトリとして機能します。データは、トランザクションシステムやその他のリレーショナルデータベースからウェアハウスに流入します。

受信データは以下のとおりです。

  1. 構造化されました
  2. 半構造化
  3. 非構造化

データは処理、変換、取り込まれ、ユーザーはビジネスインテリジェンスツール、SQLクライアント、スプレッドシートなどを通じて、厳選されたデータセットにアクセスできるようになります。データウェアハウスは、さまざまなソースからの情報を統合し、包括的なデータベースを構築します。

こうした情報をすべて一箇所に集約することで、組織は顧客を包括的に分析し、利用可能なすべてのデータポイントを考慮していることを確認できます。データウェアハウスはデータマイニングを可能にします。データマイニングは、売上増加、コスト削減、予測精度向上につながるデータ内のパターンを探索します。

データ ウェアハウスの種類

データウェアハウス(DWH)の主な種類は以下の3つです。

1. エンタープライズ データ ウェアハウス (EDW):

エンタープライズデータウェアハウスは、組織全体にわたって意思決定支援サービスを提供する集中型データウェアハウスです。データの整理と表現のための統一的なアプローチを提供し、主題別にデータを分類し、それらの区分に応じてアクセス権限を付与する機能を提供します。

2. Opera国家データストア(ODS):

An Operaナショナルデータストア(ODS)は、データウェアハウスやOLTPシステムでは組織のレポート作成ニーズを満たせない場合に使用されるデータストアです。ODSではデータがリアルタイムで更新されるため、最新の従業員記録の保存など、日常的な業務に最適です。

3. データマート:

A データ市場 データマートは、営業、財務、マーケティングなど、特定の業務分野向けに設計されたデータウェアハウスのサブセットです。独立したデータマートでは、ソースシステムから直接データを収集できます。

データウェアハウスの一般的な段階

当初、組織は比較的シンプルなデータウェアハウスの利用方法を採用していました。時が経つにつれ、より高度なパターンが現れてきました。データウェアハウス(DWH)の利用における一般的な段階は以下のとおりです。

オフライン Operaデータベース:

データは運用システムから別のサーバーにコピーされます。コピーされたデータに対するロード、処理、およびレポート作成は、運用システムのパフォーマンスに影響を与えません。

オフライン データ ウェアハウス:

データウェアハウス内のデータは、運用データベースから定期的に更新されます。データは、データウェアハウスの目的に沿うようにマッピングおよび変換されます。

リアルタイムデータウェアハウス:

データウェアハウスは、運用データベースでトランザクションが発生するたびに更新されます。航空会社や鉄道会社の予約システムは、その典型的な例です。

統合データウェアハウス:

データウェアハウスは、運用システムがトランザクションを実行するたびに継続的に更新されます。そして、データウェアハウスはトランザクションを生成し、それを運用システムに返します。

データ ウェアハウスのコンポーネント

データウェアハウスの4つの構成要素は以下のとおりです。

ロードマネージャー: フロントコンポーネントとも呼ばれるロードマネージャは、ex に関連するすべての操作を処理します。tracデータウェアハウスへのデータの変換とロード。これらの操作には、データウェアハウスへの入力用にデータを準備する変換が含まれます。

倉庫マネージャー: 倉庫管理者は、倉庫内のデータ管理に関連する業務を実行します。データの一貫性を確保するためにデータを分析したり、インデックスやビューを作成したり、非正規化や集計を生成したり、ソースデータを変換・結合したり、データをアーカイブまたはバックアップしたりします。

クエリマネージャー: バックエンドコンポーネントとも呼ばれるクエリマネージャは、ユーザーからのクエリに関連する操作を処理します。クエリを適切なテーブルにルーティングし、実行スケジュールを設定します。

エンドユーザーアクセスツール:

これらのツールは、1) データレポート、2) クエリツール、3) アプリケーション開発ツール、4) EIS ツール、5) OLAP ツールの 5 つのグループに分類されます。 データ マイニング ツール.

データウェアハウスは誰が必要とするのか?

データウェアハウス(DWH)は、以下のようなあらゆるタイプのユーザーに必要です。

  • 大量のデータに依存する意思決定者。
  • 複数の情報源からの情報を統合するために、カスタマイズされた複雑なプロセスを実行するユーザー。
  • データにアクセスするための、シンプルで手間のかからないテクノロジーを求める人々。
  • 体系的で再現性のある意思決定方法を求めるチーム。
  • レポート、ダッシュボード、グリッド、チャートなど、膨大なデータセットに対して高速なパフォーマンスを必要とするユーザー。
  • データフローやグループに隠されたパターンを発見しようとするアナリストpings.

データ ウェアハウスは何に使用されますか?

データウェアハウスが最も一般的に使用されている分野は以下のとおりです。

航空会社:

航空業界では、データウェアハウスは乗務員の割り当て、路線の収益性分析、マイレージプログラムのプロモーション、その他同様の業務上の意思決定を支援する。

銀行:

データウェアハウスは、銀行業務においてデスクリソースを効率的に管理するために広く利用されています。また、多くの銀行では、市場調査、製品性能分析、業務計画策定にも活用されています。

健康管理:

医療分野では、データウェアハウスを利用して戦略立案や結果予測を行い、患者の治療報告書を作成し、保険会社や医療扶助サービスとデータを共有している。

公的機関:

公共部門では、データウェアハウスは情報収集を支援し、政府機関が個人ごとの税務記録や医療政策記録を維持・分析するのに役立ちます。

投資と保険:

この分野では、データパターン、顧客動向、市場の動きを分析するために倉庫が利用される。

小売チェーン:

小売チェーンは、流通とマーケティングのためにデータウェアハウスを使用しています。 trac販売商品と顧客の購買パターンを分析し、プロモーションを計画し、価格設定方針を決定する。

テレコミュニケーション:

通信事業者は、製品プロモーション、販売決定、流通決定のためにデータウェアハウスを利用している。

ホスピタリティ産業:

ホスピタリティ業界では、データウェアハウスを利用して、顧客からのフィードバックや旅行パターンに基づいて、顧客をターゲットとした広告・プロモーションキャンペーンを設計・予測している。

データウェアハウスを実装するための手順

データウェアハウスの実装に伴うビジネスリスクを管理する最善の方法は、以下の3つの戦略に従うことです。

  1. 企業戦略: 現在の技術アーキテクチャとツール、さらにデータウェアハウスがサポートする必要のある事実、次元、属性を特定します。データマップping そして変革もこの段階の一部である。
  2. 段階的な導入: データウェアハウスは、対象分野に基づいて段階的に実装します。予約や請求などの関連するビジネスエンティティを最初に提供し、その後統合します。
  3. 反復プロトタイプping: データウェアハウスは、一気に導入するのではなく、開発、テスト、改良を反復的に行うべきである。

データウェアハウスの実装における主要な手順と、それぞれの成果物を以下に示します。

手順 タスク 成果
1 プロジェクトの範囲を定義する スコープ定義
2 ビジネスニーズを特定する 論理データ モデル
3 定義する Opera国家データストアの要件 Operaデータストアモデル
4 取得または開発tracツール Extracツールとソフトウェア
5 データウェアハウスのデータ要件を定義する 移行データモデル
6 ドキュメントの欠落データ やるべきことリスト
7 地図 Operaデータストアからデータウェアハウスへ データウェアハウスデータ統合マップ
8 データウェアハウスのデータベース設計を開発する データウェアハウスデータベース設計
9 Extractデータから Operaナショナルデータストア 統合データウェアデータtracts
10 データウェアハウスをロードする 初期データロード
11 データウェアハウスの維持管理 継続的なデータアクセスとそれに続くデータロード

データウェアハウスを実装するためのベストプラクティス

  • データの一貫性、正確性、および完全性をテストするための計画を策定する。
  • データウェアハウスは、適切に統合され、明確に定義され、タイムスタンプが付与されている必要がある。
  • データウェアハウスを設計する際は、適切なツールを使用し、ライフサイクルに従い、データ競合に早期に対処し、失敗から学ぶことが重要です。
  • 運用システムや運用レポートを倉庫で置き換えてはならない。
  • 過剰な時間を費やさないでくださいtracデータのクリーニングやロードなどの作業は、可能な限り自動化する。
  • データウェアハウスの実装には、ビジネスチームを含むすべての関係者を巻き込みましょう。ウェアハウスを共同プロジェクトとして捉えることで、エンドユーザーにとって常に有用なものとなるように努めてください。
  • エンドユーザー向けのトレーニング計画を準備します。

データウェアハウスの利点と欠点

データウェアハウス(DWH)の利点:

  • ビジネスユーザーは、さまざまな情報源からの重要なデータに、一箇所から迅速にアクセスできます。
  • 部門横断的な活動全体にわたって一貫した情報を提供し、アドホックなレポート作成やクエリをサポートします。
  • 複数のデータソースを統合することで、本番システムへの負荷を軽減します。
  • 分析および報告にかかる総時間を短縮します。
  • 組織再編と統合により、エンドユーザーにとってレポート作成と分析が容易になる。
  • 複数の情報源からデータを取得する必要がなくなるため、ユーザーの時間を節約できます。
  • 大量の過去データを保存することで、傾向分析や将来予測を可能にする。

データウェアハウスのデメリット:

  • 非構造化データには理想的なオプションではありません。
  • 作成と実装には時間がかかる。
  • データウェアハウスは、積極的なメンテナンスを行わないと、比較的短期間で時代遅れになってしまう可能性があります。
  • データ型、範囲、ソーススキーマ、インデックス、クエリの変更は困難です。
  • データウェアハウスは一見簡単そうに見えるが、一般ユーザーにとっては複雑なものである。
  • 最善の努力にもかかわらず、プロジェクトの範囲は実施段階で拡大する傾向がある。
  • 異なる事業部門間で、矛盾する業務ルールが策定されることがある。
  • 組織は、研修と導入のために相当なリソースを割り当てる必要がある。

データ ウェアハウジングの未来

  • 規制上の制約 異なるデータソースを組み合わせる能力が制限される可能性があり、これには保存や管理がより困難な非構造化データも含まれます。
  • として サイズ データベースの規模が拡大するにつれ、非常に大規模なデータベースとみなされる基準は上昇し続け、そのような規模のデータウェアハウスを構築および運用することはますます複雑になっている。
  • マルチメディアデータ テキストほど簡単に操作することはできない。リレーショナルソフトウェアはテキスト情報を適切に処理できるが、リッチメディアは依然として活発な研究分野である。

データ ウェアハウス ツール

市場には多くのデータウェアハウジングツールが存在します。以下に、その中でも特に有名なものをいくつか紹介します。

1.マークロジック:

MarkLogic これは、豊富なエンタープライズ機能を備え、データ統合を簡素化・高速化するデータウェアハウジングソリューションです。複雑な検索操作を実行でき、ドキュメント、リレーションシップ、メタデータのクエリも可能です。

2. Oracle:

Oracle は業界をリードするデータベースです。オンプレミス環境とクラウド環境の両方に対応した幅広いデータウェアハウスソリューションを提供し、運用効率の向上を通じて顧客体験の最適化を支援します。

3. Amazon 赤方偏移:

Amazonレッドシフト は、標準的なデータを使用してデータを分析するためのシンプルで費用対効果の高いデータウェアハウスサービスです。 SQL 既存のBIツールと連携し、クエリ最適化技術を用いてペタバイト規模の構造化データに対して複雑なクエリを実行します。

ここに便利な機能の完全なリストがあります データ ウェアハウス ツール.

よくあるご質問

データベースは、頻繁な読み書きを伴うトランザクション処理向けに構築されています。データウェアハウスは、大規模な履歴データセットに対する分析クエリに最適化されています。ウェアハウスはレポート作成を高速化するためにデータを非正規化しますが、データベースはトランザクションの整合性を保つためにデータを正規化します。

データウェアハウスは、BI(ビジネスインテリジェンス)やレポート作成のために、構造化され処理済みのデータを保存します。データレイクは、柔軟な分析や機械学習のために、構造化データ、半構造化データ、非構造化データを保存します。多くの最新のスタックでは、ガバナンスと柔軟性を両立させるために、これら両方を組み合わせたレイクハウスが採用されています。

ETLはExの略ですtract、変換、ロード。これは、ソースシステムからデータを取得し、クリーンアップして整形し、データウェアハウスにロードするパイプラインです。最新のELTアプローチでは、最後の2つのステップを逆にして、ウェアハウス内でデータを変換します。

AIは、データウェアハウスに自律的なチューニング、クエリの高速化、予測的なETL監視、自然言語分析といった機能をもたらします。Snowflake、BigQuery、Databricksなどのクラウドプラットフォームには、SQLを生成し、モデルを推奨し、ビジネスレポートに影響が出る前に異常を検出するAIコパイロットが組み込まれています。

はい。AIツールは、ソーススキーマ、ビジネス用語集、BIレポートを分析し、ディメンションモデル、スタースキーマ、集計テーブルを推奨します。 Archi技術者はその後、AIの提案を洗練させることで、初期モデリングを加速させ、レポート間で定義の不整合が生じるリスクを低減します。