Apa itu Skema Bintang dalam pemodelan Data Warehouse?

โšก Ringkasan Cerdas

Skema Bintang dalam pemodelan gudang data menempatkan tabel fakta pusat di inti tabel dimensi di sekitarnya, menciptakan desain berbentuk bintang yang tidak dinormalisasi yang menyederhanakan kueri analitik, mempercepat pelaporan, dan mendukung kubus OLAP di seluruh platform intelijen bisnis.

  • ๐ŸŒŸ Struktur Inti: Tabel fakta pusat terhubung langsung ke tabel dimensi yang dinormalisasi, membentuk bentuk bintang yang menjadi nama skema tersebut.
  • ๐Ÿ“Š Tabel Fakta: Tabel fakta menyimpan ukuran seperti unit terjual dan pendapatan, ditambah kunci asing yang menghubungkan ke setiap dimensi di sekitarnya.
  • ๏ธ Tabel Dimensi: Tabel dimensi menyimpan atribut deskriptif seperti produk, dealer, cabang, dan tanggal yang memungkinkan analis untuk memilah dan menyaring fakta.
  • โšก Kinerja Kueri: Dimensi yang dinormalisasi berarti lebih sedikit operasi join, sehingga skema bintang menghasilkan SQL yang sederhana dan pelaporan yang cepat pada kumpulan data yang besar.
  • โ„๏ธ Bintang vs Kepingan Salju: Skema bintang menyimpan setiap dimensi dalam satu tabel, sedangkan skema kepingan salju menormalkan dimensi ke dalam tabel sub-dimensi yang saling terkait.
  • ๏ธ Langkah-langkah Desain: Membangun skema bintang mengikuti alur Kimball: pilih proses bisnis, tetapkan tingkat detail (grain), pilih dimensi, lalu definisikan fakta.
  • ๐ŸงŠ OLAP dan BI: Skema bintang menjadi masukan bagi kubus OLAP dan didukung secara luas oleh alat BI, meskipun denormalisasi yang berlebihan melemahkan integritas data.

Skema Bintang dalam pemodelan gudang data dengan tabel fakta pusat dan tabel dimensi di sekitarnya.

Apa itu Skema Bintang?

A skema bintang Dalam data warehouse, struktur pemodelannya adalah tabel fakta pusat yang terhubung ke sejumlah tabel dimensi terkait. Struktur ini disebut skema bintang karena tata letaknya menyerupai bintang, dengan tabel fakta berada di tengah dan tabel dimensi memancar keluar seperti titik-titik.

Skema bintang adalah jenis skema gudang data yang paling sederhana, dan juga dikenal sebagai skema gabungan bintang. Karena tabel dimensinya tidak dinormalisasi, model ini dioptimalkan untuk melakukan kueri pada kumpulan data yang sangat besar, yang menjadikannya pilihan umum untuk pemodelan dimensi dan pelaporan.

Apa itu Skema Multidimensi?

A skema multidimensi Dirancang khusus untuk memodelkan sistem gudang data. Skema ini menjawab kebutuhan unik dari basis data yang sangat besar yang dibangun untuk tujuan analitis. OLAP alih-alih untuk pemrosesan transaksi rutin.

Jenis-jenis skema gudang data: Terdapat tiga jenis utama skema multidimensi, dan masing-masing menawarkan keunggulan tersendiri.

  • Skema bintang โ€“ tabel fakta pusat yang terhubung langsung ke tabel dimensi yang telah dinormalisasi.
  • Skema kepingan salju โ€“ perluasan dari skema bintang di mana dimensi dinormalisasi ke dalam tabel sub-dimensi tambahan.
  • Skema galaksi โ€“ juga disebut sebagai konstelasi fakta, ia menggunakan beberapa tabel fakta yang memiliki tabel dimensi yang sama.

Karena skema snowflake dibangun langsung di atas skema bintang, ada baiknya membandingkan kedua model tersebut sebelum mengerjakan contoh skema bintang secara detail.

Skema Bintang vs Skema Kepingan Salju

Skema bintang dan skema kepingan salju Keduanya mengatur data di sekitar tabel fakta dan dimensi, tetapi berbeda dalam cara penyimpanan dimensinya. Skema bintang menyimpan setiap dimensi dalam satu tabel yang tidak dinormalisasi, sedangkan skema kepingan salju menormalisasi dimensi tersebut ke dalam beberapa tabel yang saling terkait.

  • Struktur: Skema bintang bersifat datar dan sederhana; skema kepingan salju membagi dimensi menjadi sub-dimensi.
  • Kecepatan kueri: Skema bintang membutuhkan lebih sedikit operasi join, sehingga kueri biasanya berjalan lebih cepat dan kode SQL tetap lebih sederhana.
  • penyimpanan: Skema Snowflake menghilangkan redundansi, sehingga menggunakan lebih sedikit ruang tetapi menambah kompleksitas desain.
  • Integritas data: Dimensi kepingan salju yang dinormalisasi lebih baik dalam menegakkan integritas, sedangkan dimensi bintang yang didenormalisasi lebih mengutamakan kinerja.
  • Mudah digunakan: Skema bintang lebih mudah dipahami oleh analis dan lebih cepat dipelihara, sedangkan skema kepingan salju membutuhkan desain yang lebih cermat.

Dalam praktiknya, tim sering memilih skema bintang untuk data mart dan dasbor yang membutuhkan pelaporan cepat dan mudah, dan skema kepingan salju ketika penghematan penyimpanan dan konsistensi yang ketat lebih penting.

Contoh Skema Bintang

Dalam contoh skema bintang berikut, tabel fakta berada di tengah dan menyimpan kunci untuk setiap tabel dimensi, seperti Dealer_ID, Model_ID, Date_ID, Product_ID, dan Branch_ID, beserta atribut yang dapat diukur seperti unit terjual dan pendapatan.

Contoh pemodelan data skema bintang dengan tabel fakta penjualan pusat yang digabungkan dengan tabel dimensi produk, dealer, cabang, tanggal, dan model.
Contoh Diagram Skema Bintang

Setiap tabel dimensi di sekitarnya menambahkan konteks deskriptif pada ukuran-ukuran tersebut, sehingga satu kueri dapat mengelompokkan atau memfilter fakta penjualan berdasarkan dealer, model, tanggal, produk, atau cabang tanpa menggabungkan tabel lain.

Tabel Fakta

Tabel fakta dalam skema bintang berisi fakta dan terhubung ke dimensi. Tabel fakta memiliki dua jenis kolom:

  • Kolom yang menyimpan fakta, atau ukuran.
  • Kunci asing yang menghubungkan ke setiap tabel dimensi.

Secara umum, kunci utama dari sebuah tabel fakta adalah kunci komposit yang terdiri dari semua kunci asing yang membentuk tabel tersebut.

Tabel fakta dapat berisi fakta tingkat detail atau fakta yang telah diagregasi. Tabel fakta yang mencakup fakta yang telah diagregasi sering disebut tabel ringkasan, dan biasanya berisi fakta yang telah diagregasi hingga tingkat tertentu.

Tabel Dimensi

Dimensi adalah struktur yang mengkategorikan data ke dalam hierarki. Dimensi tanpa hierarki dan tingkatan disebut dimensi datar atau daftar. Kunci utama setiap tabel dimensi merupakan bagian dari kunci utama komposit tabel fakta.

Atribut dimensi adalah atribut tekstual deskriptif yang membantu menjelaskan nilai dimensi, seperti nama produk atau kota. Karena tabel dimensi menyimpan konteks deskriptif ini dan bukan peristiwa transaksional, tabel fakta biasanya jauh lebih besar daripada tabel dimensi.

Cara Mendesain Skema Bintang

Perancangan skema bintang mengikuti pendekatan pemodelan dimensional yang dipopulerkan oleh Ralph Kimball. Tujuannya adalah untuk mengatur ukuran bisnis di sekitar dimensi yang jelas dan dapat digunakan kembali sehingga model yang dihasilkan mudah untuk dipertanyakan dan cepat untuk dilaporkan. Lima langkah di bawah ini menguraikan proses yang diikuti oleh sebagian besar proyek pemodelan dimensional, mulai dari pertanyaan bisnis tingkat tertinggi hingga tabel fakta dan dimensi fisik.

  1. Identifikasi proses bisnis: Pilih aktivitas yang ingin Anda analisis, seperti penjualan, pengiriman.pingatau inventaris. Keputusan ini menentukan apa yang akan diukur oleh tabel fakta.
  2. Sebutkan jenis biji-bijiannya: Tentukan tingkat detail yang diwakili oleh setiap baris fakta, misalnya satu baris per item, per transaksi, atau per hari. Tingkat detail yang jelas menjaga konsistensi model.
  3. Identifikasi dimensinya: Cantumkan konteks deskriptif yang dibutuhkan untuk memilah fakta, seperti produk, pelanggan, dealer, cabang, dan tanggal. Masing-masing menjadi tabel dimensi atribut.
  4. Identifikasi fakta-faktanya: Tentukan ukuran numerik yang diinginkan bisnis. track, seperti unit terjual, pendapatan, atau biaya, dan tempatkan di tabel fakta pusat.
  5. Bangun bintangnya: Hubungkan tabel fakta ke setiap dimensi melalui kunci asing, simpanping Dimensi-dimensi tersebut dinormalisasi sehingga diagram membentuk tabel fakta pusat tunggal yang dikelilingi oleh dimensi-dimensinya.

Setelah struktur bintang dibuat, tambahkan kunci pengganti (surrogate key) ke setiap dimensi, pastikan setiap tabel fakta memiliki dimensi tanggal yang terkait, dan konfirmasikan bahwa semua fakta berada pada tingkat detail yang sama. Sebaiknya juga memuat data atomik tingkat terendah terlebih dahulu, karena tabel ringkasan selalu dapat dibuat kemudian. Mengikuti aturan-aturan ini akan menjaga skema tetap optimal untuk kinerja tinggi dan sederhana. data warehouse pelaporan.

Karakteristik Skema Bintang

  • Setiap dimensi dalam skema bintang hanya diwakili oleh satu tabel dimensi.
  • Setiap tabel dimensi berisi kumpulan atributnya sendiri.
  • Tabel dimensi dihubungkan ke tabel fakta menggunakan kunci asing.
  • Tabel dimensi tidak saling terhubung.
  • Tabel fakta berisi kunci dan ukuran.
  • Skema bintang mudah dipahami dan memberikan penggunaan disk yang optimal.
  • Tabel dimensi tidak dinormalisasi. Misalnya, pada contoh di atas, Country_ID tidak memiliki tabel pencarian Negara terpisah seperti yang seharusnya. OLTP desain akan.
  • Skema ini didukung secara luas oleh perangkat BI.

Keuntungan Skema Bintang

Skema bintang menawarkan beberapa manfaat yang menjadikannya titik awal yang populer untuk desain gudang data:

  • Skema bintang menggunakan logika penggabungan yang lebih sederhana daripada skema lain saat mengambil data dari sumber transaksional yang sangat dinormalisasi.
  • Skema bintang menyederhanakan logika pelaporan bisnis umum, seperti pelaporan periode ke periode dan pelaporan per tanggal.
  • Skema bintang banyak digunakan oleh sistem OLAP untuk membangun kubus secara efisien, dan skema bintang dapat berfungsi sebagai sumber tanpa perlu mendesain struktur kubus di sebagian besar sistem OLAP utama.
  • Dengan mengaktifkan penyetelan kinerja spesifik yang dapat diterapkan pada kueri, prosesor kueri dapat menawarkan rencana eksekusi yang lebih baik.

Kelemahan Skema Bintang

  • Karena skema tersebut sangat tidak dinormalisasi, integritas data tidak ditegakkan secara ketat.
  • Sistem ini kurang fleksibel dalam hal kebutuhan analisis tingkat lanjut.
  • Skema bintang tidak memperkuat hubungan banyak-ke-banyak antara entitas bisnis.

Kapan Menggunakan Skema Bintang?

Skema bintang adalah pilihan yang tepat ketika kinerja kueri yang cepat dan dapat diprediksi lebih penting daripada penghematan ruang penyimpanan. Karena model ini menjaga tabel dimensinya tetap tidak dinormalisasi dan jumlah penggabungan (join) rendah, model ini cocok untuk beban kerja analitik di mana pengguna bisnis berulang kali menjalankan laporan, dasbor, dan agregasi serupa pada volume data historis yang besar.

Situasi umum di mana skema bintang sangat cocok meliputi:

  • Data mart: Departemen data mart Hubungan yang sederhana dan mudah dipahami akan mendapat manfaat dari struktur yang mudah dibaca.
  • Dasbor BI: Intelijen bisnis Alat-alat tersebut terintegrasi dengan rapi ke dalam skema bintang, sehingga laporan dan visualisasi dapat dibuat dengan cepat.
  • Kubus OLAP: Skema bintang merupakan sumber alami untuk kubus OLAP, agregasi, dan analisis irisan-dan-potong.

Jika prioritasnya bergeser ke penyimpanan minimal, integritas data yang ketat, atau hierarki yang dalam dan berubah-ubah, skema snowflake atau desain yang lebih ternormalisasi mungkin lebih cocok. Banyak tim bahkan menggabungkan keduanya, dimulai dengan skema bintang dan menormalisasi hanya dimensi yang benar-benar membutuhkannya.

Pertanyaan Umum Demo Slot

Tabel fakta menyimpan peristiwa bisnis numerik yang terukur, seperti unit terjual atau pendapatan, ditambah kunci asing. Tabel dimensi menyimpan atribut deskriptif, seperti produk, tanggal, atau cabang, yang memberikan konteks pada fakta-fakta tersebut. Tabel fakta biasanya jauh lebih besar daripada tabel dimensi.

Skema bintang tidak dinormalisasi. Setiap dimensi disimpan dalam satu tabel tanpa sub-tabel pencarian, yang mengurangi jumlah penggabungan (join) dan mempercepat kueri. Kelemahannya adalah adanya redundansi data dan penegakan integritas data yang lebih lemah dibandingkan dengan skema kepingan salju yang dinormalisasi.

Skema galaksi, juga disebut konstelasi fakta, berisi beberapa tabel fakta yang berbagi tabel dimensi umum. Ini cocok untuk gudang data yang kompleks. tracSkema ini menggabungkan beberapa proses bisnis sekaligus, tetapi lebih sulit untuk dirancang dan dikueri daripada skema bintang satu fakta.

Skema bintang klasik menggunakan satu tabel fakta pusat. Ketika sebuah gudang data membutuhkan beberapa tabel fakta yang berbagi dimensi, desainnya menjadi skema galaksi atau konstelasi fakta. Keeping Satu tabel fakta per bintang membuat kueri tetap sederhana dan model mudah dipahami.

Kunci pengganti (surrogate key) adalah pengidentifikasi yang dihasilkan sistem, biasanya berupa bilangan bulat, yang digunakan sebagai kunci utama tabel dimensi sebagai pengganti kunci bisnis. Fungsinya adalah untuk mempercepat proses penggabungan (join), tetap stabil ketika kunci sumber berubah, dan mendukung berbagai fitur. tracRaja mengalami perubahan historis dalam dimensi.

Ya. Power BI Dioptimalkan untuk skema bintang, sehingga pemodelan data sebagai satu tabel fakta yang dikelilingi oleh dimensi meningkatkan kinerja, menyederhanakan ukuran DAX, dan membuat hubungan lebih mudah dikelola daripada desain kepingan salju atau datar.

Asisten AI dapat menyarankan tabel fakta dan dimensi dari deskripsi skema, merekomendasikan tingkat detail (grain), dan menandai dimensi tanggal atau kunci pengganti yang hilang. Mereka mempercepat pemodelan, tetapi seorang insinyur data harus meninjau desain yang diusulkan sebelum membangunnya di lingkungan produksi.

Ya. ChatGPT ke Kopilot GitHub dapat membuat draf perintah CREATE TABLE dan perintah JOIN untuk tabel fakta dan dimensi dari perintah singkat. RevPeriksa kunci, tipe data, dan granularitas yang dihasilkan sebelum menjalankan SQL, karena AI dapat salah membaca persyaratan.

Ringkaslah postingan ini dengan: