Star Schema และ Extended Star Schema ใน SAP บีไอ/บีดับเบิลยู

⚡ สรุปอย่างชาญฉลาด

แผนผังดาวและแผนผังดาวแบบขยายใน SAP BW จัดระเบียบข้อมูลลงในตารางข้อเท็จจริงและตารางมิติ โดยที่แบบจำลองที่ขยายออกไปจะเชื่อมโยงมิติเข้ากับข้อมูลหลักผ่านตาราง SID ซึ่งช่วยให้สามารถวิเคราะห์ได้ลึกซึ้งยิ่งขึ้นและนำข้อมูลหลักกลับมาใช้ใหม่ได้มากขึ้น

  • โครงสร้างดาวแบบคลาสสิก: ตารางข้อเท็จจริงส่วนกลางล้อมรอบด้วยตารางมิติที่เก็บข้อมูลหลักภายในคิวบ์
  • 🔗 โครงสร้างดาวแบบขยาย: ตาราง SID เชื่อมโยงมิติข้อมูลกับข้อมูลหลักที่จัดเก็บไว้ภายนอกคิวบ์เพื่อนำกลับมาใช้ใหม่
  • 📐 ระดับความลึกของการวิเคราะห์: โมเดลที่ขยายเพิ่มเติมนี้รองรับมิติ 16 มิติ คูณด้วยตาราง SID จำนวน 248 ตาราง เพื่อการวิเคราะห์ที่ละเอียดกว่าเดิม
  • 🔑 ตาราง SID: รหัสตัวแทน (Surrogate IDs) ทำหน้าที่เชื่อมโยงตารางมิติเข้ากับตารางคุณลักษณะ ตารางข้อความ และตารางข้อมูลหลัก
  • 📊 ตารางข้อเท็จจริง: ตารางข้อเท็จจริงประกอบด้วยตัวเลขสำคัญและรองรับตัวเลขสำคัญที่วัดได้มากถึง 233 รายการ
  • 🤖 ความช่วยเหลือจาก AI: AI และ SAP HANA ปรับแต่งโมเดลเหล่านี้เพื่อรองรับการสืบค้นข้อมูลเชิงวิเคราะห์ขนาดใหญ่และรวดเร็ว

Star Schema และ Extended Star Schema ใน SAP บีไอ/บีดับเบิลยู

Schema คืออะไร?

ในระบบจัดการฐานข้อมูล (DBMS) สคีมา (schema) แทนฐานข้อมูลเชิงสัมพันธ์ โดยกำหนดตาราง ฟิลด์ในแต่ละตาราง และความสัมพันธ์ระหว่างฟิลด์และตาราง กล่าวอีกนัยหนึ่ง สคีมาคือกลุ่มของวัตถุในฐานข้อมูล ซึ่งรวมถึงตาราง มุมมอง ดัชนี และคำพ้องความหมาย โดยทั่วไป สคีมาจะถูกจัดเก็บไว้ในพจนานุกรมข้อมูล

โครงสร้างดาวแบบคลาสสิกคืออะไร?

แบบจำลองข้อมูลแบบสตาร์สกีมาแบบคลาสสิกเป็นแบบจำลองข้อมูลหลายมิติ โดยมีพื้นฐานมาจากจุดศูนย์กลาง ตารางข้อเท็จจริง ล้อมรอบด้วยตารางหลายมิติเป็นรูปดาว (จึงเป็นที่มาของชื่อ)

InfoCube ประกอบด้วยหลายส่วน วัตถุข้อมูล (ลักษณะเฉพาะและตัวเลขสำคัญ) และมีโครงสร้างตามแบบแผนดาว (Star Schema) ประกอบด้วยตารางข้อเท็จจริงขนาดใหญ่ที่มีตัวเลขสำคัญสำหรับ InfoCube ซึ่งล้อมรอบด้วยตารางมิติหลายตารางที่ประกอบกันเป็นรูปดาว ตารางข้อเท็จจริงหนึ่งตารางสามารถมีมิติได้สูงสุด 16 มิติ

ข้อดีของโครงสร้างข้อมูลแบบดาว (Star Schema) ได้แก่ การแบ่งข้อมูลทำได้ง่าย เข้าใจง่าย และประสิทธิภาพการทำงานดีขึ้น

แผนผังดาวใน SAP บีไอ/บีดับเบิลยู

Extended Star Schema คืออะไร?

ในสคีมาแบบดาวขยาย ตารางข้อเท็จจริง (fact table) และตารางข้อมูลหลัก (master data table) เชื่อมต่อกันผ่านตาราง SID (Surrogate ID) ตารางข้อเท็จจริงและตารางมิติ (dimension table) อยู่ภายในคิวบ์ ในขณะที่ข้อมูลหลักอยู่ภายนอกคิวบ์ มีขีดความสามารถในการวิเคราะห์ 16 × 248 (ตาราง SID) ตารางข้อเท็จจริงมีขนาดเล็กและตารางมิติมีขนาดใหญ่ ซึ่งแตกต่างจากสคีมาแบบดาวแบบดั้งเดิม ภายใต้สคีมาแบบดาวขยาย ตารางมิติจะไม่มีข้อมูลหลักอยู่ด้วย

โครงร่างดาวขยายใน SAP บีไอ/บีดับเบิลยู

ส่วนประกอบต่างๆ ของแผนผังดาวแบบขยายมีดังนี้:

  1. ตารางคุณลักษณะจะเก็บคุณลักษณะของข้อมูลหลัก
  2. ตาราง SID จะสร้าง SID (Surrogate ID) ที่ไม่ซ้ำกันสำหรับทุกระเบียนข้อมูลหลัก
  3. ตารางมิติจะสร้าง DimID สำหรับทุกชุดค่าผสมที่ไม่ซ้ำกันของ SID (ตารางมิติสามารถรองรับคุณลักษณะ SID ได้สูงสุด 248 รายการ)
  4. ตารางข้อความนี้บรรจุคำอธิบายของข้อมูลหลัก
  5. ตารางข้อเท็จจริงประกอบด้วยชุดค่าผสมที่ไม่ซ้ำกันของ DimID และตัวเลขสำคัญ (ตารางข้อเท็จจริงสามารถรองรับตัวเลขสำคัญได้สูงสุด 233 รายการ)

โครงร่างดาวขยายใน SAP บีไอ/บีดับเบิลยู

ด้านล่างนี้คือตัวอย่างตารางข้อเท็จจริงของ InfoCube

โครงร่างดาวขยายใน SAP บีไอ/บีดับเบิลยู

ตารางมิติและตาราง SID อยู่ด้านล่าง

โครงร่างดาวขยายใน SAP บีไอ/บีดับเบิลยู

ด้านล่างนี้คือข้อมูลหลักและตารางข้อความของ InfoObject

โครงร่างดาวขยายใน SAP บีไอ/บีดับเบิลยู

InfoCube: ตัวอย่าง Extended Star Schema

ต่อไปนี้เป็นตัวอย่างของ InfoCube ที่แสดงโครงสร้างแบบดาว (star schema) ที่ขยายเพิ่มเติม

ขั้นตอนอธิบายโครงสร้างข้อมูลแบบดาวขยายของ InfoCube:

  1. ตารางข้อเท็จจริงของ InfoCube มีค่าเป็น 3
  2. ค่าของตารางข้อเท็จจริง (“3”) จะถูกแมปในตารางมิติ
  3. รหัสมิติ "3" มี SID ที่แมปในตาราง SID
  4. ค่า SID จะถูกแมปกับตารางข้อความและตารางข้อมูลหลัก

ตัวอย่าง InfoCube Extended Star Schema

คำถามที่พบบ่อย

ตาราง SID (Surrogate ID) กำหนดคีย์จำนวนเต็มสั้นๆ ที่ไม่ซ้ำกันให้กับค่าข้อมูลหลักแต่ละค่า ในสคีมาแบบสตาร์ที่ขยายแล้ว ตาราง SID จะเชื่อมโยงตารางมิติเข้ากับตารางข้อมูลหลัก ตารางข้อความ และตารางคุณลักษณะ ซึ่งช่วยปรับปรุงประสิทธิภาพการเชื่อมต่อและการนำกลับมาใช้ใหม่

ข้อมูลหลักจะถูกจัดเก็บไว้นอก InfoCube ในตารางแอตทริบิวต์ ตารางข้อความ และตาราง SID แยกต่างหาก ไม่ได้จัดเก็บไว้ภายในตารางมิติ การแยกข้อมูลเช่นนี้ทำให้สามารถนำข้อมูลหลักเดียวกันไปใช้ซ้ำได้ใน InfoCube หลายๆ ตัว แทนที่จะต้องคัดลอกข้อมูลซ้ำซ้อน

ตารางข้อเท็จจริง (Fact Table) จะจัดเก็บตัวเลขสำคัญที่วัดได้และรหัส DimID ที่เชื่อมโยงกับมิติข้อมูล ส่วนตารางมิติข้อมูล (Dimension Table) จะจัดกลุ่มคุณลักษณะที่เกี่ยวข้องและเชื่อมต่อผ่านตาราง SID กับข้อมูลหลักที่อธิบายคุณลักษณะเหล่านั้น ตารางข้อเท็จจริงมีขนาดใหญ่ ส่วนตารางมิติข้อมูลมีขนาดเล็กกว่า

ใช่. SAP HANA และแมชชีนเลิร์นนิงวิเคราะห์รูปแบบการสืบค้นเพื่อแนะนำการรวมข้อมูล การแบ่งพาร์ติชัน และการเปลี่ยนแปลงโมเดล ใน SAP ใน Datasphere และ Analytics Cloud ปัญญาประดิษฐ์ (AI) ยังช่วยแนะนำโมเดลและแสดงข้อมูลเชิงลึกจากโครงสร้างพื้นฐานของข้อมูลอีกด้วย

การเรียนรู้ของเครื่องจะอ่านข้อมูลข้อเท็จจริงและมิติที่มีโครงสร้างและสะอาดตา เพื่อฝึกฝนโมเดลการพยากรณ์และการตรวจจับความผิดปกติ คีย์และข้อมูลหลักที่สอดคล้องกันของสตาร์สคีมา ทำให้เป็นรากฐานที่เชื่อถือได้สำหรับการวิเคราะห์และการวางแผนที่ขับเคลื่อนด้วย AI

สรุปโพสต์นี้ด้วย: