Hvad er Data Mart i Data Warehouse? Typer og eksempler

โšก Smart opsummering

Data Mart-design leverer en fokuseret delmรฆngde af datalagerinformation til รฉn afdeling, der spรฆnder over de tre data mart-typer, de fem faser fra design til administration og de bedste fremgangsmรฅder, der sikrer hurtig, sikker og omkostningseffektiv levering.

  • ๐ŸŽฏ Definition: Et datamart er en emneorienteret delmรฆngde af et datalager, bygget til รฉn afdeling sรฅsom salg, marketing, HR eller finans.
  • ๐Ÿงฉ Mart-typer: Afhรฆngige marts henter varer fra et centrallager, uafhรฆngige marts henter varer direkte fra driftssystemer, og hybride marts kombinerer begge dele.
  • ๐Ÿ‡ง๐Ÿ‡ท Implementeringsfaser: Opbygning af et datamart gรฅr gennem design, konstruktion, udfyldning, adgang til og administration.
  • ๐Ÿ”Œ ETL og RDBMS: En RDBMS gemmer markedet, mens et ETL-vรฆrktรธj kortlรฆgger, f.eks.tracts, transformerer, renser og indlรฆser kildedata plus metadata.
  • ๐Ÿ“Š Dimensionsdesign: Modellering af data omkring et stjerneskema fremskynder forespรธrgsler og forenkler rapportering for forretningsbrugere.
  • ๐Ÿ’ก Forretningspรฅvirkning: Et mindre omfang betyder hurtigere forespรธrgsler, lavere omkostninger, strammere adgangskontrol og hurtigere levering end et fuldt lager.
  • ๐Ÿงญ Bedste praksis: Hold leveringscyklussen til uger, budgetter hardware og netvรฆrk, og involver alle interessenter tidligt.

Data Mart i et datalager, der viser afhรฆngige, uafhรฆngige og hybride data marts

Et datacenter bringer den analytiske kraft fra en datalager til et enkelt team. Ved at fokusere pรฅ รฉt emneomrรฅde giver det en afdeling mulighed for hurtigt at analysere sine egne data uden at skulle vente bagefter virksomhedsomfattende arbejdsbyrder. Afsnittene nedenfor forklarer, hvad et datacenter er, hvorfor organisationer bruger et, de tre tilgรฆngelige typer, og hvordan man implementerer og administrerer et.

Hvad er Data Mart?

Et datamart fokuserer pรฅ et enkelt funktionelt omrรฅde i en organisation og indeholder en delmรฆngde af de data, der er lagret i et Data varehusDet er en kondenseret version af et datalager, designet til brug for en bestemt afdeling, enhed eller gruppe af brugere โ€“ for eksempel marketing, salg, HR eller finans.

Fordi et datacenter kun tjener รฉn funktion, styres det normalt af en enkelt afdeling i organisationen. Dette fokus holder dets omfang snรฆvert og dets ejerskab klart.

Et datacenter henter ogsรฅ kun data fra fรฅ kilder, i modsรฆtning til et datalager, der integrerer mange. Som fรธlge heraf er datamarts smรฅ i stรธrrelse og langt mere fleksible end et komplet datalager.

Hvorfor har vi brug for Data Mart?

Organisationer er afhรฆngige af datamarts af flere praktiske รฅrsager:

  • Et datacenter forbedrer brugernes svartid ved at reducere mรฆngden af โ€‹โ€‹data, de forespรธrger.
  • Det giver nem adgang til ofte efterspurgte data.
  • Et datamart er enklere og billigere at implementere end et virksomhedsdatalager.
  • Den er agil: Nรฅr modellen รฆndres, kan et mindre datacenter hurtigt genopbygges.
  • Et datamart defineres af en enkelt fagekspert, hvorimod et datawarehouse defineres af et tvรฆrfagligt team, sรฅ et mart er mere รฅbent for forandringer.
  • Data er partitioneret, hvilket giver meget detaljerede adgangskontrolrettigheder.
  • Data kan segmenteres og lagres pรฅ forskellige hardware- eller softwareplatforme.

Kort sagt, fordi et datacenter hรฅndterer et mindre, veldefineret dataudsnit, er det hurtigere at bygge, billigere at drive og nemmere at sikre end et virksomhedsdatalager.

Datamarts er dog ikke alle bygget pรฅ samme mรฅde. Kilden et mart henter fra bestemmer, hvilken af โ€‹โ€‹tre typer du arbejder med.

Typer af Data Mart

Der er tre hovedtyper af datamarts, der adskiller sig ved, hvor de henter deres data fra:

  1. Afhรฆngig: Afhรฆngige datamarts trรฆkker data direkte fra driftskilder, eksterne kilder eller begge dele.
  2. Uafhรฆngig: Et uafhรฆngigt datamart oprettes uden et centralt datalager.
  3. Hybrid: Et hybrid datamart kan tage data fra datalagre eller driftssystemer.

Afhรฆngig Data Mart

Et afhรฆngigt datamarts henter en organisations data fra et enkelt datalager, hvilket giver den fordelen af โ€‹โ€‹centralisering. Hvis du har brug for at opbygge et eller flere fysiske datamarts, konfigurerer du dem som afhรฆngige datamarts.

Et afhรฆngigt datamart kan bygges pรฅ to mรฅder: รฉn, hvor brugerne tilgรฅr bรฅde datamarten og datalageret afhรฆngigt af behovet, og รฉn, hvor adgangen er begrรฆnset til kun datamarten. Den anden tilgang er ikke optimal, fordi den kan producere en "dataskrotplads" - data, der starter fra en fรฆlles kilde, men derefter kasseres og stort set ikke bruges.

Afhรฆngig Data Mart, der henter data fra et enkelt datalager
Afhรฆngig Data Mart

Independent Data Mart

Et uafhรฆngigt datacenter oprettes uden et centralt datalager. Denne type datacenter er en ideel mulighed for mindre grupper inden for en organisation.

Et uafhรฆngigt datacenter har ingen relation til et virksomhedsdatalager eller til noget andet datacenter. Dets data indlรฆses og analyseres alene. Denne tilgang gรฅr imod hovedรฅrsagen til at opbygge et datalager i fรธrste omgang: et ensartet, centraliseret lager af virksomhedsdata, som mange brugere med forskellige interesser kan analysere.

Uafhรฆngigt datacenter skabt uden et centralt datalager

Independent Data Mart

Hybrid Data Mart

Et hybrid datacenter kombinerer input fra kilder uden for datalageret. Dette er nyttigt, nรฅr du har brug for ad hoc-integration โ€“ for eksempel efter en ny gruppe eller et nyt produkt er tilfรธjet til organisationen.

Det er velegnet til miljรธer med flere databaser og tilbyder en hurtig implementeringsproces med minimal datarensningsindsats. Et hybrid datacenter understรธtter ogsรฅ store lagerstrukturer og fungerer godt til mindre, datacentrerede applikationer.

Hybrid Data Mart, der kombinerer et datalager med andre kilder

Hybrid Data Mart

Trin i implementering af en Datamart

De fem trin i implementeringen af โ€‹โ€‹et datamarked

Trin i implementering af en Datamart

Implementering af et datacenter er en givende, men detaljeret proces. Den gennemgรฅr fem faser โ€“ design, konstruktion, udfyldning, adgang og administration โ€“ som hver isรฆr er beskrevet nedenfor.

Design

Design er den fรธrste fase i implementeringen af โ€‹โ€‹et datamart. Det dรฆkker alle opgaver fra den indledende anmodning om et datamart til indsamling af krav, og det slutter med det logiske og fysiske datamart-design.

Designtrinnet involverer fรธlgende opgaver:

  • Indsamling af forretningsmรฆssige og tekniske krav og identifikation af datakilder.
  • Valg af det relevante undersรฆt af data.
  • Design af den logiske og fysiske struktur af datamarkedet.

Data kan opdeles baseret pรฅ fรธlgende kriterier:

  • Dato
  • Forretnings- eller funktionel enhed
  • Geografi
  • Enhver kombination af ovenstรฅende

Data kan partitioneres pรฅ applikations- eller DBMS-niveau, selvom partitionering pรฅ applikationsniveau anbefales, fordi det muliggรธr en forskellig datamodel hvert รฅr, efterhรฅnden som forretningsmiljรธet รฆndrer sig. De fleste datamarts er bygget pรฅ en dimensionel model, sรฅsom et stjerneskema, for at holde forespรธrgsler hurtige.

Hvilke produkter og teknologier har du brug for?

En simpel pen og papir er tilstrรฆkkeligt pรฅ dette stadie. Vรฆrktรธjer, der hjรฆlper dig med at oprette UML- eller entitetsrelationsdiagrammer, kan ogsรฅ tilfรธje metadata til dine logiske og fysiske designs.

Konstruktion

Konstruktion er den anden fase af implementeringen. Det involverer oprettelse af den fysiske database og de logiske strukturer.

Dette trin involverer fรธlgende opgave:

  • Implementering af den fysiske database, der blev designet i den tidligere fase โ€” for eksempel oprettelse af skemaobjekter sรฅsom tabeller, indekser og visninger.

Hvilke produkter og teknologier har du brug for?

Du skal bruge et relationelt databasestyringssystem (RDBMS) for at konstruere et datamarts. Et RDBMS tilbyder adskillige funktioner, der er afgรธrende for et datamarts succes:

  • Lagerstyring: Et RDBMS lagrer og administrerer data, sรฅ du kan oprette, tilfรธje og slette poster.
  • Hurtig dataadgang: Med en SQL-forespรธrgsel kan du nemt hente data baseret pรฅ specifikke betingelser eller filtre.
  • Databeskyttelse: RDBMS'en kan gendanne efter systemfejl sรฅsom strรธmafbrydelser og gendanne data fra sikkerhedskopier, hvis en disk fejler.
  • Multiuser support: Det tilbyder samtidig adgang, sรฅ flere brugere kan lรฆse og รฆndre data uden at overskrive hinandens รฆndringer.
  • Sikkerhed: Den regulerer, hvilke brugere der kan tilgรฅ hvilke objekter, og hvilke handlinger de kan udfรธre.

Befolker

I den tredje fase indlรฆses data i datamartet.

Udfyldningstrinnet involverer fรธlgende opgaver:

  • Kortping kildedata til mรฅldata.
  • Extrackildedataene.
  • Rensning og transformation af data.
  • Indlรฆsning af data i datamarten.
  • Oprettelse og lagring af metadata.

Hvilke produkter og teknologier har du brug for?

Du udfรธrer disse opgaver med en ETL (f.eks.tract, Transformer, Indlรฆs) vรฆrktรธj. Det undersรธger datakilderne, udfรธrer kilde-til-mรฅl-kortlรฆgningping, og sรฅ eks.tracts, transformerer, renser og indlรฆser dataene i datamarten.

Undervejs opretter vรฆrktรธjet ogsรฅ metadata โ€“ detaljer som hvor dataene kommer fra, hvor nye de er, hvilke รฆndringer der er foretaget, og hvilket niveau af opsummering der er anvendt.

Adgang

Adgang er det fjerde trin, og det sรฆtter dataene i brug: forespรธrgsler om data, opbygning af rapporter og diagrammer og publicering af dem. Slutbrugere indsender forespรธrgsler og ser resultaterne, ofte via OLAP vรฆrktรธjer.

Adgangstrinnet involverer fรธlgende opgaver:

  • Opsรฆtning af et metalag, der oversรฆtter databasestrukturer og objektnavne til forretningsmรฆssige termer, sรฅ ikke-tekniske brugere nemt kan tilgรฅ datamarten.
  • Opsรฆtning og vedligeholdelse af databasestrukturer.
  • Opsรฆtning af API'er og grรฆnseflader efter behov.

Hvilke produkter og teknologier har du brug for?

Du kan tilgรฅ datamarten ved hjรฆlp af kommandolinjen eller en GUI. En GUI foretrรฆkkes normalt, fordi den genererer grafer nemt og er mere brugervenlig end kommandolinjen.

Hรฅndtering

Administration er den sidste fase i implementeringsprocessen for et datacenter. Ved hjรฆlp af enten en brugergrรฆnseflade eller kommandolinjen hรฅndterer teams lรธbende administrationsopgaver sรฅsom:

  • Lรธbende brugeradgangsstyring.
  • Systemoptimering og finjustering for bedre ydeevne.
  • Tilfรธjelse og hรฅndtering af nye data i datamartet.
  • Planlรฆgning af genoprettelsesscenarier for at holde systemet tilgรฆngeligt, hvis det svigter.
  • Gendannelse fra hardware- og softwarefejl, samtidig med at data bevares.

Bedste praksis for implementering af Data Marts

Fรธlg disse bedste fremgangsmรฅder gennem hele implementeringsprocessen af โ€‹โ€‹datamart:

  • Strukturer kilden til et datacenter efter afdeling.
  • Mรฅl implementeringscyklussen i uger i stedet for mรฅneder eller รฅr.
  • Involver alle interessenter i planlรฆgnings- og designfasen, da implementeringen af โ€‹โ€‹et datacenter kan vรฆre kompleks.
  • Budgetter prรฆcist for datamart-hardware, -software, -netvรฆrk og implementeringsomkostninger.
  • Selv nรฅr et datacenter deler hardware, kan det have brug for forskellig software til at hรฅndtere brugerforespรธrgsler; vurder den ekstra processorkraft og lagerplads, der er nรธdvendig for hurtige svar.
  • Nรฅr et datacenter er placeret et andet sted end datalageret, skal du sรธrge for tilstrรฆkkelig netvรฆrkskapacitet til at flytte de nรธdvendige datamรฆngder.
  • Budget for indlรฆsningstid, som vokser i takt med at transformationernes kompleksitet stiger.

Fordele og ulemper ved en Data Mart

Som ethvert arkitekturvalg bringer et datamart klare fordele sammen med et par kompromiser.

Fordele

  • Et datacenter indeholder en delmรฆngde af organisationsdรฆkkende data, der er vรฆrdifulde for en bestemt gruppe af brugere.
  • Det er et omkostningseffektivt alternativ til et datalager, som kan vรฆre dyrt at bygge.
  • Et datacenter giver hurtigere adgang til data.
  • Den er nem at bruge, fordi den er designet til brugernes specifikke behov, hvilket kan fremskynde forretningsprocesser.
  • Et datamart krรฆver mindre implementeringstid end et datawarehouse, da man kun fokuserer pรฅ en delmรฆngde af dataene.
  • Den indeholder historiske data, der hjรฆlper analytikere med at identificere tendenser.

Ulemper

  • Virksomheder opretter sommetider for mange forskellige, uafhรฆngige datamarts, som bliver vanskelige at vedligeholde.
  • Et datacenter kan ikke levere virksomhedsomfattende dataanalyse, fordi dets datasรฆt er begrรฆnset.

Ofte Stillede Spรธrgsmรฅl

A datalager er et virksomhedsomspรฆndende repository, der dรฆkker alle emner, mens et datamart indeholder en mindre, emneorienteret delmรฆngde for รฉn afdeling. Datamarts er billigere, hurtigere at bygge og hurtigere at forespรธrge pรฅ, men de kan ikke levere virksomhedsomspรฆndende analyser.

Et datacenter lagrer strukturerede, bearbejdede data modelleret til รฉn forretningsfunktion. En datasรธ lagrer rรฅdata af enhver type - struktureret, semistruktureret eller ustruktureret - i stor skala. Datacenters tilbyder hurtig rapportering, mens sรธer understรธtter udforskende datavidenskab og maskinlรฆring.

De fleste datacenters bruger en dimensionel model, typisk et stjerneskema med รฉn central faktatabel forbundet med dimensionstabeller. Et snefnugskema normaliserer disse dimensioner yderligere. Begge fremskynder forespรธrgsler og forenkler rapportering for forretningsbrugere.

Et salgsdatacenter indeholder kundetransaktioner, omsรฆtning og pipeline-mรฅlinger for salgsteamet. Marketing-, finans- og HR-center fungerer pรฅ samme mรฅde og giver hver afdeling forudaggregerede data uden at forespรธrge hele virksomhedens datalager.

Et datacenter understรธtter OLAP, ikke OLTP. Det er optimeret til at lรฆse, aggregere og analysere historiske data til rapporter og dashboards, snarere end til de hurtige indsรฆttelser og opdateringer, som transaktionelle OLTP-systemer hรฅndterer.

Et cloud-datacenter kรธrer pรฅ en administreret cloud-datalagerplatform i stedet for lokale servere. Det fjerner hardwareadministration, skalerer lagerplads og beregning efter behov og fakturerer normalt pr. forespรธrgsel, hvilket sรฆnker omkostningerne og fremskynder implementeringen.

AI og maskinlรฆringsvรฆrktรธjer fremskynder datamarkedsarbejdet ved at profilere kildedata, anbefale skemaer og dimensioner og generere ETL-kort.pings, og markering af problemer med datakvaliteten. De foreslรฅr ogsรฅ partitionerings- og indekseringsstrategier, selvom ingeniรธrer bรธr gennemgรฅ alle anbefalinger, fรธr de implementeres i produktion.

Ja. ChatGPT og GitHub Copilot udkast til SQL-forespรธrgsler, stjerneskema-DDL og ETL-scripts fra en kort prompt. RevSe outputtet for korrekte tabelnavne, joinforbindelser og korn, fรธr du kรธrer det, da genereret kode kan overse forretningsregler.

Opsummer dette indlรฆg med: