Hva er et datalager? Typer

⚡ Smart oppsummering

Datavarehus definerer et sentralisert arkiv som samler informasjon fra mange kilder for analyse, rapportering og beslutningsstøtte. Denne veiledningen forklarer historien, arbeidsmodellen, typene, stadiene, komponentene, implementeringstrinn, fordeler, ulemper og fremtredende verktøy som gjør datavarehus til grunnlaget for moderne forretningsintelligens.

  • 🏛️ Kjernedefinisjon: Et datavarehus er et emneorientert, integrert, tidsvariant, ikke-flyktig lager designet for analytiske spørringer i stedet for transaksjonsbehandling.
  • 🧱 Tre typer: Bedriftsdatalager, OperaDet nasjonale datalageret og datamart tilbyr henholdsvis bedriftsomfattende rapportering i sanntid og rapportering for hver forretningsenhet.
  • ⚙️ Fire komponenter: Lastbehandling, Lagerbehandling, Spørrebehandling og Tilgangsverktøy for sluttbrukere håndterer inntak, styring, ruting av spørringer og analyser.
  • 📈 Modenhetsstadier: Lagerhold utvikler seg fra Offline Operasjonal til frakoblet DW, sanntids-DW og integrert DW som mater transaksjoner tilbake til kildesystemer.
  • 🛠️ Implementeringsstrategi: Kombiner bedriftsstrategi, faset levering og iterativ prototypeping for å kontrollere risiko og levere verdi tidlig.

Hva er et datalager - Typer, definisjon og eksempel

Hva er datavarehus?

Datavarehus (DW) er prosessen med å samle inn og administrere data fra ulike kilder for å gi meningsfull forretningsinnsikt. Et datalager brukes vanligvis til å koble sammen og analysere forretningsdata fra heterogene kilder, og det er kjernen i ethvert Business Intelligence (BI)-system som er bygget for dataanalyse og rapportering.

Datavarehus er en blanding av teknologier og komponenter som støtter strategisk bruk av data. Det er elektronisk lagring av store mengder forretningsinformasjon designet for spørring og analyse snarere enn transaksjonsbehandling. Datavarehuset omdanner rådata til brukbar informasjon og leverer den til brukerne i tide til å ta viktige beslutninger.

En beslutningsstøttedatabase (datalageret) vedlikeholdes separat fra en organisasjons driftsdatabase. Datalageret er ikke et produkt, men et miljø – en arkitektonisk konstruksjon av et informasjonssystem som gir brukere aktuell og historisk beslutningsstøtteinformasjon som er vanskelig å få tilgang til eller presentere i et tradisjonelt driftsdatalager.

Du vet kanskje at en 3NF-designet database for et lagersystem vanligvis har mange tabeller relatert til hverandre. For eksempel kan en rapport om gjeldende lager kreve mer enn 12 sammenføyde betingelser, noe som reduserer responstiden for spørringer og rapporter. Et datalager gir en denormalisert design som reduserer responstiden og forbedrer ytelsen for rapportering og analyse.

Datavarehussystemet er også kjent under følgende navn:

  • Decision Support System (DSS)
  • Executive Information System
  • Management Information System
  • Business Intelligence-løsning
  • Analytisk applikasjon
  • Datavarehus

Konseptdiagram for datavarehus

Datavarehusets historie

Datavarehuset hjelper brukere med å forstå og forbedre organisasjonens ytelse. Behovet for å lagre data utviklet seg etter hvert som datasystemer ble mer komplekse og behandlet stadig voksende mengder informasjon. Datavarehus er ikke et nytt konsept – det har en lang evolusjonær historie.

Her er noen av de viktigste hendelsene i utviklingen av datalageret:

  • 1960 — Dartmouth og General Mills utvikler i et felles forskningsprosjekt begrepene «dimensjoner» og «fakta».
  • 1970 — AC Nielsen og IRI introduserer dimensjonale datamarts for detaljhandel.
  • 1983 — Teradata Corporation introduserer et databasehåndteringssystem spesielt utviklet for beslutningsstøtte.
  • Sent på 1980-tallet - IBM Forskerne Paul Murphy og Barry Devlin utvikler konseptet Business Data Warehouse.
  • Den moderne datavarehusvisjonen tilskrives Bill Inmon, ofte kalt «datavarehusets far». Han forfattet grunnleggende verk om bygging, bruk og vedlikehold av datavarehuset og Corporate Information Factory.

Hvordan fungerer et datalager?

Et datalager fungerer som et sentralt arkiv der informasjon kommer fra én eller flere datakilder. Data flyter inn i lageret fra transaksjonssystemer og andre relasjonsdatabaser.

De innkommende dataene kan være:

  1. Strukturert
  2. Halvstrukturert
  3. Ustrukturert

Dataene behandles, transformeres og innhentes slik at brukerne kan få tilgang til det kuraterte datasettet via Business Intelligence-verktøy, SQL-klienter og regneark. Et datavarehus slår sammen informasjon fra ulike kilder til én omfattende database.

Ved å samle all denne informasjonen på ett sted, kan en organisasjon analysere kundene sine helhetlig og bekrefte at de har vurdert alle tilgjengelige datapunkter. Datavarehus muliggjør datautvinning – datautvinning søker etter mønstre i dataene som fører til høyere salg, lavere kostnader og bedre prognoser.

Typer datavarehus

De tre hovedtypene av datavarehus (DWH) er:

1. Enterprise Data Warehouse (EDW):

Et Enterprise Data Warehouse er et sentralisert lager som tilbyr beslutningsstøttetjenester på tvers av en hel organisasjon. Det tilbyr en enhetlig tilnærming for organisering og representasjon av data og gir muligheten til å klassifisere data etter emne og gi tilgang i henhold til disse inndelingene.

2. Operanasjonalt datalager (ODS):

An OperaEt ional datalager er et datalager som brukes når verken et datalager eller OLTP-systemer kan betjene organisasjonens rapporteringsbehov. I et ODS oppdateres data i sanntid, noe som gjør det ideelt for rutineaktiviteter som lagring av gjeldende ansattjournaler.

3. Data Mart:

A Databutikk er en delmengde av datavarehuset designet for en spesifikk forretningslinje, for eksempel salg, finans eller markedsføring. I et uavhengig datalager kan data samles inn direkte fra kildesystemer.

Generelle stadier i et datalager

I starten tok organisasjoner i bruk relativt enkle bruksområder for datavarehus. Over tid dukket det opp mer sofistikerte mønstre. Følgende er de generelle stadiene i bruk av datavarehus (DWH):

Offline Operanasjonal database:

Data kopieres fra et operativsystem til en annen server. Lasting, behandling og rapportering mot kopien påvirker ikke operativsystemets ytelse.

Frakoblet datavarehus:

Data i datalageret oppdateres jevnlig fra den operative databasen. Dataene kartlegges og transformeres for å oppfylle datalagerets mål.

Sanntids datalager:

Datavarehus oppdateres hver gang en transaksjon finner sted i driftsdatabasen. Bestillingssystemer for flyselskaper og jernbaner er klassiske eksempler.

Integrert datavarehus:

Datavarehus oppdateres kontinuerlig når operasjonelle systemer utfører transaksjoner. Datavarehuset genererer deretter transaksjoner som sendes tilbake til operasjonelle system.

Komponenter i et datalager

De fire komponentene i et datalager er:

Lasthåndtering: Også kalt frontkomponenten, håndterer Load Manager alle operasjoner knyttet til f.eks.tractionering og lasting av data inn i datalageret. Disse operasjonene inkluderer transformasjonene som forbereder data for innføring i datalageret.

Butikk sjef: Lagersjefen utfører operasjoner knyttet til datahåndtering i lageret. Vedkommende analyserer data for å sikre konsistens, oppretter indekser og visninger, genererer denormaliseringer og aggregeringer, transformerer og slår sammen kildedata, og arkiverer eller sikkerhetskopierer data.

Query Manager: Spørrebehandlingen, også kjent som backend-komponenten, håndterer operasjoner relatert til brukerspørringer. Den ruter spørringer til de riktige tabellene og planlegger kjøringen av dem.

Verktøy for sluttbrukertilgang:

Disse verktøyene faller inn i fem grupper: 1) Datarapportering, 2) Spørreverktøy, 3) Verktøy for applikasjonsutvikling, 4) EIS-verktøy og 5) OLAP-verktøy og Data mining-verktøy.

Hvem trenger et datalager?

Et datalager (DWH) er nødvendig for alle typer brukere, inkludert:

  • Beslutningstakere som er avhengige av store mengder data.
  • Brukere som kjører tilpassede, komplekse prosesser for å kombinere informasjon fra flere kilder.
  • Folk som ønsker enkel, lettvint teknologi for å få tilgang til data.
  • Team som ønsker en systematisk, repeterbar tilnærming til beslutningstaking.
  • Brukere som trenger rask ytelse på enorme datasett for rapporter, dashbord, rutenett eller diagrammer.
  • Analytikere som ønsker å oppdage skjulte mønstre i dataflyter og grupperpings.

Hva brukes et datavarehus til?

Nedenfor er de vanligste sektorene der datavarehus brukes:

Flyselskap:

I flybransjen støtter datavarehus tildeling av besetning, analyse av rutelønnsomhet, kampanjer for bonusprogrammer og lignende driftsbeslutninger.

Banking:

Datavarehus er mye brukt i bankvirksomhet for å administrere skrivebordsressurser effektivt. Flere banker bruker dem også til markedsundersøkelser, analyse av produktytelse og driftsplanlegging.

Helsevesen:

Helsesektoren bruker datavarehus til å strategisere og forutsi utfall, generere rapporter om pasientbehandling og dele data med forsikringspartnere og helsetjenester.

Offentlig sektor:

I offentlig sektor støtter datavarehus innsamling av etterretning og hjelper offentlige etater med å vedlikeholde og analysere skatteregistre og helsepolitiske registre for hver enkelt person.

Investering og forsikring:

I denne sektoren brukes varehus til å analysere datamønstre, kundetrender og markedsbevegelser.

Butikkkjeder:

Butikkjeder bruker datavarehus til distribusjon og markedsføring, for å track-varer og kunders kjøpsmønstre, planlegge kampanjer og bestemme prispolitikk.

Telekommunikasjon:

Teleselskaper bruker datavarehus til produktkampanjer, salgsbeslutninger og distribusjonsbeslutninger.

Serveringsbransjen:

Hotellbransjen bruker datavarehus til å designe og estimere reklame- og markedsføringskampanjer som er rettet mot kunder basert på tilbakemeldinger og reisemønstre.

Fremgangsmåte for å implementere et datalager

Den beste måten å håndtere forretningsrisikoen knyttet til en datavarehusimplementering på er å følge en tredelt strategi:

  1. Bedriftsstrategi: Identifiser gjeldende tekniske arkitektur og verktøy, samt fakta, dimensjoner og attributter som lageret må støtte. Datakartping og transformasjon er en del av denne fasen.
  2. Fasevis levering: Implementer datalageret i faser basert på fagområder. Relaterte forretningsenheter som booking og fakturering bør leveres først og deretter integreres.
  3. Iterativ prototypeping: I stedet for en big bang-implementering, bør datavarehuset utvikles, testes og forbedres iterativt.

Her er de viktigste trinnene i implementeringen av datavarehuset sammen med leveransene:

Trinn Oppgaver leveransen
1 Definer prosjektomfang Definisjon av omfang
2 Bestem forretningsbehov Logisk datamodell
3 Definere OperaKrav til nasjonale datalager Operanasjonal datalagermodell
4 Erverve eller utvikle ekstracsjonsverktøy ExtracVerktøy og programvare
5 Definer datakrav for datalageret Overgangsdatamodell
6 Dokumenter manglende data Liste over gjøremålsprosjekter
7 kart Operational Data Store til Data Warehouse DW-dataintegrasjonskart
8 Utvikle databasedesign for datalager DW-databasedesign
9 Extract-data fra Operanasjonalt datalager Integrert DW-dataeksempeltracts
10 Last inn datalageret Første datainnlasting
11 Vedlikehold datalageret Løpende datatilgang og påfølgende lastinger

Beste praksis for å implementere et datalager

  • Definer en plan for å teste dataenes konsistens, nøyaktighet og integritet.
  • Datavarehuset må være godt integrert, veldefinert og tidsstemplet.
  • Når du designer datavarehuset, bruk riktig verktøy, følg livssyklusen, ta tak i datakonflikter tidlig og lær av feil.
  • Aldri erstatt driftssystemer og driftsrapporter med lageret.
  • Ikke bruk for mye tid på eksentracting, rengjøring og lasting av data – automatiser der det er mulig.
  • Involver alle interessenter, inkludert forretningsteam, i implementeringen av datalageret. Behandle lageret som et felles prosjekt, slik at det fortsatt er nyttig for sluttbrukerne.
  • Utarbeid en opplæringsplan for sluttbrukerne.

Fordeler og ulemper med et datalager

Fordeler med et datalager (DWH):

  • Forretningsbrukere kan raskt få tilgang til kritiske data fra mange kilder på ett sted.
  • Gir konsistent informasjon på tvers av tverrfaglige aktiviteter og støtter ad hoc-rapportering og -spørringer.
  • Integrerer flere datakilder, noe som reduserer belastningen på produksjonssystemer.
  • Reduserer den totale behandlingstiden for analyse og rapportering.
  • Omstrukturering og integrasjon gjør rapportering og analyse enklere for sluttbrukeren.
  • Sparer brukerens tid ved å fjerne behovet for å hente data fra flere kilder.
  • Lagrer store mengder historiske data, noe som muliggjør trendanalyse og fremtidige spådommer.

Ulemper med et datalager:

  • Ikke et ideelt alternativ for ustrukturerte data.
  • Opprettelse og implementering er tidkrevende.
  • Datavarehus kan bli utdaterte relativt raskt uten aktivt vedlikehold.
  • Endringer i datatyper, områder, kildeskjemaer, indekser eller spørringer er vanskelige.
  • Datavarehuset kan virke enkelt på overflaten, men er komplekst for den gjennomsnittlige brukeren.
  • Til tross for beste innsats, har prosjektets omfang en tendens til å utvide seg under implementeringen.
  • Ulike forretningsenheter utvikler noen ganger motstridende forretningsregler.
  • Organisasjoner må sette av betydelige ressurser til opplæring og utrulling.

Fremtiden for datavarehus

  • Regulatoriske begrensninger kan begrense muligheten til å kombinere ulike datakilder, inkludert ustrukturerte data som er vanskeligere å lagre og administrere.
  • Som størrelse av databaser vokser, det som regnes som en veldig stor database fortsetter å endre seg oppover, og bygging og drift av varehus i den skalaen blir stadig mer komplekst.
  • Multimediedata kan ikke manipuleres like enkelt som tekst. Relasjonell programvare håndterer tekstinformasjon godt, men rikt medieinnhold er fortsatt et aktivt forskningsområde.

Datavarehusverktøy

Det finnes mange datavarehusverktøy på markedet. Her er noen av de mest fremtredende:

1. MarkLogic:

Marklogic er en datavarehusløsning som forenkler og akselererer dataintegrasjon med et rikt sett med bedriftsfunksjoner. Den utfører komplekse søkeoperasjoner og kan spørre dokumenter, relasjoner og metadata.

2. Oracle:

Oracle er den bransjeledende databasen. Den tilbyr et bredt spekter av datavarehusløsninger for både lokale og skybaserte distribusjoner, og bidrar til å optimalisere kundeopplevelsen ved å forbedre driftseffektiviteten.

3. Amazon Rødforskyvning:

Amazon rødforskyvning er en datavarehustjeneste som er enkel og kostnadseffektiv for å analysere data med standard SQL og eksisterende BI-verktøy. Den kjører komplekse spørringer mot petabyte med strukturerte data ved hjelp av spørreoptimaliseringsteknikker.

Her er en komplett liste over nyttige Datavarehusverktøy.

Spørsmål og svar

En database er bygget for transaksjonelle arbeidsbelastninger med hyppige lesinger og skrivinger. Et datalager er optimalisert for analytiske spørringer mot store historiske datasett. Lagre avnormaliserer data for å fremskynde rapporteringen, mens databaser holder data normalisert for transaksjonell integritet.

Et datalager lagrer strukturerte, bearbeidede data for BI og rapportering. En datasjø lagrer rå strukturerte, semistrukturerte og ustrukturerte data for fleksibel analyse og maskinlæring. Mange moderne stabler kombinerer begge deler i et Lakehouse for å oppnå styring og fleksibilitet.

ETL står for Extract, Transformer, Last. Det er pipelinen som henter data fra kildesystemer, renser og omformer dem, og laster dem inn i datalageret. Moderne ELT-tilnærminger reverserer de to siste trinnene, og transformerer i stedet data inne i lageret.

AI bringer autonom finjustering, spørreakselerasjon, prediktiv ETL-overvåking og analyse av naturlig språk til datavarehus. Skyplattformer som Snowflake, BigQuery og Databricks bygger inn AI-copiloter som genererer SQL, anbefaler modeller og oppdager avvik før de påvirker forretningsrapporteringen.

Ja. AI-verktøy analyserer kildeskjemaer, forretningsordlister og BI-rapporter for å anbefale dimensjonsmodeller, stjerneskjemaer og aggregerte tabeller. ArchiTekstene forbedrer deretter AI-forslagene, noe som akselererer den innledende modelleringen og reduserer risikoen for inkonsistente definisjoner på tvers av rapporter.

Oppsummer dette innlegget med: