Hva er et datalager? Typer

โšก Smart oppsummering

Datavarehus definerer et sentralisert arkiv som samler informasjon fra mange kilder for analyse, rapportering og beslutningsstรธtte. Denne veiledningen forklarer historien, arbeidsmodellen, typene, stadiene, komponentene, implementeringstrinn, fordeler, ulemper og fremtredende verktรธy som gjรธr datavarehus til grunnlaget for moderne forretningsintelligens.

  • ๐Ÿ›๏ธ Kjernedefinisjon: Et datavarehus er et emneorientert, integrert, tidsvariant, ikke-flyktig lager designet for analytiske spรธrringer i stedet for transaksjonsbehandling.
  • ๐Ÿงฑ Tre typer: Bedriftsdatalager, OperaDet nasjonale datalageret og datamart tilbyr henholdsvis bedriftsomfattende rapportering i sanntid og rapportering for hver forretningsenhet.
  • โš™๏ธ Fire komponenter: Lastbehandling, Lagerbehandling, Spรธrrebehandling og Tilgangsverktรธy for sluttbrukere hรฅndterer inntak, styring, ruting av spรธrringer og analyser.
  • ๐Ÿ“ˆ Modenhetsstadier: Lagerhold utvikler seg fra Offline Operasjonal til frakoblet DW, sanntids-DW og integrert DW som mater transaksjoner tilbake til kildesystemer.
  • ๐Ÿ› ๏ธ Implementeringsstrategi: Kombiner bedriftsstrategi, faset levering og iterativ prototypeping for รฅ kontrollere risiko og levere verdi tidlig.

Hva er et datalager - Typer, definisjon og eksempel

Hva er datavarehus?

Datavarehus (DW) er prosessen med รฅ samle inn og administrere data fra ulike kilder for รฅ gi meningsfull forretningsinnsikt. Et datalager brukes vanligvis til รฅ koble sammen og analysere forretningsdata fra heterogene kilder, og det er kjernen i ethvert Business Intelligence (BI)-system som er bygget for dataanalyse og rapportering.

Datavarehus er en blanding av teknologier og komponenter som stรธtter strategisk bruk av data. Det er elektronisk lagring av store mengder forretningsinformasjon designet for spรธrring og analyse snarere enn transaksjonsbehandling. Datavarehuset omdanner rรฅdata til brukbar informasjon og leverer den til brukerne i tide til รฅ ta viktige beslutninger.

En beslutningsstรธttedatabase (datalageret) vedlikeholdes separat fra en organisasjons driftsdatabase. Datalageret er ikke et produkt, men et miljรธ โ€“ en arkitektonisk konstruksjon av et informasjonssystem som gir brukere aktuell og historisk beslutningsstรธtteinformasjon som er vanskelig รฅ fรฅ tilgang til eller presentere i et tradisjonelt driftsdatalager.

Du vet kanskje at en 3NF-designet database for et lagersystem vanligvis har mange tabeller relatert til hverandre. For eksempel kan en rapport om gjeldende lager kreve mer enn 12 sammenfรธyde betingelser, noe som reduserer responstiden for spรธrringer og rapporter. Et datalager gir en denormalisert design som reduserer responstiden og forbedrer ytelsen for rapportering og analyse.

Datavarehussystemet er ogsรฅ kjent under fรธlgende navn:

  • Decision Support System (DSS)
  • Executive Information System
  • Management Information System
  • Business Intelligence-lรธsning
  • Analytisk applikasjon
  • Datavarehus

Konseptdiagram for datavarehus

Datavarehusets historie

Datavarehuset hjelper brukere med รฅ forstรฅ og forbedre organisasjonens ytelse. Behovet for รฅ lagre data utviklet seg etter hvert som datasystemer ble mer komplekse og behandlet stadig voksende mengder informasjon. Datavarehus er ikke et nytt konsept โ€“ det har en lang evolusjonรฆr historie.

Her er noen av de viktigste hendelsene i utviklingen av datalageret:

  • 1960 โ€” Dartmouth og General Mills utvikler i et felles forskningsprosjekt begrepene ยซdimensjonerยป og ยซfaktaยป.
  • 1970 โ€” AC Nielsen og IRI introduserer dimensjonale datamarts for detaljhandel.
  • 1983 โ€” Teradata Corporation introduserer et databasehรฅndteringssystem spesielt utviklet for beslutningsstรธtte.
  • Sent pรฅ 1980-tallet - IBM Forskerne Paul Murphy og Barry Devlin utvikler konseptet Business Data Warehouse.
  • Den moderne datavarehusvisjonen tilskrives Bill Inmon, ofte kalt ยซdatavarehusets farยป. Han forfattet grunnleggende verk om bygging, bruk og vedlikehold av datavarehuset og Corporate Information Factory.

Hvordan fungerer et datalager?

Et datalager fungerer som et sentralt arkiv der informasjon kommer fra รฉn eller flere datakilder. Data flyter inn i lageret fra transaksjonssystemer og andre relasjonsdatabaser.

De innkommende dataene kan vรฆre:

  1. Strukturert
  2. Halvstrukturert
  3. Ustrukturert

Dataene behandles, transformeres og innhentes slik at brukerne kan fรฅ tilgang til det kuraterte datasettet via Business Intelligence-verktรธy, SQL-klienter og regneark. Et datavarehus slรฅr sammen informasjon fra ulike kilder til รฉn omfattende database.

Ved รฅ samle all denne informasjonen pรฅ ett sted, kan en organisasjon analysere kundene sine helhetlig og bekrefte at de har vurdert alle tilgjengelige datapunkter. Datavarehus muliggjรธr datautvinning โ€“ datautvinning sรธker etter mรธnstre i dataene som fรธrer til hรธyere salg, lavere kostnader og bedre prognoser.

Typer datavarehus

De tre hovedtypene av datavarehus (DWH) er:

1. Enterprise Data Warehouse (EDW):

Et Enterprise Data Warehouse er et sentralisert lager som tilbyr beslutningsstรธttetjenester pรฅ tvers av en hel organisasjon. Det tilbyr en enhetlig tilnรฆrming for organisering og representasjon av data og gir muligheten til รฅ klassifisere data etter emne og gi tilgang i henhold til disse inndelingene.

2. Operanasjonalt datalager (ODS):

An OperaEt ional datalager er et datalager som brukes nรฅr verken et datalager eller OLTP-systemer kan betjene organisasjonens rapporteringsbehov. I et ODS oppdateres data i sanntid, noe som gjรธr det ideelt for rutineaktiviteter som lagring av gjeldende ansattjournaler.

3. Data Mart:

A Databutikk er en delmengde av datavarehuset designet for en spesifikk forretningslinje, for eksempel salg, finans eller markedsfรธring. I et uavhengig datalager kan data samles inn direkte fra kildesystemer.

Generelle stadier i et datalager

I starten tok organisasjoner i bruk relativt enkle bruksomrรฅder for datavarehus. Over tid dukket det opp mer sofistikerte mรธnstre. Fรธlgende er de generelle stadiene i bruk av datavarehus (DWH):

Offline Operanasjonal database:

Data kopieres fra et operativsystem til en annen server. Lasting, behandling og rapportering mot kopien pรฅvirker ikke operativsystemets ytelse.

Frakoblet datavarehus:

Data i datalageret oppdateres jevnlig fra den operative databasen. Dataene kartlegges og transformeres for รฅ oppfylle datalagerets mรฅl.

Sanntids datalager:

Datavarehus oppdateres hver gang en transaksjon finner sted i driftsdatabasen. Bestillingssystemer for flyselskaper og jernbaner er klassiske eksempler.

Integrert datavarehus:

Datavarehus oppdateres kontinuerlig nรฅr operasjonelle systemer utfรธrer transaksjoner. Datavarehuset genererer deretter transaksjoner som sendes tilbake til operasjonelle system.

Komponenter i et datalager

De fire komponentene i et datalager er:

Lasthรฅndtering: Ogsรฅ kalt frontkomponenten, hรฅndterer Load Manager alle operasjoner knyttet til f.eks.tractionering og lasting av data inn i datalageret. Disse operasjonene inkluderer transformasjonene som forbereder data for innfรธring i datalageret.

Butikk sjef: Lagersjefen utfรธrer operasjoner knyttet til datahรฅndtering i lageret. Vedkommende analyserer data for รฅ sikre konsistens, oppretter indekser og visninger, genererer denormaliseringer og aggregeringer, transformerer og slรฅr sammen kildedata, og arkiverer eller sikkerhetskopierer data.

Query Manager: Spรธrrebehandlingen, ogsรฅ kjent som backend-komponenten, hรฅndterer operasjoner relatert til brukerspรธrringer. Den ruter spรธrringer til de riktige tabellene og planlegger kjรธringen av dem.

Verktรธy for sluttbrukertilgang:

Disse verktรธyene faller inn i fem grupper: 1) Datarapportering, 2) Spรธrreverktรธy, 3) Verktรธy for applikasjonsutvikling, 4) EIS-verktรธy og 5) OLAP-verktรธy og Data mining-verktรธy.

Hvem trenger et datalager?

Et datalager (DWH) er nรธdvendig for alle typer brukere, inkludert:

  • Beslutningstakere som er avhengige av store mengder data.
  • Brukere som kjรธrer tilpassede, komplekse prosesser for รฅ kombinere informasjon fra flere kilder.
  • Folk som รธnsker enkel, lettvint teknologi for รฅ fรฅ tilgang til data.
  • Team som รธnsker en systematisk, repeterbar tilnรฆrming til beslutningstaking.
  • Brukere som trenger rask ytelse pรฅ enorme datasett for rapporter, dashbord, rutenett eller diagrammer.
  • Analytikere som รธnsker รฅ oppdage skjulte mรธnstre i dataflyter og grupperpings.

Hva brukes et datavarehus til?

Nedenfor er de vanligste sektorene der datavarehus brukes:

Flyselskap:

I flybransjen stรธtter datavarehus tildeling av besetning, analyse av rutelรธnnsomhet, kampanjer for bonusprogrammer og lignende driftsbeslutninger.

Banking:

Datavarehus er mye brukt i bankvirksomhet for รฅ administrere skrivebordsressurser effektivt. Flere banker bruker dem ogsรฅ til markedsundersรธkelser, analyse av produktytelse og driftsplanlegging.

Helsevesen:

Helsesektoren bruker datavarehus til รฅ strategisere og forutsi utfall, generere rapporter om pasientbehandling og dele data med forsikringspartnere og helsetjenester.

Offentlig sektor:

I offentlig sektor stรธtter datavarehus innsamling av etterretning og hjelper offentlige etater med รฅ vedlikeholde og analysere skatteregistre og helsepolitiske registre for hver enkelt person.

Investering og forsikring:

I denne sektoren brukes varehus til รฅ analysere datamรธnstre, kundetrender og markedsbevegelser.

Butikkkjeder:

Butikkjeder bruker datavarehus til distribusjon og markedsfรธring, for รฅ track-varer og kunders kjรธpsmรธnstre, planlegge kampanjer og bestemme prispolitikk.

Telekommunikasjon:

Teleselskaper bruker datavarehus til produktkampanjer, salgsbeslutninger og distribusjonsbeslutninger.

Serveringsbransjen:

Hotellbransjen bruker datavarehus til รฅ designe og estimere reklame- og markedsfรธringskampanjer som er rettet mot kunder basert pรฅ tilbakemeldinger og reisemรธnstre.

Fremgangsmรฅte for รฅ implementere et datalager

Den beste mรฅten รฅ hรฅndtere forretningsrisikoen knyttet til en datavarehusimplementering pรฅ er รฅ fรธlge en tredelt strategi:

  1. Bedriftsstrategi: Identifiser gjeldende tekniske arkitektur og verktรธy, samt fakta, dimensjoner og attributter som lageret mรฅ stรธtte. Datakartping og transformasjon er en del av denne fasen.
  2. Fasevis levering: Implementer datalageret i faser basert pรฅ fagomrรฅder. Relaterte forretningsenheter som booking og fakturering bรธr leveres fรธrst og deretter integreres.
  3. Iterativ prototypeping: I stedet for en big bang-implementering, bรธr datavarehuset utvikles, testes og forbedres iterativt.

Her er de viktigste trinnene i implementeringen av datavarehuset sammen med leveransene:

Trinn Oppgaver leveransen
1 Definer prosjektomfang Definisjon av omfang
2 Bestem forretningsbehov Logisk datamodell
3 Definere OperaKrav til nasjonale datalager Operanasjonal datalagermodell
4 Erverve eller utvikle ekstracsjonsverktรธy ExtracVerktรธy og programvare
5 Definer datakrav for datalageret Overgangsdatamodell
6 Dokumenter manglende data Liste over gjรธremรฅlsprosjekter
7 kart Operational Data Store til Data Warehouse DW-dataintegrasjonskart
8 Utvikle databasedesign for datalager DW-databasedesign
9 Extract-data fra Operanasjonalt datalager Integrert DW-dataeksempeltracts
10 Last inn datalageret Fรธrste datainnlasting
11 Vedlikehold datalageret Lรธpende datatilgang og pรฅfรธlgende lastinger

Beste praksis for รฅ implementere et datalager

  • Definer en plan for รฅ teste dataenes konsistens, nรธyaktighet og integritet.
  • Datavarehuset mรฅ vรฆre godt integrert, veldefinert og tidsstemplet.
  • Nรฅr du designer datavarehuset, bruk riktig verktรธy, fรธlg livssyklusen, ta tak i datakonflikter tidlig og lรฆr av feil.
  • Aldri erstatt driftssystemer og driftsrapporter med lageret.
  • Ikke bruk for mye tid pรฅ eksentracting, rengjรธring og lasting av data โ€“ automatiser der det er mulig.
  • Involver alle interessenter, inkludert forretningsteam, i implementeringen av datalageret. Behandle lageret som et felles prosjekt, slik at det fortsatt er nyttig for sluttbrukerne.
  • Utarbeid en opplรฆringsplan for sluttbrukerne.

Fordeler og ulemper med et datalager

Fordeler med et datalager (DWH):

  • Forretningsbrukere kan raskt fรฅ tilgang til kritiske data fra mange kilder pรฅ ett sted.
  • Gir konsistent informasjon pรฅ tvers av tverrfaglige aktiviteter og stรธtter ad hoc-rapportering og -spรธrringer.
  • Integrerer flere datakilder, noe som reduserer belastningen pรฅ produksjonssystemer.
  • Reduserer den totale behandlingstiden for analyse og rapportering.
  • Omstrukturering og integrasjon gjรธr rapportering og analyse enklere for sluttbrukeren.
  • Sparer brukerens tid ved รฅ fjerne behovet for รฅ hente data fra flere kilder.
  • Lagrer store mengder historiske data, noe som muliggjรธr trendanalyse og fremtidige spรฅdommer.

Ulemper med et datalager:

  • Ikke et ideelt alternativ for ustrukturerte data.
  • Opprettelse og implementering er tidkrevende.
  • Datavarehus kan bli utdaterte relativt raskt uten aktivt vedlikehold.
  • Endringer i datatyper, omrรฅder, kildeskjemaer, indekser eller spรธrringer er vanskelige.
  • Datavarehuset kan virke enkelt pรฅ overflaten, men er komplekst for den gjennomsnittlige brukeren.
  • Til tross for beste innsats, har prosjektets omfang en tendens til รฅ utvide seg under implementeringen.
  • Ulike forretningsenheter utvikler noen ganger motstridende forretningsregler.
  • Organisasjoner mรฅ sette av betydelige ressurser til opplรฆring og utrulling.

Fremtiden for datavarehus

  • Regulatoriske begrensninger kan begrense muligheten til รฅ kombinere ulike datakilder, inkludert ustrukturerte data som er vanskeligere รฅ lagre og administrere.
  • Som stรธrrelse av databaser vokser, det som regnes som en veldig stor database fortsetter รฅ endre seg oppover, og bygging og drift av varehus i den skalaen blir stadig mer komplekst.
  • Multimediedata kan ikke manipuleres like enkelt som tekst. Relasjonell programvare hรฅndterer tekstinformasjon godt, men rikt medieinnhold er fortsatt et aktivt forskningsomrรฅde.

Datavarehusverktรธy

Det finnes mange datavarehusverktรธy pรฅ markedet. Her er noen av de mest fremtredende:

1. MarkLogic:

Marklogic er en datavarehuslรธsning som forenkler og akselererer dataintegrasjon med et rikt sett med bedriftsfunksjoner. Den utfรธrer komplekse sรธkeoperasjoner og kan spรธrre dokumenter, relasjoner og metadata.

2. Oracle:

Oracle er den bransjeledende databasen. Den tilbyr et bredt spekter av datavarehuslรธsninger for bรฅde lokale og skybaserte distribusjoner, og bidrar til รฅ optimalisere kundeopplevelsen ved รฅ forbedre driftseffektiviteten.

3. Amazon Rรธdforskyvning:

Amazon rรธdforskyvning er en datavarehustjeneste som er enkel og kostnadseffektiv for รฅ analysere data med standard SQL og eksisterende BI-verktรธy. Den kjรธrer komplekse spรธrringer mot petabyte med strukturerte data ved hjelp av spรธrreoptimaliseringsteknikker.

Her er en komplett liste over nyttige Datavarehusverktรธy.

Spรธrsmรฅl og svar

En database er bygget for transaksjonelle arbeidsbelastninger med hyppige lesinger og skrivinger. Et datalager er optimalisert for analytiske spรธrringer mot store historiske datasett. Lagre avnormaliserer data for รฅ fremskynde rapporteringen, mens databaser holder data normalisert for transaksjonell integritet.

Et datalager lagrer strukturerte, bearbeidede data for BI og rapportering. En datasjรธ lagrer rรฅ strukturerte, semistrukturerte og ustrukturerte data for fleksibel analyse og maskinlรฆring. Mange moderne stabler kombinerer begge deler i et Lakehouse for รฅ oppnรฅ styring og fleksibilitet.

ETL stรฅr for Extract, Transformer, Last. Det er pipelinen som henter data fra kildesystemer, renser og omformer dem, og laster dem inn i datalageret. Moderne ELT-tilnรฆrminger reverserer de to siste trinnene, og transformerer i stedet data inne i lageret.

AI bringer autonom finjustering, spรธrreakselerasjon, prediktiv ETL-overvรฅking og analyse av naturlig sprรฅk til datavarehus. Skyplattformer som Snowflake, BigQuery og Databricks bygger inn AI-copiloter som genererer SQL, anbefaler modeller og oppdager avvik fรธr de pรฅvirker forretningsrapporteringen.

Ja. AI-verktรธy analyserer kildeskjemaer, forretningsordlister og BI-rapporter for รฅ anbefale dimensjonsmodeller, stjerneskjemaer og aggregerte tabeller. ArchiTekstene forbedrer deretter AI-forslagene, noe som akselererer den innledende modelleringen og reduserer risikoen for inkonsistente definisjoner pรฅ tvers av rapporter.

Oppsummer dette innlegget med: