Vodič za DataStage za početnike: IBM ETL alat
⚡ Pametni sažetak
DataStage od IBM InfoSphere extracts, transformira i učitava podatke poduzeća u velikom obimu. Ova stranica objašnjava arhitekturu, komponente, paralelnu obradu, postavljanje SQL replikacije, stvaranje projekata, kompilaciju poslova i testiranje integracije koristeći praktičan primjer DB2 maloprodaje.

Što je DataStage?
DataStage je ETL alat koji se koristi zatract, transformirati i učitati podatke iz izvora u ciljno odredište. Izvor tih podataka može uključivati sekvencijalne datoteke, indeksirane datoteke, relacijske baze podataka, vanjske izvore podataka, arhive, poslovne aplikacije itd. DataStage se koristi za olakšavanje poslovne analize pružanjem kvalitetnih podataka koji pomažu u dobivanju poslovne inteligencije.
DataStage ETL alat se koristi u velikim organizacijama kao sučelje između različitih sustava. Brine se o npr.traccija, prijevod i učitavanje podataka od izvora do ciljnog odredišta. Prvi put ga je pokrenuo VMark sredinom 90-ih. S IBM preuzimanjem DataStagea 2005. preimenovano je u IBM WebSphere DataStage i kasnije IBM Infosfera.
Različite verzije Datastagea koje su do sada bile dostupne na tržištu bile su Enterprise Edition (PX), Server Edition, MVS Edition, DataStage for PeopleSoft i tako dalje. Najnovije izdanje je IBM InfoSphere DataStage.
IBM Informacijski poslužitelj uključuje sljedeće proizvode,
- IBM InfoSphere DataStage
- IBM InfoSphere QualityStage
- IBM Direktor informacijskih usluga InfoSphere
- IBM InfoSphere Information Analyzer
- IBM Brzi informacijski poslužiteljTrack
- IBM InfoSphere Business Glossary
Nakon što smo definirali, sljedeći odjeljak razmatra što proizvod zapravo može učiniti unutar skladištenje podataka okoliš.
DataStage pregled
Datastage ima sljedeće mogućnosti.
- Može integrirati podatke iz najšireg raspona poslovnih i vanjskih izvora podataka
- Implementira pravila provjere valjanosti podataka
- Koristan je u obradi i transformaciji velikih količina podataka
- Koristi skalabilni pristup paralelne obrade
- Može se nositi sa složenim transformacijama i upravljati višestrukim integracijskim procesima
- Iskoristite izravnu povezanost s poslovnim aplikacijama kao izvorima ili ciljevima
- Iskoristite metapodatke za analizu i održavanje
- Operate u paketu, u stvarnom vremenu ili kao web usluga
U sljedećim odjeljcima ovog vodiča za DataStage ukratko opisujemo sljedeće aspekte IBM InfoSphere DataStage:
- Transformacija podataka
- Posao
- Paralelna obrada
InfoSphere DataStage i QualityStage mogu pristupiti podacima u poslovnim aplikacijama i izvorima podataka kao što su:
- Relacijske baze podataka
- Mainframe baze podataka
- Poslovne i analitičke aplikacije
- Planiranje resursa poduzeća (ERP) ili baze podataka za upravljanje odnosima s kupcima (CRM).
- Online analitička obrada (OLAP) ili baze podataka za upravljanje učinkom
Vrste faza obrade
IBM posao infosfere sastoji se od pojedinačnih faza koje su međusobno povezane. Opisuje tijek podataka od izvora podataka do cilja podataka. Obično stupanj ima najmanje jedan ulaz podataka i/ili jedan izlaz podataka. Međutim, neki stupnjevi mogu prihvatiti više od jednog unosa podataka i izlaza u više od jednog stupnja.
Različite faze u dizajnu posla koje možete koristiti su:
- Faza transformacije
- Stupanj filtra
- Faza agregatora
- Faza uklanjanja duplikata
- Pridružite se pozornici
- Faza traženja
- Faza kopiranja
- Sortiraj pozornicu
- Kontejneri
Zašto koristiti DataStage za integraciju podataka?
Poznavanje popisa značajki je jedno; znati kada alat zaradi cijenu licence je nešto sasvim drugo. DataStage se odabire za opterećenja gdje volumen, upravljanje i heterogeni izvori čine rukom pisane skripte neupravljivima.
Najjasniji razlog je propusnost. Budući da mehanizam particionira podatke između čvorova i istovremeno struji zapise između faza, dodavanje hardvera gotovo linearno povećava propusnost. Posao dizajniran na razvojnom sustavu s dva čvora izvodi se nepromijenjen na produkcijskom klasteru s osam čvorova.
Drugi razlozi su organizacijske, a ne tehničke prirode:
- Dijeljeni metapodaci: Definicije tablica, veze i poslovni termini pohranjuju se jednom u repozitorij i ponovno ih koristi svaki zadatak, što uklanja pomak koji se javlja kada svaki programer samostalno definira izvor.
- Ugrađena kvaliteta podataka: QualityStage provodi istraživanje, standardizaciju, usklađivanje i preživljavanje uz ETL tok, tako da čišćenje ne zahtijeva drugi proizvod.
- Široka povezivost: Izvorni konektori dosežu DB2, Oracle, Teradata, VSAM za glavna računala, SAP, Salesforce i pohrana objekata u oblaku bez prilagođenog koda.
- Operacionalna kontrola: Direktor daje povijest izvođenja, broj redaka, upozorenja i točke ponovnog pokretanja, što revizori prihvaćaju kao dokaz kontroliranog podatkovnog cjevovoda.
- Ponovno korištenje: Dijeljeni spremnici i skupovi parametara omogućuju da jedna testirana transformacija služi mnogim poslovima umjesto da se kopira u svaki od njih.
Ove prednosti izravno proizlaze iz načina sastavljanja proizvoda, što je objašnjeno u sljedećem odjeljku.
DataStage komponente i Architektura
DataStage ima četiri glavne komponente, naime,
- Admin: Koristi se za administrativne zadatke. To uključuje postavljanje DataStage korisnika, postavljanje kriterija čišćenja i stvaranje i premještanje projekata.
- Menadžer: To je glavno sučelje repozitorija ETL DataStage. Koristi se za pohranu i upravljanje metapodacima koji se mogu ponovno koristiti. Preko DataStage upravitelja moguće je pregledavati i uređivati sadržaj Repozitorija.
- Dizajner: Sučelje dizajna koje se koristi za stvaranje DataStage aplikacija ILI poslova. Određuje izvor podataka, potrebnu transformaciju i odredište podataka. Poslovi se kompajliraju kako bi se stvorila izvršna datoteka koju je rasporedio direktor i pokrenuo poslužitelj
- Redatelj: Koristi se za provjeru valjanosti, planiranje, izvršavanje i praćenje poslova DataStage poslužitelja i paralelnih poslova.

Gornja slika objašnjava kako IBM Infosphere DataStage je u interakciji s drugim elementima IBM Platforma informacijskog poslužitelja. DataStage je podijeljen u dva dijela, Dijeljene komponente i vrijeme izvođenja ArchitekturaDonja tablica detaljnije objašnjava što svaki od ta dva odjeljka doprinosi.
|
Zajednička |
Jedinstveno korisničko sučelje |
|
|
Zajedničke usluge |
|
|
|
Uobičajena paralelna obrada |
|
|
|
dužina trajanja Architektura |
Skripta za zaštitu na radu |
|
Kako paralelna obrada funkcionira u DataStageu
Gornja tablica arhitekture naziva uobičajenu paralelnu obradu dijeljenom uslugom. Ovaj odjeljak objašnjava kako ta usluga zapravo izvršava zadatak, jer je koncept obećan u pregledu i odlučuje koliko brzo će se zadatak završiti.
Paralelni posao koristi dva mehanizma istovremeno, a oba se primjenjuju automatski tijekom izvođenja, a ne kodiraju se ručno.
1. Paralelizam cjevovoda. Svaka faza u zadatku počinje odjednom umjesto da se čeka završetak prethodne faze. Izvorna faza počinje čitati retke i gura ih u memorijski cjevovod. Transformer se pokreće čim stignu prvi retci i gura svoj izlaz u drugi cjevovod. Ciljni konektor počinje pisati odmah nakon toga. Ne zapisuje se nikakva međupostaja, pa zadatak u tri faze preklapa čitanje, transformaciju i pisanje umjesto da ih pokreće u nizu.
2. Paralelizam particija. Redovi su podijeljeni u zasebne particije, a potpuna kopija logike faze izvršava se na svakoj particiji na njenom vlastitom čvoru. Osam particija znači osam istovremenih instanci Transformera. Na kraju toka particije se ponovno skupljaju u jedan tok za cilj.
Odabir prave metode particioniranja glavna je odluka koju programer donosi prilikom podešavanja:
- Car: Zadano. Engine odabire metodu na temelju onoga što je potrebno fazi.
- Raspršivanje: Šalje retke s istom ključnom vrijednošću istom čvoru. Obavezno prije spajanja, agregatora i uklanjanja duplikata kako bi se podudarajući ključevi susreli.
- Razigravanje: Ravnomjerno raspoređuje retke jedan po jedan. Najbolje za učitavanje ravne datoteke gdje je ključna grupaping nije važno.
- Cijelo: Kopira cijeli skup podataka na svaki čvor. Koristi se za male referentne tablice u fazi pretraživanja.
- Isti: Postojeća particija ostaje netaknuta, što izbjegava nepotrebnu podjelu između dvije faze.
- Raspon i modul: Raspodijeli retke prema vrijednosnom pojasu ili prema ostatku numeričkog ključa kada je potrebna ravnomjerna raspodjela.
Konfiguracijska datoteka (APT_CONFIG_FILE) deklarira koliko čvorova postoji. Budući da se broj čvorova nalazi izvan posla, isti kompilirani posao se skalira s prijenosnog računala na produkcijsku mrežu bez promjene dizajna.
Prije nego što se bilo što od ovoga može isprobati, okruženje mora biti na svom mjestu.
Preduvjet za alat Datastage
Za DataStage će vam trebati sljedeće postavke.
- Infosfera
- DataStage Server 9.1.2 ili noviji
- Microsoft Visual Studio .NET 2010 Express Edition C++
- Oracle klijent (puni klijent, ne instant klijent) ako se povezujete na Oracle baza podataka
- DB2 klijent ako se povezuje na DB2 bazu podataka
Sada ćemo u ovoj seriji DataStage vodiča za početnike naučiti kako preuzeti i instalirati InfoSphere informacijski poslužitelj.
Preuzimanje i instalacija InfoSphere Information Servera
Za pristup DataStageu preuzmite i instalirajte najnoviju verziju IBM InfoSphere poslužitelj. Poslužitelj podržava AIX, Linux i Windows operacijski sustav. Možete odabrati prema zahtjevu.
Za premještanje vaših podataka iz starije verzije infosfere u novu verziju koristite alat za razmjenu sredstava.
Instalacijske datoteke
Da biste instalirali i konfigurirali Infosphere Datastage, morate imati sljedeće datoteke u postavkama.
Za Windows,
- EtlDeploymentPackage-windows-oracle.pkg
- EtlDeploymentPackage-windows-db2.pkg
Za Linux,
- EtlDeploymentPackage-linux-db2.pkg
- EtlDeploymentPackage-linux-oracle.pkg
S instaliranim poslužiteljem, obradeni primjer u ostatku ove stranice koristi snimanje podataka o promjenama, pa je korisno vidjeti kako se podaci o promjenama prenose prije nego što ih se izradi.
Tijek procesa promjene podataka u CDC transakcijskom poslu
Gornji dijagram tracpredstavlja jednu promjenu iz izvorne baze podataka u ciljnu, redoslijedom navedenim u nastavku.
- Usluga 'InfoSphere CDC' za bazu podataka prati i bilježi promjene iz izvorne baze podataka
- Prema definiciji replikacije “InfoSphere CDC” prenosi podatke o promjeni u “InfoSphere CDC za InfoSphere DataStage.”
- “InfoSphere CDC za InfoSphere DataStage” poslužitelj šalje podatke u “CDC Transaction stage” kroz TCP/IP sesiju. Poslužitelj “InfoSphere CDC za InfoSphere DataStage” također šalje poruku COMMIT (zajedno s informacijama o knjižnoj oznaci) za označavanje granice transakcije u snimljenom dnevniku.
- Za svaku COMMIT poruku koju šalje poslužitelj “InfoSphere CDC za InfoSphere DataStage”, “faza CDC transakcije” stvara markere kraja vala (EOW). Ovi se markeri šalju na svim izlaznim vezama do ciljne faze konektora baze podataka.
- Kada "faza konektora ciljne baze podataka" primi oznaku kraja vala na svim ulaznim vezama, ona zapisuje informacije o knjižnoj oznaci u tablicu knjižne oznake i zatim predaje transakciju ciljnoj bazi podataka.
- Poslužitelj “InfoSphere CDC za InfoSphere DataStage” zahtijeva informacije o knjižnim oznakama iz tablice knjižnih oznaka na “ciljnoj bazi podataka”.
- Poslužitelj “InfoSphere CDC za InfoSphere DataStage” prima informacije o knjižnoj oznaci.
Ove informacije se koriste za,
- Odredite početnu točku u dnevniku transakcija gdje se čitaju promjene kada započne replikacija.
- Da biste utvrdili može li se postojeći dnevnik transakcija očistiti
Postavljanje SQL replikacije
Prije nego počnete s Datastageom, trebate postaviti bazu podataka. Kreirat ćete dvije DB2 baze podataka.
- Jedan koji služi kao izvor replikacije i
- Jedan kao meta.
Također ćete stvoriti dvije tablice (Proizvod i Inventar) i popuniti ih oglednim podacima. Tada možete testirati svoju integraciju između SQL Replikacija i Datastage.
U nastavku ćete postaviti SQL replikaciju stvaranjem kontrolne tablice, skupovi pretplate, registracije i članovi skupa pretplate. O tome ćemo detaljnije saznati u sljedećem odjeljku.
Ovdje ćemo uzeti primjer artikla maloprodaje kao našu bazu podataka i stvoriti dvije tablice Inventar i Proizvod. Ove će tablice učitati podatke od izvora do cilja kroz te skupove. (kontrolne tablice, skupovi pretplate, registracije i članovi skupa pretplate.)
Korak 1) Stvorite izvornu bazu podataka koja se naziva Prodaja. Ispod ove baze podataka stvorite dvije tablice proizvoda i Popis.
Korak 2) Pokrenite sljedeću naredbu za stvaranje baze podataka SALES.
db2 create database SALES
Korak 3) Uključite arhivsko bilježenje za SALES bazu podataka. Također napravite sigurnosnu kopiju baze podataka pomoću sljedećih naredbi
db2 update db cfg for SALES using LOGARCHMETH3 LOGRETAIN db2 backup db SALES
Korak 4) U istom naredbenom retku, promijenite se u poddirektorij setupDB u direktoriju sqlrepl-datastage-tutorial koji ste extraciz preuzete komprimirane datoteke.
Korak 5) Upotrijebite sljedeću naredbu za izradu tablice inventara i uvoz podataka u tablicu pokretanjem sljedeće naredbe.
db2 import from inventory.ixf of ixf create into inventory
Korak 6) Napravite ciljnu tablicu. Nazovite ciljnu bazu podataka kao STAGEDB.
Budući da ste sada stvorili i izvor i cilj baze podataka, sljedeći korak u ovom DataStage vodiču, vidjet ćemo kako to replicirati.
Sljedeće informacije mogu biti od pomoći u postavljanje ODBC izvora podataka u IBM Dokumentacija InfoSphere Information Servera.
Stvaranje SQL replikacijskih objekata
Donja slika prikazuje kako se tok podataka o promjenama isporučuje od izvorne do ciljne baze podataka. Izrađujete mapu od izvora do cilja.ping između stolova poznatih kao članovi skupa pretplate i grupirati članove u a pretplata.
Jedinica replikacije unutar InfoSphere CDC (Change Data Capture) naziva se pretplata.
- Promjene učinjene u izvoru bilježe se u "kontrolnoj tablici snimanja" koja se šalje u CD tablicu, a zatim u ciljnu tablicu. Dok će program za primjenu imati pojedinosti o retku iz kojeg je potrebno napraviti promjene. Također će se pridružiti CD stolu u pretplatničkom setu.
- Pretplata sadrži kartuping detalji koji određuju kako se podaci u izvornom spremištu podataka primjenjuju na ciljno spremište podataka. Napomena: CDC se sada naziva Replikacija podataka Infosfere.
- Kada se pretplata izvrši, InfoSphere CDC bilježi promjene na izvornoj bazi podataka. InfoSphere CDC isporučuje podatke o promjeni cilju i pohranjuje informacije o točki sinkronizacije u tablici knjižnih oznaka u ciljnoj bazi podataka.
- InfoSphere CDC koristi informacije knjižne oznake za praćenje napretka posla InfoSphere DataStage.
- U slučaju neuspjeha, podaci knjižne oznake koriste se kao točka ponovnog pokretanja. U našem primjeru, ASN.IBMTablica SNAP_FEEDETL pohranjuje informacije o sinkronizacijskoj točki povezane s DataStageom koje se koriste za track Napredak DataStagea.
U ovom odjeljku od IBM Vodič za obuku za DataStage, morate učiniti sljedeće stvari,
- Napravite tablice CAPTURE CONTROL i tablice APPLY CONTROL za pohranu opcija replikacije
- Registrirajte tablice PRODUCT i INVENTORY kao izvore replikacije
- Stvorite skup pretplate s dva člana
- Stvorite članove skupa pretplate i ciljne CCD tablice
Koristite ASNCLP program naredbenog retka za postavljanje SQL replikacije
Korak 1) Locirajte datoteku skripte crtCtlTablesCaptureServer.asnclp u direktoriju sqlrepl-datastage-tutorial/setupSQLRep.
Korak 2) U datoteci zamijeniti i " ” sa svojim korisničkim imenom i lozinkom za spajanje na SALES bazu podataka.
Korak 3) Promijenite direktorije u direktorij sqlrepl-datastage-tutorial/setupSQLRep i pokrenite skriptu. Koristite sljedeću naredbu. Naredba će se povezati s bazom podataka SALES, generirati SQL skriptu za kreiranje kontrolnih tablica Capture.
asnclp –f crtCtlTablesCaptureServer.asnclp
Korak 4) Locirajte datoteku skripte crtCtlTablesApplyCtlServer.asnclp u istom direktoriju. Sada zamijenite dvije instance od i " ” s korisničkim ID-om i lozinkom za spajanje na STAGEDB bazu podataka.
Korak 5) Sada u istom naredbenom retku upotrijebite sljedeću naredbu za stvaranje kontrolnih tablica primjene.
asnclp –f crtCtlTablesApplyCtlServer.asnclp
Korak 6) Pronađite datoteke skripte crtRegistration.asnclp i zamijenite sve instance s korisničkim ID-om za povezivanje s bazom podataka SALES. Također, promijenite " ” na lozinku za povezivanje.
Korak 7) Za registraciju izvornih tablica koristite sljedeću skriptu. U sklopu kreiranja registracije program ASNCLP kreirat će dvije CD tablice. CDPROIZVOD I CDINVENTAR.
asnclp –f crtRegistration.asnclp
Naredba CREATE REGISTRATION koristi sljedeće opcije:
- Diferencijalno osvježenje: Poziva program Primijeni da ažurira ciljnu tablicu samo kada se promijene redovi u izvornoj tablici
- Slika oboje: Ova opcija se koristi za registraciju vrijednosti u izvornom stupcu prije nego što je došlo do promjene, a jedna za vrijednost nakon što je došlo do promjene.
Korak 8) Za povezivanje s ciljnom bazom podataka (STAGEDB) koristite sljedeće korake.
- Pronađite datoteku crtTableSpaceApply.bat, otvorite je u uređivaču teksta
- Zamijeniti i s korisničkim ID-om i lozinkom
- U prozoru DB2 naredbi unesite crtTableSpaceApply.bat i pokrenite datoteku.
- Ova paketna datoteka stvara novi tablični prostor na ciljnoj bazi podataka (STAGEDB)
Korak 9) Pronađite datoteke skripte crtSubscriptionSetAndAddMembers.asnclp i napravite sljedeće promjene.
- Zamijenite sve instance od i uz korisnički ID i lozinku za spajanje na SALES bazu (izvor).
- Zamijeni sve instance od i s korisničkim ID-om za spajanje na STAGEDB bazu podataka (target).
Nakon promjena pokrenite skriptu za kreiranje skupa pretplate (ST00) koji grupira izvornu i ciljnu tablicu. Skripta također stvara dva člana skupa pretplate i CCD (podatke o dosljednim promjenama) u ciljnoj bazi podataka koja će pohraniti izmijenjene podatke. Ove podatke će koristiti Infosphere DataStage.
Korak 10) Pokrenite skriptu za kreiranje skupa pretplate, članova skupa pretplate i CCD tablica.
asnclp –f crtSubscriptionSetAndAddMembers.asnclp
Različite opcije koje se koriste za stvaranje skupa pretplate i dva člana uključuju
- Kompletno na kondenzirano isključeno
- Vanjski
- Vrsta opterećenja uvoz izvoz
- Kontinuirano mjerenje vremena
Korak 11) Zbog greške u alatima za administraciju replikacije. Morate izvršiti drugu batch datoteku da biste postavili stupac TARGET_CAPTURE_SCHEMA u IBMSNAP_SUBS_SET kontrolne tablice na nulu.
- Pronađite datoteku updateTgtCapSchema.bat. Otvorite ga u uređivaču teksta. Zamijeniti i s korisničkim ID-om za spajanje na STAGEDB bazu podataka.
- U prozoru DB2 naredbi unesite naredbu updateTgtCapSchema.bat i izvedite datoteku.
Stvaranje definicijskih datoteka za mapiranje CCD tablica u DataStage
Prije nego što napravimo replikaciju u sljedećem koraku, moramo povezati CCD tablicu s DataStageom. U ovom odjeljku ćemo vidjeti kako povezati SQL s DataStageom.
Za povezivanje CCD tablice s DataStageom, potrebno je stvoriti Datastage definicijske (.dsx) datoteke. DataStage koristi .dsx format datoteke za uvoz i izvoz definicija poslova. Za stvaranje dviju .dsx datoteka koristit ćete ASNCLP skriptu. Na primjer, ovdje smo stvorili dvije .dsx datoteke.
- stagedb_AQ00_SET00_sJobs.dsx: Stvara niz poslova koji usmjeravaju tijek rada četiri paralelna posla.
- stagedb_AQ00_SET00_pJobs.dsx : Stvara četiri paralelna posla
Program ASNCLP automatski preslikava CCD stupac u format stupca Datastage. Podržano je samo kada radi ASNCLP Windows, Linux ili Unix postupak.
Datastage poslovi povlače retke iz CCD tablice.
- Jedan zadatak postavlja točku sinkronizacije tamo gdje je DataStage stao u extracprikuplja podatke iz dvije tablice. Posao dobiva ove informacije odabirom vrijednosti SYNCHPOINT za skup pretplata ST00 iz IBMSNAP_SUBS_SET tablicu i njezino umetanje u stupac MAX_SYNCHPOINT od IBMSNAP_FEEDETL tablica.
- Dva posla koja su bivšatract podatke iz tablica PRODUCT_CCD i INVENTORY_CCD. Poslovi znaju koje retke započeti npr.tracodabirom vrijednosti MIN_SYNCHPOINT i MAX_SYNCHPOINT iz IBMSNAP_FEEDETL tablica za skup pretplate.
Nakon mapiranja definicija, replikacija se sada može pokrenuti kako bi se CCD tablice počele popunjavati.
Pokretanje replikacije
Da biste započeli replikaciju, upotrijebit ćete korake u nastavku. Kada se CCD tablice popune podacima, to znači da je postavka replikacije provjerena. Za pregled repliciranih podataka u ciljnim CCD tablicama koristite grafičko korisničko sučelje DB2 Kontrolnog centra.
Korak 1) Uvjerite se da DB2 radi, ako ne, koristite db2 početak naredba.
Korak 2) Zatim upotrijebite naredbu asncap iz odzivnika operativnog sustava za početak snimanja programa. Na primjer.
asncap capture_server=SALES
Gornja naredba navodi SALES bazu podataka kao Capture server. Držite naredbeni prozor otvoren dok snimanje traje.
Korak 3) Sada otvorite novi naredbeni redak. Zatim pokrenite PRIJAVITI programirati pomoću naredbe asnapply.
asnapply control_server=STAGEDB apply_qual=AQ00
- Naredba specificira STAGEDB bazu podataka kao kontrolni poslužitelj primjene (baza podataka koja sadrži kontrolne tablice aplikacije)
- AQ00 kao kvalifikator primjene (identifikator za ovaj skup kontrolnih tablica)
Ostavite naredbeni prozor otvoren dok je Apply pokrenut.
Korak 4) Sada otvorite drugi naredbeni redak i izdajte naredbu db2cc za pokretanje DB2 Kontrolnog centra. Prihvatite zadani Kontrolni centar.
Korak 5) Sada u lijevom navigacijskom stablu otvorite Sve baze podataka > STAGEDB, a zatim kliknite Tablice. Double kliknite na naziv tablice ( Product CCD) da biste otvorili tablicu. Izgledat će otprilike ovako.
Isto tako, također možete otvoriti CCD tablicu za INVENTAR.
Replikacija sada unosi podatke u CCD tablice, pa se pažnja prebacuje sa strane baze podataka na DataStage klijente.
Kako izraditi projekte u alatu Datastage
Prije svega, izradit ćete projekt u DataStageu. Za to morate biti InfoSphere DataStage administrator.
Nakon što su instalacija i replikacija gotovi, trebate izraditi projekt. U DataStageu projekti su metoda za organiziranje vaših podataka. Uključuje definiranje podatkovnih datoteka, faza i poslova izgradnje u određenom projektu.
Za izradu projekta u DataStageu slijedite korake u nastavku:
Korak 1) Pokrenite softver DataStage
Pokrenite DataStage i QualityStage Administrator. Zatim kliknite Start > Svi programi > IBM Informacijski poslužitelj > IBM WebSphere DataStage i QualityStage Administrator.
Korak 2) Povežite DataStage poslužitelj i klijent
Za povezivanje s DataStage poslužiteljem s vašeg DataStage klijenta unesite detalje kao što su naziv domene, ID korisnika, lozinka i informacije o poslužitelju.
Korak 3) Dodajte novi projekt
U prozoru WebSphere DataStage Administration. Kliknite karticu Projekti, a zatim kliknite Dodaj.
Korak 4) Unesite detalje projekta
U prozor WebSphere DataStage Administration unesite pojedinosti poput
- Ime
- Lokacija datoteke
- Kliknite "U redu"
Svaki projekt sadrži:
- DataStage poslovi
- Ugrađene komponente. To su unaprijed definirane komponente koje se koriste u poslu.
- Korisnički definirane komponente. To su prilagođene komponente stvorene pomoću DataStage Managera ili DataStage Designera.
Vidjet ćemo kako uvesti replikacijske poslove u Datastage Infosphere.
Kako uvesti poslove replikacije u Datastage i QualityStage Designer
Uvest ćete poslove u IBM InfoSphere DataStage i QualityStage Designer klijent. A vi ih izvršite u IBM InfoSphere DataStage i QualityStage Director klijent.
Dizajner-klijent je poput praznog platna za građevinske poslove. To je npr.tracts, transformirati, učitati i provjeriti kvalitetu podataka. Pruža alate koji čine osnovne građevne blokove posla. Uključuje
- stažiranje: Povezuje se s izvorima podataka za čitanje ili pisanje datoteka i obradu podataka.
- linkovi: povezuje faze kroz koje teku vaši podaci
Faze u klijentu InfoSphere DataStage i QualityStage Designer pohranjene su u paleti alata Designer.
Sljedeće faze uključene su u InfoSphere QualityStage:
- Istražite fazu
- Standardizirati pozornicu
- Faza učestalosti podudaranja
- Faza podudaranja s jednim izvorom
- Faza podudaranja s dva izvora
- Faza preživljavanja
- Faza procjene kvalitete standardizacije (SQA).
U DataStage infosferi možete kreirati 4 vrste poslova.
- Paralelni posao
- Slijed posla
- posao glavnog računala
- Posao poslužitelja
Pogledajmo korak po korak kako uvesti datoteke posla replikacije.
Korak 1) Pokrenite DataStage i QualityStage Designer. Pritisnite Start > Svi programi > IBM Informacijski poslužitelj > IBM WebSphere DataStage i QualityStage Designer
Korak 2) U prozoru Priloži projektu unesite sljedeće pojedinosti.
- Domena
- korisničko ime
- Lozinka
- Naziv Projekta
- OK
Korak 3) Sada iz izbornika File kliknite import -> DataStage komponente.
Otvorit će se novi prozor za uvoz DataStage repozitorija.
- U ovom prozoru pregledavajte STAGEDB_AQ00_ST00_sJobs.dsx datoteku koju smo ranije izradili
- Odaberite opciju "Uvezi sve".
- Označite potvrdni okvir "Izvrši analizu utjecaja".
- Pritisnite "U redu".
Nakon što se posao uveze, DataStage će stvoriti STAGEDB_AQ00_ST00_sequence posao.
Korak 4) Slijedite iste korake za uvoz STAGEDB_AQ00_ST00_pJobs.dsx datoteka. Ovaj uvoz stvara četiri paralelna posla.
Korak 5) Pod oknom Designer Repository -> Otvorite mapu SQLREP. Unutar mape vidjet ćete slijed poslova i četiri paralelna posla.
Korak 6) Da biste vidjeli redoslijed posla. Idite na stablo repozitorija, desnom tipkom miša kliknite STAGEDB_AQ00_ST00_sequence posao i kliknite Uredi. Prikazat će tijek rada četiri paralelna posla koje slijed poslova kontrolira.
Svaka ikona je pozornica,
- getExtracStupanj tRange: Ažurira IBMSNAP_FEEDETL tablica. Postavit će početnu točku za podatke npr.tracdo točke gdje je DataStage zadnji puttracpodijeljene retke i postavljena završna točka na posljednju transakciju koja je obrađena za skup pretplata.
- getExtracRasponUspjehOva faza dovodi početne točke do bivšegtracFaza i ex tFromINVENTORY_CCDtracFaza tFromPRODUCT_CCD
- AllExtractsUspjeh: Ova faza osigurava da oba extracIz INVENTARA_CCD i extractFromPRODUCT_CCD je uspješno završen. Zatim prosljeđuje točke sinkronizacije za posljednje retke koji su dohvaćeni u fazu setRangeProcessed.
- setRangeProcessed faza: Ažurira se IBMSNAP_FEEDETL tablica. Dakle, DataStage zna odakle započeti sljedeći krug obrade podatakatracANJE
Korak 7) Da vidim paralelne poslove. Desnom tipkom miša kliknite STAGEDB_ASN_INVENTORY_CCD i odaberite uredi pod repozitorijem. Otvorit će se prozor kao što je prikazano u nastavku.
Ovdje na gornjoj slici možete vidjeti da su podaci iz CCD tablice inventara i Synch detalji o točki iz FEEDETL tablice prikazuju se u fazi Lookup_6.
Uvezeni poslovi i dalje ne pokazuju ništa, pa se sljedeći put mora definirati objekt podatkovne veze.
Stvaranje podatkovne veze iz DataStagea u bazu podataka STAGEDB
Sada je sljedeći korak izgradnja podatkovne veze između InfoSphere DataStage i ciljne baze podataka SQL Replication. Sadrži CCD tablice.
U DataStageu koristite objekte podatkovne veze s povezanim fazama konektora za brzo definiranje veze s izvorom podataka u dizajnu posla.
Korak 1) STAGEDB sadrži kontrolne tablice Apply koje DataStage koristi za sinkronizaciju svojih podataka, npr.traci CCD tablice iz kojih se podaci izvlačetracted. Koristite sljedeće naredbe
db2 catalog tcpip node SQLREP remote ip_address server 50000 db2 catalog database STAGEDB as STAGEDB2 at node SQLREP
bilješke: IP adresa sustava na kojem je kreiran STAGEDB
Korak 2) Kliknite Datoteka > Novo > Ostalo > Podatkovna veza.
Korak 3) Imat ćete prozor s dvije kartice, Parametri i Općenito.
Korak 4) U ovom koraku
- Općenito, kartica, nazovite podatkovnu vezu sqlreplConnect
- Na kartici Parametri, kao što je prikazano u nastavku
- Kliknite gumb za pregledavanje pored polja "Poveži se pomoću polja vrste faze" i u
- Otvorite prozor idite stablom repozitorija na Vrste stupnja –> Paralelno– > Baza podataka —-> DB2 konektor.
- Pritisnite Otvori.
Korak 5) U tablicu parametara veze unesite pojedinosti poput
- ConnectionString: STAGEDB2
- Korisničko ime: ID korisnika za spajanje na STAGEDB bazu podataka
- Lozinka: Lozinka za spajanje na STAGEDB bazu podataka
- Primjer: Ime DB2 instance koja sadrži STAGEDB bazu podataka
Korak 6) U sljedećem prozoru spremite podatkovnu vezu. Kliknite na gumb 'spremi'.
Uvoz definicija tablica iz STAGEDB u DataStage
U prethodnom koraku vidjeli smo da su InfoSphere DataStage i STAGEDB baza podataka povezani. Sada uvezite definiciju stupca i druge metapodatke za PRODUCT_CCD i INVENTORY_CCD tablice u repozitorij informacijskog poslužitelja.
U prozoru dizajnera slijedite korake u nastavku.
Korak 1) Odaberite Uvoz > Definicije tablice > Pokreni čarobnjaka za uvoz konektora
Korak 2) Na stranici odabira konektora čarobnjaka, izaberite DB2 konektor i kliknite Dalje.
Korak 3) Pritisnite Učitaj na stranici s detaljima veze. Ovo će popuniti polja čarobnjaka informacijama o vezi iz podatkovne veze koju ste stvorili u prethodnom poglavlju.
Korak 4) Pritisnite Testiraj vezu na istoj stranici. Ovo će potaknuti DataStage da se pokuša povezati s bazom podataka STAGEDB. Možete vidjeti poruku "povezivanje je uspješno". Pritisnite Dalje.
Korak 5) Provjerite jesu li na stranici lokacije izvora podataka polja Naziv glavnog računala i Naziv baze podataka ispravno popunjena. Zatim kliknite dalje.
Korak 6) Na stranici sheme. Unesite shemu kontrolnih tablica Primjene (ASN) ili provjerite je li ASN shema unaprijed popunjena u polje sheme. Zatim kliknite dalje. Stranica za odabir prikazat će popis tablica koje su definirane u ASN shemi.
Korak 7) Prva tablica iz koje trebamo uvesti metapodatke je IBMSNAP_FEEDETL, kontrolna tablica Apply. Sadrži detalje o točkama sinkronizacije koje omogućuju DataStageu da track od kojih je redaka dohvatio iz CCD tablica. Odaberite IBMSNAP_FEEDETL i kliknite Dalje.
Korak 8) Za dovršetak uvoza IBMSNAP_FEEDETL definicija tablice. Kliknite uvoz i zatim u otvorenom prozoru kliknite otvori.
Korak 9) Ponovite korake 1-8 još dva puta za uvoz definicija za tablicu PRODUCT_CCD, a zatim za tablicu INVENTORY_CCD.
BILJEŠKA: Dok uvozite definicije za inventar i proizvod, provjerite jeste li promijenili sheme iz ASN-a u shemu pod kojom su stvoreni PRODUCT_CCD i INVENTORY_CCD.
Sada DataStage ima sve pojedinosti koje su mu potrebne za povezivanje s ciljnom bazom podataka SQL replikacije.
Postavljanje svojstava za DataStage poslove
Za svaki od četiri DataStage paralelna posla koja imamo, sadrži jednu ili više faza koje se povezuju s bazom podataka STAGEDB. Morate izmijeniti stupnjeve da biste dodali podatke o vezi i povezivali se s datotekama skupa podataka koje DataStage popunjava.
Faze imaju unaprijed definirana svojstva koja se mogu uređivati. Ovdje ćemo promijeniti neka od tih svojstava za STAGEDB_ASN_PRODUCT_CCD_extract paralelni posao.
Korak 1) Pregledajte stablo repozitorija Designera. U mapi SQLREP odaberite STAGEDB_ASN_PRODUCT_CCD_extracparalelni zadatak. Za uređivanje kliknite desnom tipkom miša na zadatak. Prozor za dizajn paralelnog zadatka otvara se u Paleti dizajnera.
Korak 2) Pronađite zelenu ikonu. Ova ikona označava fazu DB2 konektora. Koristi se npr.tracpreuzimanje podataka iz CCD tablice. Double- kliknite na ikonu. Otvara se prozor za uređivanje pozornice.
Korak 3) U uređivaču kliknite Učitaj za popunjavanje polja informacijama o vezi. Za zatvaranje pozornice i spremanje promjena kliknite OK.
Korak 4) Sada se vratite u prozor za dizajn za STAGEDB_ASN_PRODUCT_CCD_extracparalelni posao. Pronađite ikonu za preuzimanjeSynchPoints DB2 stupanj konektora. Zatim dvaput kliknite na ikonu.
Korak 5) Sada kliknite gumb za učitavanje kako biste popunili polja informacijama o vezi.
BILJEŠKA: Ako koristite bazu podataka koja nije STAGEDB kao vaš kontrolni poslužitelj Primjene. Zatim odaberite opciju za učitavanje informacija o vezi za getSynchPoints faza, koja je u interakciji s kontrolnim tablicama, a ne s CCD tablicom.
Korak 6) U ovom koraku
- Napravite praznu tekstualnu datoteku na sustavu na kojem se izvodi InfoSphere DataStage.
- Imenujte ovu datoteku kao productdataset.ds i zabilježite gdje ste je spremili.
- DataStage će pisati promjene u ovu datoteku nakon što dohvati promjene iz CCD tablice.
- Skupovi podataka ili datoteke koje se koriste za premještanje podataka između povezanih poslova poznati su kao trajni skupovi podataka. Predstavljen je stupnjem skupa podataka.
Korak 7) Sada otvorite pozornicu za uređivanje u prozoru dizajna i dvaput kliknite na ikonu insert_into_a_dataset. Otvorit će drugi prozor.
Korak 8) U ovom prozoru,
- Ispod kartice svojstava osigurava Target mapa je otvorena i svojstvo File = DATASETNAME je istaknuto.
- Na desnoj strani imat ćete polje datoteke
- Unesite puni put do datoteke productdataset.ds
- Kliknite "U redu".
Sada ste ažurirali sva potrebna svojstva za CCD tablicu proizvoda. Zatvorite prozor dizajna i spremite sve promjene.
Korak 9) Sada pronađite i otvorite datoteku STAGEDB_ASN_INVENTORY_CCD_extracparalelni zadatak iz okna repozitorija u Dizajneru i ponovite korake 3-8.
BILJEŠKA:
- Morate učitati informacije o vezi za bazu podataka kontrolnog poslužitelja u editor pozornice za getSynchPoints faza. Ako vaš kontrolni poslužitelj nije STAGEDB.
- Za STAGEB_ST00_AQ00_getExtracParalelni poslovi tRange i STAGEDB_ST00_AQ00_markRangeProcessed, otvorite sve faze DB2 konektora. Zatim upotrijebite funkciju load za dodavanje informacija o vezi za bazu podataka STAGEDB.
Sva svojstva su sada postavljena, tako da se poslovi mogu kompajlirati i izvršiti.
Sastavljanje i pokretanje DataStage poslova
Kada je DataStage posao spreman za kompajliranje, Dizajner provjerava dizajn posla gledajući ulaze, transformacije, izraze i druge detalje.
Kada je kompilacija posla uspješno obavljena, spremna je za izvođenje. Sastavit ćemo svih pet poslova, ali ćemo pokrenuti samo "slijed poslova". To je zato što ovaj posao kontrolira sva četiri paralelna posla.
Korak 1) U mapi SQLREP. Odaberite svaki od pet poslova pomoću (Cntrl+Shift). Zatim desnom tipkom miša kliknite i odaberite opciju sastavljanja više poslova.
Korak 2) Vidjet ćete da je odabrano pet poslova u DataStage čarobnjaku za kompilaciju. Pritisnite Dalje.
Korak 3) Kompilacija počinje i prikazuje poruku "Kompilirano uspješno" kada završi.
Korak 4) Sada pokrenite DataStage i QualityStage Director. Odaberite Start > Svi programi > IBM Informacijski poslužitelj > IBM WebSphere DataStage i QualityStage Director.
Korak 5) U navigacijskom oknu projekta s lijeve strane. Pritisnite mapu SQLREP. Ovo dovodi svih pet poslova u tablicu statusa direktora.
Korak 6) Odaberite posao STAGEDB_AQ00_S00_sequence. Na traci izbornika kliknite Posao > Pokreni sada.
Nakon što je kompilacija gotova, vidjet ćete status završen.
Sada provjerite jesu li promijenjeni retci koji su pohranjeni u tablicama PRODUCT_CCD i INVENTORY_CCD bili extrackreirano od strane DataStagea i umetnuto u dvije datoteke skupa podataka.
Korak 7) Vratite se u Dizajner i otvorite datoteku STAGEDB_ASN_PRODUCT_CCD_ex.tracposao. Za otvaranje uređivača pozornice Double-kliknite ikonu insert_into_a_dataset. Zatim kliknite prikaz podataka.
Korak 8) Prihvatite zadane postavke u redovima koji će se prikazati u prozoru. Zatim kliknite OK. Otvorit će se prozor preglednika podataka koji prikazuje sadržaj datoteke skupa podataka.
Testiranje integracije između SQL replikacije i DataStagea
U prethodnom koraku sastavili smo i izvršili posao. U ovom odjeljku provjerit ćemo integraciju SQL replikacije i DataStagea. Za to ćemo unijeti izmjene u izvornu tablicu i vidjeti je li ista promjena ažurirana u DataStage.
Korak 1) Dođite do mape sqlrepl-datastage-scripts za vaš operativni sustav.
Korak 2) Pokrenite SQL replikaciju slijedeći korake:
- Pokrenite startSQLCapture.bat (Windows) za pokretanje programa Capture u bazi podataka SALES.
- Pokrenite startSQLApply.bat (Windows) datoteku za pokretanje programa Primjena u bazi podataka STAGEDB.
Korak 3) Sada otvorite datoteku updateSourceTables.sql. Za povezivanje s bazom podataka SALES replace i s korisničkim ID-om i lozinkom.
Korak 4) Otvorite DB2 naredbeni prozor. Promijenite direktorij u sqlrepl-datastage-tutorial\scripts i pokrenite problem zadanom naredbom:
db2 -tvf updateSourceTables.sql
SQL skripta izvršit će razne operacije poput ažuriranja, umetanja i brisanja na obje tablice (PROIZVOD, ZALIHE) u bazi podataka prodaje.
Korak 5) Na sustavu na kojem se izvodi DataStage. Otvorite DataStage Director i izvršite STAGEDB_AQ00_S00_sequence posao. Kliknite Posao > Pokreni sada.
Kada pokrenete posao, izvršit će se sljedeće aktivnosti.
- Program Capture čita promjene u šest redaka u zapisniku baze podataka SALES i umeće ih u CD tablice.
- Program Primjena dohvaća redove promjena iz CD tablica na SALES i umeće ih u CCD tablice na STAGEDB.
- Dva DataStage extract poslovi preuzimaju promjene iz CCD tablica i zapisuju ih u datoteke productdataset.ds i inventory dataset.ds.
Možete provjeriti jesu li gore navedeni koraci provedeni gledanjem skupova podataka.
Korak 6) Slijedite korake u nastavku,
- Pokrenite Dizajner. Otvorite datoteku STAGEDB_ASN_PRODUCT_CCD_ex.tracposao.
- Tada Double-kliknite ikonu insert_into_a_dataset. U scenskom uredniku. Pritisnite Pregled podataka.
- Prihvatite zadane postavke u prozoru redaka koji će se prikazati i kliknite U redu.
Skup podataka sadrži tri nova retka. Najlakši način da provjerite jesu li promjene implementirane je da se pomaknete krajnje desno od Preglednika podataka. Sada pogledajte posljednja tri retka (pogledajte sliku ispod)
Slovo I, U i D označava operaciju INSERT, UPDATE i DELETE koja je rezultirala svakim novim retkom.
Istu provjeru možete učiniti za tablicu inventara.
DataStage u usporedbi s drugim popularnim ETL alatima
Nakon što je uspostavljen cjeloviti tijek rada, uobičajeno sljedeće pitanje je gdje se DataStage nalazi u odnosu na alternative koje tim možda već posjeduje. Tablica u nastavku uspoređuje ga s tri široko korištene platforme prema kriterijima koji najčešće odlučuju o kupnji.
| Kriteriji | IBM DataStage | Informatika PowerCenter | Talend | SSIS |
|---|---|---|---|---|
| Model obrade | Paralelizam cjevovoda i particije | Particioniranje vođeno metapodacima | Generirano Java or Spark kod | Tok podataka u memoriji |
| Najbolje odgovara | Vrlo velika poslovna opterećenja serija i CDC-a | Složene naslijeđene arhitekture s teškim upravljanjem | Timovi koji su izvorno u oblaku i osjetljivi na troškove | Microsoft SQL Server imanja |
| licenciranje | Komercijalni, premium nivo | Trgovački | Izdanje otvorenog koda plus komercijalne razine | U paketu sa SQL Serverom |
| Krivulja ucenja | Potrebni su Strogi, ETL stručnjaci | strm | Umjereno, vještina kodiranja pomaže | Umjereno |
| Podaci o kvalitetu | QualityStage uključen u paket | Odvojeni proizvod za kvalitetu podataka | Uključena kvaliteta podataka Talenda | Dodatne komponente |
Ukratko, DataStage se odabire kada su sirovi protok, doseg glavnog računala i spremnost za reviziju važniji od cijene licence. Timovi koji rade uglavnom u oblaku arhitektura podatkovnog jezera ili uspoređivanje bivšegtracprvo naručite, možda ćete pronaći kompromise u ETL protiv ELT-a relevantniji, a širi uži izbor pojavljuje se u sažetku ETL alati i alati za integraciju podataka.































