DataStage-opetusohjelma aloittelijoille: IBM ETL tyƶkalu
ā” ĆlykƤs yhteenveto
DataStage-sovellus IBM InfoSphere extracts, muuntaa ja lataa yritystietoja skaalautuvasti. TƤllƤ sivulla selitetƤƤn arkkitehtuuri, komponentit, rinnakkaiskƤsittely, SQL-replikoinnin asetukset, projektin luonti, tyƶn kƤƤntƤminen ja integraatiotestaus kƤytƤnnƶn DB2-jƤlleenmyyntiesimerkin avulla.

MikƤ on DataStage?
DataStage on ETL-tyƶkalu, jota kƤytetƤƤntracmuunna ja lataa tietoja lƤhteestƤ kohdekohteeseen. NƤiden tietojen lƤhde voi sisƤltƤƤ perƤkkƤisiƤ tiedostoja, indeksoituja tiedostoja, relaatiotietokantoja, ulkoisia tietolƤhteitƤ, arkistoja, yrityssovelluksia jne. DataStagea kƤytetƤƤn liiketoiminnan analysoinnin helpottamiseen tarjoamalla laadukasta dataa, joka auttaa liiketoimintatiedon hankkimisessa.
DataStage ETL -tyƶkalua kƤytetƤƤn suuressa organisaatiossa rajapintana eri jƤrjestelmien vƤlillƤ. Se huolehtii esim.tractiedon siirtƤminen, kƤƤntƤminen ja lataaminen lƤhteestƤ kohdekohteeseen. VMark julkaisi sen ensimmƤisen kerran 90-luvun puolivƤlissƤ. IBM ostettuaan DataStagen vuonna 2005, se nimettiin uudelleen IBM WebSphere DataStage ja myƶhemmin IBM InfoSphere.
Useita markkinoilla saatavilla olevia Datastage-versioita olivat Enterprise Edition (PX), Server Edition, MVS Edition, DataStage for PeopleSoft ja niin edelleen. Uusin painos on IBM InfoSphere DataStage.
IBM Tietopalvelin sisƤltƤƤ seuraavat tuotteet,
- IBM InfoSphere DataStage
- IBM InfoSphere QualityStage
- IBM InfoSpheren tietopalvelujohtaja
- IBM InfoSphere Information Analyzer
- IBM Tietopalvelin nopeastiTrack
- IBM InfoSphere Business Glossary
Kun mƤƤritelmƤ on vakiintunut, seuraavassa osiossa tarkastellaan, mitƤ tuote todellisuudessa voi tehdƤ sisƤllƤƤn tietovarastointi ympƤristƶƶn.
DataStage Yleiskatsaus
Datastagella on seuraavat ominaisuudet.
- Se voi integroida tietoja laajasta valikoimasta yritys- ja ulkoisia tietolƤhteitƤ
- Toteuttaa tietojen validointisƤƤnnƶt
- Se on hyƶdyllinen suurten tietomƤƤrien kƤsittelyssƤ ja muuntamisessa
- Se kƤyttƤƤ skaalautuvaa rinnakkaiskƤsittelyƤ
- Se pystyy kƤsittelemƤƤn monimutkaisia āāmuunnoksia ja hallita useita integraatioprosesseja
- HyƶdynnƤ suoria yhteyksiƤ yrityssovelluksiin lƤhteinƤ tai kohteina
- HyƶdynnƤ metadataa analysointia ja yllƤpitoa varten
- Operates erƤssƤ, reaaliajassa tai verkkopalveluna
TƤmƤn DataStage-opetusohjelman seuraavissa osissa kuvataan lyhyesti seuraavat seikat IBM InfoSphere DataStage:
- Tietojen muuntaminen
- Tyƶpaikat
- RinnakkaiskƤsittely
InfoSphere DataStage ja QualityStage voivat kƤyttƤƤ tietoja yrityssovelluksissa ja tietolƤhteissƤ, kuten:
- Relaatiotietokannat
- Mainframe-tietokannat
- Liiketoiminta- ja analyyttiset sovellukset
- Yrityksen resurssien suunnittelu (ERP) tai asiakassuhteiden hallinnan (CRM) tietokannat
- Online-analyyttinen kƤsittely (OLAP) tai suorituskyvyn hallinnan tietokannat
KƤsittelyvaiheen tyypit
IBM infosphere-tyƶ koostuu yksittƤisistƤ vaiheista, jotka on linkitetty toisiinsa. Se kuvaa tiedonkulkua tietolƤhteestƤ tietokohteeseen. YleensƤ vaiheessa on vƤhintƤƤn yksi datatulo ja/tai yksi datalƤhtƶ. Jotkut vaiheet voivat kuitenkin hyvƤksyƤ useamman kuin yhden datasyƶtƶn ja ulostulon useampaan kuin yhteen vaiheeseen.
Tyƶn suunnittelussa voit kƤyttƤƤ erilaisia āāvaiheita:
- Muutosvaihe
- Suodatusvaihe
- Aggregaattorivaihe
- Poista kaksoiskappaleet
- Liity lavalle
- Hakuvaihe
- Kopioi vaihe
- Lajittele vaihe
- Kontit
Miksi DataStagea kannattaa kƤyttƤƤ datan integrointiin?
Ominaisuusluettelon tunteminen on yksi asia ja toinen asia tietƤƤ, milloin tyƶkalu ansaitsee lisenssimaksunsa. DataStage valitaan tyƶkuormille, joissa volyymi, hallinta ja heterogeeniset lƤhteet tekevƤt kƤsinkirjoitetuista skripteistƤ hallitsemattomia.
Selkein syy on suoritusteho. Koska moottori osittaa datan solmujen vƤlillƤ ja suoratoistaa tietueita vaiheiden vƤlillƤ samanaikaisesti, laitteiston lisƤƤminen lisƤƤ suoritustehoa lƤhes lineaarisesti. Kahden solmun kehityslaatikolla suunniteltu tyƶ suoritetaan muuttumattomana kahdeksan solmun tuotantoklusterissa.
Muut syyt ovat pikemminkin organisatorisia kuin teknisiƤ:
- Jaetut metatiedot: TaulukkomƤƤritelmƤt, yhteydet ja liiketoimintatermit tallennetaan kerran repositorioon ja niitƤ kƤytetƤƤn uudelleen jokaisessa tyƶssƤ, mikƤ poistaa ajautumisen, joka syntyy, kun jokainen kehittƤjƤ mƤƤrittelee lƤhteen itsenƤisesti.
- SisƤƤnrakennettu datan laatu: QualityStage suorittaa tutkimuksen, standardoinnin, yhteensovittamisen ja selviytymisen ETL-tyƶnkulun rinnalla, joten puhdistus ei vaadi toista tuotetta.
- Laaja liitettƤvyys: Natiivit liittimet saavuttavat DB2:n, Oracle, Teradata, keskustietokoneen VSAM, SAP, Salesforce ja pilviobjektien tallennustila ilman mukautettua koodia.
- Operakansallinen hallinta: Director nƤyttƤƤ suoritushistorian, rivimƤƤrƤt, varoitukset ja uudelleenkƤynnistyspisteet, jotka auditoijat hyvƤksyvƤt todisteeksi hallitusta dataputkesta.
- UudelleenkƤytettƤvyys: Jaetut sƤilƶt ja parametrijoukot mahdollistavat yhden testatun transformaation suorittamisen useissa tehtƤvissƤ sen sijaan, ettƤ se kopioitaisiin jokaiseen niistƤ.
NƤmƤ hyƶdyt riippuvat suoraan tuotteen kokoamisesta, mikƤ selitetƤƤn seuraavassa osiossa.
DataStage Components ja Archirakenne
DataStagessa on neljƤ pƤƤkomponenttia, nimittƤin
- JƤrjestelmƤnvalvoja: SitƤ kƤytetƤƤn hallintotehtƤviin. TƤhƤn sisƤltyy DataStage-kƤyttƤjien mƤƤrittƤminen, tyhjennyskriteerien mƤƤrittƤminen sekƤ projektien luominen ja siirtƤminen.
- Manager: Se on ETL DataStage -tietovaraston pƤƤrajapinta. SitƤ kƤytetƤƤn uudelleenkƤytettƤvien metatietojen tallentamiseen ja hallintaan. DataStage managerin kautta voi tarkastella ja muokata arkiston sisƤltƶƤ.
- Suunnittelija: SuunnitteluliittymƤ, jota kƤytetƤƤn DataStage-sovellusten TAI tƶiden luomiseen. Se mƤƤrittƤƤ tietolƤhteen, vaaditun muunnoksen ja tietojen mƤƤrƤnpƤƤn. Tyƶt kootaan suoritettavan tiedoston luomiseksi, jotka johtaja ajoittaa ja joita palvelin suorittaa
- Ohjaaja: SitƤ kƤytetƤƤn DataStage-palvelintƶiden ja rinnakkaisten tƶiden validointiin, ajoittamiseen, suorittamiseen ja valvontaan.

YllƤ oleva kuva selittƤƤ kuinka IBM Infosphere DataStage on vuorovaikutuksessa muiden osien kanssa IBM Tietopalvelinalusta. DataStage on jaettu kahteen osaan, Jaetut komponentit ja suoritusaika ArchirakenneAlla oleva taulukko selittƤƤ tarkemmin, mitƤ kukin nƤistƤ kahdesta osiosta sisƤltƤƤ.
|
Yhteinen |
YhtenƤinen kƤyttƶliittymƤ |
|
|
Yhteiset palvelut |
|
|
|
Yhteinen rinnakkaiskƤsittely |
|
|
|
Runtime Archirakenne |
OSH Script |
|
Miten rinnakkaiskƤsittely toimii DataStagessa
YllƤ oleva arkkitehtuuritaulukko nimeƤƤ yhteisen rinnakkaiskƤsittelyn jaetuksi palveluksi. TƤssƤ osiossa selitetƤƤn, miten kyseinen palvelu itse asiassa suorittaa tyƶn, koska konsepti luvattiin yleiskatsauksessa ja se mƤƤrittƤƤ, kuinka nopeasti tyƶ valmistuu.
Rinnakkaistyƶ kƤyttƤƤ kahta mekanismia samanaikaisesti, ja molemmat otetaan kƤyttƶƶn automaattisesti suorituksen aikana sen sijaan, ettƤ ne koodattaisiin kƤsin.
1. Putkilinjan rinnakkaisuus. Jokainen tyƶn vaihe alkaa kerralla sen sijaan, ettƤ odotettaisiin edellisen vaiheen pƤƤttymistƤ. LƤhdevaihe alkaa lukea rivejƤ ja siirtƤƤ ne muistissa olevaan liukuhihnaan. Transformer kƤynnistyy heti ensimmƤisten rivien saapuessa ja siirtƤƤ tulosteensa toiseen liukuhihnaan. Kohdeliitin aloittaa kirjoittamisen heti sen jƤlkeen. VƤlitiedostoa ei kirjoiteta, joten kolmivaiheinen tyƶ suorittaa lukemisen, muuntamisen ja kirjoittamisen pƤƤllekkƤin sen sijaan, ettƤ ne suoritettaisiin perƤkkƤin.
2. Osioinnin rinnakkaisuus. Rivit jaetaan erillisiin osioihin, ja vaihelogiikan tƤysi kopio suoritetaan jokaista osiota vastaan āāomalla solmullaan. Kahdeksan osiota tarkoittaa kahdeksaa samanaikaista Transformer-instanssia. Virran lopussa osiot kerƤtƤƤn takaisin yhdeksi kohteen virraksi.
Oikean osiointimenetelmƤn valinta on kehittƤjƤn tƤrkein virityspƤƤtƶs:
- Auto: Oletusarvo. Moottori valitsee metodin vaiheen tarpeiden perusteella.
- hash: LƤhettƤƤ saman avainarvon sisƤltƤvƤt rivit samaan solmuun. Vaaditaan ennen Join-, Aggregator- ja Remove Duplicates -komentoja, jotta identtiset avaimet tƤsmƤƤvƤt.
- Round Robin: KƤsittelee rivejƤ tasaisesti yksi kerrallaan. Paras vaihtoehto ladattaessa tasaista tiedostoa, jossa avainryhmƤt ovatping ei ole vƤliƤ.
- Koko: Kopioi koko tietojoukon jokaiseen solmuun. KƤytetƤƤn pienille viitetaulukoille hakuvaiheessa.
- Sama: SƤilyttƤƤ olemassa olevan osioinnin koskemattomana, mikƤ vƤlttƤƤ tarpeettoman uudelleenosioinnin kahden vaiheen vƤlillƤ.
- Alue ja moduuli: Jaa rivit arvoalueen mukaan tai numeerisen avaimen jƤƤnnƶksen mukaan, kun tarvitaan tasainen jakautuminen.
Konfiguraatiotiedosto (APT_CONFIG_FILE) mƤƤrittƤƤ, kuinka monta solmua on olemassa. Koska solmujen mƤƤrƤ sijaitsee tyƶn ulkopuolella, sama kƤƤnnetty tyƶ skaalautuu kannettavasta tietokoneesta tuotantoverkkoon ilman suunnittelumuutoksia.
Ennen kuin mitƤƤn tƤstƤ voidaan kokeilla, ympƤristƶn on oltava kunnossa.
Datastage Toolin ennakkoedellytys
DataStagea varten tarvitset seuraavan asennuksen.
- InfoSphere
- DataStage Server 9.1.2 tai uudempi
- Microsoft Visual Studio .NET 2010 Express Edition C++
- Oracle asiakas (tƤysasiakas, ei vƤlitƶn asiakas), jos muodostat yhteyden Oracle tietokanta
- DB2-tyƶasema, jos muodostat yhteyden DB2-tietokantaan
Nyt tƤssƤ DataStage-opetusohjelmassa aloittelijoille opimme lataamaan ja asentamaan InfoSphere-tietopalvelimen.
Lataa ja asenna InfoSphere Information Server
Voit kƤyttƤƤ DataStagea lataamalla ja asentamalla uusimman version IBM InfoSphere-palvelin. Palvelin tukee AIX-, Linux- ja Windows kƤyttƶjƤrjestelmƤ. Voit valita tarpeen mukaan.
Tietojen siirtƤmiseen vanhemmasta infospheren versiosta uuteen versioon kƤytetƤƤn resurssien vaihtotyƶkalua.
Asennustiedostot
Infosphere Datastagen asentaminen ja mƤƤrittƤminen edellyttƤƤ, ettƤ asennuksessasi on seuraavat tiedostot.
varten Windows,
- EtlDeploymentPackage-windows-oracle.pkg
- EtlDeploymentPackage-windows-db2.pkg
Linuxille,
- EtlDeploymentPackage-linux-db2.pkg
- EtlDeploymentPackage-linux-oracle.pkg
Kun palvelin on asennettu, tƤmƤn sivun loppuosassa oleva esimerkki kƤyttƤƤ muutosdatan sieppausta, joten on hyƶdyllistƤ nƤhdƤ, miten muutosdata liikkuu ennen sen rakentamista.
Muutostietojen prosessivirta CDC Transaction Stage -tyƶssƤ
YllƤ oleva kaavio tractekee yhden muutoksen lƤhdetietokannasta kohdetietokantaan alla luetellussa jƤrjestyksessƤ.
- Tietokannan 'InfoSphere CDC' -palvelu tarkkailee ja kaappaa muutosta lƤhdetietokannasta
- ReplikointimƤƤrityksen mukaan "InfoSphere CDC" siirtƤƤ muutostiedot "InfoSphere CDC for InfoSphere DataStagelle".
- "InfoSphere CDC for InfoSphere DataStage" -palvelin lƤhettƤƤ tiedot "CDC Transaction -vaiheeseen" TCP/IP-istunnon kautta. "InfoSphere CDC for InfoSphere DataStage" -palvelin lƤhettƤƤ myƶs COMMIT-sanoman (kirjanmerkkitietojen kanssa) merkitƤkseen tapahtumarajan kaapatussa lokissa.
- Jokaiselle "InfoSphere CDC for InfoSphere DataStage" -palvelimen lƤhettƤmƤlle COMMIT-sanomille "CDC Transaction stage" luo end-of-wave (EOW) -merkit. NƤmƤ merkit lƤhetetƤƤn kaikissa lƤhtƶlinkeissƤ kohdetietokannan liitinvaiheeseen.
- Kun "kohdetietokantaliitinvaihe" vastaanottaa aallon loppumerkin kaikille tulolinkeille, se kirjoittaa kirjanmerkkitiedot kirjanmerkkitaulukkoon ja sitoo sitten tapahtuman kohdetietokantaan.
- "InfoSphere CDC for InfoSphere DataStage" -palvelin pyytƤƤ kirjanmerkkitietoja "kohdetietokannan" kirjanmerkkitaulukosta.
- "InfoSphere CDC for InfoSphere DataStage" -palvelin vastaanottaa kirjanmerkkitiedot.
TƤtƤ tietoa kƤytetƤƤn mm.
- MƤƤritƤ tapahtumalokissa aloituspiste, jossa muutokset luetaan, kun replikointi alkaa.
- SelvittƤƤksesi, voidaanko olemassa oleva tapahtumaloki puhdistaa
SQL-replikoinnin mƤƤrittƤminen
Ennen kuin aloitat Datastagen kƤytƶn, sinun on mƤƤritettƤvƤ tietokanta. Luot kaksi DB2-tietokantaa.
- Yksi toimimaan replikointilƤhteenƤ ja
- Yksi kohteena.
Luot myƶs kaksi taulukkoa (Tuote ja Varasto) ja tƤytƤt ne esimerkkitiedoilla. Sitten voit testata integraatiosi vƤlillƤ SQL Replikointi ja tietovaihe.
Jatkossa mƤƤritƤt SQL-replikoinnin luomalla ohjaustaulukot, tilausjoukot, rekisterƶinnit ja tilausjoukon jƤsenet. Opimme tƤstƤ tarkemmin seuraavassa osiossa.
TƤssƤ otamme esimerkin VƤhittƤismyyntituote tietokantaamme ja luomme kaksi taulukkoa Varasto ja Tuote. NƤmƤ taulukot lataavat tietoja lƤhteestƤ kohteeseen nƤiden joukkojen kautta. (ohjaustaulukot, tilausjoukot, rekisterƶinnit ja tilausjoukon jƤsenet.)
Vaihe 1) Luo lƤhdetietokanta, jota kutsutaan nimellƤ MYYNTI. Luo tƤmƤn tietokannan alle kaksi taulukkoa tuote ja Inventaario.
Vaihe 2) Luo SALES-tietokanta suorittamalla seuraava komento.
db2 create database SALES
Vaihe 3) Ota SALES-tietokannan arkistointiloki kƤyttƶƶn. Varmuuskopioi myƶs tietokanta kƤyttƤmƤllƤ seuraavia komentoja
db2 update db cfg for SALES using LOGARCHMETH3 LOGRETAIN db2 backup db SALES
Vaihe 4) Siirry samassa komentokehotteessa setupDB-alihakemistoon sqlrepl-datastage-tutorial-hakemistossa, jonka olet aiemmin kƤyttƤnyt.tracladatusta pakatusta tiedostosta.
Vaihe 5) KƤytƤ seuraavaa komentoa Inventory-taulukon luomiseen ja tietojen tuomiseen taulukkoon suorittamalla seuraava komento.
db2 import from inventory.ixf of ixf create into inventory
Vaihe 6) Luo kohdetaulukko. NimeƤ kohdetietokanta nimellƤ STAGEDB.
Koska olet nyt luonut sekƤ tietokannan lƤhde- ettƤ kohdetietokannan, seuraava vaihe tƤssƤ DataStage-opetusohjelmassa, nƤemme kuinka se kopioidaan.
Seuraavista tiedoista voi olla apua ODBC-tietolƤhteen mƤƤrittƤminen vuonna IBM InfoSphere Information Serverin dokumentaatio.
SQL-replikointiobjektien luominen
Alla oleva kuva nƤyttƤƤ, miten muutosdatan virtaus toimitetaan lƤhdetietokannasta kohdetietokantaan. Luot lƤhde-kohdekartan.ping ns. pƶytien vƤlissƤ tilausjoukon jƤseniƤ ja ryhmittele jƤsenet a tilaus.
InfoSphere CDC:n (Change Data Capture) replikointiyksikkƶƤ kutsutaan tilaukseksi.
- LƤhteeseen tehdyt muutokset tallennetaan "Capture control table" -taulukkoon, joka lƤhetetƤƤn CD-taulukkoon ja sitten kohdetaulukkoon. Hakemusohjelmassa on tiedot rivistƤ, josta muutokset on tehtƤvƤ. Se liittyy myƶs tilaussarjan CD-pƶytƤƤn.
- Tilaus sisƤltƤƤ kartanping tiedot, jotka mƤƤrittƤvƤt, miten lƤhdetietovaraston tietoja sovelletaan kohdetietovarastoon. Huomaa, ettƤ CDC:tƤ kutsutaan nyt nimellƤ Infosphere-tietojen replikointi.
- Kun tilaus suoritetaan, InfoSphere CDC kaappaa muutokset lƤhdetietokannassa. InfoSphere CDC toimittaa muutostiedot kohteeseen ja tallentaa synkronointipisteen tiedot kohdetietokannan kirjanmerkkitaulukkoon.
- InfoSphere CDC kƤyttƤƤ kirjanmerkkitietoja InfoSphere DataStage -tyƶn edistymisen seuraamiseen.
- Vian sattuessa kirjanmerkkitietoja kƤytetƤƤn uudelleenaloituspisteenƤ. EsimerkissƤmme ASN.IBMSNAP_FEEDETL-taulukko tallentaa DataStageen liittyviƤ synkronointipistetietoja, joita kƤytetƤƤn track DataStage-edistyminen.
TƤssƤ osiossa IBM DataStage-opetusohjelma, sinun on tehtƤvƤ seuraavat asiat,
- Luo CAPTURE CONTROL -taulukoita ja APPLY CONTROL -taulukoita replikointiasetusten tallentamiseksi
- Rekisterƶi TUOTE- ja INVENTORY-taulukot toisinnuslƤhteiksi
- Luo kahden jƤsenen tilausjoukko
- Luo tilausjoukon jƤseniƤ ja kohdista CCD-taulukoita
KƤytƤ ASNCLP-komentoriviohjelmaa SQL-replikoinnin mƤƤrittƤmiseen
Vaihe 1) Etsi crtCtlTablesCaptureServer.asnclp-komentosarjatiedosto sqlrepl-datastage-tutorial/setupSQLRep-hakemistosta.
Vaihe 2) Korvaa tiedostossa ja " ā kƤyttƤjƤtunnuksellasi ja salasanallasi liittyƤksesi SALES-tietokantaan.
Vaihe 3) Muuta hakemistot sqlrepl-datastage-tutorial/setupSQLRep-hakemistoon ja suorita komentosarja. KƤytƤ seuraavaa komentoa. Komento muodostaa yhteyden SALES-tietokantaan ja luo SQL-komentosarjan seurantaohjelman ohjaustaulukoiden luomista varten.
asnclp āf crtCtlTablesCaptureServer.asnclp
Vaihe 4) Etsi crtCtlTablesApplyCtlServer.asnclp-komentosarjatiedosto samasta hakemistosta. Korvaa nyt kaksi esiintymƤƤ ja " ā kƤyttƤjƤtunnuksella ja salasanalla STAGEDB-tietokantaan yhdistƤmistƤ varten.
Vaihe 5) KƤytƤ nyt samassa komentokehotteessa seuraavaa komentoa sovellusohjaustaulukoiden luomiseen.
asnclp āf crtCtlTablesApplyCtlServer.asnclp
Vaihe 6) Etsi crtRegistration.asnclp-komentosarjatiedostot ja korvaa kaikki esiintymƤt kƤyttƤjƤtunnuksella SALES-tietokantaan liittymistƤ varten. Muuta myƶs " ā yhteyden salasanaan.
Vaihe 7) Rekisterƶi lƤhdetaulukot kƤyttƤmƤllƤ seuraavaa komentosarjaa. Osana rekisterƶinnin luomista ASNCLP-ohjelma luo kaksi CD-taulukkoa. CD-TUOTTEET JA CDINVENTORY.
asnclp āf crtRegistration.asnclp
CREATE REGISTRATION -komento kƤyttƤƤ seuraavia vaihtoehtoja:
- Differentiaalin pƤivitys: Se kehottaa Apply-ohjelmaa pƤivittƤmƤƤn kohdetaulukon vain, kun lƤhdetaulukon rivit muuttuvat
- Kuvaa molemmat: TƤtƤ vaihtoehtoa kƤytetƤƤn rekisterƶimƤƤn arvo lƤhdesarakkeeseen ennen muutoksen tapahtumista ja yksi arvolle muutoksen tapahtumisen jƤlkeen.
Vaihe 8) Muodosta yhteys kohdetietokantaan (STAGEDB) noudattamalla seuraavia ohjeita.
- Etsi crtTableSpaceApply.bat-tiedosto ja avaa se tekstieditorissa
- Korvata ja kƤyttƤjƤtunnuksella ja salasanalla
- Kirjoita DB2-komentoikkunaan crtTableSpaceApply.bat ja suorita tiedosto.
- TƤmƤ erƤtiedosto luo uuden taulukkotilan kohdetietokantaan ( STAGEDB)
Vaihe 9) Etsi crtSubscriptionSetAndAddMembers.asnclp-komentosarjatiedostot ja tee seuraavat muutokset.
- Korvaa kaikki esiintymƤt ja kƤyttƤjƤtunnuksella ja salasanalla SALES-tietokantaan (lƤhde) liittymistƤ varten.
- Korvaa kaikki esiintymƤt ja kƤyttƤjƤtunnuksella STAGEDB-tietokantaan (kohde) yhdistƤmistƤ varten.
Muutosten jƤlkeen suorita komentosarja luodaksesi tilausjoukon (ST00), joka ryhmittelee lƤhde- ja kohdetaulukot. Komentosarja luo myƶs kaksi tilausjoukon jƤsentƤ ja CCD:n (yhdenmukaiset muutostiedot) kohdetietokantaan, joka tallentaa muokatut tiedot. Infosphere DataStage kƤyttƤƤ nƤmƤ tiedot.
Vaihe 10) Luo tilausjoukko, tilausjoukon jƤsenet ja CCD-taulukot suorittamalla komentosarja.
asnclp āf crtSubscriptionSetAndAddMembers.asnclp
Tilausjoukon ja kahden jƤsenen luomiseen kƤytetƤƤn erilaisia āāvaihtoehtoja
- TƤydellinen tiivistettynƤ pois
- Ulkoinen
- Kuorman tyyppi tuonti vienti
- Ajoitus jatkuvaa
Vaihe 11) Replikoinnin hallintatyƶkalujen viasta johtuen. Sinun on suoritettava toinen erƤtiedosto asettaaksesi sarakkeen TARGET_CAPTURE_SCHEMA IBMSNAP_SUBS_SET ohjaustaulukon nollaksi.
- Etsi tiedosto updateTgtCapSchema.bat. Avaa se tekstieditorissa. Korvata ja kƤyttƤjƤtunnuksella STAGEDB-tietokantaan yhdistƤmistƤ varten.
- Kirjoita DB2-komentoikkunaan komento updateTgtCapSchema.bat ja suorita tiedosto.
MƤƤritystiedostojen luominen CCD-taulukoiden yhdistƤmiseksi DataStageen
Ennen kuin teemme replikoinnin seuraavassa vaiheessa, meidƤn on yhdistettƤvƤ CCD-taulukko DataStageen. TƤssƤ osiossa nƤemme kuinka yhdistƤƤ SQL DataStageen.
YhdistƤƤksesi CCD-taulukon DataStageen sinun on luotava Datastage-mƤƤritystiedostoja (.dsx). DataStage kƤyttƤƤ .dsx-tiedostomuotoa tyƶmƤƤritelmien tuontiin ja vientiin. KƤytƤt ASNCLP-skriptiƤ luodaksesi kaksi .dsx-tiedostoa. Esimerkiksi tƤssƤ olemme luoneet kaksi .dsx-tiedostoa.
- stagedb_AQ00_SET00_sJobs.dsx: Luo tyƶjƤrjestyksen, joka ohjaa neljƤn rinnakkaisen tyƶn tyƶnkulkua.
- stagedb_AQ00_SET00_pJobs.dsx : Luo neljƤ rinnakkaista tyƶtƤ
ASNCLP-ohjelma yhdistƤƤ CCD-sarakkeen automaattisesti Datastage Column -muotoon. SitƤ tuetaan vain, kun ASNCLP on kƤynnissƤ Windows, Linux- tai Unix-menettely.
Datavaiheen tyƶt hakevat rivejƤ CCD-taulukosta.
- Yksi tyƶ asettaa synkronointipisteen siihen kohtaan, missƤ DataStage jƤi edellisessƤ tyƶssƤ.tractietoja kahdesta taulukosta. Tyƶ hakee nƤmƤ tiedot valitsemalla ST00-tilausjoukolle SYNCHPOINT-arvon IBMSNAP_SUBS_SET-taulukko ja lisƤƤmƤllƤ sen MAX_SYNCHPOINT-sarakkeeseen IBMSNAP_FEEDETL-taulukko.
- Kaksi tyƶpaikkaa, jotka olivat aiemmintracPRODUCT_CCD- ja INVENTORY_CCD-taulukoiden tiedot. Tyƶt tietƤvƤt, mitkƤ rivit aloitetaan, esim.tracvalitsemalla MIN_SYNCHPOINT- ja MAX_SYNCHPOINT-arvot valikosta IBMSNAP_FEEDETL-taulukko tilausjoukolle.
Kun mƤƤritelmƤt on yhdistetty, replikointi voidaan aloittaa, jotta yhtenƤisten muutostietojen taulukot alkavat tƤyttyƤ.
Aloitetaan replikointi
Aloita replikointi noudattamalla alla olevia ohjeita. Kun CCD-taulukot tƤytetƤƤn tiedoilla, se osoittaa, ettƤ toisinnusasetukset on vahvistettu. Voit tarkastella kopioituja tietoja kohde-CCD-taulukoissa DB2 Control Center -ohjelmiston graafisen kƤyttƶliittymƤn avulla.
Vaihe 1) Varmista, ettƤ DB2 on kƤynnissƤ, jos se ei ole kƤynnissƤ, kƤytƤ sitƤ db2 kƤynnistys komento.
Vaihe 2) KƤytƤ sitten kƤyttƶjƤrjestelmƤn kehotteessa olevaa asncap-komentoa aloittaaksesi ohjelman sieppauksen. Esimerkiksi.
asncap capture_server=SALES
YllƤ oleva komento mƤƤrittƤƤ SALES-tietokannan muutosten seurantapalvelimeksi. PidƤ komentoikkuna auki, kun sieppaus on kƤynnissƤ.
Vaihe 3) Avaa nyt uusi komentokehote. Aloita sitten KOSKE ohjelma asnapply-komennolla.
asnapply control_server=STAGEDB apply_qual=AQ00
- Komento mƤƤrittƤƤ STAGEDB-tietokannan pƤivitysohjelman ohjauspalvelimeksi (tietokanta, joka sisƤltƤƤ pƤivitysohjelman ohjaustaulukot).
- AQ00 Apply-tarkenteena (tƤmƤn ohjaustaulukkojoukon tunniste)
JƤtƤ komentoikkuna auki, kun Apply on kƤynnissƤ.
Vaihe 4) Avaa nyt toinen komentokehote ja kƤynnistƤ DB2 Control Center -ohjelma antamalla db2cc-komento. HyvƤksy oletusarvoinen ohjauskeskus.
Vaihe 5) Avaa nyt vasemmasta navigointipuusta Kaikki tietokannat > STAGEDB ja napsauta sitten Taulukot. Double Napsauta taulukon nimeƤ (Tuote CCD) avataksesi taulukon. Se nƤyttƤƤ tƤltƤ.
Samoin voit myƶs avata CCD-taulukon INVENTORY:lle.
Replikointi syƶttƤƤ nyt tietoja yhtenƤisten muutostietojen (CCD) taulukoihin, joten huomio siirtyy tietokannan puolelta DataStage-asiakasohjelmiin.
Projektien luominen Datastage Toolissa
EnsinnƤkin luot projektin DataStagessa. TƤtƤ varten sinun on oltava InfoSphere DataStage -jƤrjestelmƤnvalvoja.
Kun asennus ja replikointi on tehty, sinun on luotava projekti. DataStagessa projektit ovat menetelmƤ tietojen jƤrjestƤmiseen. Se sisƤltƤƤ datatiedostojen, vaiheiden ja rakennustƶiden mƤƤrittelyn tietyssƤ projektissa.
Voit luoda projektin DataStagessa seuraavasti:
Vaihe 1) KƤynnistƤ DataStage-ohjelmisto
KƤynnistƤ DataStage ja QualityStage Administrator. Napsauta sitten KƤynnistƤ > Kaikki ohjelmat > IBM Tietopalvelin > IBM WebSphere DataStage ja QualityStage Administrator.
Vaihe 2) YhdistƤ DataStage-palvelin ja asiakas
Kun haluat muodostaa yhteyden DataStage-palvelimeen DataStage-asiakkaastasi, anna tiedot, kuten verkkotunnuksen nimi, kƤyttƤjƤtunnus, salasana ja palvelintiedot.
Vaihe 3) LisƤƤ uusi projekti
WebSphere DataStage Administration -ikkunassa. Napsauta Projektit-vƤlilehteƤ ja napsauta sitten LisƤƤ.
Vaihe 4) Anna projektin tiedot
Kirjoita WebSphere DataStage Administration -ikkunaan tiedot, kuten
- Nimi
- Tiedoston sijainti
- Napsauta 'OK'
Jokainen projekti sisƤltƤƤ:
- DataStage tyƶpaikkoja
- SisƤƤnrakennetut komponentit. NƤmƤ ovat ennalta mƤƤritettyjƤ komponentteja, joita kƤytetƤƤn tyƶssƤ.
- KƤyttƤjƤn mƤƤrittƤmƤt komponentit. NƤmƤ ovat mukautettuja komponentteja, jotka on luotu DataStage Managerilla tai DataStage Designerilla.
NƤemme kuinka replikointitƶitƤ tuodaan Datastage InfospheressƤ.
Replikointitƶiden tuominen Datastagessa ja QualityStage Designerissa
Tuot tyƶpaikkoja IBM InfoSphere DataStage- ja QualityStage Designer -asiakasohjelma. Ja tƤytƤt ne IBM InfoSphere DataStage- ja QualityStage Director -asiakas.
Suunnittelija-asiakas on kuin tyhjƤ kangas rakennustƶille. Se on esim.tracts, muunna, lataa ja tarkista datan laatu. Se tarjoaa tyƶkaluja, jotka muodostavat tyƶtehtƤvƤn perusrakenteet. Se sisƤltƤƤ
- harjoittelupaikkoja: Se muodostaa yhteyden tietolƤhteisiin lukea tai kirjoittaa tiedostoja ja kƤsitellƤ tietoja.
- Linkit: Se yhdistƤƤ vaiheet, joita pitkin tietosi kulkevat
InfoSphere DataStage- ja QualityStage Designer -asiakasohjelman vaiheet on tallennettu Designer-tyƶkalupalettiin.
InfoSphere QualityStage sisƤltƤƤ seuraavat vaiheet:
- Tutki vaihetta
- Standardoi vaihe
- Match Frequency -vaihe
- Yhden lƤhteen otteluvaihe
- Kahden lƤhteen Match-vaihe
- SelviytyƤ vaihe
- Standardoinnin laadunarvioinnin (SQA) vaihe
Voit luoda DataStage-infosfƤƤrissƤ neljƤn tyyppisiƤ tƶitƤ.
- Rinnakkaistyƶ
- Jakso Job
- Mainframe-tyƶ
- Palvelimen tyƶ
Katsotaanpa vaihe vaiheelta, kuinka replikointityƶtiedostot tuodaan.
Vaihe 1) KƤynnistƤ DataStage ja QualityStage Designer. Napsauta KƤynnistƤ > Kaikki ohjelmat > IBM Tietopalvelin > IBM WebSphere DataStage ja QualityStage Designer
Vaihe 2) Anna LiitƤ projektiin -ikkunassa seuraavat tiedot.
- Domain
- kƤyttƤjƤtunnus
- Salasana
- Hankkeen nimi
- OK
Vaihe 3) Napsauta nyt Tiedosto-valikosta tuonti -> DataStage-komponentit.
Uusi DataStage Repository Import -ikkuna avautuu.
- Selaa tƤssƤ ikkunassa STAGEDB_AQ00_ST00_sJobs.dsx aiemmin luomamme tiedosto
- Valitse vaihtoehto "Tuo kaikki".
- Valitse "Suorita vaikutusanalyysi" -valintaruutu.
- Napsauta OK.
Kun tyƶ on tuotu, DataStage luo STAGEDB_AQ00_ST00_sequence-tyƶn.
Vaihe 4) Noudata samoja vaiheita tuodaksesi STAGEDB_AQ00_ST00_pJobs.dsx-tiedosto. TƤmƤ tuonti luo neljƤ rinnakkaista tyƶtƤ.
Vaihe 5) Suunnittelijan arkisto -osiossa -> Avaa SQLREP-kansio. Kansion sisƤllƤ nƤet Sequence Job ja neljƤ rinnakkaista tyƶtƤ.
Vaihe 6) NƤhdƤksesi sarjatyƶn. Siirry arkistopuuhun, napsauta hiiren kakkospainikkeella STAGEDB_AQ00_ST00_sequence-tyƶtƤ ja napsauta Muokkaa. Se nƤyttƤƤ neljƤn rinnakkaisen tyƶn tyƶnkulkua, joita tyƶjƤrjestys ohjaa.
Jokainen kuvake on nƤyttƤmƶ,
- getExtractRange-vaihe: Se pƤivittƤƤ IBMSNAP_FEEDETL-taulukko. Se asettaa lƤhtƶkohdan dataesimerkilletracsiihen pisteeseen asti, jossa DataStage viimeksi poistuitracted-rivit ja aseta lopetuspisteeksi tilausjoukon viimeinen kƤsitelty tapahtuma.
- getExtractRangeSuccessTƤmƤ vaihe antaa lƤhtƶkohdat entiselletractFromINVENTORY_CCD-vaihe ja extractFromPRODUCT_CCD-vaihe
- AllExtracOnnistui: TƤssƤ vaiheessa varmistetaan, ettƤ molemmat entisettractFromINVENTORY_CCD ja esim.tractFromPRODUCT_CCD suoritettiin onnistuneesti. Sitten viimeksi noudettujen rivien synkronointipisteet vƤlitetƤƤn setRangeProcessed-vaiheeseen.
- setRangeProcessed vaihe: PƤivittyy IBMSNAP_FEEDETL-taulukko. DataStage siis tietƤƤ, mistƤ aloittaa seuraavan datakierroksen, esim.tracTUKSEN
Vaihe 7) NƤhdƤksesi rinnakkaiset tyƶt. Napsauta hiiren kakkospainikkeella STAGEDB_ASN_INVENTORY_CCD:tƤ ja valitse arkistosta muokkaa. Se avaa ikkunan alla olevan kuvan mukaisesti.
TƤssƤ yllƤ olevassa kuvassa nƤet, ettƤ tiedot Varaston CCD-taulukosta ja Synch pisteen tiedot FEEDETL-taulukosta renderƶidƤƤn Lookup_6-vaiheeseen.
Tuodut tyƶt eivƤt vielƤkƤƤn osoita mihinkƤƤn, joten seuraavaksi on mƤƤriteltƤvƤ datayhteysobjekti.
Datayhteyden luominen DataStagesta STAGEDB-tietokantaan
Seuraava askel on nyt rakentaa tietoyhteys InfoSphere DataStagen ja SQL Replication -kohdetietokannan vƤlille. Se sisƤltƤƤ CCD-taulukot.
DataStagessa kƤytƤt datayhteysobjekteja ja niihin liittyviƤ liitinvaiheita, jotta voit mƤƤrittƤƤ nopeasti yhteyden tietolƤhteeseen tyƶn suunnittelussa.
Vaihe 1) STAGEDB sisƤltƤƤ sekƤ Apply-ohjaustaulut, joita DataStage kƤyttƤƤ dataex-tiedostojensa synkronointiintracja yhtenƤisten muutostietojen taulukot, joista tiedot otetaantracted. KƤytƤ seuraavia komentoja
db2 catalog tcpip node SQLREP remote ip_address server 50000 db2 catalog database STAGEDB as STAGEDB2 at node SQLREP
Huomautuksia: Sen jƤrjestelmƤn IP-osoite, jossa STAGEDB luotiin
Vaihe 2) Napsauta Tiedosto > Uusi > Muu > Tietoyhteys.
Vaihe 3) Sinulla on ikkuna, jossa on kaksi vƤlilehteƤ, Parametrit ja Yleiset.
Vaihe 4) TƤssƤ vaiheessa
- YleensƤ vƤlilehti, anna datayhteydelle nimi sqlreplConnect
- Parametrit-vƤlilehdessƤ alla olevan kuvan mukaisesti
- Napsauta Selaa-painiketta YhdistƤ vaihetyypin avulla -kentƤn vieressƤ ja
- Avaa ikkuna ja siirry arkistopuussa Stage Types -> Parallel -> Database -> DB2 Connector -kohtaan.
- Napsauta Avaa.
Vaihe 5) Kirjoita Yhteysparametrit-taulukkoon tiedot, kuten
- ConnectionString: STAGEDB2
- KƤyttƤjƤtunnus: KƤyttƤjƤtunnus STAGEDB-tietokantaan yhdistƤmistƤ varten
- Salasana: Salasana yhteyden muodostamiseksi STAGEDB-tietokantaan
- IlmentymƤ: STAGEDB-tietokannan sisƤltƤvƤn DB2-ilmentymƤn nimi
Vaihe 6) Tallenna datayhteys seuraavassa ikkunassa. Napsauta 'tallenna'-painiketta.
TaulukkomƤƤritelmien tuonti STAGEDB:stƤ DataStageen
EdellisessƤ vaiheessa nƤimme, ettƤ InfoSphere DataStage ja STAGEDB-tietokanta on yhdistetty. Tuo nyt sarakemƤƤritykset ja muut metatiedot PRODUCT_CCD- ja INVENTORY_CCD-taulukoille Information Server -sƤilƶƶn.
Noudata alla olevia ohjeita suunnittelijaikkunassa.
Vaihe 1) Valitse Tuo > TaulukkomƤƤritykset > KƤynnistƤ ohjattu liittimen tuontitoiminto
Vaihe 2) Valitse ohjatun toiminnon liittimen valintasivulta DB2-liitin ja napsauta Seuraava.
Vaihe 3) Napsauta latausta yhteyden tietosivulla. TƤmƤ tƤyttƤƤ ohjatun toiminnon kentƤt yhteystiedoilla edellisessƤ luvussa luomastasi datayhteydestƤ.
Vaihe 4) Napsauta Testaa yhteyttƤ samalla sivulla. TƤmƤ kehottaa DataStagea yrittƤmƤƤn yhteyttƤ STAGEDB-tietokantaan. NƤet viestin "Yhteys onnistui". Napsauta Seuraava.
Vaihe 5) Varmista, ettƤ TietolƤhteen sijainti -sivulla IsƤntƤnimi- ja Tietokannan nimi -kentƤt on tƤytetty oikein. Napsauta sitten Seuraava.
Vaihe 6) Schema-sivulla. Kirjoita pƤivitysohjaustaulukoiden (ASN) skeema tai tarkista, ettƤ ASN-skeema on esitƤytetty skeemakenttƤƤn. Napsauta sitten Seuraava. Valintasivulla nƤkyy luettelo ASN-skeemassa mƤƤritellyistƤ taulukoista.
Vaihe 7) EnsimmƤinen taulukko, josta meidƤn on tuotava metatiedot, on IBMSNAP_FEEDETL, Apply-ohjaustaulukko. Se sisƤltƤƤ synkronointipisteiden tiedot, joiden avulla DataStage voi sƤilyttƤƤ track riviƤ, joista se on noutanut yhtenƤisten muutostietojen taulukoista. Valitse IBMSNAP_FEEDETL ja napsauta Seuraava.
Vaihe 8) Suorittaaksesi tuonnin loppuun IBMTaulukon SNAP_FEEDETL mƤƤritelmƤ. Napsauta tuonti ja napsauta sitten avoimessa ikkunassa avaa.
Vaihe 9) Toista vaiheet 1ā8 vielƤ kaksi kertaa tuodaksesi mƤƤritelmƤt PRODUCT_CCD-taulukolle ja sitten INVENTORY_CCD-taulukolle.
HUOMAUTUS: Kun tuot varaston ja tuotteen mƤƤritelmiƤ, varmista, ettƤ vaihdat skeemat ASN:stƤ skeemaan, jonka mukaan PRODUCT_CCD ja INVENTORY_CCD luotiin.
Nyt DataStagella on kaikki tiedot, joita se tarvitsee muodostaakseen yhteyden SQL Replication -kohdetietokantaan.
DataStage-tƶiden ominaisuuksien asettaminen
Jokaiselle neljƤlle DataStage-rinnakkaistyƶlle, joka meillƤ on, se sisƤltƤƤ yhden tai useamman vaiheen, jotka ovat yhteydessƤ STAGEDB-tietokantaan. Sinun on muokattava vaiheita, jotta voit lisƤtƤ yhteystietoja ja linkittƤƤ DataStagen tƤyttƤmiin tietojoukkotiedostoihin.
Vaiheilla on valmiiksi mƤƤritettyjƤ ominaisuuksia, joita voi muokata. TƤssƤ muutamme joitakin nƤistƤ ominaisuuksista STAGEDB_ASN_PRODUCT_CCD_ex-tiedostolle.tract rinnakkaistyƶ.
Vaihe 1) Selaa Designerin tietovarastopuuta. Valitse SQLREP-kansiosta STAGEDB_ASN_PRODUCT_CCD_ex.tracrinnakkaistyƶ. Muokkaaksesi napsauta tyƶtƤ hiiren kakkospainikkeella. Rinnakkaistyƶn suunnitteluikkuna avautuu Suunnittelijapaletissa.
Vaihe 2) Etsi vihreƤ kuvake. TƤmƤ kuvake merkitsee DB2-liitinvaihetta. SitƤ kƤytetƤƤn esimerkiksitractietojen hakeminen yhtenƤisten muutostietojen taulukosta. Double-klikkaa kuvaketta. Vaiheen muokkausikkuna avautuu.
Vaihe 3) Napsauta editorissa Lataa tƤyttƤƤksesi kentƤt yhteystiedoilla. Sulje vaiheeditori ja tallenna muutokset napsauttamalla OK.
Vaihe 4) Palaa nyt STAGEDB_ASN_PRODUCT_CCD_ex-tiedoston suunnitteluikkunaan.tracrinnakkaistyƶ. Etsi get-komennon kuvake.SynchPoints DB2 -liitinvaihe. Kaksoisnapsauta sitten kuvaketta.
Vaihe 5) Napsauta nyt latauspainiketta tƤyttƤƤksesi kentƤt yhteystiedoilla.
HUOMAUTUS: Jos kƤytƤt muutosten ohjauspalvelimena muuta tietokantaa kuin STAGEDB. Valitse sitten vaihtoehto ladata yhteystiedot getilleSynchPoints-vaihe, joka on vuorovaikutuksessa ohjaustaulukoiden kanssa CCD-taulukon sijaan.
Vaihe 6) TƤssƤ vaiheessa
- Tee tyhjƤ tekstitiedosto jƤrjestelmƤƤn, jossa InfoSphere DataStage toimii.
- NimeƤ tƤmƤ tiedosto nimellƤ productdataset.ds ja merkitse muistiin, minne olet sen tallentanut.
- DataStage kirjoittaa muutokset tƤhƤn tiedostoon sen jƤlkeen, kun se on hakenut muutokset CCD-taulukosta.
- Tietojoukot tai tiedostot, joita kƤytetƤƤn tietojen siirtƤmiseen linkitettyjen tƶiden vƤlillƤ, tunnetaan pysyvinƤ tietojoukkoina. SitƤ edustaa DataSet-vaihe.
Vaihe 7) Avaa nyt vaiheeditori suunnitteluikkunassa ja kaksoisnapsauta kuvaketta insert_into_a_dataset. Se avaa toisen ikkunan.
Vaihe 8) TƤssƤ ikkunassa
- Varmista Ominaisuudet-vƤlilehden alla, ettƤ Target kansio on auki ja ominaisuus File = DATASETNAME on korostettuna.
- Oikealla on tiedostokenttƤ
- Anna koko polku productdataset.ds-tiedostoon
- Napsauta OK.
Olet nyt pƤivittƤnyt kaikki tarvittavat tuotteen CCD-taulukon ominaisuudet. Sulje suunnitteluikkuna ja tallenna kaikki muutokset.
Vaihe 9) Etsi ja avaa nyt STAGEDB_ASN_INVENTORY_CCD_extracrinnakkaistyƶ suunnittelijan tietovarastoruudusta ja toista vaiheet 3ā8.
HUOMAUTUS:
- Sinun on ladattava ohjauspalvelimen tietokannan yhteystiedot vaiheeditoriin getiƤ vartenSynchPoints-vaihe. Jos ohjauspalvelimesi ei ole STAGEDB.
- STAGEDB_ST00_AQ00_getEx-muuttujalletractRange- ja STAGEDB_ST00_AQ00_markRangeProcessed-rinnakkaisten tƶiden jƤlkeen avaa kaikki DB2-liitinvaiheet. LisƤƤ sitten STAGEDB-tietokannan yhteystiedot load-funktion avulla.
Kaikki ominaisuudet on nyt asetettu, joten tyƶt voidaan kƤƤntƤƤ ja suorittaa.
DataStage-tƶiden kƤƤntƤminen ja suorittaminen
Kun DataStage-tyƶ on valmis kƤƤntƤmƤƤn, suunnittelija vahvistaa tyƶn suunnittelun tarkastelemalla syƶtteitƤ, muunnoksia, lausekkeita ja muita yksityiskohtia.
Kun tyƶn kokoaminen on suoritettu onnistuneesti, se on valmis suoritettavaksi. Kokoamme kaikki viisi tyƶtƤ, mutta suoritamme vain "tyƶjƤrjestyksen". TƤmƤ johtuu siitƤ, ettƤ tƤmƤ tyƶ hallitsee kaikkia neljƤƤ rinnakkaista tyƶtƤ.
Vaihe 1) SQLREP-kansiossa. Valitse jokainen viidestƤ tyƶstƤ painamalla (Ctrl+Shift). Napsauta sitten hiiren kakkospainikkeella ja valitse Usean tyƶn kƤƤnnƶsvaihtoehto.
Vaihe 2) NƤet viisi tyƶtƤ valittuna ohjatussa DataStage Compilation Wizardissa. Napsauta Seuraava.
Vaihe 3) KƤƤntƤminen alkaa ja nƤyttƶƶn tulee viesti "KƤƤnnetty onnistui", kun se on valmis.
Vaihe 4) KƤynnistƤ nyt DataStage ja QualityStage Director. Valitse KƤynnistƤ > Kaikki ohjelmat > IBM Tietopalvelin > IBM WebSphere DataStage ja QualityStage Director.
Vaihe 5) Projektin navigointiruudussa vasemmalla. Napsauta SQLREP-kansiota. TƤmƤ tuo kaikki viisi tehtƤvƤƤ johtajan tilataulukkoon.
Vaihe 6) Valitse STAGEDB_AQ00_S00_sequence-tyƶ. Napsauta valikkoriviltƤ Tyƶ > Suorita nyt.
Kun kokoelma on valmis, nƤet valmiin tilan.
Tarkista nyt, ovatko PRODUCT_CCD- ja INVENTORY_CCD-taulukoihin tallennetut muutetut rivit olleet kƤytƶssƤ.tracDataStage on mƤƤrittƤnyt ja lisƤnnyt sen kahteen tietojoukkotiedostoon.
Vaihe 7) Palaa Designer-ohjelmaan ja avaa STAGEDB_ASN_PRODUCT_CCD_ex-tiedosto.tract-tyƶ. Avaa vaihemuokkausohjelma Double-napsauta insert_into_a_dataset -kuvaketta. Napsauta sitten NƤytƤ tiedot.
Vaihe 8) HyvƤksy nƤytettƤvƤn ikkunan rivien oletusasetukset. Napsauta sitten OK. Tietojen selainikkuna avautuu nƤyttƤmƤƤn tietojoukkotiedoston sisƤllƶn.
SQL-replicaation ja DataStage-integraation testaus
EdellisessƤ vaiheessa kokosimme ja suoritimme tyƶn. TƤssƤ osiossa tarkistamme SQL-replikoinnin ja DataStagen integroinnin. TƤtƤ varten teemme muutoksia lƤhdetaulukkoon ja katsomme, onko sama muutos pƤivitetty DataStageen.
Vaihe 1) Siirry kƤyttƶjƤrjestelmƤsi kansioon sqlrepl-datastage-scripts.
Vaihe 2) KƤynnistƤ SQL-replikointi seuraavasti:
- Suorita startSQLCapture.bat (Windows) -tiedosto kƤynnistƤƤksesi Capture-ohjelman SALES-tietokannassa.
- Suorita startSQLApply.bat (Windows) -tiedosto kƤynnistƤƤksesi Apply-ohjelman STAGEDB-tietokannassa.
Vaihe 3) Avaa nyt updateSourceTables.sql-tiedosto. Vaihda SALES-tietokantaan yhdistƤmistƤ varten ja kƤyttƤjƤtunnuksella ja salasanalla.
Vaihe 4) Avaa DB2-komentoikkuna. Vaihda hakemistoon sqlrepl-datastage-tutorial\scripts ja suorita ongelma annetulla komennolla:
db2 -tvf updateSourceTables.sql
SQL-skripti suorittaa erilaisia āātoimintoja, kuten pƤivitys, lisƤys ja poisto molemmissa myyntitietokannan taulukoissa (TUOTE, INVENTORY).
Vaihe 5) JƤrjestelmƤssƤ, jossa DataStage on kƤynnissƤ. Avaa DataStage Director ja suorita STAGEDB_AQ00_S00_sequence-tyƶ. Napsauta Tyƶ > Suorita nyt.
Kun suoritat tyƶtƤ, suoritetaan seuraavat toiminnot.
- Capture-ohjelma lukee kuuden rivin muutokset SALES-tietokannan lokista ja lisƤƤ ne CD-taulukoihin.
- Apply-ohjelma hakee muutosrivit CD-taulukoista SALES-sivustosta ja lisƤƤ ne STAGEDB:n āāCCD-taulukoihin.
- Kaksi DataStage-esimerkkiƤtract-tyƶt poimivat muutokset CCD-taulukoista ja kirjoittavat ne productdataset.ds- ja inventory dataset.ds-tiedostoihin.
Voit tarkistaa, ettƤ yllƤ olevat vaiheet tapahtuivat katsomalla tietojoukkoja.
Vaihe 6) Noudata alla olevia ohjeita,
- KƤynnistƤ suunnitteluohjelma. Avaa STAGEDB_ASN_PRODUCT_CCD_extract-tyƶ.
- Sitten Double-napsauta insert_into_a_dataset -kuvaketta. Lavaeditorissa. Napsauta NƤytƤ tiedot.
- HyvƤksy nƤytettƤvien rivien oletusasetukset ja napsauta OK.
Tietojoukko sisƤltƤƤ kolme uutta riviƤ. Helpoin tapa tarkistaa muutosten toteutuminen on selata tietoselaimen oikeaa reunaa alaspƤin. Katso nyt kolme viimeistƤ riviƤ (katso kuva alla)
Kirjain I, U ja D mƤƤrittelevƤt INSERT-, UPDATE- ja DELETE-toiminnot, jotka johtivat jokaiseen uuteen riviin.
Voit tehdƤ saman tarkistuksen Varastotaulukolle.
DataStage vs. muut suositut ETL-tyƶkalut
Kun kokonaisvaltainen prosessi toimii, seuraava kysymys on yleensƤ se, missƤ DataStage sijoittuu tiimin jo omistamiin vaihtoehtoihin verrattuna. Alla olevassa taulukossa sitƤ verrataan kolmeen laajalti kƤytettyyn alustaan āāuseimmin ostopƤƤtƶkseen vaikuttavien kriteerien perusteella.
| Kriteeri | IBM DataStage | tietokone PowerCenter | Talend | SSIS |
|---|---|---|---|---|
| KƤsittelymalli | Putkilinjan ja osioiden rinnakkaisuus | Metadatapohjainen osiointi | luotu Java or Spark koodi | Muistin sisƤinen tiedonkulku |
| Parhaiten sopiva | ErittƤin suuret yritystason erƤ- ja CDC-tyƶkuormat | Monimutkaiset vanhat arkkitehtuurit ja raskas hallinta | Pilvinatiivit ja kustannusherkƤt tiimit | Microsoft SQL Server sƤƤdyt |
| Licensing | Kaupallinen, premium-taso | Kaupallinen | Avoimen lƤhdekoodin versio sekƤ kaupalliset tasot | Mukana SQL Server |
| OppimiskƤyrƤ | JyrkkƤ, ETL-asiantuntijoita tarvitaan | JyrkkƤ | Keskitasoinen, koodaustaito auttaa | Kohtalainen |
| Tietojen laatu | QualityStage sisƤltyy sviittiin | Erillinen datan laatua parantava tuote | Talend Data Quality sisƤltyy hintaan | LisƤosat |
Lyhyesti sanottuna DataStage valitaan, kun raaka lƤpimenoaika, keskustietokoneiden ulottuvuus ja auditointivalmius merkitsevƤt enemmƤn kuin lisenssikustannukset. Tiimit tyƶskentelevƤt pƤƤasiassa pilvessƤ. Data Lake -arkkitehtuuri tai vertaamalla esim.tract-jƤrjestys ensin voi lƶytƤƤ kompromissit ETL vs ELT asiaankuuluvampi, ja laajempi lista nƤkyy koosteessa ETL-tyƶkalut ja tietojen integrointityƶkalut.































