Vodič za DataStage za početnike: IBM ETL alat

⚡ Pametni sažetak

DataStage od IBM InfoSphere extracts, transformira i učitava podatke poduzeća u velikom obimu. Ova stranica objašnjava arhitekturu, komponente, paralelnu obradu, postavljanje SQL replikacije, stvaranje projekata, kompilaciju poslova i testiranje integracije koristeći praktičan primjer DB2 maloprodaje.

  • 🧩 Osnovna definicija: DataStage premješta podatke iz sekvencijalnih datoteka, relacijskih baza podataka, glavnih računala, ERP i CRM sustava u kontrolirano ciljno odredište.
  • 🏗️ ArchiTekturni slojevi: Klijenti Administrator, Manager, Designer i Director nalaze se iznad dijeljenih usluga i skalabilnog paralelnog runtime mehanizma.
  • Paralelno izvođenje: Paralelizam cjevovoda struji zapise između faza, dok particijski paralelizam dijeli volumen između čvorova za gotovo linearnu skalabilnost.
  • 🔁 Postavljanje replikacije: ASNCLP skripte grade kontrolne tablice Capture i Apply, registracije, skupove pretplata i CCD tablice unutar DB2.
  • 🛠️ Životni ciklus posla: Dizajner sastavlja faze i povezuje ih, zatim Direktor provjerava, raspoređuje, izvršava i prati kompilirane paralelne i sekvencijalne poslove.
  • Korak validacije: Ažuriranje izvornih redaka i ponovno pokretanje sekvencijalnog zadatka potvrđuje da zastavice I, U i D dosežu extracskupovi podataka ted.

IBM Vodič za DataStage za početnike

Što je DataStage?

DataStage je ETL alat koji se koristi zatract, transformirati i učitati podatke iz izvora u ciljno odredište. Izvor tih podataka može uključivati ​​sekvencijalne datoteke, indeksirane datoteke, relacijske baze podataka, vanjske izvore podataka, arhive, poslovne aplikacije itd. DataStage se koristi za olakšavanje poslovne analize pružanjem kvalitetnih podataka koji pomažu u dobivanju poslovne inteligencije.

DataStage ETL alat se koristi u velikim organizacijama kao sučelje između različitih sustava. Brine se o npr.traccija, prijevod i učitavanje podataka od izvora do ciljnog odredišta. Prvi put ga je pokrenuo VMark sredinom 90-ih. S IBM preuzimanjem DataStagea 2005. preimenovano je u IBM WebSphere DataStage i kasnije IBM Infosfera.

Različite verzije Datastagea koje su do sada bile dostupne na tržištu bile su Enterprise Edition (PX), Server Edition, MVS Edition, DataStage for PeopleSoft i tako dalje. Najnovije izdanje je IBM InfoSphere DataStage.

IBM Informacijski poslužitelj uključuje sljedeće proizvode,

  • IBM InfoSphere DataStage
  • IBM InfoSphere QualityStage
  • IBM Direktor informacijskih usluga InfoSphere
  • IBM InfoSphere Information Analyzer
  • IBM Brzi informacijski poslužiteljTrack
  • IBM InfoSphere Business Glossary

Nakon što smo definirali, sljedeći odjeljak razmatra što proizvod zapravo može učiniti unutar skladištenje podataka okoliš.

DataStage pregled

Datastage ima sljedeće mogućnosti.

  • Može integrirati podatke iz najšireg raspona poslovnih i vanjskih izvora podataka
  • Implementira pravila provjere valjanosti podataka
  • Koristan je u obradi i transformaciji velikih količina podataka
  • Koristi skalabilni pristup paralelne obrade
  • Može se nositi sa složenim transformacijama i upravljati višestrukim integracijskim procesima
  • Iskoristite izravnu povezanost s poslovnim aplikacijama kao izvorima ili ciljevima
  • Iskoristite metapodatke za analizu i održavanje
  • Operate u paketu, u stvarnom vremenu ili kao web usluga

U sljedećim odjeljcima ovog vodiča za DataStage ukratko opisujemo sljedeće aspekte IBM InfoSphere DataStage:

  • Transformacija podataka
  • Posao
  • Paralelna obrada

InfoSphere DataStage i QualityStage mogu pristupiti podacima u poslovnim aplikacijama i izvorima podataka kao što su:

Vrste faza obrade

IBM posao infosfere sastoji se od pojedinačnih faza koje su međusobno povezane. Opisuje tijek podataka od izvora podataka do cilja podataka. Obično stupanj ima najmanje jedan ulaz podataka i/ili jedan izlaz podataka. Međutim, neki stupnjevi mogu prihvatiti više od jednog unosa podataka i izlaza u više od jednog stupnja.

Različite faze u dizajnu posla koje možete koristiti su:

  • Faza transformacije
  • Stupanj filtra
  • Faza agregatora
  • Faza uklanjanja duplikata
  • Pridružite se pozornici
  • Faza traženja
  • Faza kopiranja
  • Sortiraj pozornicu
  • Kontejneri

Zašto koristiti DataStage za integraciju podataka?

Poznavanje popisa značajki je jedno; znati kada alat zaradi cijenu licence je nešto sasvim drugo. DataStage se odabire za opterećenja gdje volumen, upravljanje i heterogeni izvori čine rukom pisane skripte neupravljivima.

Najjasniji razlog je propusnost. Budući da mehanizam particionira podatke između čvorova i istovremeno struji zapise između faza, dodavanje hardvera gotovo linearno povećava propusnost. Posao dizajniran na razvojnom sustavu s dva čvora izvodi se nepromijenjen na produkcijskom klasteru s osam čvorova.

Drugi razlozi su organizacijske, a ne tehničke prirode:

  • Dijeljeni metapodaci: Definicije tablica, veze i poslovni termini pohranjuju se jednom u repozitorij i ponovno ih koristi svaki zadatak, što uklanja pomak koji se javlja kada svaki programer samostalno definira izvor.
  • Ugrađena kvaliteta podataka: QualityStage provodi istraživanje, standardizaciju, usklađivanje i preživljavanje uz ETL tok, tako da čišćenje ne zahtijeva drugi proizvod.
  • Široka povezivost: Izvorni konektori dosežu DB2, Oracle, Teradata, VSAM za glavna računala, SAP, Salesforce i pohrana objekata u oblaku bez prilagođenog koda.
  • Operacionalna kontrola: Direktor daje povijest izvođenja, broj redaka, upozorenja i točke ponovnog pokretanja, što revizori prihvaćaju kao dokaz kontroliranog podatkovnog cjevovoda.
  • Ponovno korištenje: Dijeljeni spremnici i skupovi parametara omogućuju da jedna testirana transformacija služi mnogim poslovima umjesto da se kopira u svaki od njih.

Ove prednosti izravno proizlaze iz načina sastavljanja proizvoda, što je objašnjeno u sljedećem odjeljku.

DataStage komponente i Architektura

DataStage ima četiri glavne komponente, naime,

  1. Admin: Koristi se za administrativne zadatke. To uključuje postavljanje DataStage korisnika, postavljanje kriterija čišćenja i stvaranje i premještanje projekata.
  2. Menadžer: To je glavno sučelje repozitorija ETL DataStage. Koristi se za pohranu i upravljanje metapodacima koji se mogu ponovno koristiti. Preko DataStage upravitelja moguće je pregledavati i uređivati ​​sadržaj Repozitorija.
  3. Dizajner: Sučelje dizajna koje se koristi za stvaranje DataStage aplikacija ILI poslova. Određuje izvor podataka, potrebnu transformaciju i odredište podataka. Poslovi se kompajliraju kako bi se stvorila izvršna datoteka koju je rasporedio direktor i pokrenuo poslužitelj
  4. Redatelj: Koristi se za provjeru valjanosti, planiranje, izvršavanje i praćenje poslova DataStage poslužitelja i paralelnih poslova.
Datastage Archidijagram strukture
Datastage Archidijagram strukture

Gornja slika objašnjava kako IBM Infosphere DataStage je u interakciji s drugim elementima IBM Platforma informacijskog poslužitelja. DataStage je podijeljen u dva dijela, Dijeljene komponente i vrijeme izvođenja ArchitekturaDonja tablica detaljnije objašnjava što svaki od ta dva odjeljka doprinosi.

   
Aktivnosti

Zajednička

Jedinstveno korisničko sučelje

  • Sučelje grafičkog dizajna koristi se za stvaranje InfoSphere DataStage aplikacija (poznatih kao poslovi).
  • Svaki posao određuje izvore podataka, potrebne transformacije i odredište podataka.
  • Poslovi se sastavljaju za stvaranje paralelnih tokova poslova i komponenti koje se mogu ponovno koristiti. Planiraju ih i vode InfoSphere DataStage i QualityStage Director.
  • Klijent Designer upravlja metapodacima u repozitoriju. Dok su prevedeni podaci o izvršenju raspoređeni na razini Information Server Engine.

Zajedničke usluge

  • Usluge metapodataka kao što su analiza utjecaja i pretraživanje
  • Usluge dizajna koje podržavaju razvoj i održavanje InfoSphere DataStage zadataka
  • Izvršne usluge koje podržavaju sve InfoSphere DataStage funkcije

Uobičajena paralelna obrada

  • Motor pokreće izvršne zadatke kojitract, transformirati i učitati podatke u širokom rasponu postavki.
  • Motor odabira pristup paralelne obrade i cjevovoda za rukovanje velikom količinom posla.

dužina trajanja Architektura

Skripta za zaštitu na radu

  • Ovo opisuje generiranje OSH-a (orkestriranje Shell Scripta) i tijek izvršenja IBM i tok IBM Infosphere DataStage koji koristi informacijski poslužitelj
  • Omogućuje vam korištenje grafičkih tehnika "pokaži i klikni" za razvoj tijeka poslova, na primjertracobrada, čišćenje, transformiranje, integriranje i učitavanje podataka u ciljne datoteke.

Kako paralelna obrada funkcionira u DataStageu

Gornja tablica arhitekture naziva uobičajenu paralelnu obradu dijeljenom uslugom. Ovaj odjeljak objašnjava kako ta usluga zapravo izvršava zadatak, jer je koncept obećan u pregledu i odlučuje koliko brzo će se zadatak završiti.

Paralelni posao koristi dva mehanizma istovremeno, a oba se primjenjuju automatski tijekom izvođenja, a ne kodiraju se ručno.

1. Paralelizam cjevovoda. Svaka faza u zadatku počinje odjednom umjesto da se čeka završetak prethodne faze. Izvorna faza počinje čitati retke i gura ih u memorijski cjevovod. Transformer se pokreće čim stignu prvi retci i gura svoj izlaz u drugi cjevovod. Ciljni konektor počinje pisati odmah nakon toga. Ne zapisuje se nikakva međupostaja, pa zadatak u tri faze preklapa čitanje, transformaciju i pisanje umjesto da ih pokreće u nizu.

2. Paralelizam particija. Redovi su podijeljeni u zasebne particije, a potpuna kopija logike faze izvršava se na svakoj particiji na njenom vlastitom čvoru. Osam particija znači osam istovremenih instanci Transformera. Na kraju toka particije se ponovno skupljaju u jedan tok za cilj.

Odabir prave metode particioniranja glavna je odluka koju programer donosi prilikom podešavanja:

  • Car: Zadano. Engine odabire metodu na temelju onoga što je potrebno fazi.
  • Raspršivanje: Šalje retke s istom ključnom vrijednošću istom čvoru. Obavezno prije spajanja, agregatora i uklanjanja duplikata kako bi se podudarajući ključevi susreli.
  • Razigravanje: Ravnomjerno raspoređuje retke jedan po jedan. Najbolje za učitavanje ravne datoteke gdje je ključna grupaping nije važno.
  • Cijelo: Kopira cijeli skup podataka na svaki čvor. Koristi se za male referentne tablice u fazi pretraživanja.
  • Isti: Postojeća particija ostaje netaknuta, što izbjegava nepotrebnu podjelu između dvije faze.
  • Raspon i modul: Raspodijeli retke prema vrijednosnom pojasu ili prema ostatku numeričkog ključa kada je potrebna ravnomjerna raspodjela.

Konfiguracijska datoteka (APT_CONFIG_FILE) deklarira koliko čvorova postoji. Budući da se broj čvorova nalazi izvan posla, isti kompilirani posao se skalira s prijenosnog računala na produkcijsku mrežu bez promjene dizajna.

Prije nego što se bilo što od ovoga može isprobati, okruženje mora biti na svom mjestu.

Preduvjet za alat Datastage

Za DataStage će vam trebati sljedeće postavke.

  • Infosfera
  • DataStage Server 9.1.2 ili noviji
  • Microsoft Visual Studio .NET 2010 Express Edition C++
  • Oracle klijent (puni klijent, ne instant klijent) ako se povezujete na Oracle baza podataka
  • DB2 klijent ako se povezuje na DB2 bazu podataka

Sada ćemo u ovoj seriji DataStage vodiča za početnike naučiti kako preuzeti i instalirati InfoSphere informacijski poslužitelj.

Preuzimanje i instalacija InfoSphere Information Servera

Za pristup DataStageu preuzmite i instalirajte najnoviju verziju IBM InfoSphere poslužitelj. Poslužitelj podržava AIX, Linux i Windows operacijski sustav. Možete odabrati prema zahtjevu.

Za premještanje vaših podataka iz starije verzije infosfere u novu verziju koristite alat za razmjenu sredstava.

Instalacijske datoteke

Da biste instalirali i konfigurirali Infosphere Datastage, morate imati sljedeće datoteke u postavkama.

Za Windows,

  • EtlDeploymentPackage-windows-oracle.pkg
  • EtlDeploymentPackage-windows-db2.pkg

Za Linux,

  • EtlDeploymentPackage-linux-db2.pkg
  • EtlDeploymentPackage-linux-oracle.pkg

S instaliranim poslužiteljem, obradeni primjer u ostatku ove stranice koristi snimanje podataka o promjenama, pa je korisno vidjeti kako se podaci o promjenama prenose prije nego što ih se izradi.

Tijek procesa promjene podataka u CDC transakcijskom poslu

Procesni tok podataka o promjenama u CDC-u

Gornji dijagram tracpredstavlja jednu promjenu iz izvorne baze podataka u ciljnu, redoslijedom navedenim u nastavku.

  1. Usluga 'InfoSphere CDC' za bazu podataka prati i bilježi promjene iz izvorne baze podataka
  2. Prema definiciji replikacije “InfoSphere CDC” prenosi podatke o promjeni u “InfoSphere CDC za InfoSphere DataStage.”
  3. “InfoSphere CDC za InfoSphere DataStage” poslužitelj šalje podatke u “CDC Transaction stage” kroz TCP/IP sesiju. Poslužitelj “InfoSphere CDC za InfoSphere DataStage” također šalje poruku COMMIT (zajedno s informacijama o knjižnoj oznaci) za označavanje granice transakcije u snimljenom dnevniku.
  4. Za svaku COMMIT poruku koju šalje poslužitelj “InfoSphere CDC za InfoSphere DataStage”, “faza CDC transakcije” stvara markere kraja vala (EOW). Ovi se markeri šalju na svim izlaznim vezama do ciljne faze konektora baze podataka.
  5. Kada "faza konektora ciljne baze podataka" primi oznaku kraja vala na svim ulaznim vezama, ona zapisuje informacije o knjižnoj oznaci u tablicu knjižne oznake i zatim predaje transakciju ciljnoj bazi podataka.
  6. Poslužitelj “InfoSphere CDC za InfoSphere DataStage” zahtijeva informacije o knjižnim oznakama iz tablice knjižnih oznaka na “ciljnoj bazi podataka”.
  7. Poslužitelj “InfoSphere CDC za InfoSphere DataStage” prima informacije o knjižnoj oznaci.

Ove informacije se koriste za,

  • Odredite početnu točku u dnevniku transakcija gdje se čitaju promjene kada započne replikacija.
  • Da biste utvrdili može li se postojeći dnevnik transakcija očistiti

Postavljanje SQL replikacije

Prije nego počnete s Datastageom, trebate postaviti bazu podataka. Kreirat ćete dvije DB2 baze podataka.

  • Jedan koji služi kao izvor replikacije i
  • Jedan kao meta.

Također ćete stvoriti dvije tablice (Proizvod i Inventar) i popuniti ih oglednim podacima. Tada možete testirati svoju integraciju između SQL Replikacija i Datastage.

U nastavku ćete postaviti SQL replikaciju stvaranjem kontrolne tablice, skupovi pretplate, registracije i članovi skupa pretplate. O tome ćemo detaljnije saznati u sljedećem odjeljku.

Ovdje ćemo uzeti primjer artikla maloprodaje kao našu bazu podataka i stvoriti dvije tablice Inventar i Proizvod. Ove će tablice učitati podatke od izvora do cilja kroz te skupove. (kontrolne tablice, skupovi pretplate, registracije i članovi skupa pretplate.)

Korak 1) Stvorite izvornu bazu podataka koja se naziva Prodaja. Ispod ove baze podataka stvorite dvije tablice proizvoda i Popis.

Korak 2) Pokrenite sljedeću naredbu za stvaranje baze podataka SALES.

db2 create database SALES

Korak 3) Uključite arhivsko bilježenje za SALES bazu podataka. Također napravite sigurnosnu kopiju baze podataka pomoću sljedećih naredbi

db2 update db cfg for SALES using LOGARCHMETH3 LOGRETAIN
db2 backup db SALES

Korak 4) U istom naredbenom retku, promijenite se u poddirektorij setupDB u direktoriju sqlrepl-datastage-tutorial koji ste extraciz preuzete komprimirane datoteke.

Postavljanje SQL replikacije

Korak 5) Upotrijebite sljedeću naredbu za izradu tablice inventara i uvoz podataka u tablicu pokretanjem sljedeće naredbe.

db2 import from inventory.ixf of ixf create into inventory

Korak 6) Napravite ciljnu tablicu. Nazovite ciljnu bazu podataka kao STAGEDB.

Budući da ste sada stvorili i izvor i cilj baze podataka, sljedeći korak u ovom DataStage vodiču, vidjet ćemo kako to replicirati.

Sljedeće informacije mogu biti od pomoći u postavljanje ODBC izvora podataka u IBM Dokumentacija InfoSphere Information Servera.

Stvaranje SQL replikacijskih objekata

Donja slika prikazuje kako se tok podataka o promjenama isporučuje od izvorne do ciljne baze podataka. Izrađujete mapu od izvora do cilja.ping između stolova poznatih kao članovi skupa pretplate i grupirati članove u a pretplata.

Stvaranje SQL replikacijskih objekata

Jedinica replikacije unutar InfoSphere CDC (Change Data Capture) naziva se pretplata.

  • Promjene učinjene u izvoru bilježe se u "kontrolnoj tablici snimanja" koja se šalje u CD tablicu, a zatim u ciljnu tablicu. Dok će program za primjenu imati pojedinosti o retku iz kojeg je potrebno napraviti promjene. Također će se pridružiti CD stolu u pretplatničkom setu.
  • Pretplata sadrži kartuping detalji koji određuju kako se podaci u izvornom spremištu podataka primjenjuju na ciljno spremište podataka. Napomena: CDC se sada naziva Replikacija podataka Infosfere.
  • Kada se pretplata izvrši, InfoSphere CDC bilježi promjene na izvornoj bazi podataka. InfoSphere CDC isporučuje podatke o promjeni cilju i pohranjuje informacije o točki sinkronizacije u tablici knjižnih oznaka u ciljnoj bazi podataka.
  • InfoSphere CDC koristi informacije knjižne oznake za praćenje napretka posla InfoSphere DataStage.
  • U slučaju neuspjeha, podaci knjižne oznake koriste se kao točka ponovnog pokretanja. U našem primjeru, ASN.IBMTablica SNAP_FEEDETL pohranjuje informacije o sinkronizacijskoj točki povezane s DataStageom koje se koriste za track Napredak DataStagea.

U ovom odjeljku od IBM Vodič za obuku za DataStage, morate učiniti sljedeće stvari,

  • Napravite tablice CAPTURE CONTROL i tablice APPLY CONTROL za pohranu opcija replikacije
  • Registrirajte tablice PRODUCT i INVENTORY kao izvore replikacije
  • Stvorite skup pretplate s dva člana
  • Stvorite članove skupa pretplate i ciljne CCD tablice

Koristite ASNCLP program naredbenog retka za postavljanje SQL replikacije

Korak 1) Locirajte datoteku skripte crtCtlTablesCaptureServer.asnclp u direktoriju sqlrepl-datastage-tutorial/setupSQLRep.

Korak 2) U datoteci zamijeniti i " ” sa svojim korisničkim imenom i lozinkom za spajanje na SALES bazu podataka.

Korak 3) Promijenite direktorije u direktorij sqlrepl-datastage-tutorial/setupSQLRep i pokrenite skriptu. Koristite sljedeću naredbu. Naredba će se povezati s bazom podataka SALES, generirati SQL skriptu za kreiranje kontrolnih tablica Capture.

asnclp –f crtCtlTablesCaptureServer.asnclp

Korak 4) Locirajte datoteku skripte crtCtlTablesApplyCtlServer.asnclp u istom direktoriju. Sada zamijenite dvije instance od i " ” s korisničkim ID-om i lozinkom za spajanje na STAGEDB bazu podataka.

Korak 5) Sada u istom naredbenom retku upotrijebite sljedeću naredbu za stvaranje kontrolnih tablica primjene.

asnclp –f crtCtlTablesApplyCtlServer.asnclp

Korak 6) Pronađite datoteke skripte crtRegistration.asnclp i zamijenite sve instance s korisničkim ID-om za povezivanje s bazom podataka SALES. Također, promijenite " ” na lozinku za povezivanje.

Korak 7) Za registraciju izvornih tablica koristite sljedeću skriptu. U sklopu kreiranja registracije program ASNCLP kreirat će dvije CD tablice. CDPROIZVOD I CDINVENTAR.

asnclp –f crtRegistration.asnclp

Naredba CREATE REGISTRATION koristi sljedeće opcije:

  • Diferencijalno osvježenje: Poziva program Primijeni da ažurira ciljnu tablicu samo kada se promijene redovi u izvornoj tablici
  • Slika oboje: Ova opcija se koristi za registraciju vrijednosti u izvornom stupcu prije nego što je došlo do promjene, a jedna za vrijednost nakon što je došlo do promjene.

Korak 8) Za povezivanje s ciljnom bazom podataka (STAGEDB) koristite sljedeće korake.

  • Pronađite datoteku crtTableSpaceApply.bat, otvorite je u uređivaču teksta
  • Zamijeniti i s korisničkim ID-om i lozinkom
  • U prozoru DB2 naredbi unesite crtTableSpaceApply.bat i pokrenite datoteku.
  • Ova paketna datoteka stvara novi tablični prostor na ciljnoj bazi podataka (STAGEDB)

Korak 9) Pronađite datoteke skripte crtSubscriptionSetAndAddMembers.asnclp i napravite sljedeće promjene.

  • Zamijenite sve instance od i uz korisnički ID i lozinku za spajanje na SALES bazu (izvor).
  • Zamijeni sve instance od i s korisničkim ID-om za spajanje na STAGEDB bazu podataka (target).

Nakon promjena pokrenite skriptu za kreiranje skupa pretplate (ST00) koji grupira izvornu i ciljnu tablicu. Skripta također stvara dva člana skupa pretplate i CCD (podatke o dosljednim promjenama) u ciljnoj bazi podataka koja će pohraniti izmijenjene podatke. Ove podatke će koristiti Infosphere DataStage.

Korak 10) Pokrenite skriptu za kreiranje skupa pretplate, članova skupa pretplate i CCD tablica.

asnclp –f crtSubscriptionSetAndAddMembers.asnclp

Različite opcije koje se koriste za stvaranje skupa pretplate i dva člana uključuju

  • Kompletno na kondenzirano isključeno
  • Vanjski
  • Vrsta opterećenja uvoz izvoz
  • Kontinuirano mjerenje vremena

Korak 11) Zbog greške u alatima za administraciju replikacije. Morate izvršiti drugu batch datoteku da biste postavili stupac TARGET_CAPTURE_SCHEMA u IBMSNAP_SUBS_SET kontrolne tablice na nulu.

  • Pronađite datoteku updateTgtCapSchema.bat. Otvorite ga u uređivaču teksta. Zamijeniti i s korisničkim ID-om za spajanje na STAGEDB bazu podataka.
  • U prozoru DB2 naredbi unesite naredbu updateTgtCapSchema.bat i izvedite datoteku.

Stvaranje definicijskih datoteka za mapiranje CCD tablica u DataStage

Prije nego što napravimo replikaciju u sljedećem koraku, moramo povezati CCD tablicu s DataStageom. U ovom odjeljku ćemo vidjeti kako povezati SQL s DataStageom.

Za povezivanje CCD tablice s DataStageom, potrebno je stvoriti Datastage definicijske (.dsx) datoteke. DataStage koristi .dsx format datoteke za uvoz i izvoz definicija poslova. Za stvaranje dviju .dsx datoteka koristit ćete ASNCLP skriptu. Na primjer, ovdje smo stvorili dvije .dsx datoteke.

  • stagedb_AQ00_SET00_sJobs.dsx: Stvara niz poslova koji usmjeravaju tijek rada četiri paralelna posla.
  • stagedb_AQ00_SET00_pJobs.dsx : Stvara četiri paralelna posla

Program ASNCLP automatski preslikava CCD stupac u format stupca Datastage. Podržano je samo kada radi ASNCLP Windows, Linux ili Unix postupak.

Definicijske datoteke za mapiranje CCD tablica u DataStage

Datastage poslovi povlače retke iz CCD tablice.

  1. Jedan zadatak postavlja točku sinkronizacije tamo gdje je DataStage stao u extracprikuplja podatke iz dvije tablice. Posao dobiva ove informacije odabirom vrijednosti SYNCHPOINT za skup pretplata ST00 iz IBMSNAP_SUBS_SET tablicu i njezino umetanje u stupac MAX_SYNCHPOINT od IBMSNAP_FEEDETL tablica.
  2. Dva posla koja su bivšatract podatke iz tablica PRODUCT_CCD i INVENTORY_CCD. Poslovi znaju koje retke započeti npr.tracodabirom vrijednosti MIN_SYNCHPOINT i MAX_SYNCHPOINT iz IBMSNAP_FEEDETL tablica za skup pretplate.

Nakon mapiranja definicija, replikacija se sada može pokrenuti kako bi se CCD tablice počele popunjavati.

Pokretanje replikacije

Da biste započeli replikaciju, upotrijebit ćete korake u nastavku. Kada se CCD tablice popune podacima, to znači da je postavka replikacije provjerena. Za pregled repliciranih podataka u ciljnim CCD tablicama koristite grafičko korisničko sučelje DB2 Kontrolnog centra.

Korak 1) Uvjerite se da DB2 radi, ako ne, koristite db2 početak naredba.

Korak 2) Zatim upotrijebite naredbu asncap iz odzivnika operativnog sustava za početak snimanja programa. Na primjer.

asncap capture_server=SALES

Gornja naredba navodi SALES bazu podataka kao Capture server. Držite naredbeni prozor otvoren dok snimanje traje.

Korak 3) Sada otvorite novi naredbeni redak. Zatim pokrenite PRIJAVITI programirati pomoću naredbe asnapply.

asnapply control_server=STAGEDB apply_qual=AQ00

Pokretanje replikacije

  • Naredba specificira STAGEDB bazu podataka kao kontrolni poslužitelj primjene (baza podataka koja sadrži kontrolne tablice aplikacije)
  • AQ00 kao kvalifikator primjene (identifikator za ovaj skup kontrolnih tablica)

Ostavite naredbeni prozor otvoren dok je Apply pokrenut.

Korak 4) Sada otvorite drugi naredbeni redak i izdajte naredbu db2cc za pokretanje DB2 Kontrolnog centra. Prihvatite zadani Kontrolni centar.

Korak 5) Sada u lijevom navigacijskom stablu otvorite Sve baze podataka > STAGEDB, a zatim kliknite Tablice. Double kliknite na naziv tablice ( Product CCD) da biste otvorili tablicu. Izgledat će otprilike ovako.

Pokretanje replikacije

Isto tako, također možete otvoriti CCD tablicu za INVENTAR.

Pokretanje replikacije

Replikacija sada unosi podatke u CCD tablice, pa se pažnja prebacuje sa strane baze podataka na DataStage klijente.

Kako izraditi projekte u alatu Datastage

Prije svega, izradit ćete projekt u DataStageu. Za to morate biti InfoSphere DataStage administrator.

Nakon što su instalacija i replikacija gotovi, trebate izraditi projekt. U DataStageu projekti su metoda za organiziranje vaših podataka. Uključuje definiranje podatkovnih datoteka, faza i poslova izgradnje u određenom projektu.

Za izradu projekta u DataStageu slijedite korake u nastavku:

Korak 1) Pokrenite softver DataStage

Pokrenite DataStage i QualityStage Administrator. Zatim kliknite Start > Svi programi > IBM Informacijski poslužitelj > IBM WebSphere DataStage i QualityStage Administrator.

Korak 2) Povežite DataStage poslužitelj i klijent

Za povezivanje s DataStage poslužiteljem s vašeg DataStage klijenta unesite detalje kao što su naziv domene, ID korisnika, lozinka i informacije o poslužitelju.

Korak 3) Dodajte novi projekt

U prozoru WebSphere DataStage Administration. Kliknite karticu Projekti, a zatim kliknite Dodaj.

Korak 4) Unesite detalje projekta

U prozor WebSphere DataStage Administration unesite pojedinosti poput

  1. Ime
  2. Lokacija datoteke
  3. Kliknite "U redu"

Stvorite projekte u alatu Datastage

Svaki projekt sadrži:

  • DataStage poslovi
  • Ugrađene komponente. To su unaprijed definirane komponente koje se koriste u poslu.
  • Korisnički definirane komponente. To su prilagođene komponente stvorene pomoću DataStage Managera ili DataStage Designera.

Vidjet ćemo kako uvesti replikacijske poslove u Datastage Infosphere.

Kako uvesti poslove replikacije u Datastage i QualityStage Designer

Uvest ćete poslove u IBM InfoSphere DataStage i QualityStage Designer klijent. A vi ih izvršite u IBM InfoSphere DataStage i QualityStage Director klijent.

Dizajner-klijent je poput praznog platna za građevinske poslove. To je npr.tracts, transformirati, učitati i provjeriti kvalitetu podataka. Pruža alate koji čine osnovne građevne blokove posla. Uključuje

  • stažiranje: Povezuje se s izvorima podataka za čitanje ili pisanje datoteka i obradu podataka.
  • linkovi: povezuje faze kroz koje teku vaši podaci

Faze u klijentu InfoSphere DataStage i QualityStage Designer pohranjene su u paleti alata Designer.

Sljedeće faze uključene su u InfoSphere QualityStage:

  • Istražite fazu
  • Standardizirati pozornicu
  • Faza učestalosti podudaranja
  • Faza podudaranja s jednim izvorom
  • Faza podudaranja s dva izvora
  • Faza preživljavanja
  • Faza procjene kvalitete standardizacije (SQA).

U DataStage infosferi možete kreirati 4 vrste poslova.

  • Paralelni posao
  • Slijed posla
  • posao glavnog računala
  • Posao poslužitelja

Pogledajmo korak po korak kako uvesti datoteke posla replikacije.

Korak 1) Pokrenite DataStage i QualityStage Designer. Pritisnite Start > Svi programi > IBM Informacijski poslužitelj > IBM WebSphere DataStage i QualityStage Designer

Korak 2) U prozoru Priloži projektu unesite sljedeće pojedinosti.

  • Domena
  • korisničko ime
  • Lozinka
  • Naziv Projekta
  • OK

Uvoz poslova replikacije u Datastage i QualityStage

Korak 3) Sada iz izbornika File kliknite import -> DataStage komponente.

Otvorit će se novi prozor za uvoz DataStage repozitorija.

  1. U ovom prozoru pregledavajte STAGEDB_AQ00_ST00_sJobs.dsx datoteku koju smo ranije izradili
  2. Odaberite opciju "Uvezi sve".
  3. Označite potvrdni okvir "Izvrši analizu utjecaja".
  4. Pritisnite "U redu".

Uvoz poslova replikacije u Datastage i QualityStage

Nakon što se posao uveze, DataStage će stvoriti STAGEDB_AQ00_ST00_sequence posao.

Korak 4) Slijedite iste korake za uvoz STAGEDB_AQ00_ST00_pJobs.dsx datoteka. Ovaj uvoz stvara četiri paralelna posla.

Korak 5) Pod oknom Designer Repository -> Otvorite mapu SQLREP. Unutar mape vidjet ćete slijed poslova i četiri paralelna posla.

Uvoz poslova replikacije u Datastage i QualityStage

Korak 6) Da biste vidjeli redoslijed posla. Idite na stablo repozitorija, desnom tipkom miša kliknite STAGEDB_AQ00_ST00_sequence posao i kliknite Uredi. Prikazat će tijek rada četiri paralelna posla koje slijed poslova kontrolira.

Uvoz poslova replikacije u Datastage i QualityStage

Svaka ikona je pozornica,

  • getExtracStupanj tRange: Ažurira IBMSNAP_FEEDETL tablica. Postavit će početnu točku za podatke npr.tracdo točke gdje je DataStage zadnji puttracpodijeljene retke i postavljena završna točka na posljednju transakciju koja je obrađena za skup pretplata.
  • getExtracRasponUspjehOva faza dovodi početne točke do bivšegtracFaza i ex tFromINVENTORY_CCDtracFaza tFromPRODUCT_CCD
  • AllExtractsUspjeh: Ova faza osigurava da oba extracIz INVENTARA_CCD i extractFromPRODUCT_CCD je uspješno završen. Zatim prosljeđuje točke sinkronizacije za posljednje retke koji su dohvaćeni u fazu setRangeProcessed.
  • setRangeProcessed faza: Ažurira se IBMSNAP_FEEDETL tablica. Dakle, DataStage zna odakle započeti sljedeći krug obrade podatakatracANJE

Korak 7) Da vidim paralelne poslove. Desnom tipkom miša kliknite STAGEDB_ASN_INVENTORY_CCD i odaberite uredi pod repozitorijem. Otvorit će se prozor kao što je prikazano u nastavku.

Uvoz poslova replikacije u Datastage i QualityStage

Ovdje na gornjoj slici možete vidjeti da su podaci iz CCD tablice inventara i Synch detalji o točki iz FEEDETL tablice prikazuju se u fazi Lookup_6.

Uvezeni poslovi i dalje ne pokazuju ništa, pa se sljedeći put mora definirati objekt podatkovne veze.

Stvaranje podatkovne veze iz DataStagea u bazu podataka STAGEDB

Sada je sljedeći korak izgradnja podatkovne veze između InfoSphere DataStage i ciljne baze podataka SQL Replication. Sadrži CCD tablice.

U DataStageu koristite objekte podatkovne veze s povezanim fazama konektora za brzo definiranje veze s izvorom podataka u dizajnu posla.

Korak 1) STAGEDB sadrži kontrolne tablice Apply koje DataStage koristi za sinkronizaciju svojih podataka, npr.traci CCD tablice iz kojih se podaci izvlačetracted. Koristite sljedeće naredbe

db2 catalog tcpip node SQLREP remote ip_address server 50000
db2 catalog database STAGEDB as STAGEDB2 at node SQLREP

bilješke: IP adresa sustava na kojem je kreiran STAGEDB

Korak 2) Kliknite Datoteka > Novo > Ostalo > Podatkovna veza.

Korak 3) Imat ćete prozor s dvije kartice, Parametri i Općenito.

Podatkovna veza iz DataStagea u STAGEDB bazu podataka

Korak 4) U ovom koraku

  1. Općenito, kartica, nazovite podatkovnu vezu sqlreplConnect
  2. Na kartici Parametri, kao što je prikazano u nastavku
  • Kliknite gumb za pregledavanje pored polja "Poveži se pomoću polja vrste faze" i u
  • Otvorite prozor idite stablom repozitorija na Vrste stupnja –> Paralelno– > Baza podataka —-> DB2 konektor.
  • Pritisnite Otvori.

Podatkovna veza iz DataStagea u STAGEDB bazu podataka

Korak 5) U tablicu parametara veze unesite pojedinosti poput

  • ConnectionString: STAGEDB2
  • Korisničko ime: ID korisnika za spajanje na STAGEDB bazu podataka
  • Lozinka: Lozinka za spajanje na STAGEDB bazu podataka
  • Primjer: Ime DB2 instance koja sadrži STAGEDB bazu podataka

Korak 6) U sljedećem prozoru spremite podatkovnu vezu. Kliknite na gumb 'spremi'.

Uvoz definicija tablica iz STAGEDB u DataStage

U prethodnom koraku vidjeli smo da su InfoSphere DataStage i STAGEDB baza podataka povezani. Sada uvezite definiciju stupca i druge metapodatke za PRODUCT_CCD i INVENTORY_CCD tablice u repozitorij informacijskog poslužitelja.

U prozoru dizajnera slijedite korake u nastavku.

Korak 1) Odaberite Uvoz > Definicije tablice > Pokreni čarobnjaka za uvoz konektora

Korak 2) Na stranici odabira konektora čarobnjaka, izaberite DB2 konektor i kliknite Dalje.

Uvoz definicija tablica iz STAGEDB u DataStage

Korak 3) Pritisnite Učitaj na stranici s detaljima veze. Ovo će popuniti polja čarobnjaka informacijama o vezi iz podatkovne veze koju ste stvorili u prethodnom poglavlju.

Uvoz definicija tablica iz STAGEDB u DataStage

Korak 4) Pritisnite Testiraj vezu na istoj stranici. Ovo će potaknuti DataStage da se pokuša povezati s bazom podataka STAGEDB. Možete vidjeti poruku "povezivanje je uspješno". Pritisnite Dalje.

Uvoz definicija tablica iz STAGEDB u DataStage

Korak 5) Provjerite jesu li na stranici lokacije izvora podataka polja Naziv glavnog računala i Naziv baze podataka ispravno popunjena. Zatim kliknite dalje.

Korak 6) Na stranici sheme. Unesite shemu kontrolnih tablica Primjene (ASN) ili provjerite je li ASN shema unaprijed popunjena u polje sheme. Zatim kliknite dalje. Stranica za odabir prikazat će popis tablica koje su definirane u ASN shemi.

Uvoz definicija tablica iz STAGEDB u DataStage

Korak 7) Prva tablica iz koje trebamo uvesti metapodatke je IBMSNAP_FEEDETL, kontrolna tablica Apply. Sadrži detalje o točkama sinkronizacije koje omogućuju DataStageu da track od kojih je redaka dohvatio iz CCD tablica. Odaberite IBMSNAP_FEEDETL i kliknite Dalje.

Korak 8) Za dovršetak uvoza IBMSNAP_FEEDETL definicija tablice. Kliknite uvoz i zatim u otvorenom prozoru kliknite otvori.

Korak 9) Ponovite korake 1-8 još dva puta za uvoz definicija za tablicu PRODUCT_CCD, a zatim za tablicu INVENTORY_CCD.

BILJEŠKA: Dok uvozite definicije za inventar i proizvod, provjerite jeste li promijenili sheme iz ASN-a u shemu pod kojom su stvoreni PRODUCT_CCD i INVENTORY_CCD.

Sada DataStage ima sve pojedinosti koje su mu potrebne za povezivanje s ciljnom bazom podataka SQL replikacije.

Postavljanje svojstava za DataStage poslove

Za svaki od četiri DataStage paralelna posla koja imamo, sadrži jednu ili više faza koje se povezuju s bazom podataka STAGEDB. Morate izmijeniti stupnjeve da biste dodali podatke o vezi i povezivali se s datotekama skupa podataka koje DataStage popunjava.

Faze imaju unaprijed definirana svojstva koja se mogu uređivati. Ovdje ćemo promijeniti neka od tih svojstava za STAGEDB_ASN_PRODUCT_CCD_extract paralelni posao.

Korak 1) Pregledajte stablo repozitorija Designera. U mapi SQLREP odaberite STAGEDB_ASN_PRODUCT_CCD_extracparalelni zadatak. Za uređivanje kliknite desnom tipkom miša na zadatak. Prozor za dizajn paralelnog zadatka otvara se u Paleti dizajnera.

Korak 2) Pronađite zelenu ikonu. Ova ikona označava fazu DB2 konektora. Koristi se npr.tracpreuzimanje podataka iz CCD tablice. Double- kliknite na ikonu. Otvara se prozor za uređivanje pozornice.

Postavljanje svojstava za DataStage poslove

Postavljanje svojstava za DataStage poslove

Korak 3) U uređivaču kliknite Učitaj za popunjavanje polja informacijama o vezi. Za zatvaranje pozornice i spremanje promjena kliknite OK.

Korak 4) Sada se vratite u prozor za dizajn za STAGEDB_ASN_PRODUCT_CCD_extracparalelni posao. Pronađite ikonu za preuzimanjeSynchPoints DB2 stupanj konektora. Zatim dvaput kliknite na ikonu.

Korak 5) Sada kliknite gumb za učitavanje kako biste popunili polja informacijama o vezi.

BILJEŠKA: Ako koristite bazu podataka koja nije STAGEDB kao vaš kontrolni poslužitelj Primjene. Zatim odaberite opciju za učitavanje informacija o vezi za getSynchPoints faza, koja je u interakciji s kontrolnim tablicama, a ne s CCD tablicom.

Korak 6) U ovom koraku

  • Napravite praznu tekstualnu datoteku na sustavu na kojem se izvodi InfoSphere DataStage.
  • Imenujte ovu datoteku kao productdataset.ds i zabilježite gdje ste je spremili.
  • DataStage će pisati promjene u ovu datoteku nakon što dohvati promjene iz CCD tablice.
  • Skupovi podataka ili datoteke koje se koriste za premještanje podataka između povezanih poslova poznati su kao trajni skupovi podataka. Predstavljen je stupnjem skupa podataka.

Korak 7) Sada otvorite pozornicu za uređivanje u prozoru dizajna i dvaput kliknite na ikonu insert_into_a_dataset. Otvorit će drugi prozor.

Postavljanje svojstava za DataStage poslove

Korak 8) U ovom prozoru,

Postavljanje svojstava za DataStage poslove

  • Ispod kartice svojstava osigurava Target mapa je otvorena i svojstvo File = DATASETNAME je istaknuto.
  • Na desnoj strani imat ćete polje datoteke
  • Unesite puni put do datoteke productdataset.ds
  • Kliknite "U redu".

Sada ste ažurirali sva potrebna svojstva za CCD tablicu proizvoda. Zatvorite prozor dizajna i spremite sve promjene.

Korak 9) Sada pronađite i otvorite datoteku STAGEDB_ASN_INVENTORY_CCD_extracparalelni zadatak iz okna repozitorija u Dizajneru i ponovite korake 3-8.

BILJEŠKA:

  • Morate učitati informacije o vezi za bazu podataka kontrolnog poslužitelja u editor pozornice za getSynchPoints faza. Ako vaš kontrolni poslužitelj nije STAGEDB.
  • Za STAGEB_ST00_AQ00_getExtracParalelni poslovi tRange i STAGEDB_ST00_AQ00_markRangeProcessed, otvorite sve faze DB2 konektora. Zatim upotrijebite funkciju load za dodavanje informacija o vezi za bazu podataka STAGEDB.

Sva svojstva su sada postavljena, tako da se poslovi mogu kompajlirati i izvršiti.

Sastavljanje i pokretanje DataStage poslova

Kada je DataStage posao spreman za kompajliranje, Dizajner provjerava dizajn posla gledajući ulaze, transformacije, izraze i druge detalje.

Kada je kompilacija posla uspješno obavljena, spremna je za izvođenje. Sastavit ćemo svih pet poslova, ali ćemo pokrenuti samo "slijed poslova". To je zato što ovaj posao kontrolira sva četiri paralelna posla.

Korak 1) U mapi SQLREP. Odaberite svaki od pet poslova pomoću (Cntrl+Shift). Zatim desnom tipkom miša kliknite i odaberite opciju sastavljanja više poslova.

Sastavljanje i pokretanje DataStage poslova

Korak 2) Vidjet ćete da je odabrano pet poslova u DataStage čarobnjaku za kompilaciju. Pritisnite Dalje.

Sastavljanje i pokretanje DataStage poslova

Korak 3) Kompilacija počinje i prikazuje poruku "Kompilirano uspješno" kada završi.

Sastavljanje i pokretanje DataStage poslova

Korak 4) Sada pokrenite DataStage i QualityStage Director. Odaberite Start > Svi programi > IBM Informacijski poslužitelj > IBM WebSphere DataStage i QualityStage Director.

Korak 5) U navigacijskom oknu projekta s lijeve strane. Pritisnite mapu SQLREP. Ovo dovodi svih pet poslova u tablicu statusa direktora.

Korak 6) Odaberite posao STAGEDB_AQ00_S00_sequence. Na traci izbornika kliknite Posao > Pokreni sada.

Sastavljanje i pokretanje DataStage poslova

Nakon što je kompilacija gotova, vidjet ćete status završen.

Sastavljanje i pokretanje DataStage poslova

Sada provjerite jesu li promijenjeni retci koji su pohranjeni u tablicama PRODUCT_CCD i INVENTORY_CCD bili extrackreirano od strane DataStagea i umetnuto u dvije datoteke skupa podataka.

Korak 7) Vratite se u Dizajner i otvorite datoteku STAGEDB_ASN_PRODUCT_CCD_ex.tracposao. Za otvaranje uređivača pozornice Double-kliknite ikonu insert_into_a_dataset. Zatim kliknite prikaz podataka.

Korak 8) Prihvatite zadane postavke u redovima koji će se prikazati u prozoru. Zatim kliknite OK. Otvorit će se prozor preglednika podataka koji prikazuje sadržaj datoteke skupa podataka.

Sastavljanje i pokretanje DataStage poslova

Testiranje integracije između SQL replikacije i DataStagea

U prethodnom koraku sastavili smo i izvršili posao. U ovom odjeljku provjerit ćemo integraciju SQL replikacije i DataStagea. Za to ćemo unijeti izmjene u izvornu tablicu i vidjeti je li ista promjena ažurirana u DataStage.

Korak 1) Dođite do mape sqlrepl-datastage-scripts za vaš operativni sustav.

Korak 2) Pokrenite SQL replikaciju slijedeći korake:

  • Pokrenite startSQLCapture.bat (Windows) za pokretanje programa Capture u bazi podataka SALES.
  • Pokrenite startSQLApply.bat (Windows) datoteku za pokretanje programa Primjena u bazi podataka STAGEDB.

Korak 3) Sada otvorite datoteku updateSourceTables.sql. Za povezivanje s bazom podataka SALES replace i s korisničkim ID-om i lozinkom.

Korak 4) Otvorite DB2 naredbeni prozor. Promijenite direktorij u sqlrepl-datastage-tutorial\scripts i pokrenite problem zadanom naredbom:

db2 -tvf updateSourceTables.sql

SQL skripta izvršit će razne operacije poput ažuriranja, umetanja i brisanja na obje tablice (PROIZVOD, ZALIHE) u bazi podataka prodaje.

Korak 5) Na sustavu na kojem se izvodi DataStage. Otvorite DataStage Director i izvršite STAGEDB_AQ00_S00_sequence posao. Kliknite Posao > Pokreni sada.

Integracija između SQL replikacije i DataStagea

Kada pokrenete posao, izvršit će se sljedeće aktivnosti.

  • Program Capture čita promjene u šest redaka u zapisniku baze podataka SALES i umeće ih u CD tablice.
  • Program Primjena dohvaća redove promjena iz CD tablica na SALES i umeće ih u CCD tablice na STAGEDB.
  • Dva DataStage extract poslovi preuzimaju promjene iz CCD tablica i zapisuju ih u datoteke productdataset.ds i inventory dataset.ds.

Možete provjeriti jesu li gore navedeni koraci provedeni gledanjem skupova podataka.

Korak 6) Slijedite korake u nastavku,

  • Pokrenite Dizajner. Otvorite datoteku STAGEDB_ASN_PRODUCT_CCD_ex.tracposao.
  • Tada Double-kliknite ikonu insert_into_a_dataset. U scenskom uredniku. Pritisnite Pregled podataka.
  • Prihvatite zadane postavke u prozoru redaka koji će se prikazati i kliknite U redu.

Skup podataka sadrži tri nova retka. Najlakši način da provjerite jesu li promjene implementirane je da se pomaknete krajnje desno od Preglednika podataka. Sada pogledajte posljednja tri retka (pogledajte sliku ispod)

Integracija između SQL replikacije i DataStagea

Slovo I, U i D označava operaciju INSERT, UPDATE i DELETE koja je rezultirala svakim novim retkom.

Istu provjeru možete učiniti za tablicu inventara.

DataStage u usporedbi s drugim popularnim ETL alatima

Nakon što je uspostavljen cjeloviti tijek rada, uobičajeno sljedeće pitanje je gdje se DataStage nalazi u odnosu na alternative koje tim možda već posjeduje. Tablica u nastavku uspoređuje ga s tri široko korištene platforme prema kriterijima koji najčešće odlučuju o kupnji.

Kriteriji IBM DataStage Informatika PowerCenter Talend SSIS
Model obrade Paralelizam cjevovoda i particije Particioniranje vođeno metapodacima Generirano Java or Spark kod Tok podataka u memoriji
Najbolje odgovara Vrlo velika poslovna opterećenja serija i CDC-a Složene naslijeđene arhitekture s teškim upravljanjem Timovi koji su izvorno u oblaku i osjetljivi na troškove Microsoft SQL Server imanja
licenciranje Komercijalni, premium nivo Trgovački Izdanje otvorenog koda plus komercijalne razine U paketu sa SQL Serverom
Krivulja ucenja Potrebni su Strogi, ETL stručnjaci strm Umjereno, vještina kodiranja pomaže Umjereno
Podaci o kvalitetu QualityStage uključen u paket Odvojeni proizvod za kvalitetu podataka Uključena kvaliteta podataka Talenda Dodatne komponente

Ukratko, DataStage se odabire kada su sirovi protok, doseg glavnog računala i spremnost za reviziju važniji od cijene licence. Timovi koji rade uglavnom u oblaku arhitektura podatkovnog jezera ili uspoređivanje bivšegtracprvo naručite, možda ćete pronaći kompromise u ETL protiv ELT-a relevantniji, a širi uži izbor pojavljuje se u sažetku ETL alati i alati za integraciju podataka.

Pitanja i odgovori

Poslužiteljski zadatak izvodi se na jednom čvoru koristeći ograničeni skup faza. Paralelni zadatak izvodi se na paralelnom mehanizmu, podržava particioniranje između čvorova i koristi bogatiju paletu faza, pa se skalira na puno veće volumene.

Da. Uz lokalni informacijski poslužitelj, IBM nudi DataStage kao upravljanu uslugu na IBM Cloud Pak za podatke i unutar integracije watsonx.data, tako da se isti dizajni toka mogu izvoditi bez lokalne administracije poslužitelja.

Većina rada je grafička. Korisni dodaci su SQL za upite izvora, shell skriptiranje za kontrolu poslova i jezik izraza DataStage BASIC koji se koristi unutar derivacija i rutina faze Transformera.

AI asistenti u IBM Cloud Pak za podatke predlaže mapu od izvora do ciljapings, generirati transformacijske izraze iz običnog jezika, otkriti pomak sheme i preporučiti promjene particioniranja kada se posao izvodi sporije od svoje osnovne linije.

Ne. Umjetna inteligencija ubrzava kartuping, dokumentaciju i prijedloge za podešavanje, ali programeri i dalje posjeduju modeliranje podataka, poslovna pravila, rukovanje iznimkama i odgovornost za produkciju. Uloga se pomiče prema pregledu i dizajnu umjesto da nestaje.

Sažmite ovu objavu uz: