Tutorial de DataStage para principiantes: IBM Herramienta ETL

โšก Resumen inteligente

DataStage de IBM InfoSphere extracEsta herramienta procesa, transforma y carga datos empresariales a gran escala. Explica la arquitectura, los componentes, el procesamiento paralelo, la configuraciรณn de la replicaciรณn SQL, la creaciรณn de proyectos, la compilaciรณn de trabajos y las pruebas de integraciรณn mediante un ejemplo prรกctico de DB2 Retail.

  • ๐Ÿงฉ Definiciรณn bรกsica: DataStage transfiere datos desde archivos secuenciales, bases de datos relacionales, sistemas centrales, ERP y CRM a un destino controlado.
  • ???? ๏ธ ArchiCapas de textura: Los clientes Administrador, Gerente, Diseรฑador y Director se sitรบan por encima de los servicios compartidos y un motor de ejecuciรณn paralelo escalable.
  • โšก Ejecuciรณn paralela: El paralelismo de canalizaciรณn transmite los registros entre las etapas, mientras que el paralelismo de particiรณn divide el volumen entre los nodos para lograr una escalabilidad casi lineal.
  • ๐Ÿ” Configuraciรณn de replicaciรณn: Los scripts de ASNCLP crean tablas de control de captura y aplicaciรณn, registros, conjuntos de suscripciรณn y tablas CCD dentro de DB2.
  • ๐Ÿ› ๏ธ Ciclo de vida del empleo: El diseรฑador ensambla las etapas y los enlaces, y luego el director valida, programa, ejecuta y supervisa los trabajos paralelos y secuenciales compilados.
  • โœ… Paso de validaciรณn: Actualizar las filas de origen y volver a ejecutar el trabajo de secuencia confirma que los indicadores I, U y D llegan al extracconjuntos de datos ted.

IBM Tutorial de DataStage para principiantes

ยฟQuรฉ es DataStage?

Etapa de Datos es una herramienta ETL utilizada para extracDataStage permite transferir, transformar y cargar datos desde el origen hasta el destino. El origen de estos datos puede incluir archivos secuenciales, archivos indexados, bases de datos relacionales, fuentes de datos externas, archivos comprimidos, aplicaciones empresariales, etc. DataStage facilita el anรกlisis empresarial al proporcionar datos de calidad que contribuyen a la obtenciรณn de inteligencia de negocio.

La herramienta ETL DataStage se utiliza en grandes organizaciones como interfaz entre diferentes sistemas. Se encarga de...tracciรณn, traducciรณn y carga de datos desde el origen al destino. Fue lanzado por primera vez por VMark a mediados de los 90. Con IBM Al adquirir DataStage en 2005, pasรณ a llamarse IBM WebSphere DataStage y posteriores a IBM Infoesfera.

Varias versiones de Datastage disponibles en el mercado hasta ahora eran Enterprise Edition (PX), Server Edition, MVS Edition, DataStage para PeopleSoft, etc. La รบltima ediciรณn es IBM InfoSphere DataStage.

IBM El servidor de informaciรณn incluye los siguientes productos:

  • IBM Etapa de datos de InfoSphere
  • IBM Etapa de calidad de InfoSphere
  • IBM Director de servicios de informaciรณn de InfoSphere
  • IBM Analizador de informaciรณn InfoSphere
  • IBM Servidor de informaciรณn rรกpidoTrack
  • IBM Glosario empresarial de InfoSphere

Una vez establecida la definiciรณn, la siguiente secciรณn analiza lo que el producto puede hacer realmente dentro de un almacenamiento de datos ambiente.

Descripciรณn general de DataStage

Datastage tiene las siguientes capacidades:

  • Puede integrar datos de la mรกs amplia gama de fuentes de datos empresariales y externas.
  • Implementa reglas de validaciรณn de datos.
  • Es รบtil para procesar y transformar grandes cantidades de datos.
  • Utiliza un enfoque de procesamiento paralelo escalable.
  • Puede manejar transformaciones complejas y gestionar mรบltiples procesos de integraciรณn.
  • Aproveche la conectividad directa a aplicaciones empresariales como fuentes u objetivos
  • Aproveche los metadatos para anรกlisis y mantenimiento
  • OperaPruebas por lotes, en tiempo real o como servicio web.

En las siguientes secciones de este tutorial de DataStage, describimos brevemente los siguientes aspectos de IBM Etapa de datos de InfoSphere:

  • Transformaciรณn de datos
  • Ofertas de empleo
  • Procesamiento en paralelo

InfoSphere DataStage y QualityStage pueden acceder a datos en aplicaciones empresariales y fuentes de datos como:

Tipos de etapas de procesamiento

IBM El trabajo de la infosfera consta de etapas individuales que estรกn interconectadas. Describe el flujo de datos desde una fuente de datos a un destino de datos. Normalmente, una etapa tiene como mรญnimo una entrada de datos y/o una salida de datos. Sin embargo, algunas etapas pueden aceptar mรกs de una entrada de datos y salida a mรกs de una etapa.

En el diseรฑo del trabajo, varias etapas que puede utilizar son:

  • etapa de transformaciรณn
  • Etapa de filtrado
  • Etapa agregadora
  • Eliminar etapa duplicada
  • Unirse al escenario
  • etapa de bรบsqueda
  • Copiar etapa
  • Ordenar etapa
  • Tanques Flexibles

ยฟPor quรฉ utilizar DataStage para la integraciรณn de datos?

Una cosa es conocer la lista de funciones; otra muy distinta es saber cuรกndo la herramienta justifica el coste de su licencia. DataStage se elige para cargas de trabajo donde el volumen, la gobernanza y las fuentes heterogรฉneas hacen que los scripts escritos manualmente sean inmanejables.

La razรณn mรกs evidente es el rendimiento. Dado que el motor particiona los datos entre nodos y transmite registros entre etapas simultรกneamente, aรฑadir hardware aumenta el rendimiento de forma casi lineal. Un trabajo diseรฑado en un entorno de desarrollo de dos nodos se ejecuta sin cambios en un clรบster de producciรณn de ocho nodos.

Las otras razones son organizativas mรกs que tรฉcnicas:

  • Metadatos compartidos: Las definiciones de tablas, las conexiones y los tรฉrminos comerciales se almacenan una sola vez en el repositorio y se reutilizan en cada tarea, lo que elimina la inconsistencia que se produce cuando cada desarrollador define una fuente de forma independiente.
  • Calidad de datos integrada: QualityStage ejecuta la investigaciรณn, la estandarizaciรณn, la comparaciรณn y la detecciรณn de supervivencia junto con el flujo ETL, por lo que la limpieza no necesita un segundo producto.
  • Amplia conectividad: Los conectores nativos llegan a DB2, Oracle, Teradata, VSAM de mainframe, SAPSalesforce y el almacenamiento de objetos en la nube sin cรณdigo personalizado.
  • Operacontrol cional: El sistema Director proporciona el historial de ejecuciรณn, el recuento de filas, las advertencias y los puntos de reinicio, que los auditores aceptan como evidencia de una canalizaciรณn de datos controlada.
  • Reutilizaciรณn: Los contenedores y conjuntos de parรกmetros compartidos permiten que una transformaciรณn probada sirva para muchos trabajos en lugar de copiarse en cada uno de ellos.

Estas ventajas dependen directamente de cรณmo se ensambla el producto, lo cual se explica en la siguiente secciรณn.

Componentes de DataStage y Architectura

DataStage tiene cuatro componentes principales, a saber,

  1. Administrador: Se utiliza para tareas de administraciรณn. Esto incluye configurar usuarios de DataStage, configurar criterios de depuraciรณn y crear y mover proyectos.
  2. Manager: Es la interfaz principal del Repositorio de ETL DataStage. Se utiliza para el almacenamiento y gestiรณn de Metadatos reutilizables. A travรฉs del administrador de DataStage, se puede ver y editar el contenido del Repositorio.
  3. Diseรฑador: Una interfaz de diseรฑo utilizada para crear aplicaciones O trabajos de DataStage. Especifica el origen de los datos, la transformaciรณn requerida y el destino de los datos. Los trabajos se compilan para crear un ejecutable que el Director programa y ejecuta el Servidor.
  4. Direcciรณn: Se utiliza para validar, programar, ejecutar y monitorear trabajos del servidor DataStage y trabajos paralelos.
Etapa de Datos ArchiDiagrama de tecnologรญa
Etapa de Datos ArchiDiagrama de tecnologรญa

La imagen de arriba explica cรณmo IBM Infosphere DataStage interactรบa con otros elementos del IBM Plataforma de servidor de informaciรณn. DataStage se divide en dos secciones, Componentes compartidos y tiempo de ejecuciรณn ArchitecturaLa tabla que aparece a continuaciรณn detalla la contribuciรณn de cada una de esas dos secciones.

   
Actividades

Compartido

Interfaz de usuario unificada

  • Se utiliza una interfaz de diseรฑo grรกfico para crear aplicaciones de InfoSphere DataStage (conocidas como trabajos).
  • Cada trabajo determina las fuentes de datos, las transformaciones requeridas y el destino de los datos.
  • Los trabajos se compilan para crear flujos de trabajo paralelos y componentes reutilizables. Son planificados y ejecutados por InfoSphere DataStage y QualityStage Director.
  • El cliente Designer gestiona los metadatos en el repositorio. Mientras que los datos de ejecuciรณn compilados se implementan en el nivel del motor del servidor de informaciรณn.

Servicios comunes

  • Servicios de metadatos como anรกlisis de impacto y bรบsqueda.
  • Servicios de diseรฑo que soportan el desarrollo y mantenimiento de tareas de InfoSphere DataStage
  • Servicios de ejecuciรณn que soportan todas las funciones de InfoSphere DataStage

Procesamiento paralelo comรบn

  • El motor ejecuta trabajos ejecutables quetract, transformar y cargar datos en una amplia variedad de entornos.
  • El motor selecciona un enfoque de procesamiento paralelo y canalizaciรณn para manejar un gran volumen de trabajo.

Runtime Architectura

Guiรณn de SST

  • Esto describe la generaciรณn del OSH (orquestate Shell Script) y el flujo de ejecuciรณn de IBM y el flujo de IBM Infosphere DataStage utilizando el motor del servidor de informaciรณn
  • Le permite utilizar tรฉcnicas grรกficas de apuntar y hacer clic para desarrollar flujos de trabajo, por ejemplotracProcesamiento, limpieza, transformaciรณn, integraciรณn y carga de datos en archivos de destino.

Cรณmo funciona el procesamiento paralelo en DataStage

La tabla de arquitectura anterior identifica el procesamiento paralelo comรบn como un servicio compartido. Esta secciรณn explica cรณmo dicho servicio ejecuta una tarea, ya que este concepto se mencionรณ en la descripciรณn general y determina la velocidad de finalizaciรณn de la tarea.

Un proceso paralelo utiliza dos mecanismos al mismo tiempo, y ambos se aplican automรกticamente en tiempo de ejecuciรณn en lugar de ser programados manualmente.

1. Paralelismo de tuberรญas. Cada etapa de un trabajo comienza simultรกneamente, sin esperar a que finalice la anterior. La etapa de origen comienza a leer las filas y las introduce en una canalizaciรณn en memoria. El transformador se inicia en cuanto llegan las primeras filas y envรญa su salida a una segunda canalizaciรณn. El conector de destino comienza a escribir inmediatamente despuรฉs. No se escribe ningรบn archivo intermedio, por lo que un trabajo de tres etapas superpone la lectura, la transformaciรณn y la escritura, en lugar de ejecutarlas secuencialmente.

2. Paralelismo de particiรณn. Las filas se dividen en particiones separadas, y una copia completa de la lรณgica de la etapa se ejecuta en cada particiรณn en su propio nodo. Ocho particiones implican ocho instancias de Transformer simultรกneas. Al final del flujo, las particiones se recopilan en un รบnico flujo para el destino.

Elegir el mรฉtodo de particionamiento adecuado es la principal decisiรณn de optimizaciรณn que toma un desarrollador:

  • Coches: Por defecto, el motor elige un mรฉtodo en funciรณn de las necesidades de la etapa.
  • Hash: Envรญa filas con el mismo valor de clave al mismo nodo. Es necesario antes de Unir, Agregar y Eliminar duplicados para que las claves coincidentes se encuentren.
  • Ronda Robin: Trata las filas uniformemente una por una. Mejores para cargar un archivo plano donde la clave grouping no importa.
  • Completo: Copia el conjunto completo de datos a cada nodo. Se utiliza para tablas de referencia pequeรฑas en una etapa de bรบsqueda.
  • Mismo: Mantiene intacta la particiรณn existente, lo que evita una nueva particiรณn innecesaria entre dos etapas.
  • Rango y mรณdulo: Distribuya las filas por rango de valor o por resto de clave numรฉrica cuando se necesite una distribuciรณn uniforme.

Un archivo de configuraciรณn (APT_CONFIG_FILE) declara la cantidad de nodos existentes. Dado que el nรบmero de nodos reside fuera del trabajo, el mismo trabajo compilado se adapta desde una computadora portรกtil a una red de producciรณn sin necesidad de modificar el diseรฑo.

Antes de poder poner en prรกctica cualquiera de estas ideas, es necesario que se den las condiciones adecuadas.

Requisito previo para la herramienta Datastage

Para DataStage, necesitarรก la siguiente configuraciรณn.

  • Infosfera
  • Servidor DataStage 9.1.2 o superior
  • Microsoft Ediciรณn Express de Visual Studio .NET 2010 C++
  • Oracle cliente (cliente completo, no un cliente instantรกneo) si se conecta a un Oracle base de datos de CRISPR Medicine News
  • Cliente DB2 si se conecta a una base de datos DB2

Ahora, en esta serie de tutoriales de DataStage para principiantes, aprenderemos cรณmo descargar e instalar el servidor de informaciรณn InfoSphere.

Descarga e instalaciรณn de InfoSphere Information Server

Para acceder a DataStage, descargue e instale la รบltima versiรณn de IBM Servidor de InfoSphere. El servidor es compatible con AIX, Linux y Windows Sistema operativo. Puedes elegir segรบn tus necesidades.

Para migrar sus datos de una versiรณn anterior de infosphere a una nueva versiรณn, utilice la herramienta de intercambio de activos.

Archivos de instalaciรณn

Para instalar y configurar Infosphere Datastage, debe tener los siguientes archivos en su configuraciรณn.

Para Windows,

  • Paquete de implementaciรณn Etl-windows-oracle.pkg
  • Paquete de implementaciรณn Etl-windows-db2.pkg

Para linux

  • EtlDeploymentPackage-linux-db2.pkg
  • Paquete de implementaciรณn Etl-linux-oracle.pkg

Una vez instalado el servidor, el ejemplo prรกctico que se muestra en el resto de esta pรกgina utiliza la captura de datos de cambios, por lo que resulta รบtil ver cรณmo se transmiten los datos de cambios antes de implementarlo.

Flujo de proceso de datos de cambio en un trabajo de etapa de transacciรณn CDC

Flujo de proceso de datos de cambio en un CDC

El diagrama de arriba traces un รบnico cambio de la base de datos de origen a la de destino, en el orden que se indica a continuaciรณn.

  1. El servicio 'InfoSphere CDC' para la base de datos monitorea y captura el cambio desde una base de datos de origen
  2. Segรบn la definiciรณn de replicaciรณn, โ€œInfoSphere CDCโ€ transfiere los datos de cambio a โ€œInfoSphere CDC para InfoSphere DataStageโ€.
  3. El servidor โ€œInfoSphere CDC para InfoSphere DataStageโ€ envรญa datos a la โ€œetapa de transacciรณn CDCโ€ a travรฉs de una sesiรณn TCP/IP. El servidor โ€œInfoSphere CDC para InfoSphere DataStageโ€ tambiรฉn envรญa un mensaje COMMIT (junto con informaciรณn de marcador) para marcar el lรญmite de la transacciรณn en el registro capturado.
  4. Para cada mensaje COMMIT enviado por el servidor โ€œInfoSphere CDC para InfoSphere DataStageโ€, la โ€œetapa de transacciรณn CDCโ€ crea marcadores de fin de onda (EOW). Estos marcadores se envรญan en todos los enlaces de salida a la etapa del conector de la base de datos de destino.
  5. Cuando la "etapa del conector de la base de datos de destino" recibe un marcador de fin de onda en todos los enlaces de entrada, escribe informaciรณn de marcador en una tabla de marcadores y luego confirma la transacciรณn en la base de datos de destino.
  6. El servidor โ€œInfoSphere CDC para InfoSphere DataStageโ€ solicita informaciรณn de marcadores de una tabla de marcadores en la โ€œbase de datos de destinoโ€.
  7. El servidor โ€œInfoSphere CDC para InfoSphere DataStageโ€ recibe la informaciรณn del marcador.

Esta informaciรณn se utiliza para,

  • Determine el punto de partida en el registro de transacciones donde se leen los cambios cuando comienza la replicaciรณn.
  • Para determinar si el registro de transacciones existente se puede limpiar

Configurar la replicaciรณn SQL

Antes de comenzar con Datastage, necesita configurar la base de datos. Crearรก dos bases de datos DB2.

  • Uno para servir como fuente de replicaciรณn y
  • Uno como objetivo.

Tambiรฉn crearรก dos tablas (Producto e Inventario) y las completarรก con datos de muestra. Entonces puedes probar tu integraciรณn entre SQL Replicaciรณn y etapa de datos.

En el futuro, configurarรก la replicaciรณn de SQL creando tablas de control, conjuntos de suscripciรณn, registros y miembros del conjunto de suscripciรณnAprenderemos mรกs sobre esto en detalle en la siguiente secciรณn.

Aquรญ tomaremos un ejemplo de artรญculo de ventas minoristas como nuestra base de datos y crearemos dos tablas Inventario y Producto. Estas tablas cargarรกn datos desde el origen al destino a travรฉs de estos conjuntos. (tablas de control, conjuntos de suscripciรณn, registros y miembros del conjunto de suscripciรณn.)

Paso 1) Cree una base de datos de origen denominada OFERTAS. Bajo esta base de datos, cree dos tablas. producto y Inventario.

Paso 2) Ejecute el siguiente comando para crear la base de datos VENTAS.

db2 create database SALES

Paso 3) Active el registro de archivo para la base de datos SALES. Ademรกs, realice una copia de seguridad de la base de datos mediante los siguientes comandos

db2 update db cfg for SALES using LOGARCHMETH3 LOGRETAIN
db2 backup db SALES

Paso 4) En el mismo sรญmbolo del sistema, cambie al subdirectorio setupDB en el directorio sqlrepl-datastage-tutorial que usted extracted del archivo comprimido descargado.

Configurar la replicaciรณn SQL

Paso 5) Utilice el siguiente comando para crear la tabla de Inventario e importar datos a la tabla ejecutando el siguiente comando.

db2 import from inventory.ixf of ixf create into inventory

Paso 6) Cree una tabla de destino. Nombra la base de datos de destino como ETAPADB.

Como ahora ha creado tanto el origen como el destino de la base de datos, en el siguiente paso de este tutorial de DataStage veremos cรณmo replicarlo.

La siguiente informaciรณn puede ser รบtil en Configuraciรณn de una fuente de datos ODBC en el IBM Documentaciรณn de InfoSphere Information Server.

Crear los objetos de replicaciรณn SQL

La imagen a continuaciรณn muestra cรณmo se entrega el flujo de datos de cambios desde la base de datos de origen a la de destino. Se crea un mapa de origen a destino.ping entre mesas conocidas como miembros del conjunto de suscripciรณn y agrupar a los miembros en un suscripciรณn.

Crear los objetos de replicaciรณn SQL

La unidad de replicaciรณn dentro de InfoSphere CDC (Change Data Capture) se denomina suscripciรณn.

  • Los cambios realizados en la fuente se capturan en la โ€œtabla de control de capturaโ€ que se envรญa a la tabla CD y luego a la tabla de destino. Mientras que el programa de aplicaciรณn tendrรก los detalles sobre la fila desde donde se deben realizar los cambios. Tambiรฉn unirรก la tabla CD en el conjunto de suscripciรณn.
  • Una suscripciรณn incluye un mapa.ping detalles que especifican cรณmo se aplican los datos de un almacรฉn de datos de origen a un almacรฉn de datos de destino. Nota: ahora se hace referencia a CDC como Replicaciรณn de datos de infosfera.
  • Cuando se ejecuta una suscripciรณn, InfoSphere CDC captura los cambios en la base de datos de origen. InfoSphere CDC envรญa los datos de los cambios a la base de datos de destino y almacena la informaciรณn del punto de sincronizaciรณn en una tabla de marcadores en la base de datos de destino.
  • InfoSphere CDC utiliza la informaciรณn del marcador para supervisar el progreso del trabajo de InfoSphere DataStage.
  • En caso de error, la informaciรณn del marcador se utiliza como punto de reinicio. En nuestro ejemplo, el ASN.IBMLa tabla SNAP_FEEDETL almacena informaciรณn de punto de sincronizaciรณn relacionada con DataStage que se utiliza para track progreso de DataStage.

En esta secciรณn de IBM Tutorial de capacitaciรณn de DataStage, debes hacer lo siguiente:

  • Cree tablas CAPTURE CONTROL y APPLY CONTROL para almacenar opciones de replicaciรณn
  • Registre las tablas PRODUCTO e INVENTARIO como fuentes de replicaciรณn
  • Crear un conjunto de suscripciรณn con dos miembros
  • Crear miembros del conjunto de suscripciรณn y tablas CCD de destino

Utilice el programa de lรญnea de comandos ASNCLP para configurar la replicaciรณn SQL

Paso 1) Localice el archivo de script crtCtlTablesCaptureServer.asnclp en el directorio sqlrepl-datastage-tutorial/setupSQLRep.

Paso 2) En el archivo, reemplace y โ€œโ€ con su ID de usuario y contraseรฑa para conectarse a la base de datos de VENTAS.

Paso 3) Cambie al directorio sqlrepl-datastage-tutorial/setupSQLRep y ejecute el script. Utilice el siguiente comando. El comando se conectarรก a la base de datos SALES y generarรก un script SQL para crear las tablas de control de Capture.

asnclp โ€“f crtCtlTablesCaptureServer.asnclp

Paso 4) Localice el archivo de script crtCtlTablesApplyCtlServer.asnclp en el mismo directorio. Ahora reemplace dos instancias de y โ€œโ€ con el ID de usuario y la contraseรฑa para conectarse a la base de datos STAGEDB.

Paso 5) Ahora, en el mismo sรญmbolo del sistema, utilice el siguiente comando para crear tablas de control de aplicaciรณn.

asnclp โ€“f crtCtlTablesApplyCtlServer.asnclp

Paso 6) Localice los archivos de script crtRegistration.asnclp y reemplace todas las instancias de con el ID de usuario para conectarse a la base de datos SALES. Ademรกs, cambie โ€œโ€ por la contraseรฑa de conexiรณn.

Paso 7) Para registrar las tablas de origen, utilice el siguiente script. Como parte de la creaciรณn del registro, el programa ASNCLP crearรก dos tablas de CD: CDPRODUCT Y CDINVENTORY.

asnclp โ€“f crtRegistration.asnclp

El comando CREAR REGISTRO utiliza las siguientes opciones:

  • Actualizaciรณn diferencial: Solicita al programa Aplicar que actualice la tabla de destino solo cuando cambian las filas en la tabla de origen
  • Imagen de ambos: Esta opciรณn se utiliza para registrar el valor en la columna de origen antes de que se produjera el cambio y una para el valor despuรฉs de que se produjera el cambio.

Paso 8) Para conectarse a la base de datos de destino (STAGEDB), siga los siguientes pasos.

  • Busque el archivo crtTableSpaceApply.bat, รกbralo en un editor de texto
  • Reemplace y con el ID de usuario y la contraseรฑa.
  • En la ventana de comandos de DB2, ingrese crtTableSpaceApply.bat y ejecute el archivo.
  • Este archivo por lotes crea un nuevo espacio de tabla en la base de datos de destino (STAGEDB)

Paso 9) Localice los archivos de script crtSubscriptionSetAndAddMembers.asnclp y realice los siguientes cambios.

  • Reemplace todas las instancias de y con el ID de usuario y la contraseรฑa para conectarse a la base de datos de VENTAS (fuente).
  • Reemplace todas las instancias de y con el ID de usuario para conectarse a la base de datos STAGEDB (destino).

Despuรฉs de los cambios, ejecute el script para crear un conjunto de suscripciรณn (ST00) que agrupe las tablas de origen y de destino. El script tambiรฉn crea dos miembros del conjunto de suscripciรณn y CCD (datos de cambio consistentes) en la base de datos de destino que almacenarรก los datos modificados. Estos datos serรกn consumidos por Infosphere DataStage.

Paso 10) Ejecute el script para crear el conjunto de suscripciรณn, los miembros del conjunto de suscripciรณn y las tablas CCD.

asnclp โ€“f crtSubscriptionSetAndAddMembers.asnclp

Varias opciones utilizadas para crear un conjunto de suscripciรณn y dos miembros incluyen

  • Completo en condensado
  • Externo
  • Tipo de carga importaciรณn exportaciรณn
  • Temporizaciรณn continua

Paso 11) Por defecto en las herramientas de administraciรณn de replicaciรณn. Debe ejecutar otro archivo por lotes para configurar la columna TARGET_CAPTURE_SCHEMA en el IBMTabla de control SNAP_SUBS_SET a nula.

  • Localice el archivo updateTgtCapSchema.bat. รbrelo en un editor de texto. Reemplace y con el ID de usuario para conectarse a la base de datos STAGEDB.
  • En la ventana de comandos de DB2, ingrese el comando updateTgtCapSchema.bat y ejecute el archivo.

Creaciรณn de archivos de definiciรณn para asignar tablas CCD a DataStage

Antes de realizar la replicaciรณn en el siguiente paso, debemos conectar la tabla CCD con DataStage. En esta secciรณn, veremos cรณmo conectar SQL con DataStage.

Para conectar una tabla CCD con DataStage, es necesario crear archivos de definiciรณn de DataStage (.dsx). DataStage utiliza el formato de archivo .dsx para importar y exportar definiciones de trabajos. Se utiliza el script ASNCLP para crear dos archivos .dsx. Por ejemplo, aquรญ se muestran dos archivos .dsx.

  • stagedb_AQ00_SET00_sJobs.dsx: Crea una secuencia de trabajos que dirige el flujo de trabajo de los cuatro trabajos paralelos.
  • stagedb_AQ00_SET00_pJobs.dsx : Crea los cuatro trabajos paralelos

El programa ASNCLP asigna automรกticamente la columna CCD al formato de columna Datastage. Sรณlo se admite cuando ASNCLP se ejecuta en Windows, Linux o Unix.

Archivos de definiciรณn para asignar tablas CCD a DataStage

Los trabajos de Datastage extraen filas de la tabla CCD.

  1. Un trabajo establece un punto de sincronizaciรณn donde DataStage se quedรณ en extracdatos de las dos tablas. El trabajo obtiene esta informaciรณn seleccionando el valor SYNCHPOINT para el conjunto de suscripciรณn ST00 de la IBMTabla SNAP_SUBS_SET e insertarla en la columna MAX_SYNCHPOINT de la IBMTabla SNAP_FEEDETL.
  2. Dos trabajos que extract datos de las tablas PRODUCT_CCD e INVENTORY_CCD. Los trabajos saben quรฉ filas deben comenzar.tracting seleccionando los valores MIN_SYNCHPOINT y MAX_SYNCHPOINT del IBMTabla SNAP_FEEDETL para el conjunto de suscripciรณn.

Una vez asignadas las definiciones, se puede iniciar la replicaciรณn para que las tablas CCD comiencen a llenarse.

Iniciando la replicaciรณn

Para iniciar la replicaciรณn, seguirรก los pasos siguientes. Cuando las tablas CCD se completan con datos, indica que la configuraciรณn de replicaciรณn estรก validada. Para ver los datos replicados en las tablas CCD de destino, utilice la interfaz grรกfica de usuario del Centro de control de DB2.

Paso 1) Asegรบrese de que DB2 se estรฉ ejecutando; de lo contrario, utilice inicio de db2 mando.

Paso 2) Luego use el comando asncap desde el indicador del sistema operativo para comenzar a capturar el programa. Por ejemplo.

asncap capture_server=SALES

El comando anterior especifica la base de datos SALES como servidor de captura. Mantenga abierta la ventana de comandos mientras se ejecuta la captura.

Paso 3) Ahora abra un nuevo sรญmbolo del sistema. Entonces comienza el RESERVAR programa utilizando el comando asnapply.

asnapply control_server=STAGEDB apply_qual=AQ00

Iniciando la replicaciรณn

  • El comando especifica la base de datos STAGEDB como servidor de control de Apply (la base de datos que contiene las tablas de control de Apply)
  • AQ00 como calificador de Aplicar (el identificador de este conjunto de tablas de control)

Deje abierta la ventana de comandos con Aplicar en ejecuciรณn.

Paso 4) Ahora abra otro sรญmbolo del sistema y ejecute el comando db2cc para iniciar el Centro de control de DB2. Acepte el Centro de control predeterminado.

Paso 5) Ahora, en el รกrbol de navegaciรณn izquierdo, abra Todas las bases de datos > STAGEDB y luego haga clic en Tablas. Double haga clic en el nombre de la tabla (Product CCD) para abrir la tabla. Se verรก algo como esto.

Iniciando la replicaciรณn

Asimismo, tambiรฉn puedes abrir la tabla CCD para INVENTARIO.

Iniciando la replicaciรณn

Ahora la replicaciรณn alimenta las tablas CCD, por lo que la atenciรณn se traslada del lado de la base de datos a los clientes de DataStage.

Cรณmo crear proyectos en la herramienta Datastage

En primer lugar, crearรก un proyecto en DataStage. Para ello, debe ser administrador de InfoSphere DataStage.

Una vez realizadas la instalaciรณn y la replicaciรณn, debe crear un proyecto. En DataStage, los proyectos son un mรฉtodo para organizar sus datos. Incluye la definiciรณn de archivos de datos, etapas y trabajos de construcciรณn en un proyecto especรญfico.

Para crear un proyecto en DataStage, siga los pasos a continuaciรณn:

Paso 1) Inicie el software DataStage

Inicie el administrador de DataStage y QualityStage. Luego haga clic en Inicio > Todos los programas > IBM Servidor de informaciรณn > IBM Administrador de WebSphere DataStage y QualityStage.

Paso 2) Conecte el servidor y el cliente de DataStage

Para conectarse al servidor DataStage desde su cliente DataStage, ingrese detalles como el nombre de dominio, el ID de usuario, la contraseรฑa y la informaciรณn del servidor.

Paso 3) Agregar un nuevo proyecto

En la ventana Administraciรณn de WebSphere DataStage. Haga clic en la pestaรฑa Proyectos y luego haga clic en Agregar.

Paso 4) Ingrese los detalles del proyecto

En la ventana Administraciรณn de WebSphere DataStage, ingrese detalles como

  1. Nombre
  2. Ubicaciรณn del archivo
  3. Haga clic en Aceptar'

Crear proyectos en la herramienta Datastage

Cada proyecto contiene:

  • Empleos de DataStage
  • Componentes incorporados. Estos son componentes predefinidos que se utilizan en un trabajo.
  • Componentes definidos por el usuario. Estos son componentes personalizados creados utilizando DataStage Manager o DataStage Designer.

Veremos cรณmo importar trabajos de replicaciรณn en Datastage Infosphere.

Cรณmo importar trabajos de replicaciรณn en Datastage y QualityStage Designer

Importarรกs trabajos en el IBM Cliente InfoSphere DataStage y QualityStage Designer. Y los ejecutas en el IBM Cliente InfoSphere DataStage y QualityStage Director.

El diseรฑador-cliente es como un lienzo en blanco para los trabajos de construcciรณn.tracts, transformar, cargar y verificar la calidad de los datos. Proporciona herramientas que forman los bloques de construcciรณn bรกsicos de un trabajo. Incluye

  • Cรญclos: Se conecta a fuentes de datos para leer o escribir archivos y procesar datos.
  • Enlaces: Conecta las etapas por las que fluyen tus datos.

Las etapas del cliente InfoSphere DataStage y QualityStage Designer se almacenan en la paleta de herramientas del Diseรฑador.

Las siguientes etapas estรกn incluidas en InfoSphere QualityStage:

  • etapa de investigaciรณn
  • Estandarizar etapa
  • Etapa de frecuencia de coincidencia
  • Etapa de coincidencia de fuente รบnica
  • Etapa de coincidencia de dos fuentes
  • Etapa de supervivencia
  • Etapa de Evaluaciรณn de la Calidad de la Estandarizaciรณn (SQA)

Puede crear 4 tipos de trabajos en la infoesfera de DataStage.

  • trabajo paralelo
  • Trabajo de secuencia
  • Trabajo de computadora central
  • Trabajo del servidor

Veamos paso a paso cรณmo importar archivos de trabajos de replicaciรณn.

Paso 1) Inicie DataStage y QualityStage Designer. Haga clic en Inicio > Todos los programas > IBM Servidor de informaciรณn > IBM WebSphere DataStage y QualityStage Designer

Paso 2) En la ventana Adjuntar al proyecto, ingrese los siguientes detalles.

  • Dominio
  • Nombre de usuario
  • Contraseรฑa
  • Nombre del Proyecto
  • OK

Importar trabajos de replicaciรณn en Datastage y QualityStage

Paso 3) Ahora desde el menรบ Archivo, haga clic en importar -> Componentes de DataStage.

Se abrirรก una nueva ventana de importaciรณn del repositorio de DataStage.

  1. En esta ventana navega STAGEDB_AQ00_ST00_sTrabajos.dsx archivo que habรญamos creado anteriormente
  2. Seleccione la opciรณn "Importar todo".
  3. Marque la casilla de verificaciรณn โ€œRealizar anรกlisis de impactoโ€.
  4. Haga clic en Aceptar.'

Importar trabajos de replicaciรณn en Datastage y QualityStage

Una vez importado el trabajo, DataStage crearรก el trabajo STAGEDB_AQ00_ST00_sequence.

Paso 4) Siga los mismos pasos para importar el Archivo STAGEDB_AQ00_ST00_pJobs.dsx. Esta importaciรณn crea los cuatro trabajos paralelos.

Paso 5) En el panel Repositorio de Designer -> Abra la carpeta SQLREP. Dentro de la carpeta, verรก Sequence Job y cuatro trabajos paralelos.

Importar trabajos de replicaciรณn en Datastage y QualityStage

Paso 6) Para ver el trabajo de secuencia. Vaya al รกrbol del repositorio, haga clic derecho en el trabajo STAGEDB_AQ00_ST00_sequence y haga clic en Editar. Mostrarรก el flujo de trabajo de los cuatro trabajos paralelos que controla la secuencia de trabajos.

Importar trabajos de replicaciรณn en Datastage y QualityStage

Cada icono es un escenario,

  • obtenerExtracEtapa de rango: Actualiza el IBMTabla SNAP_FEEDETL. Establecerรก el punto de partida para los datos.tracciรณn hasta el punto donde DataStage ex รบltimotracted filas y establecer el punto final en la รบltima transacciรณn que se procesรณ para el conjunto de suscripciรณn.
  • obtenerExtractRangeSuccess: Esta etapa alimenta los puntos de partida a la extracEtapa y ex de tFromINVENTORY_CCDtracEtapa tFromPRODUCT_CCD
  • AllExtractsSuccess: Esta etapa garantiza que ambos extractFromINVENTORY_CCD y extractFromPRODUCT_CCD se completรณ correctamente. Luego, pasa los puntos de sincronizaciรณn de las รบltimas filas recuperadas a la etapa setRangeProcessed.
  • etapa setRangeProcessed: Se actualiza IBMTabla SNAP_FEEDETL. Por lo tanto, DataStage sabe desde dรณnde comenzar la siguiente ronda de extracciรณn de datos.tracdisrupciรณn

Paso 7) Para ver los trabajos paralelos. Haga clic derecho en STAGEDB_ASN_INVENTORY_CCD y seleccione editar en el repositorio. Se abrirรก una ventana como se muestra a continuaciรณn.

Importar trabajos de replicaciรณn en Datastage y QualityStage

Aquรญ, en la imagen de arriba, puede ver que los datos de la tabla CCD de inventario y SyncLos detalles del punto h de la tabla FEEDETL se representan en la etapa Lookup_6.

Los trabajos importados siguen sin apuntar a nada, por lo que a continuaciรณn hay que definir un objeto de conexiรณn de datos.

Creaciรณn de una conexiรณn de datos desde DataStage a la base de datos STAGEDB

Ahora el siguiente paso es crear una conexiรณn de datos entre InfoSphere DataStage y la base de datos de destino de SQL Replication. Contiene las tablas CCD.

En DataStage, utiliza objetos de conexiรณn de datos con etapas de conector relacionadas para definir rรกpidamente una conexiรณn a una fuente de datos en un diseรฑo de trabajo.

Paso 1) STAGEDB contiene las tablas de control Apply que DataStage utiliza para sincronizar sus datos.tracciรณn y las tablas CCD de las que se extraen los datostracted. Utilice los siguientes comandos

db2 catalog tcpip node SQLREP remote ip_address server 50000
db2 catalog database STAGEDB as STAGEDB2 at node SQLREP

Nota: : direcciรณn IP del sistema donde se creรณ STAGEDB

Paso 2) Haga clic en Archivo > Nuevo > Otro > Conexiรณn de datos.

Paso 3) Tendrรกs una ventana con dos pestaรฑas, Parรกmetros y General.

Conexiรณn de datos desde DataStage a la base de datos STAGEDB

Paso 4) En este paso,

  1. En general, pestaรฑa, nombre la conexiรณn de datos sqlreplConnect
  2. En la pestaรฑa Parรกmetros, como se muestra a continuaciรณn
  • Haga clic en el botรณn de exploraciรณn junto al campo "Conectar usando el tipo de etapa" y en el
  • Ventana abierta, navegue por el รกrbol del repositorio hasta Tipos de etapa โ€“> Paraleloโ€“ > Base de datos โ€”-> Conector DB2.
  • Haga clic en Abrir.

Conexiรณn de datos desde DataStage a la base de datos STAGEDB

Paso 5) En la tabla de parรกmetros de conexiรณn, ingrese detalles como

  • Cadena de conexiรณn: STAGEDB2
  • Nombre de usuario: ID de usuario para conectarse a la base de datos STAGEDB
  • Contraseรฑa: Contraseรฑa para conectarse a la base de datos STAGEDB
  • Ejemplo: Nombre de la instancia de DB2 que contiene la base de datos STAGEDB

Paso 6) En la siguiente ventana guarde la conexiรณn de datos. Haga clic en el botรณn "guardar".

Importaciรณn de definiciones de tablas desde STAGEDB a DataStage

En el paso anterior, vimos que InfoSphere DataStage y la base de datos STAGEDB estรกn conectados. Ahora, importe la definiciรณn de columna y otros metadatos para las tablas PRODUCT_CCD e INVENTORY_CCD al repositorio del servidor de informaciรณn.

En la ventana del diseรฑador, siga los pasos a continuaciรณn.

Paso 1) Seleccione Importar > Definiciones de tabla > Iniciar asistente de importaciรณn de conectores.

Paso 2) En la pรกgina de selecciรณn de conector del asistente, seleccione el conector DB2 y haga clic en Siguiente.

Importaciรณn de definiciones de tablas desde STAGEDB a DataStage

Paso 3) Haga clic en cargar en la pรกgina de detalles de la conexiรณn. Esto completarรก los campos del asistente con informaciรณn de conexiรณn de la conexiรณn de datos que creรณ en el capรญtulo anterior.

Importaciรณn de definiciones de tablas desde STAGEDB a DataStage

Paso 4) Haga clic en Probar conexiรณn en la misma pรกgina. Esto harรก que DataStage intente conectarse a la base de datos STAGEDB. Puede ver el mensaje "la conexiรณn se realizรณ correctamente". Haga clic en Siguiente.

Importaciรณn de definiciones de tablas desde STAGEDB a DataStage

Paso 5) Asegรบrese de que en la pรกgina Ubicaciรณn de la fuente de datos los campos Nombre de host y Nombre de base de datos estรฉn correctamente completados. Luego haga clic en siguiente.

Paso 6) En la pรกgina de esquema. Ingrese el esquema de Aplicar tablas de control (ASN) o verifique que el esquema ASN estรฉ completado previamente en el campo de esquema. Luego haga clic en siguiente. La pรกgina de selecciรณn mostrarรก la lista de tablas definidas en el esquema ASN.

Importaciรณn de definiciones de tablas desde STAGEDB a DataStage

Paso 7) La primera tabla desde la que necesitamos importar metadatos es IBMSNAP_FEEDETL, una tabla de control de aplicaciรณn. Contiene los detalles sobre los puntos de sincronizaciรณn que permiten a DataStage mantener track de las cuales filas ha obtenido de las tablas CCD. Elija IBMSNAP_FEEDETL y haga clic en Siguiente.

Paso 8) Para completar la importaciรณn del IBMDefiniciรณn de tabla SNAP_FEEDETL. Haga clic en importar y luego, en la ventana abierta, haga clic en abrir.

Paso 9) Repita los pasos del 1 al 8 dos veces mรกs para importar las definiciones de la tabla PRODUCT_CCD y luego la tabla INVENTORY_CCD.

NOTA: Al importar definiciones para el inventario y el producto, asegรบrese de cambiar los esquemas de ASN al esquema bajo el cual se crearon PRODUCT_CCD e INVENTORY_CCD.

Ahora DataStage tiene todos los detalles que necesita para conectarse a la base de datos de destino de replicaciรณn SQL.

Configuraciรณn de propiedades para los trabajos de DataStage

Para cada uno de los cuatro trabajos paralelos de DataStage que tenemos, contiene una o mรกs etapas que se conectan con la base de datos STAGEDB. Debe modificar las etapas para agregar informaciรณn de conexiรณn y vincular a los archivos del conjunto de datos que completa DataStage.

Las etapas tienen propiedades predefinidas que se pueden editar. Aquรญ cambiaremos algunas de estas propiedades para STAGEDB_ASN_PRODUCT_CCD_ex.tractrabajo paralelo.

Paso 1) Explore el รกrbol del repositorio del Diseรฑador. En la carpeta SQLREP, seleccione STAGEDB_ASN_PRODUCT_CCD_ex.tracTrabajo paralelo. Para editar, haga clic con el botรณn derecho en el trabajo. La ventana de diseรฑo del trabajo paralelo se abrirรก en la paleta de diseรฑo.

Paso 2) Localice el icono verde. Este icono indica la etapa del conector DB2. Se utiliza para, por ejemplo:tracdatos de la tabla CCD. Double-haga clic en el icono. Se abre una ventana del editor de escenario.

Configuraciรณn de propiedades para los trabajos de DataStage

Configuraciรณn de propiedades para los trabajos de DataStage

Paso 3) En el editor, haga clic en Cargar para completar los campos con informaciรณn de conexiรณn. Para cerrar el editor de escenario y guardar los cambios, haga clic en Aceptar.

Paso 4) Ahora vuelva a la ventana de diseรฑo para STAGEDB_ASN_PRODUCT_CCD_ex.tractrabajo paralelo. Localice el icono para obtenerSyncEtapa del conector DB2 de hPoints. A continuaciรณn, haga doble clic en el icono.

Paso 5) Ahora haga clic en el botรณn cargar para completar los campos con informaciรณn de conexiรณn.

NOTA: si estรก utilizando una base de datos distinta de STAGEDB como servidor de control de Apply. Luego seleccione la opciรณn para cargar la informaciรณn de conexiรณn para obtenerSyncEtapa hPoints, que interactรบa con las tablas de control en lugar de con la tabla CCD.

Paso 6) En este paso,

  • Cree un archivo de texto vacรญo en el sistema donde se ejecuta InfoSphere DataStage.
  • Nombra este archivo como productdataset.ds y toma nota de dรณnde lo guardaste.
  • DataStage escribirรก cambios en este archivo despuรฉs de recuperar los cambios de la tabla CCD.
  • Los conjuntos de datos o archivos que se utilizan para mover datos entre trabajos vinculados se conocen como conjuntos de datos persistentes. Estรก representado por una etapa DataSet.

Paso 7) Ahora abra el editor de escenarios en la ventana de diseรฑo y haga doble clic en el icono insert_into_a_dataset. Se abrirรก otra ventana.

Configuraciรณn de propiedades para los trabajos de DataStage

Paso 8) En esta ventana

Configuraciรณn de propiedades para los trabajos de DataStage

  • En la pestaรฑa de propiedades, asegรบrese de que Target La carpeta estรก abierta y la propiedad Archivo = DATASETNAME estรก resaltada.
  • A la derecha, tendrรกs un campo de archivo.
  • Ingrese la ruta completa al archivo productdataset.ds
  • Haga clic en Aceptar'.

Ahora ha actualizado todas las propiedades necesarias para la tabla CCD del producto. Cierre la ventana de diseรฑo y guarde todos los cambios.

Paso 9) Ahora localice y abra STAGEDB_ASN_INVENTORY_CCD_extract trabajo paralelo desde el panel del repositorio del Diseรฑador y repita los pasos 3-8.

NOTA:

  • Debe cargar la informaciรณn de conexiรณn para la base de datos del servidor de control en el editor de escenario para obtenerSyncEtapa de puntos. Si su servidor de control no es STAGEDB.
  • Para STAGEDB_ST00_AQ00_getExtracLos trabajos paralelos tRange y STAGEDB_ST00_AQ00_markRangeProcessed abren todas las etapas del conector DB2. Luego, utiliza la funciรณn de carga para agregar informaciรณn de conexiรณn para la base de datos STAGEDB.

Todas las propiedades ya estรกn configuradas, por lo que los trabajos pueden compilarse y ejecutarse.

Compilaciรณn y ejecuciรณn de trabajos de DataStage

Cuando el trabajo de DataStage estรก listo para compilarse, el Diseรฑador valida el diseรฑo del trabajo observando entradas, transformaciones, expresiones y otros detalles.

Cuando la compilaciรณn del trabajo se realiza correctamente, estarรก listo para ejecutarse. Compilaremos los cinco trabajos, pero solo ejecutaremos la "secuencia de trabajos". Esto se debe a que este trabajo controla los cuatro trabajos paralelos.

Paso 1) En la carpeta SQLREP. Seleccione cada uno de los cinco trabajos con (Cntrl+Shift). Luego haga clic derecho y elija la opciรณn de compilaciรณn de trabajos mรบltiples.

Compilaciรณn y ejecuciรณn de trabajos de DataStage

Paso 2) Verรก que hay cinco trabajos seleccionados en el Asistente de compilaciรณn de DataStage. Haga clic en Siguiente.

Compilaciรณn y ejecuciรณn de trabajos de DataStage

Paso 3) La compilaciรณn comienza y muestra un mensaje "Compilado correctamente" una vez finalizada.

Compilaciรณn y ejecuciรณn de trabajos de DataStage

Paso 4) Ahora inicie DataStage y QualityStage Director. Seleccione Inicio > Todos los programas > IBM Servidor de informaciรณn > IBM Director de WebSphere DataStage y QualityStage.

Paso 5) En el panel de navegaciรณn del proyecto a la izquierda. Haga clic en la carpeta SQLREP. Esto incluye los cinco puestos de trabajo en la tabla de estatus de director.

Paso 6) Seleccione el trabajo STAGEDB_AQ00_S00_sequence. En la barra de menรบ, haga clic en Trabajo > Ejecutar ahora.

Compilaciรณn y ejecuciรณn de trabajos de DataStage

Una vez finalizada la compilaciรณn, verรก el estado finalizado.

Compilaciรณn y ejecuciรณn de trabajos de DataStage

Ahora verifique si las filas modificadas que se almacenan en las tablas PRODUCT_CCD e INVENTORY_CCD fueron extracprocesado por DataStage e insertado en los dos archivos de conjunto de datos.

Paso 7) Vuelva al Diseรฑador y abra STAGEDB_ASN_PRODUCT_CCD_ex.tractrabajo t. Para abrir el editor de escenarios Double-Haga clic en el icono insertar_en_un_conjunto de datos. Luego haga clic en ver datos.

Paso 8) Acepte los valores predeterminados en las filas que se mostrarรกn en la ventana. Luego haga clic en Aceptar. Se abrirรก una ventana del navegador de datos para mostrar el contenido del archivo del conjunto de datos.

Compilaciรณn y ejecuciรณn de trabajos de DataStage

Prueba de integraciรณn entre replicaciรณn SQL y DataStage

En el paso anterior, compilamos y ejecutamos el trabajo. En esta secciรณn, comprobaremos la integraciรณn de la replicaciรณn SQL y DataStage. Para eso, realizaremos cambios en la tabla de origen y veremos si el mismo cambio se actualiza en DataStage.

Paso 1) Navegue hasta la carpeta sqlrepl-datastage-scripts de su sistema operativo.

Paso 2) Inicie la replicaciรณn SQL siguiendo estos pasos:

  • Ejecute startSQLCapture.bat (Windows) archivo para iniciar el programa Capture en la base de datos de VENTAS.
  • Ejecute startSQLApply.bat (Windows) para iniciar el programa Apply en la base de datos STAGEDB.

Paso 3) Ahora abra el archivo updateSourceTables.sql. Para conectarse a la base de datos de VENTAS, reemplace y con el ID de usuario y la contraseรฑa.

Paso 4) Abra una ventana de comandos de DB2. Cambie el directorio a sqlrepl-datastage-tutorial\scripts y ejecute el problema con el comando indicado:

db2 -tvf updateSourceTables.sql

El script SQL realizarรก varias operaciones como Actualizar, Insertar y eliminar en ambas tablas (PRODUCTO, INVENTARIO) en la base de datos de Ventas.

Paso 5) En el sistema donde se ejecuta DataStage. Abra DataStage Director y ejecute el trabajo STAGEDB_AQ00_S00_sequence. Haga clic en Trabajo > Ejecutar ahora.

Integraciรณn entre replicaciรณn SQL y DataStage

Cuando se ejecuta el trabajo se llevarรกn a cabo las siguientes actividades.

  • El programa Capture lee los cambios de seis filas en el registro de la base de datos de VENTAS y los inserta en las tablas del CD.
  • El programa Apply recupera las filas de cambios de las tablas CD en SALES y las inserta en las tablas CCD en STAGEDB.
  • Los dos DataStage extracLos trabajos t recogen los cambios de las tablas CCD y los escriben en los archivos productdataset.ds e inventory dataset.ds.

Puede comprobar que los pasos anteriores se llevaron a cabo observando los conjuntos de datos.

Paso 6) Siga los pasos a continuaciรณn,

  • Inicie el Diseรฑador. Abra STAGEDB_ASN_PRODUCT_CCD_extractrabajo.
  • Entonces Double-Haga clic en el icono insertar_en_un_conjunto de datos. En el editor de escenario. Haga clic en Ver datos.
  • Acepte los valores predeterminados en las filas que se mostrarรกn en la ventana y haga clic en Aceptar.

El conjunto de datos contiene tres filas nuevas. La forma mรกs sencilla de comprobar que se implementaron los cambios es desplazarse hacia abajo a la derecha del Explorador de datos. Ahora mira las รบltimas tres filas (ver imagen a continuaciรณn)

Integraciรณn entre replicaciรณn SQL y DataStage

Las letras I, U y D especifican las operaciones INSERTAR, ACTUALIZAR y ELIMINAR que dieron como resultado cada nueva fila.

Puede hacer la misma verificaciรณn para la tabla de Inventario.

DataStage frente a otras herramientas ETL populares

Una vez que el flujo de trabajo integral funciona correctamente, la siguiente pregunta habitual es cรณmo se compara DataStage con las alternativas que el equipo ya posee. La siguiente tabla lo compara con tres plataformas ampliamente utilizadas segรบn los criterios que suelen influir en la decisiรณn de compra.

Criterios IBM Etapa de Datos informรกtica Centro de poder Talend SSIS
Modelo de procesamiento Pipeline mรกs paralelismo de particiรณn Particionamiento basado en metadatos Generado Java or Spark cรณdigo Flujo de datos en memoria
Mejores ajuste Cargas de trabajo empresariales muy grandes, tanto por lotes como de CDC. Arquitecturas heredadas complejas con una gobernanza robusta Equipos nativos de la nube y sensibles a los costos Microsoft SQL Server fincas
Licencias Comercial, nivel premium Comercial Ediciรณn de cรณdigo abierto mรกs niveles comerciales Incluido con SQL Server
Curva de aprendizaje Se necesitan especialistas en ETL con un alto nivel de desarrollo. Empinado Nivel moderado, la habilidad para programar ayuda Moderado
Calidad de datos QualityStage incluido en la suite Producto independiente de calidad de datos Calidad de datos de Talend incluida Componentes adicionales

En resumen, DataStage se elige cuando el rendimiento bruto, el alcance del mainframe y el linaje listo para auditorรญa importan mรกs que el costo de la licencia. Equipos que trabajan principalmente en la nube. arquitectura del lago de datos o comparando extracEl orden t primero puede encontrar las compensaciones en ETL vs ELT mรกs relevante, y una lista mรกs amplia aparece en el resumen de Herramientas ETL y herramientas de integraciรณn de datos.

Preguntas Frecuentes

Un trabajo de servidor se ejecuta en un solo nodo utilizando un conjunto limitado de etapas. Un trabajo paralelo se ejecuta en el motor paralelo, admite la particiรณn entre nodos y utiliza una paleta de etapas mรกs amplia, por lo que puede escalar a volรบmenes mucho mayores.

Sรญ. Junto con el servidor de informaciรณn local, IBM ofrece DataStage como un servicio administrado en IBM Cloud Pak for Data y la integraciรณn con watsonx.data permiten que los mismos flujos de trabajo se ejecuten sin necesidad de administrar un servidor local.

La mayor parte del trabajo es grรกfico. Las adiciones รบtiles son: SQL para consultas de origen, scripts de shell para el control de trabajos y el lenguaje de expresiones DataStage BASIC utilizado dentro de las derivaciones y rutinas de las etapas Transformer.

Asistentes de IA en IBM Cloud Pak for Data sugiere un mapa de origen a destino.pings, generar expresiones de transformaciรณn a partir de lenguaje natural, detectar desviaciones de esquema y recomendar cambios de particionamiento cuando un trabajo se ejecuta mรกs lento que su lรญnea base.

No. La IA acelera el mapa.pingSe proporcionan documentaciรณn y sugerencias de optimizaciรณn, pero los desarrolladores siguen siendo responsables del modelado de datos, las reglas de negocio, el manejo de excepciones y la responsabilidad en producciรณn. El rol se orienta hacia la revisiรณn y el diseรฑo en lugar de desaparecer.

Resumir este post con: