데이터 조정이란 무엇입니까? 정의, 프로세스, 도구
⚡ 스마트 요약
데이터 조정은 마이그레이션 중에 대상 데이터와 소스 데이터를 비교하여 정보의 정확성을 검증하는 과정입니다. 이 페이지에서는 데이터 조정 프로세스를 정의하고, 데이터 불일치가 발생하는 원인, 핵심 용어, 세 가지 조정 방법, 모범 사례 및 작업을 자동화하는 도구에 대해 설명합니다.

데이터 조정이란 무엇입니까?
데이터 조정(DR)은 데이터 마이그레이션 중 데이터 검증 프로세스로 정의됩니다. 이 프로세스에서 대상 데이터는 소스 데이터와 비교되어 마이그레이션 아키텍처가 데이터를 전송하고 있는지 확인합니다. 데이터 검증 및 조정(DVR)은 수학적 모델을 사용하여 정보를 처리하는 기술을 의미합니다.
데이터 조정 vs 데이터 유효성 검사
두 용어는 워낙 자주 함께 등장해서 종종 하나로 취급되지만, 서로 다른 질문에 대한 답을 제시하고 다른 시점에 사용됩니다.
데이터 유효성 검사 유효성 검사는 단일 값이 그 자체로 허용 가능한지 여부를 묻습니다. 레코드를 규칙과 비교하여 검사하는데, 날짜가 유효한지, 이메일 주소 형식이 올바른지, 국가 코드가 참조 목록에 있는지 등을 확인합니다. 유효성 검사에는 앞에 있는 레코드만 필요하므로 일반적으로 데이터 입력 또는 로드 시 실행됩니다.
데이터 조정 두 데이터 세트가 일치하는지 여부를 확인합니다. 소스 시스템과 대상 시스템 간의 개수, 합계 및 주요 관계를 비교하며, 양쪽 시스템에 데이터가 모두 존재하는 경우에만 실행할 수 있습니다. 레코드가 모든 유효성 검사 규칙을 통과하더라도 중복 기록되었거나 아예 도착하지 않은 경우 조정 실패로 간주될 수 있습니다.
| 차이점 | 데이터 유효성 검사 | 데이터 조정 |
|---|---|---|
| 질문에 대한 답변 | 이 값의 형식이 올바른가요? | 소스와 대상이 일치합니까? |
| 범위 | 단일 레코드 또는 필드 | 두 개의 완전한 데이터 세트 |
| 실행될 때 | 입장 시 또는 적재 중 | 로딩이 완료된 후 |
| 전형적인 오류 포착 | 형식이 잘못되었거나 범위를 벗어난 값입니다. | 누락, 중복 또는 일치하지 않는 레코드 |
두 방법이 서로 다른 오류를 포착하기 때문에 안정적인 마이그레이션을 위해서는 둘 중 하나를 선택하는 대신 둘 다 사용하는 것이 좋습니다.
데이터 조정이 중요한 이유는 무엇입니까?
데이터 마이그레이션 과정에서 지도에 오류가 발생할 가능성이 있습니다.ping 그리고 변환 로직. 네트워크 연결 끊김이나 트랜잭션 오류와 같은 런타임 오류는 데이터를 손상시킬 수 있습니다.
이러한 오류는 데이터가 유효하지 않은 상태로 남게 되는 결과를 초래할 수 있습니다. 이는 다음과 같은 다양한 문제를 야기할 수 있습니다.
- 누락된 레코드
- 결 측값
- 잘못된 값
- 중복된 기록
- 형식이 잘못된 값
- 테이블이나 시스템 전반에 걸쳐 끊어진 관계
다음은 데이터 조정 프로세스를 사용해야 하는 중요한 이유입니다.
- 데이터 조정 기능을 사용하면 다음과 같은 이점을 얻을 수 있습니다.trac원시 측정 데이터로부터 산업 공정 상태에 대한 정확하고 신뢰할 수 있는 정보를 제공합니다.
- 또한 가장 가능성이 높은 공정 작동을 나타내는 일관된 단일 데이터 세트를 생성하는 데 도움이 됩니다.
- 이것이 없으면 감지되지 않은 오류로 인해 부정확한 분석 결과가 나오고 고객 서비스에 문제가 발생합니다.
- 데이터 조정은 엔터프라이즈 제어 통합에도 중요합니다.
위에서 언급한 내용 외에도 데이터 일치에는 많은 장점과 이점이 있습니다.
데이터 조정과 관련된 용어
| 심각한 오류 | 측정의 심각한 오류. 짧은 시간 평균 기간만 사용하는 경우 바이어스 오류, 계측기 오류 또는 비정상적인 노이즈 스파이크만 반영됩니다. |
| 관찰 성 | 관찰성 분석을 통해 주어진 제약 조건과 측정값 집합에 대해 어떤 변수를 결정할 수 있는지에 대한 세부 정보를 얻을 수 있습니다. |
| 변화 | 분산은 센서의 변동성을 나타내는 척도입니다. |
| 여분 | 제약 조건 방정식을 사용하면 어떤 측정값을 다른 변수로부터 추정해야 하는지 판단하는 데 도움이 됩니다. |
데이터 조정의 역사
여기에 데이터 조정 역사의 중요한 랜드마크가 있습니다.
- DVR(데이터 검증 및 조정)은 1960년대 초에 시작되었습니다. 이는 모든 변수에 대한 원시 측정이 가능한 생산 시 자재 수지를 마감하는 것을 목표로 했습니다.
- 1960년대 후반에는 데이터 조정 과정에서 측정되지 않은 모든 변수가 고려되었습니다.
- 시간 경과에 따른 필터링 및 병렬 매개변수 추정을 위한 준정상 상태 역학은 1977년 Stanley와 Mah에 의해 도입되었습니다.
- Dynamic DVR은 1992년 Liebman이 발표한 비선형 최적화 모델로 개발되었습니다.
현대적인 실무 그룹은 세 가지 뚜렷한 조정 방식을 사용합니다.
데이터 조정 프로세스
데이터 조정 방법의 유형은 다음과 같습니다.
마스터 데이터 조정
마스터 데이터 조정은 소스와 타겟 간의 마스터 데이터만 조정하는 기술입니다. 마스터 데이터는 대부분 본질적으로 변하지 않거나 느리게 변하며, 데이터 세트에 대한 집계 작업은 수행되지 않습니다.
마스터 데이터 조정의 몇 가지 일반적인 예는 다음과 같습니다.
- 총 행 수
- 소스 및 대상의 총 고객
- 소스 및 대상의 총 항목 수
- 주어진 조건에 따른 총 행 수
- 활성 사용자 수
- 비활성 사용자 수 등
거래 데이터 조정
거래 데이터는 BI 보고서의 기반이 됩니다. 따라서 트랜잭션 데이터의 불일치는 보고서와 전체 BI 시스템의 신뢰성에 직접적인 영향을 미칠 수 있습니다.
트랜잭션 데이터 조정 방법은 적격 차원의 세분성 변경으로 인해 발생하는 불일치를 방지하는 총 합계 측면에서 사용됩니다.
거래 데이터 조정에 사용되는 조치의 예는 다음과 같습니다.
- 소스와 타겟에서 계산된 총 수입의 합계
- 판매된 모든 품목의 합계(출처 및 목표 등에서 계산)
자동화된 데이터 조정
대규모 데이터 웨어하우스 관리 시스템에서는 이를 데이터 로딩의 필수 부분으로 만들어 데이터 조정 프로세스를 자동화하는 것이 편리합니다. 이를 통해 별도의 로딩 메타데이터 테이블을 유지할 수 있습니다. 또한 자동화된 조정을 통해 모든 이해관계자에게 보고서의 유효성에 대한 정보를 지속적으로 제공합니다.
데이터 조정 사용의 모범 사례
- 데이터 조정 프로세스는 측정 오류를 수정하는 것을 목표로 해야 합니다.
- 데이터 조정 프로세스를 효율적으로 수행하려면 총 오류가 XNUMX이어야 합니다.
- 데이터 조정의 표준 접근 방식은 단순한 레코드 수 계산에 의존해 왔습니다. trac목표 레코드 수가 마이그레이션되었는지 여부에 대한 k 값입니다.
- 데이터 마이그레이션 솔루션은 유사한 조정 기능과 데이터 프로토타입을 제공합니다.ping 전체 용량의 데이터 일치성 테스트를 제공하는 기능입니다.
활동의 정확성
수치와 총계뿐만 아니라, 그 바탕이 되는 활동 자체도 검사에 견딜 수 있어야 합니다.
- 거래가 유효하고 목적이 올바른지 확인해야 합니다.
- 거래가 제대로 승인되었는지 확인해야 합니다.
데이터 조정 도구
1) 오픈리파인
OpenRefine은 이전에는 다음과 같이 알려져 있었습니다. Google Refine은 유용한 데이터베이스 조정 프레임워크입니다. 이를 통해 정리되지 않은 데이터를 정리하고 전송할 수 있습니다.
링크를 다운로드 : https://openrefine.org/
2) TIBCO
이 데이터 조정 도구는 서비스형 소프트웨어(SaaS) 형태로 웹에서 온디맨드 소프트웨어 서비스를 제공합니다. 사용자는 이 도구를 통해 데이터를 검증하고 정제할 수 있으며, 완벽한 조정 테스트 기능을 제공합니다. ETL 프로세스에서 널리 사용되는 이 기능은 원래 TIBCO Clarity라는 이름으로 판매되었으나 현재는 TIBCO 데이터 관리 포트폴리오에 포함되어 있습니다.
링크를 다운로드 : https://www.tibco.com/solutions/data-management
3) 윈퓨어
Winpure는 합리적인 가격에 정확한 데이터 정리를 제공하는 소프트웨어입니다. 대량의 데이터를 정리하여 중복을 제거하고, 오류를 수정하고, 표준화하여 최종 데이터 세트를 구성할 수 있습니다.
링크를 다운로드 : https://winpure.com/





