빅데이터란 무엇인가? 유형, 특징 및 사례
⚡ 스마트 요약
빅 데이터는 규모가 너무 크고, 종류가 너무 다양하며, 변화 속도가 너무 빨라 일반적인 데이터베이스 도구로는 저장하거나 처리할 수 없는 정보의 집합체를 의미합니다. 이러한 이유로 분산 플랫폼과 새로운 분석 방법이 필요하게 되었습니다.
빅데이터 소개로 넘어가기 전에 먼저 데이터 자체가 무엇인지 알아야 합니다.
데이터 란?
데이터는 컴퓨터가 연산을 수행하는 데 사용하는 수량, 문자 또는 기호이며, 저장될 수 있습니다. transmit전기 신호 형태로 생성되어 자기, 광학 또는 기계적 기록 매체에 기록됩니다.
자, 그럼 빅데이터의 정의를 살펴보겠습니다.
빅 데이터 란 무엇입니까?
빅데이터 빅데이터는 방대한 양의 데이터를 의미하며, 시간이 지남에 따라 기하급수적으로 증가합니다. 그 규모와 복잡성 때문에 기존의 데이터 관리 도구로는 효율적으로 저장하거나 처리할 수 없습니다. 빅데이터는 여전히 데이터이지만, 일반적인 도구로는 처리할 수 없을 정도로 규모가 큰 데이터입니다.
아래 다이어그램은 해당 정의를 조직이 이미 처리하고 있는 일반적인 데이터와 비교하여 보여주므로 규모의 도약을 쉽게 확인할 수 있습니다.
빅 데이터 란 무엇입니까?
빅 데이터의 예는 무엇입니까?
다음은 몇 가지 빅데이터 사례입니다.
증권 거래소 데이터
The 뉴욕 증권 거래소 생성되는 빅데이터의 한 예입니다. XNUMX테라바이트 하루에 새로운 거래 데이터가 발생합니다.
소셜 미디어
통계에 따르면 500테라바이트 이상 의 새로운 데이터가 소셜 미디어 사이트의 데이터베이스에 수집됩니다. 수면 북, 매일. 이 데이터는 주로 사진 및 비디오 업로드, 메시지 교환, 댓글 달기 등의 측면에서 생성됩니다.
제트 엔진
하나의 제트 엔진 생성할 수 있습니다 10테라바이트 이상 데이터의 30 분 비행 시간의. 하루에 수천 번의 항공편으로 데이터 생성이 최대 페타바이트.
이 세 수치는 사례가 처음 발표된 시점의 자료 출처별 스냅샷이며, 이후로 계속 증가해 왔습니다. 현재 규모를 가늠해 보자면, 전 세계는 이제 대략 이 정도의 규모를 이루고 있습니다. 매일 4억 2백만 테라바이트의 데이터2026년 연간 총액을 다음과 같이 설정합니다. track는 200제타바이트 이상입니다.
빅데이터의 종류
빅데이터의 유형은 다음과 같습니다.
- 구조화 된
- 비정형
- 반구조화
구조화 된
고정된 형식으로 저장, 접근 및 처리할 수 있는 모든 데이터를 '구조화된 데이터'라고 합니다. 컴퓨터 과학은 오랜 시간에 걸쳐 구조화된 데이터 개발에 큰 성공을 거두었습니다.ping 데이터 형식이 사전에 잘 알려져 있는 이러한 유형의 데이터를 다루고 그로부터 가치를 도출하는 데에는 여러 기술이 있습니다. 그러나 이제 우리는 이러한 데이터의 크기가 수 제타바이트에 달하는 등 엄청나게 커지는 문제에 직면하고 있습니다.
당신은 알고 계십니까? 1제타바이트는 1021 바이트어느입니다 10억 테라바이트.
이러한 수치를 보면 빅데이터라는 이름이 왜 붙여졌는지 쉽게 이해할 수 있으며, 빅데이터의 저장 및 처리에 따르는 어려움을 짐작할 수 있습니다.
당신은 알고 계십니까? 관계형 데이터베이스 관리 시스템에 저장된 데이터가 그 예 중 하나입니다. '구조화' 데이터입니다.
구조화된 데이터의 예
데이터베이스의 '직원' 테이블은 구조화된 데이터의 예입니다. 모든 행은 동일한 다섯 개의 열을 가지고 있으며, 각 열은 데이터 유형이 명확하게 정의되어 있어 데이터를 쉽게 쿼리할 수 있습니다.
| 직원_ID | 직원_이름 | 성별 | 학과 | Salary_In_lacs |
|---|---|---|---|---|
| 2365 | 라제시 쿨카르니 | 남성 | 핀테크 | 650000 |
| 3398 | 프라 티바 조시 | 여성 | 관리자 | 650000 |
| 7465 | 슈실 로이 | 남성 | 관리자 | 500000 |
| 7500 | 슈부호짓 다스 | 남성 | 핀테크 | 500000 |
| 7699 | 프리야 사네 | 여성 | 핀테크 | 550000 |
비정형
형태나 구조가 알려지지 않은 모든 데이터는 비정형 데이터로 분류됩니다. 비정형 데이터는 규모가 방대할 뿐만 아니라, 가치를 추출하기 위해 처리하는 데 있어 여러 가지 어려움을 야기합니다. 비정형 데이터의 대표적인 예는 단순 텍스트 파일, 이미지, 비디오 등이 혼합된 이기종 데이터 소스입니다. 오늘날 기업들은 방대한 양의 데이터를 보유하고 있지만, 안타깝게도 이러한 데이터가 가공되지 않은 비정형 형태로 존재하기 때문에 그 안에서 가치를 추출하는 방법을 알지 못하는 경우가 많습니다.
비정형 데이터의 예시
'에서 반환된 출력Google '검색'은 비정형적입니다. 동일한 쿼리를 수행해도 공통된 스키마 없이 페이지, 이미지, 스니펫 및 링크가 반환됩니다.
비정형 데이터의 예
반구조화
반정형 데이터는 위의 두 가지 형태를 모두 포함할 수 있습니다. 겉보기에는 정형화된 것처럼 보이지만, 관계형 데이터베이스의 테이블 정의와 같은 공식적인 스키마로 정의되어 있지는 않습니다. DBMS반정형 데이터의 일반적인 예로는 XML 파일로 표현된 데이터가 있습니다. JSON 문서와 키-값 쌍으로 구성된 로그 라인도 같은 범주에 속합니다.
반정형 데이터의 예시
XML 파일에 저장된 개인 데이터 -
<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec> <rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec> <rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec> <rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec> <rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>
데이터 증가 추이 (수년간)
아래 차트 trac데이터 총량이 증가함에 따라 정형 데이터와 비정형 데이터의 비율이 어떻게 변화했는지 살펴봅니다.
데이터 증가 추이
참고하여 주시기 바랍니다 웹 애플리케이션 비정형 데이터는 로그 파일, 거래 내역 파일 등으로 구성됩니다. OLTP 시스템은 데이터가 관계형(테이블) 형태로 저장되는 정형 데이터를 처리하도록 설계되었습니다.
빅데이터의 특징
빅데이터는 다음과 같은 특징으로 설명할 수 있습니다.
- 음량
- 종류
- 속도
- 변동성
(i) 볼륨 – 빅데이터라는 이름 자체는 엄청난 규모와 관련이 있습니다. 데이터의 크기는 데이터에서 얻을 수 있는 가치를 결정하는 데 매우 중요한 역할을 합니다. 또한 특정 데이터 세트가 실제로 빅데이터로 간주될 수 있는지 여부는 그 양에 달려 있습니다. 따라서, '음량' 빅데이터 솔루션을 다룰 때 고려해야 할 특성 중 하나입니다.
(ii) 다양성 – 빅데이터의 다음 측면은 종류.
다양성은 데이터의 출처와 특성이 이질적이라는 것을 의미하며, 정형 데이터와 비정형 데이터를 모두 포함합니다. 과거에는 스프레드시트와 데이터베이스가 대부분의 애플리케이션에서 고려되는 유일한 데이터 소스였습니다. 그러나 오늘날에는 이메일, 사진, 비디오, 모니터링 장치, PDF, 오디오 등 다양한 형태의 데이터가 분석 애플리케이션에서 활용되고 있습니다. 이처럼 다양한 비정형 데이터는 데이터 저장, 마이닝 및 분석에 있어 여러 가지 문제점을 야기합니다.
(iii) 속도 - 용어 '속도' 데이터 생성 속도를 의미합니다. 수요를 충족하기 위해 데이터가 얼마나 빨리 생성되고 처리되는지가 데이터의 진정한 잠재력을 결정합니다.
빅데이터 속도는 비즈니스 프로세스, 애플리케이션 로그, 네트워크, 소셜 미디어 사이트, 센서 등과 같은 소스에서 데이터가 유입되는 속도를 의미합니다. 변하기 쉬운 데이터의 흐름은 방대하고 연속적입니다.
(iv) 가변성 - 이는 때때로 데이터에 의해 나타날 수 있는 불일치를 의미하며, 이로 인해 데이터를 효과적으로 처리하고 관리할 수 있는 프로세스를 방해합니다.
오늘날에는 그 목록에 두 가지 특징이 더 추가되어 널리 인용되는 "5V"가 되었습니다.
- 정확성 – 데이터의 신뢰성과 정확성. 중복 기록, 센서 오차, 누락된 필드는 모두 데이터의 정확성을 떨어뜨리며, 아무리 많은 데이터를 수집해도 이를 보완할 수는 없습니다.
- 가치관 분석 후 데이터의 실제 가치는 얼마인가. 의사 결정으로 이어지지 않는 데이터는 저장 비용만 증가시킬 뿐이다.
빅데이터 처리의 장점
DBMS에서 빅데이터를 처리할 수 있는 능력은 다음과 같은 여러 가지 이점을 제공합니다.
기업은 의사결정을 내릴 때 외부 정보를 활용할 수 있습니다.
소셜 데이터에 대한 액세스 검색 엔진 페이스북이나 X(이전 트위터)와 같은 사이트를 통해 조직은 비즈니스 전략을 세밀하게 조정할 수 있습니다.
향상된 고객 서비스
기존의 고객 피드백 시스템은 빅데이터 기술을 활용한 새로운 시스템으로 대체되고 있습니다. 이러한 새로운 시스템에서는 빅데이터와 자연어 처리 기술을 사용하여 소비자의 반응을 분석하고 평가합니다.
제품 및 서비스에 대한 위험의 조기 식별
거래 기록, 센서 판독값 및 지원 티켓에 대한 지속적인 분석을 통해 월간 보고서가 나올 때까지 기다리지 않고 결함, 사기 패턴 및 서비스 오류를 초기 단계에서 파악할 수 있습니다.
더 나은 Opera국가 효율성
빅데이터 기술은 어떤 데이터를 최종 저장소로 옮겨야 할지 판단하기 전에 새로운 데이터를 저장할 임시 영역 또는 랜딩 존을 만드는 데 사용할 수 있습니다. 데이터웨어 하우스또한, 빅데이터 기술과 데이터 웨어하우스를 통합하면 조직이 자주 접근하지 않는 데이터를 효율적으로 관리할 수 있습니다.






