Що таке великі дані? Типи, характеристики та приклади

⚡ Розумний підсумок

Великі дані описують настільки великі, різноманітні та швидкозмінні колекції інформації, що звичайні інструменти для роботи з базами даних не можуть їх зберігати чи обробляти, саме тому стали необхідними розподілені платформи та нові методи аналізу.

  • 🔘 Визначення: Сам по собі обсяг не робить дані великими; складність і темпи зростання мають не менш значення.
  • ☑️ Три типи: Структуровані дані мають фіксований формат, неструктуровані дані його не мають, а напівструктуровані дані знаходяться між ними.
  • Приклади виконаних робіт: Фондові біржі, соціальні платформи та реактивні двигуни щодня створюють терабайти нових записів.
  • 🧪 Характеристики: Обсяг, різноманітність, швидкість та мінливість – це класичні чотири принципи, до яких часто додаються правдивість та цінність.
  • 🛠️ Ділова цінність: Зовнішня аналітика, швидший аналіз відгуків клієнтів, раніше виявлення ризиків та дешевше розвантаження складу.
  • ⚠️ Масштаб сьогодні: Зараз у світі щодня створюється приблизно 402 мільйони терабайтів даних. track для понад 200 зеттабайтів у 2026 році.

Типи та характеристики великих даних, пояснені на прикладах

Перш ніж перейти до вступу до великих даних, вам спочатку потрібно знати, що таке самі дані.

Що таке дані?

Дані – це величини, символи або символи, над якими виконує операції комп’ютер, які можуть зберігатися та transmitпередані у вигляді електричних сигналів та записані на магнітних, оптичних або механічних носіях запису.

Тепер давайте розглянемо визначення Великих даних.

Що таке великі дані?

Великий даних – це величезний обсяг даних, який з часом зростає експоненціально. Це дані такого великого розміру та складності, що жоден із традиційних інструментів управління даними не може їх ефективно зберігати чи обробляти. Великі дані – це все ще дані, але такого розміру, що перевершує можливості звичайних інструментів.

На діаграмі нижче це визначення порівнюється зі звичайними даними, які організація вже обробляє, тому стрибок у масштабі легко побачити.

Діаграма, що визначає великі дані та їх відмінності від даних, що обробляються традиційними інструментами управління

Що таке великі дані?

Що таке приклад великих даних?

Нижче наведено деякі приклади великих даних.

Дані фондової біржі

Команда New York Stock Exchange є прикладом великих даних, які генерують приблизно один терабайт нових торгових даних на день.

Торговий майданчик фондової біржі генерує близько одного терабайта торгових даних на день

Соціальні мережі

Про це свідчить статистика 500 + терабайт нових даних потрапляє в бази даних сайту соціальних мереж Facebook, кожен день. Ці дані в основному генеруються під час завантаження фотографій і відео, обміну повідомленнями, розміщення коментарів тощо.

Іконки соціальних мереж, що ілюструють щоденний обсяг фото, відео та повідомлень

Реактивні двигуни

Одинокий Реактивний двигун може генерувати 10 + терабайт даних в 30 хвилин часу польоту. З багатьма тисячами рейсів на день генерація даних досягає багатьох Петабайти.

Датчики реактивного двигуна виробляють понад десять терабайтів телеметрії за тридцять хвилин польоту

Ці три цифри є знімками для кожного джерела з періоду, коли приклади були вперше опубліковані, і з того часу вони лише зросли. Для поточного відчуття масштабу, світ в цілому зараз створює приблизно 402 мільйони терабайтів даних щодня, враховуючи підсумок за 2026 рік track для понад 200 зеттабайтів.

Типи великих даних

Нижче наведено типи великих даних:

  1. Структурований
  2. Неструктурований
  3. Напівструктурований

Структурований

Будь-які дані, які можна зберігати, отримувати до них доступ та обробляти у фіксованому форматі, називаються «структурованими» даними. З часом інформатика досягла великих успіхів у розвиткуping методи роботи з такими даними, де формат добре відомий заздалегідь, та отримання з нього цінності. Однак зараз ми стикаємося з проблемами, коли розмір таких даних зростає до величезних розмірів, типові розміри яких сягають кількох зеттабайтів.

Чи знаєте ви? Один зеттабайт — це 1021 bytes, Яка є один мільярд терабайт.

Дивлячись на ці цифри, легко зрозуміти, чому дається назва «великі дані», та уявити собі труднощі, пов’язані з їх зберіганням та обробкою.

Чи знаєте ви? Дані, що зберігаються в реляційній системі керування базами даних, є одним із прикладів "структурований" дані.

Приклади структурованих даних

Таблиця «Співробітник» у базі даних є прикладом структурованих даних. Кожен рядок має однакові п’ять стовпців, а кожен стовпець має відомий тип, що саме полегшує запити до даних.

Employee_ID Ім'я працівника Стать відділ Зарплата_в_лаках
2365 Раджеш Кулкарні чоловік Фінансові установи 650000
3398 Пратібха Джоші жінка Адміністратор 650000
7465 Шушіл Рой чоловік Адміністратор 500000
7500 Шубходжит Дас чоловік Фінансові установи 500000
7699 Прія Сане жінка Фінансові установи 550000

Неструктурований

Будь-які дані з невідомою формою або структурою класифікуються як неструктуровані дані. Окрім величезного розміру, неструктуровані дані створюють численні труднощі з точки зору їх обробки для отримання цінності. Типовим прикладом неструктурованих даних є гетерогенне джерело даних, що містить комбінацію простих текстових файлів, зображень, відео тощо. Сьогодні організації мають величезну кількість даних, але, на жаль, вони не знають, як отримати з них цінність, оскільки ці дані знаходяться в необробленому або неструктурованому форматі.

Приклади неструктурованих даних

Вивід, що повертається функцією 'Google Пошук неструктурований: той самий запит повертає сторінки, зображення, фрагменти та посилання без спільної схеми.

Google сторінка результатів пошуку як приклад неструктурованих даних зі змішаним текстом, посиланнями та зображеннями

Приклад неструктурованих даних

Напівструктурований

Напівструктуровані дані можуть містити обидві вищезазначені форми. Вони виглядають структурованими, але не визначені формальною схемою, такою як визначення таблиці в реляційному СУБДТиповим прикладом напівструктурованих даних є дані, представлені у XML-файлі. JSON-документи та рядки журналу з парами ключ-значення належать до тієї ж категорії.

Приклади напівструктурованих даних

Особисті дані, що зберігаються у файлі XML-

<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec>
<rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec>
<rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec>
<rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec>
<rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>

Зростання обсягу даних протягом багатьох років

Діаграма нижче tracпокаже, як змінилося співвідношення структурованих та неструктурованих даних зі зростанням загального обсягу.

Діаграма зростання обсягів даних протягом багатьох років, яка показує, що обсяг неструктурованих даних випереджає обсяг структурованих даних

Зростання обсягу даних протягом багатьох років

Зверніть увагу, що веб-застосунком Неструктуровані дані складаються з файлів журналів, файлів історії транзакцій тощо. OLTP-системи створені для роботи зі структурованими даними, де дані зберігаються у відношеннях (таблицях).

Характеристики великих даних

Великі дані можна описати такими характеристиками:

  • Об'єм
  • Різноманітність
  • Швидкість
  • Змінність

(i) Обсяг – Сама назва «Великі дані» пов’язана з величезним розміром. Розмір даних відіграє дуже важливу роль у визначенні цінності, яку можна з них отримати. Також те, чи можна вважати певний набір даних великими даними, залежить від його обсягу. Отже, 'Об'єм' це одна з характеристик, яку необхідно враховувати під час роботи з рішеннями для великих даних.

(ii) Різноманітність – Наступним аспектом Big Data є його різноманітність.

Різноманітність стосується неоднорідних джерел та характеру даних, як структурованих, так і неструктурованих. Раніше електронні таблиці та бази даних були єдиними джерелами даних, що враховувалися більшістю програм. Сьогодні дані у вигляді електронних листів, фотографій, відео, пристроїв моніторингу, PDF-файлів, аудіо тощо також враховуються в аналітичних програмах. Така різноманітність неструктурованих даних створює певні проблеми для зберігання, аналізу та аналізу даних.

(iii) Швидкість – Термін "швидкість" стосується швидкості генерації даних. Те, наскільки швидко дані генеруються та обробляються для задоволення попиту, визначає реальний потенціал даних.

Швидкість великих даних стосується швидкості, з якою дані надходять з таких джерел, як бізнес-процеси, журнали програм, мережі, сайти соціальних мереж, датчики, мобільний пристрої тощо. Потік даних є масивним і безперервним.

(iv) Мінливість – Це стосується неузгодженості, яку іноді можуть демонструвати дані, що перешкоджає процесу ефективної обробки та керування даними.

Сьогодні до цього списку зазвичай додають ще дві характеристики, що дає широко цитовані «п’ять V»:

  • Правда – наскільки достовірними та точними є дані. Дублікати записів, дрейф датчиків та відсутні поля знижують достовірність, і жодний обсяг цього не компенсує.
  • значення – яку фактичну цінність мають дані після аналізу. Дані, які ніколи не перетворюються на рішення, лише збільшують вартість зберігання.

Переваги обробки великих даних

Здатність обробляти великі дані в СУБД має численні переваги, такі як:

Бізнес може використовувати зовнішню розвідку під час прийняття рішень

Доступ до соціальних даних від пошукові системи а такі сайти, як Facebook та X (раніше Twitter), дозволяють організаціям удосконалювати свої бізнес-стратегії.

Покращене обслуговування клієнтів

Традиційні системи зворотного зв'язку з клієнтами замінюються новими системами, розробленими з використанням технологій великих даних. У цих нових системах великі дані та технології обробки природної мови використовуються для зчитування та оцінки відповідей споживачів.

Раннє виявлення ризиків для продуктів та послуг

Безперервний аналіз записів транзакцій, показників датчиків та заявок на підтримку виявляє дефекти, схеми шахрайства та збої в обслуговуванні, поки вони ще незначні, замість того, щоб чекати на щомісячний звіт, який їх виявить.

Краще Operaційна ефективність

Технології великих даних можна використовувати для створення проміжної зони або зони вивантаження нових даних, перш ніж визначити, що слід перемістити до сховище данихКрім того, така інтеграція технологій великих даних та сховища даних допомагає організації розвантажити дані, до яких рідко звертаються.

Поширені запитання

За поточними оцінками, це приблизно 402 мільйони терабайтів на день, що перевищує річний показник у 2026 році у понад 200 зеттабайтів. Ця цифра продовжує зростати, оскільки відео, телеметрія датчиків та журнали додатків зростають швидше, ніж записи транзакцій.

Algorithms знаходити закономірності серед мільйонів записів, які жоден аналітик не міг би переглянути вручну, а потім оцінювати нові записи за цими закономірностями. Більші, різноманітніші навчальні набори зазвичай підвищують точність, саме тому ці дві галузі об'єдналися.

Він добре оформлює рутинну роботу: Spark перетворення, визначення схем, SQL-з'єднання та конфігурація конекторів. RevУважно перегляньте вихідні дані, оскільки згенеровані конвеєри часто ігнорують розділення, типи даних та вартість, саме тут реальні конвеєри зазнають невдачі.

Розподілене сховище, таке як HDFS або хмарні сховища об'єктів, механізми обробки, такі як Spark та Flink, потокові системи, такі як Kafka, та рівні запитів, такі як ВуликКеровані хмарні сховища тепер охоплюють багато тих самих завдань.

Низька якість даних, нечіткі питання власності, вартість зберігання та обчислень, а також нестача інженерів, які можуть керувати розподіленими системами. Більшість невдалих проектів зупиняються через управління та нечіткі бізнес-питання, а не через технології.

Такі правила, як GDPR, обмежують, які персональні дані можна збирати, як довго вони можуть зберігатися та де вони можуть зберігатися. Команди відповідають згодою. tracкороль, політики зберігання, псевдонімізація та журнали аудиту, вбудовані в конвеєр.

Озеро даних зберігає необроблені файли будь-якого формату та застосовує структуру під час зчитування даних. Сховище даних зберігає очищені, змодельовані таблиці та застосовує структуру під час запису даних, що пришвидшує виконання запитів, але уповільнює завантаження.

Спочатку SQL, потім мова програмування, така як Python або Scala, розподілена обробка з Spark, хмарна платформа та достатнє моделювання даних для розумного проектування таблиць. Комунікація не менш важлива, оскільки результати мають переконати читачів, які не мають технічних знань.

Підсумуйте цей пост за допомогою: