Какво представляват големите данни? Видове, характеристики и примери

⚡ Умно обобщение

Големите данни описват колекции от информация, които са толкова големи, толкова разнообразни и толкова бързо движещи се, че обикновените инструменти за бази данни не могат да ги съхраняват или обработват, поради което се наложиха разпределени платформи и нови методи за анализ.

  • 🔘 Определение: Само обемът не прави данните големи; сложността и темпът на растеж са също толкова важни.
  • ☑️ Три вида: Структурираните данни имат фиксиран формат, неструктурираните данни нямат такъв, а полуструктурираните данни се намират между тях.
  • Разработени примери: Фондовите борси, социалните платформи и реактивните двигатели произвеждат терабайти нови записи ежедневно.
  • 🧪 Характеристики: Обем, разнообразие, скорост и променливост са класическите четири, като често се добавят достоверност и стойност.
  • 🛠️ Бизнес стойност: Външно разузнаване, по-бърз анализ на обратната връзка от клиентите, по-ранно откриване на рискове и по-евтино разтоварване на склада.
  • ⚠️ Мащаб днес: Светът сега създава приблизително 402 милиона терабайта всеки ден. track за над 200 зетабайта през 2026 г.

Видовете и характеристиките на големите данни, обяснени с примери

Преди да преминете към въведение в Големите данни, първо трябва да знаете какво представляват самите данни.

Какво е данни?

Данните са количествата, знаците или символите, върху които се извършват операции от компютър, които могат да бъдат съхранявани и transmitпод формата на електрически сигнали и записани върху магнитни, оптични или механични носители на запис.

Сега нека разгледаме определението за Големи данни.

Какво е Big Data?

Голямо количество от данни Големите данни са сбор от данни с огромен обем, но нарастват експоненциално с времето. Това са данни с толкова голям размер и сложност, че никой от традиционните инструменти за управление на данни не може да ги съхранява или обработва ефективно. Големите данни все още са данни, но с размер, който превъзхожда обичайните инструменти.

Диаграмата по-долу сравнява това определение с обикновените данни, които организацията вече обработва, така че скокът в мащаба е лесен за виждане.

Диаграма, дефинираща големи данни и как те се различават от данните, обработвани от традиционните инструменти за управление

Какво е Big Data?

Какво е пример за големи данни?

Следват някои от примерите за големи данни -

Данни за фондовата борса

- New York Stock Exchange е пример за големи данни, които генерират около един терабайт нови търговски данни на ден.

Търговската площадка на фондовата борса генерира около един терабайт търговски данни на ден

Социална медия

Това показва статистиката 500+терабайта нови данни се поглъщат в базите данни на сайта на социалните медии Facebook, всеки ден. Тези данни се генерират главно по отношение на качване на снимки и видеоклипове, обмен на съобщения, поставяне на коментари и др.

Икони в социалните медии, илюстриращи дневния обем от снимки, видеоклипове и съобщения

Реактивни двигатели

Сингъл Реактивен двигател може да генерира 10+терабайта на данни в 30 минути на времето за полет. С много хиляди полети на ден генерирането на данни достига до много петабайти.

Сензори на реактивни двигатели, произвеждащи повече от десет терабайта телеметрия за тридесет минути полет

Тези три цифри са моментни данни за всеки източник от периода, когато примерите са публикувани за първи път, и оттогава те само са се увеличили. За да добиете представа за мащаба, светът като цяло сега създава приблизително 402 милиона терабайта данни всеки ден, като се добавя годишната сума за 2026 г. track за повече от 200 зетабайта.

Видове големи данни

Следват видовете Big Data:

  1. Структуриран
  2. Неструктуриран
  3. Полуструктуриран

Структуриран

Всякакви данни, които могат да се съхраняват, достъпват и обработват във фиксиран формат, се наричат ​​„структурирани“ данни. С течение на времето компютърните науки постигнаха голям успех в разработванетоping техники за работа с този вид данни, при които форматът е добре познат предварително, и за извличане на стойност от него. Сега обаче се сблъскваме с проблеми, когато размерът на такива данни нараства до огромна степен, като типичните размери достигат няколко зетабайта.

Знаеш ли? Един зетабайт е 1021 байта, кое е един милиард терабайта.

Като се погледнат тези цифри, човек лесно може да разбере защо е дадено името Големи данни и да си представи предизвикателствата, свързани с тяхното съхранение и обработка.

Знаеш ли? Данните, съхранявани в система за управление на релационни бази данни, са един пример за "структуриран" данни.

Примери за структурирани данни

Таблица „Служител“ в база данни е пример за структурирани данни. Всеки ред има едни и същи пет колони и всяка колона е с известен тип, което е точно това, което прави данните лесни за заявки.

Employee_ID Employee_Name Пол отдел Заплата_в_лак
2365 Раджеш Кулкарни Мъжки финанси 650000
3398 Пратиба Джоши Женски Admin 650000
7465 Шушил Рой Мъжки Admin 500000
7500 Шубходжит Дас Мъжки финанси 500000
7699 Прия Сане Женски финанси 550000

Неструктуриран

Всякакви данни с неизвестна форма или структура се класифицират като неструктурирани данни. Освен огромния си размер, неструктурираните данни представляват множество предизвикателства по отношение на обработката им за извличане на стойност. Типичен пример за неструктурирани данни е хетерогенен източник на данни, съдържащ комбинация от прости текстови файлове, изображения, видеоклипове и др. В днешно време организациите разполагат с огромно количество данни, но за съжаление не знаят как да извлекат стойност от тях, тъй като тези данни са в суров или неструктуриран формат.

Примери за неструктурирани данни

Изходът, върнат от 'Google „Търсене“ е неструктурирано: една и съща заявка връща страници, изображения, фрагменти и връзки без обща схема зад тях.

Google страница с резултати от търсенето като пример за неструктурирани данни със смесен текст, връзки и изображения

Пример за неструктурирани данни

Полуструктуриран

Полуструктурираните данни могат да съдържат и двете от горните форми. Те изглеждат структурирани, но не са дефинирани от формална схема, като например дефиниция на таблица в релационна... СУБДЧесто срещан пример за полуструктурирани данни са данните, представени в XML файл. JSON документи и лог редове с двойки ключ-стойност попадат в същата категория.

Примери за полуструктурирани данни

Лични данни, съхранявани в XML файл-

<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec>
<rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec>
<rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec>
<rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec>
<rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>

Растеж на данните през годините

Диаграмата по-долу tracкак се е променила комбинацията от структурирани и неструктурирани данни с увеличаването на общия обем.

Графика на растежа на данните през годините, показваща, че неструктурираните данни изпреварват структурираните данни

Ръстът на данните през годините

Имайте предвид, че уеб приложение Неструктурираните данни се състоят от лог файлове, файлове с история на транзакциите и др. OLTP системите са създадени да работят със структурирани данни, при които данните се съхраняват в релации (таблици).

Характеристики на големите данни

Големите данни могат да бъдат описани чрез следните характеристики:

  • Размер
  • разнообразие
  • Скорост
  • променливост

(i) Обем – Самото име „Големи данни“ е свързано с огромен размер. Размерът на данните играе много важна роля при определянето на стойността, която може да се извлече от тях. Също така, дали даден набор от данни може действително да се счита за „Големи данни“ или не, зависи от неговия обем. Следователно, 'Сила на звука' е една характеристика, която трябва да се вземе предвид при работа с решения за големи данни.

(ii) Разнообразие – Следващият аспект на Big Data е неговият разнообразие.

Разнообразието се отнася до хетерогенните източници и естеството на данните, както структурирани, така и неструктурирани. В миналото електронните таблици и базите данни бяха единствените източници на данни, разглеждани от повечето приложения. В днешно време данни под формата на имейли, снимки, видеоклипове, устройства за наблюдение, PDF файлове, аудио и др. също се разглеждат в приложенията за анализ. Това разнообразие от неструктурирани данни създава определени проблеми при съхранението, извличането и анализа на данни.

(iii) Скорост – Терминът "скорост" отнася се до скоростта на генериране на данни. Колко бързо се генерират и обработват данните, за да се отговори на търсенето, определя реалния потенциал на данните.

Скоростта на големите данни се отнася до скоростта, с която данните постъпват от източници като бизнес процеси, лог файлове на приложения, мрежи, сайтове за социални медии, сензори, Подвижен устройства и т.н. Потокът от данни е масивен и непрекъснат.

(iv) Променливост – Това се отнася до несъответствието, което понякога може да бъде показано от данните, като по този начин възпрепятства процеса на ефективно обработване и управление на данните.

Днес към този списък често се добавят още две характеристики, давайки широко цитираните „пет V“:

  • истинност – колко надеждни и точни са данните. Дублиращите се записи, отклонението на сензорите и липсващите полета намаляват достоверността и никакъв обем не може да компенсира това.
  • Стойност – каква е реалната стойност на данните след анализ. Данните, които никога не се превръщат в решение, само увеличават разходите за съхранение.

Предимства на обработката на големи данни

Възможността за обработка на големи данни в СУБД носи множество предимства, като например-

Бизнесът може да използва външна информация при вземане на решения

Достъп до социални данни от търсачки и сайтове като Facebook и X (бивш Twitter) позволяват на организациите да усъвършенстват своите бизнес стратегии.

Подобрено обслужване на клиенти

Традиционните системи за обратна връзка с клиентите се заменят от нови системи, проектирани с технологии за големи данни. В тези нови системи се използват технологии за обработка на големи данни и естествен език, за да се четат и оценяват отговорите на потребителите.

Ранно идентифициране на риска за продуктите и услугите

Непрекъснатият анализ на записи от транзакции, показания от сензори и заявки за поддръжка разкрива дефекти, модели на измами и повреди в услугите, докато те са все още малки, вместо да се чака месечен отчет, който да ги разкрие.

По-добре Operaционална ефективност

Технологиите за големи данни могат да се използват за създаване на зона за подготовка или зона за качване на нови данни, преди да се определи какво трябва да се премести в склад за данниОсвен това, подобна интеграция на технологиите за големи данни и хранилището за данни помага на организацията да се освободи от рядко използваните данни.

Въпроси и Отговори

Според текущите оценки, това е приблизително 402 милиона терабайта на ден, което поставя годишния общ обем за 2026 г. над 200 зетабайта. Цифрата продължава да се покачва, защото видеото, телеметрията на сензорите и регистрационните файлове на приложенията растат по-бързо от записите на транзакциите.

Algorithms намират модели в милиони записи, които никой анализатор не би могъл да прегледа на ръка, след което оценяват нови записи спрямо тези модели. По-големите и по-разнообразни обучителни набори обикновено подобряват точността, поради което двете области се обединиха.

Добре изготвя рутинна работа: Spark трансформации, дефиниции на схеми, SQL съединения и конфигурация на конектори. RevПрегледайте внимателно резултата, защото генерираните конвейери често игнорират разделянето, типовете данни и цената, което е мястото, където истинските конвейери се провалят.

Разпределено съхранение, като например HDFS или хранилища за облачни обекти, обработващи механизми като например Spark и Flink, стрийминг системи като Kafka и слоеве за заявки като КошерУправляваните облачни складове сега обхващат много от същите задачи.

Лошо качество на данните, неясна собственост, разходи за съхранение и изчисления, както и недостиг на инженери, които могат да работят с разпределени системи. Повечето неуспешни проекти се зациклят на неясни бизнес въпроси, а не на технологии.

Правила като GDPR ограничават какви лични данни могат да се събират, колко дълго могат да се съхраняват и къде могат да се съхраняват. Екипите отговарят със съгласие. tracкрал, политики за запазване, псевдонимизация и регистрационни файлове за одит, вградени в конвейера.

Езерото с данни съхранява сурови файлове от всякакъв формат и прилага структура, когато данните се четат. Хранилището съхранява почистени, моделирани таблици и прилага структура, когато данните се записват, което прави заявките по-бързи, но зареждането им по-бавно.

Първо SQL, след това език за програмиране, като например Python или Scala, разпределена обработка с Spark, облачна платформа и достатъчно моделиране на данни за разумно проектиране на таблици. Комуникацията е от голямо значение, защото резултатите трябва да убедят нетехническите читатели.

Обобщете тази публикация с: