Какво представляват големите данни? Видове, характеристики и примери
⚡ Умно обобщение
Големите данни описват колекции от информация, които са толкова големи, толкова разнообразни и толкова бързо движещи се, че обикновените инструменти за бази данни не могат да ги съхраняват или обработват, поради което се наложиха разпределени платформи и нови методи за анализ.
Преди да преминете към въведение в Големите данни, първо трябва да знаете какво представляват самите данни.
Какво е данни?
Данните са количествата, знаците или символите, върху които се извършват операции от компютър, които могат да бъдат съхранявани и transmitпод формата на електрически сигнали и записани върху магнитни, оптични или механични носители на запис.
Сега нека разгледаме определението за Големи данни.
Какво е Big Data?
Голямо количество от данни Големите данни са сбор от данни с огромен обем, но нарастват експоненциално с времето. Това са данни с толкова голям размер и сложност, че никой от традиционните инструменти за управление на данни не може да ги съхранява или обработва ефективно. Големите данни все още са данни, но с размер, който превъзхожда обичайните инструменти.
Диаграмата по-долу сравнява това определение с обикновените данни, които организацията вече обработва, така че скокът в мащаба е лесен за виждане.
Какво е Big Data?
Какво е пример за големи данни?
Следват някои от примерите за големи данни -
Данни за фондовата борса
- New York Stock Exchange е пример за големи данни, които генерират около един терабайт нови търговски данни на ден.
Социална медия
Това показва статистиката 500+терабайта нови данни се поглъщат в базите данни на сайта на социалните медии Facebook, всеки ден. Тези данни се генерират главно по отношение на качване на снимки и видеоклипове, обмен на съобщения, поставяне на коментари и др.
Реактивни двигатели
Сингъл Реактивен двигател може да генерира 10+терабайта на данни в 30 минути на времето за полет. С много хиляди полети на ден генерирането на данни достига до много петабайти.
Тези три цифри са моментни данни за всеки източник от периода, когато примерите са публикувани за първи път, и оттогава те само са се увеличили. За да добиете представа за мащаба, светът като цяло сега създава приблизително 402 милиона терабайта данни всеки ден, като се добавя годишната сума за 2026 г. track за повече от 200 зетабайта.
Видове големи данни
Следват видовете Big Data:
- Структуриран
- Неструктуриран
- Полуструктуриран
Структуриран
Всякакви данни, които могат да се съхраняват, достъпват и обработват във фиксиран формат, се наричат „структурирани“ данни. С течение на времето компютърните науки постигнаха голям успех в разработванетоping техники за работа с този вид данни, при които форматът е добре познат предварително, и за извличане на стойност от него. Сега обаче се сблъскваме с проблеми, когато размерът на такива данни нараства до огромна степен, като типичните размери достигат няколко зетабайта.
Знаеш ли? Един зетабайт е 1021 байта, кое е един милиард терабайта.
Като се погледнат тези цифри, човек лесно може да разбере защо е дадено името Големи данни и да си представи предизвикателствата, свързани с тяхното съхранение и обработка.
Знаеш ли? Данните, съхранявани в система за управление на релационни бази данни, са един пример за "структуриран" данни.
Примери за структурирани данни
Таблица „Служител“ в база данни е пример за структурирани данни. Всеки ред има едни и същи пет колони и всяка колона е с известен тип, което е точно това, което прави данните лесни за заявки.
| Employee_ID | Employee_Name | Пол | отдел | Заплата_в_лак |
|---|---|---|---|---|
| 2365 | Раджеш Кулкарни | Мъжки | финанси | 650000 |
| 3398 | Пратиба Джоши | Женски | Admin | 650000 |
| 7465 | Шушил Рой | Мъжки | Admin | 500000 |
| 7500 | Шубходжит Дас | Мъжки | финанси | 500000 |
| 7699 | Прия Сане | Женски | финанси | 550000 |
Неструктуриран
Всякакви данни с неизвестна форма или структура се класифицират като неструктурирани данни. Освен огромния си размер, неструктурираните данни представляват множество предизвикателства по отношение на обработката им за извличане на стойност. Типичен пример за неструктурирани данни е хетерогенен източник на данни, съдържащ комбинация от прости текстови файлове, изображения, видеоклипове и др. В днешно време организациите разполагат с огромно количество данни, но за съжаление не знаят как да извлекат стойност от тях, тъй като тези данни са в суров или неструктуриран формат.
Примери за неструктурирани данни
Изходът, върнат от 'Google „Търсене“ е неструктурирано: една и съща заявка връща страници, изображения, фрагменти и връзки без обща схема зад тях.
Пример за неструктурирани данни
Полуструктуриран
Полуструктурираните данни могат да съдържат и двете от горните форми. Те изглеждат структурирани, но не са дефинирани от формална схема, като например дефиниция на таблица в релационна... СУБДЧесто срещан пример за полуструктурирани данни са данните, представени в XML файл. JSON документи и лог редове с двойки ключ-стойност попадат в същата категория.
Примери за полуструктурирани данни
Лични данни, съхранявани в XML файл-
<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec> <rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec> <rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec> <rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec> <rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>
Растеж на данните през годините
Диаграмата по-долу tracкак се е променила комбинацията от структурирани и неструктурирани данни с увеличаването на общия обем.
Ръстът на данните през годините
Имайте предвид, че уеб приложение Неструктурираните данни се състоят от лог файлове, файлове с история на транзакциите и др. OLTP системите са създадени да работят със структурирани данни, при които данните се съхраняват в релации (таблици).
Характеристики на големите данни
Големите данни могат да бъдат описани чрез следните характеристики:
- Размер
- разнообразие
- Скорост
- променливост
(i) Обем – Самото име „Големи данни“ е свързано с огромен размер. Размерът на данните играе много важна роля при определянето на стойността, която може да се извлече от тях. Също така, дали даден набор от данни може действително да се счита за „Големи данни“ или не, зависи от неговия обем. Следователно, 'Сила на звука' е една характеристика, която трябва да се вземе предвид при работа с решения за големи данни.
(ii) Разнообразие – Следващият аспект на Big Data е неговият разнообразие.
Разнообразието се отнася до хетерогенните източници и естеството на данните, както структурирани, така и неструктурирани. В миналото електронните таблици и базите данни бяха единствените източници на данни, разглеждани от повечето приложения. В днешно време данни под формата на имейли, снимки, видеоклипове, устройства за наблюдение, PDF файлове, аудио и др. също се разглеждат в приложенията за анализ. Това разнообразие от неструктурирани данни създава определени проблеми при съхранението, извличането и анализа на данни.
(iii) Скорост – Терминът "скорост" отнася се до скоростта на генериране на данни. Колко бързо се генерират и обработват данните, за да се отговори на търсенето, определя реалния потенциал на данните.
Скоростта на големите данни се отнася до скоростта, с която данните постъпват от източници като бизнес процеси, лог файлове на приложения, мрежи, сайтове за социални медии, сензори, Подвижен устройства и т.н. Потокът от данни е масивен и непрекъснат.
(iv) Променливост – Това се отнася до несъответствието, което понякога може да бъде показано от данните, като по този начин възпрепятства процеса на ефективно обработване и управление на данните.
Днес към този списък често се добавят още две характеристики, давайки широко цитираните „пет V“:
- истинност – колко надеждни и точни са данните. Дублиращите се записи, отклонението на сензорите и липсващите полета намаляват достоверността и никакъв обем не може да компенсира това.
- Стойност – каква е реалната стойност на данните след анализ. Данните, които никога не се превръщат в решение, само увеличават разходите за съхранение.
Предимства на обработката на големи данни
Възможността за обработка на големи данни в СУБД носи множество предимства, като например-
Бизнесът може да използва външна информация при вземане на решения
Достъп до социални данни от търсачки и сайтове като Facebook и X (бивш Twitter) позволяват на организациите да усъвършенстват своите бизнес стратегии.
Подобрено обслужване на клиенти
Традиционните системи за обратна връзка с клиентите се заменят от нови системи, проектирани с технологии за големи данни. В тези нови системи се използват технологии за обработка на големи данни и естествен език, за да се четат и оценяват отговорите на потребителите.
Ранно идентифициране на риска за продуктите и услугите
Непрекъснатият анализ на записи от транзакции, показания от сензори и заявки за поддръжка разкрива дефекти, модели на измами и повреди в услугите, докато те са все още малки, вместо да се чака месечен отчет, който да ги разкрие.
По-добре Operaционална ефективност
Технологиите за големи данни могат да се използват за създаване на зона за подготовка или зона за качване на нови данни, преди да се определи какво трябва да се премести в склад за данниОсвен това, подобна интеграция на технологиите за големи данни и хранилището за данни помага на организацията да се освободи от рядко използваните данни.






