Урок за извличане на данни: Какво е извличане на данни? Техники, Процес

⚡ Умно обобщение

Извличането на данни е процесът на намиране на потенциално полезни модели в големи масиви от данни. Тази страница обяснява шестфазния процес на внедряване, седемте основни техники, инструментите, които ги поддържат, реални бизнес примери, както и предимствата и ограниченията на всеки подход.

  • 🔍 Определение: Извличането на данни използва машинно обучение, статистика и изкуствен интелект, за да...tracскрити връзки от големи масиви от данни.
  • 🗂️ Източници на данни: Релационните бази данни, хранилищата за данни, транзакционните, пространствените, мултимедийните и текстовите хранилища поддържат извличане на информация.
  • 🔄 Процес на внедряване: Разбиране на бизнеса, разбиране на данните, подготовка на данни, моделиране, оценка и внедряване.
  • 🧩 Основни техники: Класификация, клъстеризация, регресия, правила за асоцииране, откриване на отклонения, последователни модели и прогнозиране.
  • 🛠️ Инструменти: R и Oracle Машинното обучение предоставя статистически изчисления и прогнозно моделиране в база данни.
  • 🏢 Приложения: Банковото дело, търговията на дребно, застраховането, образованието, производството и разследването на престъпления прилагат копаене в ежедневните си решения.
  • ⚠️ Ограничения: Прекаленото обучение, недостигът на умения и опасенията за поверителност ограничават до каква степен резултатите могат да бъдат надеждни.

Какво е извличане на данни, техники и процеси

Какво е Data Mining?

Data Mining е процес на намиране на потенциално полезни модели от огромни набори от данни. Това е мултидисциплинарно умение, което използва машинно обучение, статистика и изкуствен интелект към extracинформация за оценка на вероятността от бъдещи събития. Прозренията, получени от извличането на данни, се използват за маркетинг, откриване на измами, научни открития и др.

Извличането на данни е свързано с откриването на скрити, неподозирани и неизвестни досега, но валидни връзки между данните. Извличането на данни се нарича още „Откриване на знания в данни“ (KDD), „Откриване на знания в данни“ (Knowledge Discovery in Data, Knowledge ex).tracция, анализ на данни/модели, събиране на информация и др.

Видове данни

Извличането на данни може да се извърши върху следните типове данни

  • Релационни бази данни
  • Складове за данни
  • Разширена база данни и информационни хранилища
  • Обектно-ориентирани и обектно-релационни бази данни
  • Транзакционни и пространствени бази данни
  • Хетерогенни и наследени бази данни
  • База данни за мултимедия и стрийминг
  • Текстови бази данни
  • Копаене на текст и уеб копаене

Какъвто и да е източникът, същата дисциплинирана последователност от фази превръща тези сурови данни в използваем модел.

Процес на внедряване на Data Mining

Процес на внедряване на Data Mining
Процес на внедряване на Data Mining

Нека проучим подробно процеса на внедряване на Data Mining

Бизнес разбиране

В тази фаза се установяват бизнес целите и целите за извличане на данни.

  • Първо, трябва да разберете целите на бизнеса и клиента. Трябва да определите какво иска вашият клиент (което много пъти дори самите те не знаят)
  • Направете преглед на текущия сценарий за извличане на данни. Вземете предвид ресурсите, предположенията, ограниченията и други значими фактори във вашата оценка.
  • Като използвате бизнес цели и текущия сценарий, определете вашите цели за извличане на данни.
  • Добрият план за извличане на данни е много подробен и трябва да бъде разработен, за да постигне както бизнес целите, така и целите за извличане на данни.

Разбиране на данните

В тази фаза се извършва проверка за надеждност на данните, за да се определи дали те са подходящи за целите на извличането на данни.

  • Първо, данните се събират от множество източници на данни, налични в организацията.
  • Тези източници на данни могат да включват множество бази данни, плоски файлове или кубове с данни. По време на процеса на интегриране на данни могат да възникнат проблеми като съвпадение на обекти и интеграция на схеми. Това е доста сложен и труден процес, тъй като е малко вероятно данните от различни източници да съвпадат лесно. Например, таблица А съдържа обект с име cust_no, докато друга таблица Б съдържа обект с име cust-id.
  • Следователно е доста трудно да се гарантира, че и двата дадени обекта се отнасят до една и съща стойност или не. Тук метаданните трябва да се използват за намаляване на грешките в процеса на интегриране на данни.
  • Следващата стъпка е търсене на свойства на придобитите данни. Добър начин за изследване на данните е да отговорите на въпросите за извличане на информация (решени в бизнес фаза) с помощта на инструментите за заявка, отчитане и визуализация.
  • Въз основа на резултатите от запитването, качеството на данните трябва да се установи. Липсващите данни, ако има такива, трябва да се придобият.

Подготовка на данни

В тази фаза данните са готови за производство.

Подготовката на данните обикновено е най-дългата фаза, като обикновено се цитира, че представлява 60% до 80% от общите усилия.

Данните от различни източници трябва да бъдат подбрани, почистени, трансформирани, форматирани, анонимизирани и конструирани (ако е необходимо).

Почистването на данни е процес за „почистване“ на данните чрез изглаждане на шумни данни и попълване на липсващи стойности.

Например, за клиентски демографски профил липсват данни за възрастта. Данните са непълни и трябва да се попълнят. В някои случаи може да има отклонения в данните. Например възрастта има стойност 300. Данните може да са непоследователни. Например името на клиента е различно в различните таблици.

Операциите за трансформация на данни променят данните, за да ги направят полезни при извличане на данни. Могат да се приложат следните трансформации.

Преобразуване на данни

Операциите за преобразуване на данни ще допринесат за успеха на процеса на копаене.

Изглаждане: Помага за премахване на шума от данните.

агрегиране: Към данните се прилагат операции за обобщаване или агрегиране. Т.е. седмичните данни за продажбите се обобщават, за да се изчисли общата месечна и годишна сума.

Обобщение: В тази стъпка данните от ниско ниво се заменят с понятия от по-високо ниво с помощта на йерархии от понятия. Например, градът се заменя с щата или държавата.

Нормализация: Нормализация, извършвана при увеличаване или намаляване на мащаба на данните за атрибутите. Пример: Данните трябва да попадат в диапазона от -2.0 до 2.0 след нормализация.

Конструкция на атрибути: тези атрибути са конструирани и включват дадения набор от атрибути, полезни за извличане на данни.

Резултатът от този процес е окончателен набор от данни, който може да се използва при моделиране.

Моделиране

В тази фаза се използват математически модели за определяне на модели на данни.

  • Въз основа на бизнес целите трябва да се изберат подходящи техники за моделиране за подготвения набор от данни.
  • Създайте сценарий за проверка на качеството и валидността на модела.
  • Стартирайте модела върху подготвения набор от данни.
  • Резултатите трябва да бъдат оценени от всички заинтересовани страни, за да се гарантира, че моделът може да изпълни целите за извличане на данни.

Оценка

В тази фаза идентифицираните модели се оценяват спрямо бизнес целите.

  • Резултатите, генерирани от модела за извличане на данни, трябва да бъдат оценени спрямо бизнес целите.
  • Получаването на разбиране за бизнеса е итеративен процес. Всъщност, докато се разбира, може да се повишат нови бизнес изисквания поради извличането на данни.
  • За преместване на модела във фазата на внедряване се взема решение за стартиране или отказ.

внедряване

Във фазата на внедряване вие ​​изпращате вашите открития за извличане на данни към ежедневните бизнес операции.

  • Знанията или информацията, открити по време на процеса на извличане на данни, трябва да бъдат лесни за разбиране от нетехнически заинтересовани страни.
  • Подробен план за разполагане на корабаping, поддръжка и наблюдение на откритията за извличане на данни е създаден.
  • Създава се окончателен доклад за проекта с извлечените уроци и ключови преживявания по време на проекта. Това помага за подобряване на бизнес политиката на организацията.

Фазата на моделиране, описана по-горе, се основава на определен набор от техники, всяка от които е подходяща за различен вид въпроси.

Техники за извличане на данни

1. Класификация

Този анализ се използва за извличане на важна и подходяща информация за данни и метаданни. Този метод за извличане на данни помага да се класифицират данните в различни класове.

2. ClusterING

Clusterанализът е техника за извличане на данни за идентифициране на данни, които си приличат. Този процес помага да се разберат разликите и приликите между данните.

3. Регресия

Регресионният анализ е методът за извличане на данни за идентифициране и анализиране на връзката между променливите. Използва се за идентифициране на вероятността за конкретна променлива, предвид наличието на други променливи.

4. Правила на асоциирането

Тази техника за извличане на данни помага да се намери връзката между два или повече елемента. Той открива скрит модел в набора от данни.

5. Откриване на отклонения

Този тип техника за извличане на данни се отнася до наблюдение на елементи от данни в набора от данни, които не съответстват на очакван модел или очаквано поведение. Тази техника може да се използва в различни области, като например откриване на проникване, откриване на измами или грешки и др. Откриването на отклонения се нарича още анализ на отклонения или извличане на отклонения.

6. Последователни модели

Тази техника за извличане на данни помага да се открият или идентифицират подобни модели или тенденции в данните за транзакциите за определен период.

7. Прогноза

Прогнозата използва комбинация от други техники за извличане на данни като тенденции, последователни модели, групиране, класификация и т.н. Анализира минали събития или случаи в правилна последователност за прогнозиране на бъдещо събитие.

Descriptive срещу Predictive Data Mining

Седемте техники по-горе се разделят на две семейства и познаването на това към кое семейство принадлежи даден въпрос определя как трябва да се тълкува резултатът.

Descriptизвличане на данни от ive обобщава какво вече се е случило. Търси структура в съществуващите данни, без да има цел, към която да се стреми, поради което понякога се нарича без надзор. ClusterТук принадлежат правилата за асоцииране и последователните модели. Супермаркетът, който научава, че пелените и бирата често се купуват заедно, е описателно откритие: то обяснява миналото и човек решава какво да прави по въпроса.

Прогнозно извличане на данни оценява какво ще се случи след това. Учи се от исторически записи, където отговорът вече е известен, след което прилага това обучение към нови записи, поради което се нарича контролирано. Тук принадлежат класификация, регресия и прогнозиране. Оценяването на кандидат за кредит като вероятно или малко вероятно да изпадне в неизпълнение е предсказващ резултат.

От това разграничение следват две практически последици.

  • Валидирането се различава: Предсказващият модел може да бъде оценен за точност спрямо известни резултати. Описателен резултат не може, така че се преценява дали е интересен и приложим на практика.
  • Изискванията за данни се различават: Прогнозната работа се нуждае от обозначена колона с исторически резултати. DescriptЖивата работа не го прави, което я прави обичайната отправна точка, когато бизнесът има данни, но все още няма ясна цел.

Предизвикателства при внедряването на извличане на данни

  • Необходими са квалифицирани експерти за формулиране на заявки за извличане на данни.
  • Прекомерно оборудване: Поради малкия размер на базата данни за обучение, даден модел може да не отговаря на бъдещи състояния.
  • Извличането на данни се нуждае от големи бази данни, които понякога са трудни за управление
  • Може да се наложи бизнес практиките да бъдат променени, за да се реши дали да се използва непокритата информация.
  • Ако наборът от данни не е разнообразен, резултатите от извличането на данни може да не са точни.
  • Информацията за интегриране, необходима от разнородни бази данни и глобални информационни системи, може да бъде сложна

Примери за извличане на данни

Сега в този курс за извличане на данни, нека научим за извличането на данни с примери:

Пример 1:

Да разгледаме маркетинг мениджър на телекомуникационни услуги, който иска да увеличи приходите от услуги за дълги разстояния. За висока възвръщаемост на инвестициите в продажбите и маркетинга му е важно да се профилира клиентът. Той разполага с огромен набор от данни за клиентите, като възраст, пол, доход, кредитна история и др. Но е невъзможно да се определят характеристиките на хората, които предпочитат разговори на дълги разстояния, с ръчен анализ. Използвайки техники за извличане на данни, той може да открие модели между потребителите, които предпочитат разговори на дълги разстояния, и техните характеристики.

Например, той може да научи, че най-добрите му клиенти са омъжени жени на възраст между 45 и 54 години, които правят повече от $80,000 XNUMX на година. Маркетинговите усилия могат да бъдат насочени към такава демографска група.

Пример 2:

Банка иска да търси нови начини за увеличаване на приходите от операциите си с кредитни карти. Те искат да проверят дали потреблението ще се удвои, ако таксите бъдат намалени наполовина.

Банката има многогодишна статистика за средните салда по кредитни карти, суми на плащанията, използване на кредитния лимит и други ключови параметри. Те създават модел за проверка на въздействието на предложената нова бизнес политика. Резултатите от данните показват, че намаляването наполовина на таксите за целева клиентска база би могло да увеличи приходите с 10 милиона долара.

Извличане на данни срещу машинно обучение

Двата термина се припокриват силно и често се използват взаимозаменяемо, но отговарят на различни въпроси. Извличането на данни има за цел да открие модел, за който човек не е знаел преди. Машинното обучение има за цел да изгради система, която подобрява собствените си прогнози с постъпването на повече данни.

Точка на разликата Data Mining Machine Learning
Главна цел Открийте непознати модели в съществуващите данни Изградете модел, който прави прогнози въз основа на нови данни
Човешко участие Анализаторът интерпретира и действа въз основа на констатацията Алгоритъмът прилага правилото автоматично
обем на данните Работи върху дефиниран набор от исторически данни Подобрява се с предоставянето на повече данни с течение на времето
Типична мощност Правило, клъстер или асоциация, които човек може да прочете Обучен модел, който връща резултат или клас
Връзка Извличането на данни често използва алгоритми за машинно обучение като свой двигател

Накратко, машинното обучение е един от инструментите, на които се основава извличането на данни, а простото извличане на данни може да се извърши само със статистика.

Инструменти за извличане на данни

Следват 2 популярни Инструменти за извличане на данни широко използвани в промишлеността

R-език:

R език е инструмент с отворен код за статистически изчисления и графики. R разполага с голямо разнообразие от статистически, класически статистически тестове, анализ на времеви редове, класификация и графични техники. Предлага ефективно средство за обработка и съхранение на данни.

Научете повече тук

Oracle Извличане на данни:

Oracle Data Mining, известен като ODM, е модул на Oracle База данни за разширен анализ и сега се предоставя като част от Oracle Машинно обучение. Този инструмент за извличане на данни позволява на анализаторите на данни да генерират подробни анализи и да правят прогнози. Той помага за прогнозиране на поведението на клиентите, разработване на клиентски профили и идентифициране на възможности за кръстосани продажби.

Научете повече тук

Ползи от извличането на данни

  • Техниката за извличане на данни помага на компаниите да получат информация, базирана на знания.
  • Извличането на данни помага на организациите да направят печелившите корекции в работата и производството.
  • Извличането на данни е рентабилно и ефикасно решение в сравнение с други приложения за статистически данни.
  • Извличането на данни помага в процеса на вземане на решения.
  • Улеснява автоматизираното предвиждане на тенденции и поведение, както и автоматизирано откриване на скрити модели.
  • Може да се внедри в нови системи, както и в съществуващи платформи
  • Това е бързият процес, който улеснява потребителите да анализират огромно количество данни за по-малко време.

Недостатъци на Data Mining

  • Съществува риск компаниите да продават полезна информация за своите клиенти на други организации, което поражда значителни опасения за поверителността.
  • Много софтуер за анализ на извличане на данни е труден за работа и изисква предварително обучение за работа.
  • Различните инструменти за извличане на данни работят по различни начини поради различните алгоритми, използвани в техния дизайн. Следователно изборът на правилен инструмент за извличане на данни е много трудна задача.
  • Техниките за извличане на данни не са точни и могат да причинят сериозни последствия при определени условия.

Приложения за извличане на данни

Приложения употреба
комуникации Техниките за извличане на данни се използват в комуникационния сектор, за да се предскаже поведението на клиентите, за да се предложат високо насочени и релевантни кампании.
Застраховка Извличането на данни помага на застрахователните компании да определят изгодни цени на своите продукти и да популяризират нови оферти на своите нови или съществуващи клиенти.
Образование Извличането на данни облагодетелства преподавателите за достъп до данни на учениците, прогнозиране на нивата на постижения и намиране на ученици или групи от ученици, които се нуждаят от допълнително внимание. Например ученици, които са слаби по математика.
производство С помощта на извличане на данни производителите могат да прогнозират износването на производствените активи. Те могат да предвидят поддръжката, което им помага да сведат до минимум времето на престой.
Банков Извличането на данни помага на финансовия сектор да получи представа за пазарните рискове и да управлява спазването на регулаторните изисквания. Помага на банките да идентифицират вероятни неизпълнения, за да решат дали да издадат кредитни карти, заеми и др.
На дребно Техниките за извличане на данни помагат на търговските центрове и магазините за хранителни стоки да идентифицират и подредят най-продаваните артикули на най-внимателните позиции. Това помага на собствениците на магазини да измислят оферти, които насърчават клиентите да увеличат разходите си.
Доставчици на услуги Доставчици на услуги като мобилни телефони и индустрии за комунални услуги използват Data Mining, за да предвидят причините, когато клиентът напусне тяхната компания. Те анализират подробностите за фактуриране, взаимодействията с обслужването на клиенти, оплакванията, отправени към компанията, за да присвоят на всеки клиент вероятностен резултат и предлагат стимули.
Електронна търговия Уебсайтовете за електронна търговия използват извличане на данни, за да предложат кръстосани продажби и по-високи продажби чрез своите уебсайтове. Едно от най-известните имена е Amazon, които използват техники за извличане на данни, за да привлекат повече клиенти в своя магазин за електронна търговия.
Супер пазари Извличането на данни позволява на супермаркетите да разработват правила, за да предскажат дали е вероятно купувачите им да са бременни. Чрез оценка на моделите им на пазаруване, те биха могли да намерят жени клиенти, които най-вероятно са бременни. Те могат да започнат да се насочват към продукти като бебешка пудра, бебешки сапун, пелени и т.н.
Разследване на престъпления Извличането на данни помага на агенциите за разследване на престъпления да разположат полицейска работна сила (къде е най-вероятно да се случи престъпление и кога?), кого да претърсят на граничен пункт и т.н.
Биоинформатика Извличането на данни помага за извличане на биологични данни от масивни набори от данни, събрани в биологията и медицината.

Въпроси и Отговори

Не точно. Откриването на знания в бази данни е целият процес, от подбора и почистването до интерпретацията. Извличането на данни е стъпката за намиране на модели в него, въпреки че двете имена сега се използват взаимозаменяемо на практика.

SQL за примерtracданни за обработка, статистика за преценка дали даден модел е реален, един език като R или Pythonи познания в областта на бизнеса. Комуникацията е от също толкова голямо значение, защото резултатите трябва да убедят нетехнически заинтересовани страни.

Законно е, когато данните се събират и използват законно. Регламенти като GDPR изискват законно основание, ограничаване на целта и често анонимизиране, така че личните идентификатори обикновено се премахват преди началото на добива.

Съкращава най-бавните стъпки. Асистентите с изкуствен интелект пишат примери.tracзаявки за управление, предлага правила за почистване и изготвя обяснения на модела на разбираем език за заинтересованите страни. Анализаторът все още формулира бизнес въпроса и валидира всеки резултат.

Да, като отправна точка. Опишете данните и въпроса, а асистент с изкуствен интелект ще препоръча класификация, клъстеризация или регресия и ще обясни защо. Потвърдете избора си спрямо извадка, преди да разчитате на него.

Обобщете тази публикация с: