Підручник з інтелектуального аналізу даних: що таке інтелектуальний аналіз даних? Техніка, процес
⚡ Розумний підсумок
Аналіз даних – це процес пошуку потенційно корисних шаблонів у великих наборах даних. На цій сторінці пояснюється шестиетапний процес впровадження, сім основних методів, інструменти, що їх підтримують, реальні бізнес-приклади, а також переваги та обмеження кожного підходу.

Що таке інтелектуальний аналіз даних?
Видобуток даних це процес пошуку потенційно корисних шаблонів із величезних наборів даних. Це багатопрофільна навичка, яка використовує навчання за допомогою машини, статистика та штучний інтелект для ексtracінформацію для оцінки ймовірності майбутніх подій. Висновки, отримані в результаті аналізу даних, використовуються для маркетингу, виявлення шахрайства, наукових відкриттів тощо.
Data Mining — це пошук прихованих, неочікуваних та раніше невідомих, але достовірних зв'язків між даними. Data Mining також називається виявленням знань у даних (KDD), виявленням знань.tracція, аналіз даних/закономірностей, збір інформації тощо.
Типи даних
Інтелектуальний аналіз даних можна виконувати на таких типах даних
- Реляційні бази даних
- Сховища даних
- Розширені БД та сховища інформації
- Об'єктно-орієнтовані та об'єктно-реляційні бази даних
- Транзакційні та просторові бази даних
- Гетерогенні та застарілі бази даних
- Мультимедійна та потокова база даних
- Текстові бази даних
- Текстовий і веб-майнінг
Яким би не було джерело, та сама дисциплінована послідовність фаз перетворює ці необроблені дані на придатну для використання модель.
Процес впровадження інтелектуального аналізу даних

Давайте детально вивчимо процес впровадження Data Mining
Ділове розуміння
На цьому етапі встановлюються бізнес-цілі та цілі аналізу даних.
- По-перше, вам потрібно зрозуміти цілі бізнесу та клієнта. Ви повинні визначити, чого хоче ваш клієнт (про що часто навіть вони самі не знають)
- Перегляньте поточний сценарій інтелектуального аналізу даних. У свою оцінку враховуйте ресурси, припущення, обмеження та інші важливі фактори.
- Використовуючи бізнес-цілі та поточний сценарій, визначте свої цілі інтелектуального аналізу даних.
- Хороший план інтелектуального аналізу даних є дуже детальним, і його слід розробити для досягнення як бізнес-цілей, так і цілей інтелектуального аналізу даних.
Розуміння даних
На цьому етапі виконується перевірка даних на відповідність цілям data mining.
- По-перше, дані збираються з кількох джерел даних, доступних в організації.
- Ці джерела даних можуть включати кілька баз даних, плоских файлів або кубів даних. Під час процесу інтеграції даних можуть виникнути такі проблеми, як зіставлення об'єктів та інтеграція схем. Це досить складний та хитрий процес, оскільки дані з різних джерел навряд чи легко зіставляться. Наприклад, таблиця A містить сутність з назвою cust_no, тоді як інша таблиця B містить сутність з назвою cust-id.
- Таким чином, досить важко переконатися, що обидва дані об’єкти посилаються на одне й те саме значення чи ні. Тут метадані слід використовувати для зменшення помилок у процесі інтеграції даних.
- Наступним кроком є пошук властивостей отриманих даних. Хороший спосіб дослідити дані — відповісти на запитання інтелектуального аналізу даних (вирішені на бізнес-фазі) за допомогою інструментів запитів, звітів і візуалізації.
- На основі результатів запиту слід встановити якість даних. Якщо такі відсутні, слід отримати дані.
Підготовка даних
На цьому етапі дані готові до виробництва.
Підготовка даних зазвичай є найдовшим етапом, який зазвичай становить від 60% до 80% від загальної кількості зусиль.
Дані з різних джерел слід відібрати, очистити, трансформувати, відформатувати, анонімізувати та структурувати (за потреби).
Очищення даних — це процес «очищення» даних шляхом згладжування шумних даних і заповнення пропущених значень.
Наприклад, для демографічного профілю клієнта дані про вік відсутні. Дані неповні, їх необхідно заповнити. У деяких випадках можуть бути викиди даних. Наприклад, вік має значення 300. Дані можуть бути суперечливими. Наприклад, ім'я клієнта в різних таблицях відрізняється.
Операції перетворення даних змінюють дані, щоб зробити їх корисними для data mining. Можна застосувати такі перетворення.
Перетворення даних
Операції перетворення даних сприятимуть успіху процесу видобутку.
Згладжування: Це допомагає прибрати шум із даних.
Агрегування: До даних застосовуються операції зведення або агрегування. Тобто щотижневі дані про продажі агрегуються для розрахунку місячних і річних підсумків.
Узагальнення: На цьому кроці дані низького рівня замінюються концепціями вищого рівня за допомогою ієрархій концепцій. Наприклад, місто замінюється на штат або країну.
Нормалізація: Нормалізація виконується під час масштабування даних атрибутів у напрямку збільшення або зменшення. Приклад: Дані повинні знаходитися в діапазоні від -2.0 до 2.0 після нормалізації.
Побудова атрибутів: ці атрибути побудовані та включають заданий набір атрибутів, корисних для аналізу даних.
Результатом цього процесу є кінцевий набір даних, який можна використовувати в моделюванні.
Моделювання
На цьому етапі математичні моделі використовуються для визначення шаблонів даних.
- Виходячи з бізнес-цілей, слід вибрати відповідні методи моделювання для підготовленого набору даних.
- Створіть сценарій для перевірки якості та валідності моделі.
- Запустіть модель на підготовленому наборі даних.
- Результати повинні бути оцінені всіма зацікавленими сторонами, щоб переконатися, що модель може відповідати цілям аналізу даних.
Оцінка
На цьому етапі ідентифіковані шаблони оцінюються щодо бізнес-цілей.
- Результати, отримані за допомогою моделі інтелектуального аналізу даних, слід оцінювати щодо бізнес-цілей.
- Розуміння бізнесу – це повторюваний процес. Насправді, незважаючи на розуміння, нові бізнес-вимоги можуть бути підвищені через аналіз даних.
- Приймається рішення про переміщення моделі на етапі розгортання.
розгортання
На етапі розгортання ви передаєте свої відкриття інтелектуального аналізу даних у повсякденні бізнес-операції.
- Знання або інформація, виявлені під час процесу інтелектуального аналізу даних, повинні бути легкими для розуміння зацікавленими сторонами, які не мають технічних знань.
- Детальний план розгортання корабляpingстворено , обслуговування та моніторинг результатів пошуку даних.
- Підсумковий звіт про проект створюється із засвоєними уроками та основним досвідом під час проекту. Це допомагає покращити бізнес-політику організації.
Вищеописаний етап моделювання спирається на певний набір методів, кожен з яких підходить для різного типу питань.
Методи аналізу даних
1. Класифікація
Цей аналіз використовується для отримання важливої та актуальної інформації про дані та метадані. Цей метод аналізу даних допомагає класифікувати дані в різних класах.
2. ClusterІНГ
ClusterІнтелектуальний аналіз — це метод інтелектуального аналізу даних для ідентифікації даних, які схожі один на одного. Цей процес допомагає зрозуміти відмінності та схожість між даними.
3. Регресія
Регресійний аналіз – це метод інтелектуального аналізу даних, що дозволяє ідентифікувати та аналізувати зв’язок між змінними. Він використовується для визначення ймовірності певної змінної за наявності інших змінних.
4. Правила асоціації
Цей метод інтелектуального аналізу даних допомагає знайти зв’язок між двома чи більше елементами. Він виявляє прихований шаблон у наборі даних.
5. Виявлення викидів
Цей тип методу data mining стосується спостереження за елементами даних у наборі даних, які не відповідають очікуваному шаблону або очікуваній поведінці. Цей метод може бути використаний у різних областях, таких як виявлення вторгнень, виявлення шахрайства або помилок тощо. Виявлення викидів також називається аналізом викидів або data mining.
6. Послідовні візерунки
Ця техніка інтелектуального аналізу даних допомагає виявити або ідентифікувати подібні моделі або тенденції в даних транзакцій за певний період.
7. Прогнозування
Прогнозування використовує комбінацію інших методів інтелектуального аналізу даних, таких як тенденції, послідовні шаблони, кластеризація, класифікація тощо. Він аналізує минулі події або випадки в правильній послідовності для прогнозування майбутніх подій.
DescriptЖивий та прогнозний аналіз даних
Сім вищезазначених методів поділяються на дві групи, і знання того, до якої групи належить питання, визначає, як слід інтерпретувати результат.
Descriptдинамічний аналіз даних підсумовує те, що вже сталося. Він шукає структуру всередині існуючих даних без будь-якої цілі, до якої можна було б прагнути, тому його іноді називають безнавчальним. Clusterсюди належать правила асоціацій та послідовні закономірності. Дізнання супермаркету про те, що підгузки та пиво часто купують разом, є описовим відкриттям: воно пояснює минуле, і людина вирішує, що з цим робити.
Прогнозний аналіз даних оцінює, що станеться далі. Він навчається з історичних записів, де відповідь вже відома, а потім застосовує ці знання до нових записів, тому він називається контрольованим. Сюди належать класифікація, регресія та прогнозування. Оцінка заявника на кредит як ймовірного або малоймовірного дефолту є прогностичним результатом.
З цього розмежування випливають два практичні наслідки.
- Валідація відрізняється: Прогностичну модель можна оцінити за точністю відносно відомих результатів. Описовий результат – ні, тому його оцінюють за тим, чи є він цікавим та практичним.
- Вимоги до даних відрізняються: Для прогнозної роботи потрібен позначений стовпець з історичними результатами. DescriptЖива робота цього не робить, що робить її звичайною відправною точкою, коли бізнес має дані, але ще не має чіткої цілі.
Проблеми впровадження data mining
- Для формулювання запитів інтелектуального аналізу даних потрібні кваліфіковані експерти.
- Переобладнання: через малий розмір навчальної бази даних модель може не відповідати майбутнім станам.
- Інтелектуальний аналіз даних потребує великих баз даних, якими іноді важко керувати
- Ділова практика може знадобитися змінити, щоб вирішити використовувати розкриту інформацію.
- Якщо набір даних не різноманітний, результати аналізу даних можуть бути неточними.
- Необхідна інтеграційна інформація з різнорідних баз даних і глобальних інформаційних систем може бути складною
Приклади інтелектуального аналізу даних
Тепер у цьому курсі Data Mining, давайте дізнаємось про Data Mining на прикладах:
Приклад 1:
Розглянемо керівника відділу маркетингу постачальників телекомунікаційних послуг, який хоче збільшити доходи від послуг міжміського сполучення. Для високої рентабельності інвестицій у продажі та маркетингові зусилля важливе профілювання клієнтів. Він має величезний пул даних про клієнтів, таких як вік, стать, дохід, кредитна історія тощо. Але неможливо визначити характеристики людей, які віддають перевагу міжміським дзвінкам, за допомогою ручного аналізу. Використовуючи методи інтелектуального аналізу даних, він може виявити закономірності між користувачами, які здійснюють дзвінки на великі відстані, та їхніми характеристиками.
Наприклад, він може дізнатися, що його найкращі клієнти — це заміжні жінки віком від 45 до 54 років, які заробляють понад 80,000 XNUMX доларів на рік. Маркетингові зусилля можуть бути спрямовані на таку демографічну групу.
Приклад 2:
Банк хоче знайти нові способи збільшення доходів від операцій з кредитними картками. Вони хочуть перевірити, чи подвоїться використання, якщо комісії знизити вдвічі.
Банк має багаторічні записи щодо середніх залишків на кредитних картках, сум платежів, використання кредитного ліміту та інших ключових параметрів. Вони створили модель для перевірки впливу запропонованої нової бізнес-політики. Результати дослідження показують, що скорочення комісій вдвічі для цільової клієнтської бази може збільшити доходи на 10 мільйонів доларів.
Інтелектуальний аналіз даних проти машинного навчання
Ці два терміни сильно перетинаються та часто використовуються як взаємозамінні, але вони відповідають на різні питання. Мета інтелектуального аналізу даних — виявити закономірність, про яку людина раніше не знала. Машинне навчання — створити систему, яка покращує власні прогнози в міру надходження більшої кількості даних.
| Точка різниці | Видобуток даних | машинне навчання |
|---|---|---|
| Основна мета | Виявлення невідомих закономірностей у існуючих даних | Створіть модель, яка прогнозує на основі нових даних |
| Участь людини | Аналітик інтерпретує висновки та діє відповідно до них | Алгоритм застосовує правило автоматично |
| Обсяг даних | Працює з визначеним набором історичних даних | Покращується, оскільки з часом надходить більше даних |
| Типовий вихід | Правило, кластер або асоціація, які людина може прочитати | Навчена модель, яка повертає оцінку або клас |
| Зв'язок | Інтелектуальний аналіз даних часто використовує алгоритми машинного навчання як свій механізм | |
Коротше кажучи, машинне навчання – це один із інструментів, на яких базується data mining, а простий data mining можна виконати лише за допомогою статистики.
Інструменти інтелектуального аналізу даних
Нижче наведено 2 популярних Інструменти інтелектуального аналізу даних широко використовується в промисловості
R-мова:
мова R це інструмент із відкритим кодом для статистичних обчислень і графіки. R має широкий спектр статистичних, класичних статистичних тестів, аналізу часових рядів, класифікації та графічних методів. Він пропонує ефективну обробку та зберігання даних.
Oracle Видобуток даних:
Oracle Видобуток даних, широко відомий як ODM, є модулем Oracle Розширена аналітична база даних, яка тепер постачається як частина Oracle Машинне навчання. Цей інструмент аналізу даних дозволяє аналітикам даних генерувати детальну аналітику та робити прогнози. Він допомагає передбачати поведінку клієнтів, розробляти профілі клієнтів, виявляти можливості перехресних продажів.
Переваги аналізу даних
- Метод інтелектуального аналізу даних допомагає компаніям отримувати інформацію, засновану на знаннях.
- Інтелектуальний аналіз даних допомагає організаціям вносити прибуткові зміни в роботу та виробництво.
- Інтелектуальний аналіз даних є рентабельним і ефективним рішенням порівняно з іншими програмами статистичних даних.
- Інтелектуальний аналіз даних допомагає в процесі прийняття рішень.
- Полегшує автоматичне прогнозування тенденцій і поведінки, а також автоматичне виявлення прихованих закономірностей.
- Він може бути реалізований як у нових системах, так і на існуючих платформах
- Це швидкий процес, який дозволяє користувачам легко аналізувати величезну кількість даних за менший час.
Недоліки Data Mining
- Існує ризик того, що компанії продають корисну інформацію про своїх клієнтів іншим організаціям, що викликає значні занепокоєння щодо конфіденційності.
- Багато аналітичних програм для інтелектуального аналізу даних важко використовувати, і для роботи з ними потрібне попереднє навчання.
- Різні інструменти інтелектуального аналізу даних працюють по-різному через різні алгоритми, використані в їх розробці. Тому вибір правильного інструменту інтелектуального аналізу даних є дуже складним завданням.
- Методи інтелектуального аналізу даних є неточними, тому за певних умов це може призвести до серйозних наслідків.
Програми інтелектуального аналізу даних
| додатків | Використання |
|---|---|
| зв'язку | Методи аналізу даних використовуються в секторі комунікацій для прогнозування поведінки клієнтів з метою пропонування цільових та релевантних кампаній. |
| Страхування | Інтелектуальний аналіз даних допомагає страховим компаніям вигідно оцінювати свої продукти та рекламувати нові пропозиції своїм новим або існуючим клієнтам. |
| Освіта | Інтелектуальний аналіз даних допомагає викладачам отримувати доступ до даних студентів, прогнозувати рівень успішності та знаходити студентів або групи студентів, які потребують додаткової уваги. Наприклад, учні, які мають слабкі знання з математики. |
| Manufacturing | За допомогою Data Mining виробники можуть прогнозувати знос виробничих активів. Вони можуть передбачати технічне обслуговування, що допомагає їм мінімізувати простої. |
| Banking | Інтелектуальний аналіз даних допомагає фінансовому сектору отримати уявлення про ринкові ризики та керувати дотриманням нормативних вимог. Він допомагає банкам виявити ймовірних неплатників для прийняття рішення про видачу кредитних карток, кредитів тощо. |
| Роздрібна торгівля | Методи аналізу даних допомагають торговим центрам та продуктовим магазинам визначати та розміщувати найбільш продавані товари в найцікавіших місцях. Це допомагає власникам магазинів пропонувати пропозиції, які спонукають клієнтів збільшити свої витрати. |
| Постачальники послуг | Такі постачальники послуг, як мобільні телефони та комунальні послуги, використовують інтелектуальний аналіз даних, щоб передбачити причини, коли клієнт залишає їхню компанію. Вони аналізують платіжні реквізити, взаємодію зі службою обслуговування клієнтів, скарги, подані компанії, щоб призначити кожному клієнту оцінку ймовірності та пропонують заохочення. |
| Електронна комерція | Веб-сайти електронної комерції використовують інтелектуальний аналіз даних, щоб пропонувати перехресні та додаткові продажі через свої веб-сайти. Одним із найвідоміших імен є Amazon, які використовують методи аналізу даних, щоб залучити більше клієнтів у свій магазин електронної комерції. |
| Супер ринки | Аналіз даних дозволяє супермаркетам розробляти правила для прогнозування ймовірності вагітності серед покупців. Оцінюючи їхній звичний звичний для покупок спосіб життя, вони можуть знаходити жінок-клієнтів, які, найімовірніше, вагітні. Вони можуть почати орієнтуватися на такі товари, як дитяча присипка, дитяче мило, підгузки тощо. |
| Розслідування злочинів | Інтелектуальний аналіз даних допомагає агентствам з розслідування злочинів розгортати поліцейських (де найбільш ймовірно станеться злочин і коли?), кого шукати на перетині кордону тощо. |
| біоінформатика | Інтелектуальний аналіз даних допомагає отримувати біологічні дані з масивних наборів даних, зібраних у біології та медицині. |
