Samouczek dotyczący eksploracji danych: Co to jest eksploracja danych? Techniki, proces

⚡ Inteligentne podsumowanie

Data Mining to proces wyszukiwania potencjalnie użytecznych wzorców w dużych zbiorach danych. Ta strona wyjaśnia sześcioetapowy proces implementacji, siedem podstawowych technik, narzędzia je wspierające, rzeczywiste przykłady biznesowe oraz korzyści i ograniczenia każdego podejścia.

  • 🔍 Definicja: Eksploracja danych wykorzystuje uczenie maszynowe, statystykę i sztuczną inteligencję dotracukryte zależności z dużych zbiorów danych.
  • 🗂️. Źródła danych: Eksplorację danych obsługują bazy danych relacyjne, magazyny danych, repozytoria transakcyjne, przestrzenne, multimedialne i tekstowe.
  • 🔄 Proces wdrażania: Zrozumienie biznesu, zrozumienie danych, przygotowanie danych, modelowanie, ocena i wdrażanie.
  • 🧩 Podstawowe techniki: Klasyfikacja, klasteryzacja, regresja, reguły asocjacyjne, wykrywanie wartości odstających, wzorce sekwencyjne i predykcja.
  • 🛠️. Narzędzia: R i Oracle Uczenie maszynowe umożliwia wykonywanie obliczeń statystycznych i modelowanie predykcyjne w bazie danych.
  • 🏢 Aplikacje: Branża bankowa, handlowa, ubezpieczeniowa, edukacyjna, produkcyjna i kryminalistyczna wykorzystuje wiedzę naukową do podejmowania codziennych decyzji.
  • ⚠️ Ograniczenia: Nadmierne dopasowanie, niedobór umiejętności i obawy dotyczące prywatności ograniczają stopień wiarygodności wyników.

Czym jest eksploracja danych, techniki i procesy

Co to jest eksploracja danych?

Data Mining to proces znajdowania potencjalnie przydatnych wzorców na podstawie ogromnych zbiorów danych. Jest to umiejętność wielodyscyplinarna, z której się korzysta uczenie maszynowe, statystyki i AI dotracInformacje te służą do oceny prawdopodobieństwa przyszłych zdarzeń. Wnioski uzyskane z Data Mining są wykorzystywane w marketingu, wykrywaniu oszustw, badaniach naukowych itp.

Eksploracja danych polega na odkrywaniu ukrytych, niespodziewanych i wcześniej nieznanych, ale istotnych powiązań między danymi. Eksploracja danych jest również nazywana odkrywaniem wiedzy w danych (KDD) lub odkrywaniem wiedzy w danych.tracanaliza danych/wzorców, zbieranie informacji itp.

Rodzaje danych

Eksplorację danych można przeprowadzić na następujących typach danych

  • Relacyjne bazy danych
  • Magazyn danych
  • Zaawansowane bazy danych i repozytoria informacji
  • Obiektowe i obiektowo-relacyjne bazy danych
  • Bazy transakcyjne i przestrzenne
  • Heterogeniczne i starsze bazy danych
  • Baza multimediów i transmisji strumieniowych
  • Bazy tekstowe
  • Eksploracja tekstu i eksploracja sieci

Bez względu na źródło, ta sama zdyscyplinowana sekwencja faz przekształca surowe dane w użyteczny model.

Proces wdrażania eksploracji danych

Proces wdrażania eksploracji danych
Proces wdrażania eksploracji danych

Przyjrzyjmy się szczegółowo procesowi wdrożenia Data Mining

Zrozumienie biznesu

Na tym etapie ustalane są cele biznesowe i związane z eksploracją danych.

  • Po pierwsze, musisz zrozumieć cele biznesowe i klienta. Musisz określić, czego chce Twój klient (o czym często nawet on sam nie wie)
  • Oceń bieżący scenariusz eksploracji danych. W swojej ocenie uwzględnij zasoby, założenia, ograniczenia i inne istotne czynniki.
  • Korzystając z celów biznesowych i bieżącego scenariusza, zdefiniuj cele eksploracji danych.
  • Dobry plan eksploracji danych jest bardzo szczegółowy i powinien zostać opracowany tak, aby osiągnąć cele biznesowe i eksploracji danych.

Rozumienie danych

Na tym etapie przeprowadzana jest kontrola poprawności danych w celu sprawdzenia, czy nadają się one do celów eksploracji danych.

  • Najpierw zbierane są dane z wielu źródeł dostępnych w organizacji.
  • Te źródła danych mogą obejmować wiele baz danych, pliki płaskie lub kostki danych. Podczas procesu integracji danych mogą pojawić się problemy, takie jak dopasowywanie obiektów i integracja schematów. Jest to dość złożony i trudny proces, ponieważ dane z różnych źródeł raczej nie będą do siebie pasować. Na przykład, tabela A zawiera encję o nazwie cust_no, podczas gdy inna tabela B zawiera encję o nazwie cust-id.
  • Dlatego dość trudno jest zapewnić, że oba te dane obiekty odnoszą się do tej samej wartości, czy nie. W tym przypadku należy zastosować metadane, aby ograniczyć błędy w procesie integracji danych.
  • Kolejnym krokiem jest wyszukiwanie właściwości pozyskanych danych. Dobrym sposobem na eksplorację danych jest odpowiadanie na pytania związane z eksploracją danych (decydowane w fazie biznesowej) przy użyciu narzędzi do tworzenia zapytań, raportowania i wizualizacji.
  • Na podstawie wyników zapytania należy ocenić jakość danych. Należy również pozyskać ewentualne braki danych.

Przygotowywanie danych

Na tym etapie dane są przygotowywane do produkcji.

Przygotowanie danych to zazwyczaj najdłuższa faza, stanowiąca zwykle od 60% do 80% całkowitego nakładu pracy.

Należy wybrać, oczyścić, przekształcić, sformatować, zanonimizować i skonstruować dane z różnych źródeł (jeśli jest to wymagane).

Czyszczenie danych to proces mający na celu „czyszczenie” danych poprzez wygładzenie zaszumionych danych i uzupełnienie brakujących wartości.

Na przykład w przypadku profilu demograficznego klienta brakuje danych o wieku. Dane są niekompletne i należy je uzupełnić. W niektórych przypadkach mogą wystąpić wartości odstające w danych. Na przykład wiek ma wartość 300. Dane mogą być niespójne. Na przykład nazwa klienta jest inna w różnych tabelach.

Operacje transformacji danych zmieniają dane, aby były użyteczne w eksploracji danych. Można zastosować następujące transformacje.

Transformacja danych

Operacje transformacji danych przyczyniłyby się do sukcesu procesu wydobywania danych.

Wygładzanie: Pomaga usunąć szum z danych.

Zbiór: Operacje podsumowujące lub agregujące są stosowane do danych. Tj. tygodniowe dane sprzedaży są agregowane w celu obliczenia miesięcznej i rocznej sumy.

Uogólnienie: Na tym etapie dane niskiego poziomu są zastępowane koncepcjami wyższego poziomu za pomocą hierarchii pojęć. Na przykład miasto jest zastępowane przez województwo lub kraj.

Normalizacja: Normalizacja wykonywana, gdy dane atrybutów są skalowane w górę lub w dół. Przykład: dane powinny mieścić się w zakresie od -2.0 do 2.0 po normalizacji.

Budowa atrybutów:atrybuty te są konstruowane i obejmują podany zestaw atrybutów przydatnych przy eksploracji danych.

Wynikiem tego procesu jest ostateczny zbiór danych, który można wykorzystać w modelowaniu.

Modelowanie

Na tym etapie do określenia wzorców danych wykorzystywane są modele matematyczne.

  • W oparciu o cele biznesowe należy dobrać odpowiednie techniki modelowania dla przygotowanego zbioru danych.
  • Utwórz scenariusz, aby przetestować jakość i ważność modelu.
  • Uruchom model na przygotowanym zestawie danych.
  • Wyniki powinny zostać ocenione przez wszystkie zainteresowane strony, aby upewnić się, że model spełnia cele eksploracji danych.

Ocena

Na tym etapie zidentyfikowane wzorce są oceniane pod kątem celów biznesowych.

  • Wyniki wygenerowane przez model eksploracji danych należy oceniać w odniesieniu do celów biznesowych.
  • Zdobywanie zrozumienia biznesu jest procesem iteracyjnym. W rzeczywistości, przy zrozumieniu, eksploracja danych może spowodować zwiększenie nowych wymagań biznesowych.
  • Na etapie wdrażania podejmowana jest decyzja o przeniesieniu modelu.

Rozlokowanie

W fazie wdrożenia wdrażasz odkrycia uzyskane w wyniku eksploracji danych do codziennych operacji biznesowych.

  • Wiedza lub informacje odkryte podczas procesu eksploracji danych powinny być łatwe do zrozumienia dla interesariuszy nietechnicznych.
  • Szczegółowy plan rozmieszczenia statkuping, konserwacja i monitorowanie odkryć uzyskanych w wyniku eksploracji danych.
  • Końcowy raport z projektu tworzony jest na podstawie wniosków i kluczowych doświadczeń zdobytych podczas realizacji projektu. Pomaga to ulepszyć politykę biznesową organizacji.

Opisana powyżej faza modelowania opiera się na zdefiniowanym zestawie technik, z których każda jest dostosowana do innego rodzaju pytań.

Techniki wyszukiwania danych

1. Klasyfikacja

Analiza ta służy do pobierania ważnych i istotnych informacji o danych i metadanych. Ta metoda eksploracji danych pomaga klasyfikować dane w różnych klasach.

2. ClusterING

ClusterAnaliza jest techniką eksploracji danych mającą na celu identyfikację danych, które są do siebie podobne. Proces ten pomaga zrozumieć różnice i podobieństwa pomiędzy danymi.

3. Regresja

Analiza regresji to metoda eksploracji danych służąca do identyfikowania i analizowania relacji między zmiennymi. Służy do określenia prawdopodobieństwa wystąpienia określonej zmiennej, biorąc pod uwagę obecność innych zmiennych.

4. Zasady Stowarzyszenia

Ta technika eksploracji danych pomaga znaleźć powiązanie między dwoma lub większą liczbą elementów. Odkrywa ukryty wzór w zbiorze danych.

5. Wykrywanie wartości odstających

Ten rodzaj techniki eksploracji danych polega na obserwacji elementów danych w zbiorze danych, które nie pasują do oczekiwanego wzorca lub zachowania. Technika ta może być stosowana w różnych dziedzinach, takich jak wykrywanie włamań, wykrywanie oszustw lub błędów itp. Wykrywanie wartości odstających jest również nazywane analizą wartości odstających lub eksploracją wartości odstających.

6. Wzory sekwencyjne

Ta technika eksploracji danych pomaga odkryć lub zidentyfikować podobne wzorce lub trendy w danych transakcyjnych w określonym okresie.

7. Przepowiednia

Predykcja wykorzystuje kombinację innych technik eksploracji danych, takich jak trendy, wzorce sekwencyjne, klasteryzacja, klasyfikacja itp. Analizuje przeszłe zdarzenia lub wystąpienia w odpowiedniej kolejności w celu przewidzenia przyszłych zdarzeń.

Descriptive vs predykcyjne wydobywanie danych

Siedem powyższych technik można podzielić na dwie rodziny. Wiedza o tym, do której rodziny należy pytanie, decyduje o sposobie odczytania wyniku.

Descripteksploracja danych Podsumowuje to, co już się wydarzyło. Szuka struktury w istniejących danych bez żadnego celu, do którego można by dążyć, dlatego czasami nazywa się ją nienadzorowaną. ClusterTutaj należą reguły asocjacyjne i wzorce sekwencyjne. Odkrycie w supermarkecie, że pieluchy i piwo są często kupowane razem, jest odkryciem opisowym: wyjaśnia przeszłość, a człowiek decyduje, co z nią zrobić.

Predykcyjne eksplorowanie danych Szacuje, co wydarzy się dalej. Uczy się z danych historycznych, gdzie odpowiedź jest już znana, a następnie stosuje tę wiedzę do nowych danych, dlatego nazywa się ją nadzorowaną. Klasyfikacja, regresja i prognozowanie należą do tego obszaru. Ocena wnioskodawcy o pożyczkę jako osoby prawdopodobnie lub prawdopodobnie niespłacającej pożyczki jest ustaleniem predykcyjnym.

Z tego rozróżnienia wynikają dwie praktyczne konsekwencje.

  • Walidacja różni się: Model predykcyjny można ocenić pod kątem dokładności w odniesieniu do znanych wyników. Wyniku opisowego nie da się ocenić, dlatego ocenia się go pod kątem tego, czy jest interesujący i wykonalny.
  • Wymagania dotyczące danych różnią się: Do prac predykcyjnych potrzebna jest oznaczona kolumna z wynikami historycznymi. Descriptpraca aktywną tego nie robi, dlatego jest to typowy punkt wyjścia, gdy firma ma dane, ale nie ma jeszcze jasno określonego celu.

Wyzwania wdrażania eksploracji danych

  • Do formułowania zapytań do eksploracji danych potrzebni są wykwalifikowani eksperci.
  • Nadmierne dopasowanie: Ze względu na małą bazę danych szkoleniowych model może nie pasować do przyszłych stanów.
  • Eksploracja danych wymaga dużych baz danych, którymi czasami trudno zarządzać
  • Może zaistnieć potrzeba modyfikacji praktyk biznesowych, aby zdecydować o wykorzystaniu ujawnionych informacji.
  • Jeśli zbiór danych nie jest zróżnicowany, wyniki eksploracji danych mogą nie być dokładne.
  • Informacje integracyjne potrzebne z heterogenicznych baz danych i globalnych systemów informacyjnych mogą być złożone

Przykłady eksploracji danych

Teraz w tym kursie Data Mining, poznajmy eksplorację danych na przykładach:

1 przykład:

Rozważmy szefa marketingu w firmie telekomunikacyjnej, który chce zwiększyć przychody z usług międzymiastowych. Aby uzyskać wysoki zwrot z inwestycji w sprzedaż i marketing, profilowanie klientów jest kluczowe. Posiada on rozległą bazę danych zawierającą informacje o klientach, takie jak wiek, płeć, dochody, historia kredytowa itp. Jednak określenie cech osób preferujących połączenia międzymiastowe za pomocą analizy manualnej jest niemożliwe. Wykorzystując techniki eksploracji danych, może on odkryć wzorce między użytkownikami często dzwoniącymi na międzymiastowe a ich cechami.

Może na przykład dowiedzieć się, że jego najlepszymi klientami są zamężne kobiety w wieku od 45 do 54 lat, które zarabiają ponad 80,000 XNUMX dolarów rocznie. Działania marketingowe można ukierunkować na taką grupę demograficzną.

2 przykład:

Bank chce znaleźć nowe sposoby na zwiększenie przychodów z operacji kartami kredytowymi. Chce sprawdzić, czy wykorzystanie kart podwoiłoby się, gdyby opłaty spadły o połowę.

Bank od wielu lat prowadzi rejestry dotyczące średniego salda kart kredytowych, kwot płatności, wykorzystania limitu kredytowego i innych kluczowych parametrów. Stworzyli model w celu sprawdzenia wpływu proponowanej nowej polityki biznesowej. Wyniki danych pokazują, że obniżenie opłat o połowę dla docelowej grupy klientów mogłoby zwiększyć przychody o 10 milionów dolarów.

Eksploracja danych kontra uczenie maszynowe

Te dwa terminy w dużym stopniu się pokrywają i są często używane zamiennie, ale odpowiadają na różne pytania. Eksploracja danych ma na celu odkrycie wzorca, o którym użytkownik wcześniej nie wiedział. Uczenie maszynowe ma na celu zbudowanie systemu, który ulepsza własne prognozy w miarę napływu nowych danych.

Punkt różnicy Data Mining Nauczanie maszynowe
Główny cel Odkryj nieznane wzorce w istniejących danych Zbuduj model, który przewiduje na podstawie nowych danych
Zaangażowanie człowieka Analityk interpretuje odkrycie i podejmuje działania na jego podstawie Algorytm automatycznie stosuje regułę
Ilość danych Działa na zdefiniowanym, historycznym zestawie danych Poprawia się w miarę dostarczania większej ilości danych w miarę upływu czasu
Typowy wynik Reguła, klaster lub stowarzyszenie, które osoba może odczytać Wytrenowany model zwracający wynik lub klasę
Relacja W eksploracji danych często wykorzystuje się algorytmy uczenia maszynowego jako swój silnik

Krótko mówiąc, uczenie maszynowe to jedno z narzędzi wykorzystywanych w eksploracji danych, a proste eksploracje danych można przeprowadzić, wykorzystując wyłącznie statystyki.

Narzędzia do eksploracji danych

Oto 2 popularne Narzędzia do eksploracji danych szeroko stosowane w przemyśle

Język R:

Język R. to narzędzie typu open source do obliczeń statystycznych i grafiki. R posiada szeroką gamę statystycznych, klasycznych testów statystycznych, analizy szeregów czasowych, klasyfikacji i technik graficznych. Oferuje efektywne przekazywanie i przechowywanie danych.

Dowiedz się więcej tutaj

Oracle Eksploracja danych:

Oracle Data Mining, popularnie znany jako ODM, jest modułem Oracle Zaawansowana baza danych analitycznych jest teraz dostarczana jako część Oracle Uczenie maszynowe. To narzędzie do eksploracji danych pozwala analitykom danych generować szczegółowe analizy i formułować prognozy. Pomaga przewidywać zachowania klientów, tworzyć profile klientów i identyfikować możliwości cross-sellingu.

Dowiedz się więcej tutaj

Korzyści z eksploracji danych

  • Technika eksploracji danych pomaga firmom uzyskać informacje oparte na wiedzy.
  • Eksploracja danych pomaga organizacjom wprowadzać opłacalne zmiany w działaniu i produkcji.
  • Eksploracja danych jest opłacalnym i wydajnym rozwiązaniem w porównaniu z innymi zastosowaniami danych statystycznych.
  • Eksploracja danych pomaga w procesie decyzyjnym.
  • Ułatwia automatyczne przewidywanie trendów i zachowań, a także automatyczne odkrywanie ukrytych wzorców.
  • Można go wdrożyć w nowych systemach, jak i istniejących platformach
  • Jest to szybki proces, który ułatwia użytkownikom analizę ogromnej ilości danych w krótszym czasie.

Wady eksploracji danych

  • Istnieje ryzyko, że firmy sprzedadzą przydatne informacje o swoich klientach innym organizacjom, co budzi poważne obawy dotyczące prywatności.
  • Oprogramowanie do analizy danych jest często trudne w obsłudze i wymaga wcześniejszego przeszkolenia, aby móc z niego korzystać.
  • Różne narzędzia do eksploracji danych działają w różny sposób ze względu na różne algorytmy stosowane w ich projektowaniu. Dlatego wybór właściwego narzędzia do eksploracji danych jest bardzo trudnym zadaniem.
  • Techniki eksploracji danych nie są dokładne, dlatego w pewnych warunkach mogą powodować poważne konsekwencje.

Aplikacje do eksploracji danych

Zastosowania Stosowanie
Komunikacja Techniki eksploracji danych są wykorzystywane w sektorze komunikacji w celu przewidywania zachowań klientów i oferowania wysoce ukierunkowanych i trafnych kampanii.
Ubezpieczenia Eksploracja danych pomaga firmom ubezpieczeniowym ustalać rentowne ceny swoich produktów i promować nowe oferty wśród nowych i obecnych klientów.
Wykształcenie Eksploracja danych przynosi nauczycielom korzyści w zakresie dostępu do danych uczniów, przewidywania poziomów osiągnięć i znajdowania uczniów lub grup uczniów, którzy wymagają dodatkowej uwagi. Na przykład uczniowie, którzy są słabi z przedmiotów matematycznych.
Produkcja Dzięki eksploracji danych producenci mogą przewidywać zużycie i awarie zasobów produkcyjnych. Mogą również przewidywać konserwację, co pomaga im minimalizować przestoje.
Bankowość Eksploracja danych pomaga sektorowi finansowemu uzyskać wgląd w ryzyko rynkowe i zarządzać zgodnością z przepisami. Pomaga bankom zidentyfikować prawdopodobne osoby nie wywiązujące się ze zobowiązań i podjąć decyzję o wydaniu kart kredytowych, pożyczek itp.
Sprzedaż detaliczna Techniki eksploracji danych pomagają galeriom handlowym i sklepom spożywczym identyfikować i układać produkty o największej wartości sprzedaży w najbardziej atrakcyjnych miejscach. Pomagają właścicielom sklepów opracowywać oferty zachęcające klientów do zwiększenia wydatków.
Dostawcy usług Dostawcy usług, tacy jak telefonia komórkowa i branża użyteczności publicznej, wykorzystują Data Mining do przewidywania przyczyn, dla których klient opuszcza ich firmę. Analizują szczegóły rozliczeń, interakcje z obsługą klienta, skargi składane do firmy, aby przypisać każdemu klientowi wynik prawdopodobieństwa i zaoferować zachęty.
E-Commerce Witryny handlu elektronicznego wykorzystują Data Mining do oferowania sprzedaży krzyżowej i dodatkowej za pośrednictwem swoich witryn internetowych. Jednym z najbardziej znanych nazwisk jest Amazon, którzy korzystają z technik eksploracji danych, aby przyciągnąć więcej klientów do swojego sklepu eCommerce.
Super Rynki Eksploracja danych pozwala supermarketom opracowywać reguły pozwalające przewidywać, czy ich klientki prawdopodobnie spodziewają się dziecka. Analizując ich nawyki zakupowe, supermarkety mogą znaleźć klientki, które najprawdopodobniej są w ciąży. Mogą zacząć celować w produkty takie jak puder dla niemowląt, mydło dla niemowląt, pieluchy itp.
Dochodzenie w sprawie przestępstw Data Mining pomaga agencjom dochodzeniowym w rozmieszczeniu pracowników policji (gdzie i kiedy najprawdopodobniej dochodzi do przestępstwa?), kogo należy przeszukiwać na przejściach granicznych itp.
Bioinformatyka Data Mining pomaga wydobywać dane biologiczne z ogromnych zbiorów danych zgromadzonych w biologii i medycynie.

FAQ

Nie do końca. Odkrywanie wiedzy w bazach danych to cały proces, od selekcji i oczyszczania, aż po interpretację. Eksploracja danych to etap znajdowania wzorców, choć w praktyce te dwie nazwy są obecnie używane zamiennie.

SQL na przykładtracdane liczbowe, statystyki służące do oceny, czy wzór jest prawdziwy, jeden język, taki jak R lub Pythoni wiedza branżowa. Komunikacja jest równie ważna, ponieważ wnioski muszą przekonać interesariuszy nietechnicznych.

Jest to legalne, gdy dane są gromadzone i wykorzystywane zgodnie z prawem. Przepisy takie jak RODO wymagają podstawy prawnej, ograniczenia celu i często anonimizacji, dlatego dane identyfikacyjne są zazwyczaj usuwane przed rozpoczęciem eksploracji.

Skraca najwolniejsze kroki. Asystenci AI piszą np.tracZapytania dotyczące analizy, sugerowanie zasad czyszczenia i przygotowywanie wyjaśnień modelu w prostym języku dla interesariuszy. Analityk nadal formułuje pytanie biznesowe i weryfikuje każdy wynik.

Tak, jako punkt wyjścia. Opisz dane i pytanie, a asystent AI zarekomenduje klasyfikację, klasteryzację lub regresję i wyjaśni, dlaczego. Potwierdź wybór na podstawie próby kontrolnej, zanim się na niej opierasz.

Podsumuj ten post następująco: