Strojové učení bez dozoru: Algorithms, Typy a příklad

⚡ Chytré shrnutí

Neupravené učení je technika strojového učení, která pracuje s neoznačenými daty a umožňuje modelu objevovat strukturu sám prostřednictvím shlukování, asociačních pravidel a redukce dimenzí, spíše než na základě předem poskytnutých odpovědí.

  • 🔘 Žádné štítky nejsou potřeba: Algoritmus hledá strukturu namísto porovnávání známých odpovědí.
  • ☑️ Tři skupiny úkolů: Clusterování, dolování asociačních pravidel a redukce dimenzionality.
  • (Tj. Čtyři styly shlukování: Exkluzivní, aglomerativní, překrývající seping a pravděpodobnostní.
  • 🧪 Pojmenované algoritmy: K-průměry, hierarchické shlukování, fuzzy C-průměry, PCA, SVD a ICA.
  • 🛠️ Kde se uživí: Segmentace zákazníků, detekce podvodů a anomálií, analýza tržního koše, předzpracování dat.
  • ⚙️ Kompromis: Žádná pevná pravda neznamená, že výsledky musí interpretovat, validovat a pojmenovat člověk.

Strojové učení bez dozoru: algoritmy, typy s příkladem

Co je učení bez dozoru?

Neupravené učení je technika strojového učení, ve které uživatel nemusí dohlížet na model. Místo toho umožňuje modelu pracovat samostatně a objevovat dříve nezjištěné vzory a informace. Zabývá se hlavně neoznačenými daty.

Učení bez dozoru Algorithms

Učení bez dozoru Algorithms umožňují uživatelům provádět složitější úkoly zpracování ve srovnání s učení pod dohledemNeupravené učení však může být méně předvídatelné než metody trénované na základě známých odpovědí. Mezi algoritmy neupraveného učení patří shlukování, detekce anomálií, redukce dimenzionality a samoorganizující se neuronové sítě.

Příklad strojového učení bez dozoru

Vezměme si příklad neřízeného učení pro dítě a jeho rodinného psa. První obrázek ukazuje mazlíčka, kterého dítě již poznává.

Miminko s rodinným psem, zvířetem, které už poznává

Tohoto psa zná a identifikuje. O několik týdnů později si s sebou rodinný přítel přivede psa a snaží se si s mládětem hrát. Ten druhý, neznámý pes je zobrazen níže.

Neznámý pes, kterého dítě nikdy předtím nevidělo

Dítě tohoto psa dříve nevidělo. Ale rozpoznává, že mnoho rysů (2 uši, oči, chůze po 4 nohách) je podobných jejímu psovi. Identifikuje nové zvíře jako psa. Jedná se o neřízené učení, kdy se nic neučíte, ale učíte se z dat (v tomto případě dat o psu). Kdyby se jednalo o řízené učení, rodinný přítel by dítěti řekl, že je to pes, jak je ukázáno ve výše uvedeném příkladu neřízeného učení.

Proč učení bez dozoru?

Zde jsou hlavní důvody pro použití neřízeného učení v Strojové učení:

  • Neřízené strojové učení nachází v datech nejrůznější neznámé vzory.
  • Metody bez dozoru vám pomohou najít funkce, které mohou být užitečné pro kategorizaci.
  • Může pracovat s daty ihned po jejich příchodu, takže příchozí záznamy jsou analyzovány a seskupovány, aniž by se čekalo na jejich první označení člověkem.
  • Je snazší získat neoznačená data z počítače než označená data, která vyžadují ruční zásah.

ClusterTypy učení bez dozoru Algorithms

Problémy s učením bez dozoru se dále dělí na problémy se shlukováním, asociace a redukce dimenzionality. ClusterSeskupování podobných záznamů, asociace vyhledává položky, které se objevují společně, a redukce dimenzionality komprimuje mnoho prvků do několika málo.

Clustering.

Clustering je důležitý koncept, pokud jde o učení bez dozoru. Zabývá se především hledáním struktury nebo vzoru ve sbírce nekategorizovaných dat. Učení bez dozoru ClusterAlgoritmy pro rozpoznávání dat zpracují vaše data a najdou přirozené shluky (skupiny), pokud v datech existují. Můžete také upravit, kolik shluků by vaše algoritmy měly identifikovat. To vám umožní upravit granularitu těchto skupin. Níže uvedený diagram ukazuje rozptýlené záznamy rozdělené do samostatných skupin.

Clusterdiagram znázorňující neoznačené datové body seskupené do samostatných shluků

Existují různé typy shlukování, které můžete použít:

Exkluzivní (rozdělení na oddíly)

V této metodě shlukování jsou data seskupena tak, že jeden záznam může patřit pouze do jednoho shluku.

Příklad: K-znamená

Aglomerativní

V této technice shlukování začíná každý záznam jako svůj vlastní shluk. Iterativní sjednocení mezi dvěma nejbližšími shluky snižuje jejich počet.

Příklad: Hierarchické shlukování

Překrytíping

V této technice, fuzzy množiny se používají ke shlukování dat. Každý bod může patřit do dvou nebo více shluků s odlišnými stupni členství.

Zde budou data spojena s příslušnou hodnotou členství. Příklad: Fuzzy C-Means

Pravděpodobně

Tato technika používá k vytvoření shluků rozdělení pravděpodobnosti.

Příklad: Následující klíčová slova

  • "mužská bota."
  • "dámská bota."
  • "dámská rukavice."
  • "mužská rukavice."

lze rozdělit do dvou kategorií, „bota“ a „rukavice“ nebo „muž“ a „ženy“.

Clustering Typy

Následují algoritmy, které se nejčastěji vyskytují v neřízeném strojovém učení. První dva seskupují záznamy, poslední tři spíše redukují dimenze než tvoří shluky a K-NN je uvedena proto, že se často zaměňuje s K-průměry.

  • Hierarchické shlukování — shlukování
  • K-means shlukování — shlukování
  • K-NN (k nejbližších sousedů) – klasifikátor s dohledem, nikoli metoda shlukování
  • Analýza hlavních komponent – ​​redukce dimenzionality
  • Rozklad singulární hodnoty — redukce dimenzionality
  • Analýza nezávislých komponent – ​​redukce rozměrů

Hierarchický Clustering.

Hierarchické shlukování je algoritmus, který vytváří hierarchii shluků. Začíná se všemi daty přiřazenými k jednomu vlastnímu shluku. V tomto případě se dva blízké shluky sloučí do jednoho shluku. Tento algoritmus končí, když zbývá pouze jeden shluk. Definuje dvě myšlenky, které stojí za to pojmenovat samostatně.

Aglomerativní shlukování

Tato forma hierarchického shlukování zdola nahoru nevyžaduje jako vstup počet shluků K. Proces aglomerace začíná vytvořením každého záznamu jako jednoho shluku.

Tato metoda využívá určitou míru vzdálenosti a snižuje počet shluků (jeden v každé iteraci) procesem slučování. Nakonec máme jeden velký shluk obsahující všechny objekty a analytik strom ořízne ve výšce, která dává rozumný počet skupin.

Dendrogram

V metodě shlukování Dendrogram bude každá úroveň představovat možný shluk. Výška dendrogramu ukazuje úroveň podobnosti mezi dvěma spojenými shluky. Čím blíže jsou ke spodní části procesu, tím jsou si shluky podobnější; výběr řezu, který definuje finální skupiny, není automatický a je většinou subjektivní.

K-znamená Clustering.

K-means je iterativní shlukovací algoritmus, který zpřesňuje skupinuping v každé iteraci. Nejprve se vybere požadovaný počet shluků. V této metodě shlukování je třeba datové body shluknout do k skupin. Větší k znamená menší skupiny s větší granularitou; nižší k znamená větší skupiny s menší granularitou.

Výstupem algoritmu je skupina „štítků“. Každý datový bod je přiřazen k jedné z k skupin. V k-means shlukování je každá skupina definována vytvořením centroidu pro tuto skupinu. Centroidy jsou jako srdce shluku, které zachycuje body nejblíže k nim a přidává je do shluku.

K- Nejbližší sousedé

Metoda K-nejbližšího souseda je nejjednodušší ze všech klasifikátorů strojového učení. Liší se od ostatních technik strojového učení tím, že nevytváří model. Jedná se o jednoduchý algoritmus, který ukládá všechny dostupné případy a klasifikuje nové instance na základě míry podobnosti. Protože pro klasifikaci potřebuje označené případy, je K-NN metoda s dohledem; zde se objevuje pouze proto, že její logika založená na vzdálenosti se podobá shlukování.

Funguje to velmi dobře, když je mezi příklady smysluplná vzdálenost. Rychlost učení je pomalá, když je trénovací sada velká a výpočet vzdálenosti je netriviální.

Analýza hlavních komponent

Analýza hlavních komponent bere vysokorozměrný prostor a vybírá novou bázi, tj.ping pouze jeho nejdůležitější skóre. Každý směr v této bázi je známý jako hlavní komponenta. Podmnožina, kterou si ponecháte, představuje nový prostor, který je menší ve srovnání s původním prostorem. Zachovává co největší možnou složitost dat.

Sdružení

Asociační pravidla umožňují vytvářet asociace mezi datovými objekty v rámci rozsáhlých databází. Tato neřízená technika se zabývá objevováním zajímavých vztahů mezi proměnnými ve velkých databázích a je základem... data miningNapříklad lidé, kteří si kupují nový dům, si s největší pravděpodobností koupí i nový nábytek.

Další příklady:

  • Podskupina pacientů s rakovinou seskupených podle měření genové exprese
  • Skupiny nakupujících na základě jejich historie prohlížení a nákupů
  • Filmy seskupené podle hodnocení diváků

Strojové učení pod dohledem vs. bez dozoru

Zde je hlavní rozdíl mezi Učení pod dohledem vs. učení bez dohledu:

parametry Technika strojového učení pod dohledem Technika strojového učení bez dozoru
Vstupní data Algorithms jsou trénováni pomocí označených dat. Algorithms se používají proti údajům, které nejsou označeny
Výpočetní složitost Učení pod dohledem je jednodušší metoda. Učení bez dozoru je výpočetně složité
Přesnost Přesnost lze měřit přímo oproti známým označením. Přesnost nelze měřit přímo; výsledky je třeba interpretovat
Typický výstup Předpověď pro každý nový rekord Skupiny, pravidla nebo komprimované prvky

Aplikace nekontrolovaného strojového učení

Některé aplikace technik neřízeného učení jsou:

  • Clustering automaticky rozděluje datovou sadu do skupin na základě jejich podobností
  • Detekce anomálií může objevit neobvyklé datové body ve vaší datové sadě. Je to užitečné pro vyhledávání podvodných transakcí
  • Asociace dolování identifikuje sady položek, které se často vyskytují společně ve vaší datové sadě
  • Modely latentních proměnných se široce používají pro předzpracování dat, jako je například snižování počtu prvků v datové sadě nebo rozklad datové sady na více komponent.

Nevýhody učení bez dozoru

  • Nemůžete získat přesné informace o třídění dat, protože data použitá v neřízeném učení nejsou označena a jejich skutečná skupinaping není známo
  • Less přesnost výsledků, protože vstupní data nejsou předem známa a nejsou lidmi označena. To znamená, že stroj to musí udělat sám.
  • Spektrální třídy ne vždy odpovídají informačním třídám.
  • Uživatel musí věnovat čas interpretaci a označování tříd, které z klasifikace vyplývají.
  • Spektrální vlastnosti tříd se také mohou v průběhu času měnit, takže při přechodu z jednoho obrázku na druhý nelze zachovat stejné informace o třídě.

Nejčastější dotazy

Metoda lokte vykresluje chybu v rámci shluku v závislosti na k a hledá ohyb. Skóre siluety v rozmezí od -1 do 1 vyhodnocuje, jak dobře každý bod odpovídá svému shluku. Čtěte oba údaje společně.

Algoritmy založené na vzdálenosti zacházejí s každou jednotkou stejně, takže sloupec platu v tisících bude dominovat sloupci věku v letech. Standardizace každého prvku v první řadě dává každé proměnné spravedlivé slovo v otázce vzdálenosti.

Apriori je klasický nástroj pro analýzu tržních košů založený na asociačních pravidlech. Nachází často se vyskytující sady položek a poté je převádí do pravidel seřazených podle podpory, důvěryhodnosti a nárůstu. FP-growth a Eclat dělají totéž rychleji.

Polo-supervizované učení využívá malou označenou množinu vedle velké neoznačené množiny. Struktura nalezená v neoznačených datech řídí model, takže přesnost se blíží supervizovanému výsledku za mnohem nižší náklady na značení.

PCA je lineární transformace, která zachovává globální rozptyl a aplikuje se na nové záznamy. t-SNE je nelineární a je vytvořena pro vizualizaci lokálních sousedství ve dvou rozměrech; vzdálenosti mezi oddělenými skupinami by se neměly číst doslovně.

Obvyklými možnostmi jsou izolační les, jednotřídní SVM, DBSCAN a chyba rekonstrukce autoencoderem. Každá z nich hodnotí, jak daleko se záznam nachází od většiny dat, takže prahová hodnota určuje, co se považuje za anomální.

Automatizované algoritmy pro procházení kanálů, měření vzdáleností a hodnot k, poté seřazují běhy podle skóre interní validity. Jazykové modely stále častěji navrhují pro výsledné segmenty názvy v jednoduché angličtině, čímž zkracují krok interpretace.

GitHub Copilot Scaffolding scikit-learn vytváří pipeline, loketní grafy a siluetové grafy z jednořádkového promptu. Zkontrolujte, zda škáloval prvky a nastavil náhodné seed, které generované úryvky často vynechávají.

Shrňte tento příspěvek takto: