Strojové učení bez dozoru: Algorithms, Typy a příklad
⚡ Chytré shrnutí
Neupravené učení je technika strojového učení, která pracuje s neoznačenými daty a umožňuje modelu objevovat strukturu sám prostřednictvím shlukování, asociačních pravidel a redukce dimenzí, spíše než na základě předem poskytnutých odpovědí.
Co je učení bez dozoru?
Neupravené učení je technika strojového učení, ve které uživatel nemusí dohlížet na model. Místo toho umožňuje modelu pracovat samostatně a objevovat dříve nezjištěné vzory a informace. Zabývá se hlavně neoznačenými daty.
Učení bez dozoru Algorithms
Učení bez dozoru Algorithms umožňují uživatelům provádět složitější úkoly zpracování ve srovnání s učení pod dohledemNeupravené učení však může být méně předvídatelné než metody trénované na základě známých odpovědí. Mezi algoritmy neupraveného učení patří shlukování, detekce anomálií, redukce dimenzionality a samoorganizující se neuronové sítě.
Příklad strojového učení bez dozoru
Vezměme si příklad neřízeného učení pro dítě a jeho rodinného psa. První obrázek ukazuje mazlíčka, kterého dítě již poznává.
Tohoto psa zná a identifikuje. O několik týdnů později si s sebou rodinný přítel přivede psa a snaží se si s mládětem hrát. Ten druhý, neznámý pes je zobrazen níže.
Dítě tohoto psa dříve nevidělo. Ale rozpoznává, že mnoho rysů (2 uši, oči, chůze po 4 nohách) je podobných jejímu psovi. Identifikuje nové zvíře jako psa. Jedná se o neřízené učení, kdy se nic neučíte, ale učíte se z dat (v tomto případě dat o psu). Kdyby se jednalo o řízené učení, rodinný přítel by dítěti řekl, že je to pes, jak je ukázáno ve výše uvedeném příkladu neřízeného učení.
Proč učení bez dozoru?
Zde jsou hlavní důvody pro použití neřízeného učení v Strojové učení:
- Neřízené strojové učení nachází v datech nejrůznější neznámé vzory.
- Metody bez dozoru vám pomohou najít funkce, které mohou být užitečné pro kategorizaci.
- Může pracovat s daty ihned po jejich příchodu, takže příchozí záznamy jsou analyzovány a seskupovány, aniž by se čekalo na jejich první označení člověkem.
- Je snazší získat neoznačená data z počítače než označená data, která vyžadují ruční zásah.
ClusterTypy učení bez dozoru Algorithms
Problémy s učením bez dozoru se dále dělí na problémy se shlukováním, asociace a redukce dimenzionality. ClusterSeskupování podobných záznamů, asociace vyhledává položky, které se objevují společně, a redukce dimenzionality komprimuje mnoho prvků do několika málo.
Clustering.
Clustering je důležitý koncept, pokud jde o učení bez dozoru. Zabývá se především hledáním struktury nebo vzoru ve sbírce nekategorizovaných dat. Učení bez dozoru ClusterAlgoritmy pro rozpoznávání dat zpracují vaše data a najdou přirozené shluky (skupiny), pokud v datech existují. Můžete také upravit, kolik shluků by vaše algoritmy měly identifikovat. To vám umožní upravit granularitu těchto skupin. Níže uvedený diagram ukazuje rozptýlené záznamy rozdělené do samostatných skupin.
Existují různé typy shlukování, které můžete použít:
Exkluzivní (rozdělení na oddíly)
V této metodě shlukování jsou data seskupena tak, že jeden záznam může patřit pouze do jednoho shluku.
Příklad: K-znamená
Aglomerativní
V této technice shlukování začíná každý záznam jako svůj vlastní shluk. Iterativní sjednocení mezi dvěma nejbližšími shluky snižuje jejich počet.
Příklad: Hierarchické shlukování
Překrytíping
V této technice, fuzzy množiny se používají ke shlukování dat. Každý bod může patřit do dvou nebo více shluků s odlišnými stupni členství.
Zde budou data spojena s příslušnou hodnotou členství. Příklad: Fuzzy C-Means
Pravděpodobně
Tato technika používá k vytvoření shluků rozdělení pravděpodobnosti.
Příklad: Následující klíčová slova
- "mužská bota."
- "dámská bota."
- "dámská rukavice."
- "mužská rukavice."
lze rozdělit do dvou kategorií, „bota“ a „rukavice“ nebo „muž“ a „ženy“.
Clustering Typy
Následují algoritmy, které se nejčastěji vyskytují v neřízeném strojovém učení. První dva seskupují záznamy, poslední tři spíše redukují dimenze než tvoří shluky a K-NN je uvedena proto, že se často zaměňuje s K-průměry.
- Hierarchické shlukování — shlukování
- K-means shlukování — shlukování
- K-NN (k nejbližších sousedů) – klasifikátor s dohledem, nikoli metoda shlukování
- Analýza hlavních komponent – redukce dimenzionality
- Rozklad singulární hodnoty — redukce dimenzionality
- Analýza nezávislých komponent – redukce rozměrů
Hierarchický Clustering.
Hierarchické shlukování je algoritmus, který vytváří hierarchii shluků. Začíná se všemi daty přiřazenými k jednomu vlastnímu shluku. V tomto případě se dva blízké shluky sloučí do jednoho shluku. Tento algoritmus končí, když zbývá pouze jeden shluk. Definuje dvě myšlenky, které stojí za to pojmenovat samostatně.
Aglomerativní shlukování
Tato forma hierarchického shlukování zdola nahoru nevyžaduje jako vstup počet shluků K. Proces aglomerace začíná vytvořením každého záznamu jako jednoho shluku.
Tato metoda využívá určitou míru vzdálenosti a snižuje počet shluků (jeden v každé iteraci) procesem slučování. Nakonec máme jeden velký shluk obsahující všechny objekty a analytik strom ořízne ve výšce, která dává rozumný počet skupin.
Dendrogram
V metodě shlukování Dendrogram bude každá úroveň představovat možný shluk. Výška dendrogramu ukazuje úroveň podobnosti mezi dvěma spojenými shluky. Čím blíže jsou ke spodní části procesu, tím jsou si shluky podobnější; výběr řezu, který definuje finální skupiny, není automatický a je většinou subjektivní.
K-znamená Clustering.
K-means je iterativní shlukovací algoritmus, který zpřesňuje skupinuping v každé iteraci. Nejprve se vybere požadovaný počet shluků. V této metodě shlukování je třeba datové body shluknout do k skupin. Větší k znamená menší skupiny s větší granularitou; nižší k znamená větší skupiny s menší granularitou.
Výstupem algoritmu je skupina „štítků“. Každý datový bod je přiřazen k jedné z k skupin. V k-means shlukování je každá skupina definována vytvořením centroidu pro tuto skupinu. Centroidy jsou jako srdce shluku, které zachycuje body nejblíže k nim a přidává je do shluku.
K- Nejbližší sousedé
Metoda K-nejbližšího souseda je nejjednodušší ze všech klasifikátorů strojového učení. Liší se od ostatních technik strojového učení tím, že nevytváří model. Jedná se o jednoduchý algoritmus, který ukládá všechny dostupné případy a klasifikuje nové instance na základě míry podobnosti. Protože pro klasifikaci potřebuje označené případy, je K-NN metoda s dohledem; zde se objevuje pouze proto, že její logika založená na vzdálenosti se podobá shlukování.
Funguje to velmi dobře, když je mezi příklady smysluplná vzdálenost. Rychlost učení je pomalá, když je trénovací sada velká a výpočet vzdálenosti je netriviální.
Analýza hlavních komponent
Analýza hlavních komponent bere vysokorozměrný prostor a vybírá novou bázi, tj.ping pouze jeho nejdůležitější skóre. Každý směr v této bázi je známý jako hlavní komponenta. Podmnožina, kterou si ponecháte, představuje nový prostor, který je menší ve srovnání s původním prostorem. Zachovává co největší možnou složitost dat.
Sdružení
Asociační pravidla umožňují vytvářet asociace mezi datovými objekty v rámci rozsáhlých databází. Tato neřízená technika se zabývá objevováním zajímavých vztahů mezi proměnnými ve velkých databázích a je základem... data miningNapříklad lidé, kteří si kupují nový dům, si s největší pravděpodobností koupí i nový nábytek.
Další příklady:
- Podskupina pacientů s rakovinou seskupených podle měření genové exprese
- Skupiny nakupujících na základě jejich historie prohlížení a nákupů
- Filmy seskupené podle hodnocení diváků
Strojové učení pod dohledem vs. bez dozoru
Zde je hlavní rozdíl mezi Učení pod dohledem vs. učení bez dohledu:
| parametry | Technika strojového učení pod dohledem | Technika strojového učení bez dozoru |
| Vstupní data | Algorithms jsou trénováni pomocí označených dat. | Algorithms se používají proti údajům, které nejsou označeny |
| Výpočetní složitost | Učení pod dohledem je jednodušší metoda. | Učení bez dozoru je výpočetně složité |
| Přesnost | Přesnost lze měřit přímo oproti známým označením. | Přesnost nelze měřit přímo; výsledky je třeba interpretovat |
| Typický výstup | Předpověď pro každý nový rekord | Skupiny, pravidla nebo komprimované prvky |
Aplikace nekontrolovaného strojového učení
Některé aplikace technik neřízeného učení jsou:
- Clustering automaticky rozděluje datovou sadu do skupin na základě jejich podobností
- Detekce anomálií může objevit neobvyklé datové body ve vaší datové sadě. Je to užitečné pro vyhledávání podvodných transakcí
- Asociace dolování identifikuje sady položek, které se často vyskytují společně ve vaší datové sadě
- Modely latentních proměnných se široce používají pro předzpracování dat, jako je například snižování počtu prvků v datové sadě nebo rozklad datové sady na více komponent.
Nevýhody učení bez dozoru
- Nemůžete získat přesné informace o třídění dat, protože data použitá v neřízeném učení nejsou označena a jejich skutečná skupinaping není známo
- Less přesnost výsledků, protože vstupní data nejsou předem známa a nejsou lidmi označena. To znamená, že stroj to musí udělat sám.
- Spektrální třídy ne vždy odpovídají informačním třídám.
- Uživatel musí věnovat čas interpretaci a označování tříd, které z klasifikace vyplývají.
- Spektrální vlastnosti tříd se také mohou v průběhu času měnit, takže při přechodu z jednoho obrázku na druhý nelze zachovat stejné informace o třídě.



