Co je posilovací učení? Typy, Algorithms & Příklad
⚡ Chytré shrnutí
Posilovací učení je metoda strojového učení, ve které se softwarový agent učí tím, že působí v daném prostředí, sbírá odměny nebo penalizace a upravuje své chování tak, aby maximalizoval kumulativní odměnu v průběhu mnoha kroků.
Co je posilovací učení?
Posílení učení je Strojové učení Metoda zabývající se tím, jak by softwaroví agenti měli v daném prostředí jednat. Agentovi nejsou zobrazovány správné odpovědi; učí se z odměny, kterou obdrží, a upravuje své chování tak, aby maximalizoval kumulativní odměnu.
Učení s posilováním je samo o sobě odvětvím strojového učení, vedle pod dohledem a bez dozoru učení. Pokud je politika nebo hodnotová funkce agenta reprezentována neuronovou sítí, tato kombinace se nazývá hluboké posílení učení — že párování je to, co umožňuje agentovi dosáhnout komplexního cíle nebo maximalizovat specifický rozměr v průběhu mnoha kroků.
Důležité součásti metody posilování učení
Než algoritmy pochopíme, je dobré si jednotlivé části pojmenovat. Níže uvedený diagram ukazuje, jak agent, prostředí, akce a signál odměny zapadají do jedné smyčky.
Zde jsou některé důležité pojmy používané v učení s posilováním:
- Činidlo: Entita, která v určitém prostředí vykonává činnosti za účelem získání určité odměny.
- Prostředí (e): Scénář, kterému musí agent čelit.
- Odměna (R): Okamžitá odměna poskytnutá agentovi, když provede určitou akci nebo úkol.
- Státy: Stav odkazuje na současnou situaci navrácenou prostředím.
- Zásady (π): Strategie použitá agentem k rozhodnutí o další akci na základě aktuálního stavu.
- Hodnota (V): Očekávaný dlouhodobý výnos se slevou ve srovnání s krátkodobou odměnou.
- Funkce hodnoty: Určuje hodnotu stavu, tj. celkovou výši odměny, kterou může agent očekávat, že nashromáždí počínaje daným stavem.
- Model prostředí: Toto napodobuje chování prostředí. Umožňuje vám to vyvozovat závěry a také určit, jak se prostředí bude chovat.
- Metody založené na modelu: Metody, které řeší problémy učení s posilováním, se nejprve učí nebo používají model prostředí a poté podle něj plánují.
- Hodnota Q nebo akční hodnota (Q): Hodnota Q je docela podobná hodnotě. Jediný rozdíl mezi nimi je, že má další parametr, aktuální akci.
Jak posilovací učení funguje?
Každodenní analogie objasní mechanismus ještě předtím, než se objeví jakákoli notace.
Představte si scénář, kdy učíte svou kočku novým trikům.
- Protože kočka nerozumí angličtině ani žádnému jinému lidskému jazyku, nemůžeme jí přímo říkat, co má dělat. Místo toho se řídíme jinou strategií.
- Napodobíme situaci a kočka se snaží reagovat mnoha různými způsoby. Pokud je kočičí reakce požadovaná, dáme jí rybu.
- Nyní, kdykoli je kočka vystavena stejné situaci, provádí podobnou akci ještě s větším nadšením v očekávání větší odměny (jídla).
- To je učení, které kočka získává o tom, „co má dělat“, z pozitivních zkušeností.
- Zároveň se kočka učí, co nedělat, když čelí negativním zkušenostem.
Příklad posilovacího učení
Obrázek níže mapuje tento kočičí příběh do formální smyčky, kde domácnost je prostředím a ryba odměnou.

V tomto případě,
- Vaše kočka je činitel, který je vystaven vlivům prostředí. V tomto případě je to váš dům. Příkladem stavu může být vaše kočka, která sedí, a vy používáte konkrétní slovo, abyste ji přiměli chodit.
- Náš agent reaguje provedením akčního přechodu z jednoho „stavu“ do jiného „stavu“.
- Například vaše kočka přejde ze sezení do chůze.
- Reakce agenta je akce a politika je metoda výběru akce daného stavu v očekávání lepších výsledků.
- Po přechodu může agent za to dostat odměnu nebo pokutu.
Posílení učení Algorithms
Existují tři přístupy k implementaci algoritmu posilovacího učení a liší se hlavně v tom, co agent ukládá a učí.
Na základě hodnoty
V metodě učení s posilováním založené na hodnotách se snažíte maximalizovat hodnotovou funkci V(s). V této metodě agent očekává dlouhodobý výnos aktuálních stavů za politiky π.
Na základě zásad
V metodě RL založené na pravidlech se snažíte přijít s takovou politikou, aby akce provedená v každém stavu pomohla v budoucnu získat maximální odměnu.
Existují dva typy metod založených na zásadách:
- Deterministický: Pro jakýkoli stav je stejná akce vyvolána politikou π.
- Stochastické: Každá akce má určitou pravděpodobnost, danou následující rovnicí.
Stochastická politika:
π(a|s) = P[At = a | St = s]
Model založený
V této metodě učení s posilováním vytváříte virtuální model pro každé prostředí. Agent se učí, jak v daném prostředí fungovat.
Charakteristika posilovacího učení
Zde jsou důležité charakteristiky posilovacího učení:
- Neexistuje žádný supervizor, pouze skutečné číslo nebo signál odměny
- Sekvenční rozhodování
- Čas hraje v problémech s posilováním zásadní roli
- Zpětná vazba je často opožděná, nikoli okamžitá
- Akce agenta určují následující data, která obdrží
Typy posilovacího učení
Slovo „posílení“ je převzato z behaviorální psychologie a má dvě podoby:
Pozitivní:
Je definována jako událost, která nastává v důsledku specifického chování. Zvyšuje sílu a četnost daného chování a pozitivně ovlivňuje akci prováděnou agentem.
Tento typ posilování vám pomáhá maximalizovat výkon a udržet změnu po delší dobu. Příliš mnoho posilování však může vést k nadměrné optimalizaci stavu, což může ovlivnit výsledky.
Negativní:
Negativní posilování je definováno jako posilování chování, ke kterému dochází v důsledku negativní podmínky, která měla být zastavena nebo se jí mělo předejít. Pomáhá definovat minimální standard výkonu. Nevýhodou této metody je však to, že poskytuje pouze tolik, kolik je potřeba k dosažení minimálního chování.
Učební modely posilování
V posilovacím učení existují dva důležité modely učení:
- Markovův rozhodovací proces
- Q učení
Markovův rozhodovací proces
K získání řešení se používají následující parametry:
- Sada akcí – A
- Sada stavů – S
- Odměna – R
- Politika – π
- Hodnota – V
Matematický přístup k mapěping Řešení v Reinforcement Learning je formalizováno jako Markovův rozhodovací proces neboli MDP. Níže uvedené schéma ukazuje těchto pět parametrů zapojených do stejného cyklu agent-prostředí.
Q-Learning
Q-učení je metoda založená na hodnotách, která agentovi říká, jakou akci má podniknout.
Pojďme si tuto metodu vysvětlit na následujícím příkladu:
- V budově je pět místností, které jsou propojeny dveřmi.
- Každý pokoj je očíslován od 0 do 4
- Vnější část budovy lze považovat za jeden velký venkovní prostor (5)
- Dveře číslo 1 a 4 vedou do budovy z místnosti 5
Níže uvedený plánek půdorysu očísluje tyto místnosti a ukazuje, které dveře je spojují.
Dále je třeba ke každým dveřím přiřadit hodnotu odměny:
- Dveře, které vedou přímo k cíli, mají odměnu 100
- Dveře, které nejsou přímo propojeny s cílovou místností, nedávají žádnou odměnu.
- Protože jsou dveře obousměrné, jsou pro každou místnost přiřazeny dvě šipky.
- Každá šipka na obrázku výše nese okamžitou odměnu
Vysvětlení: Na tomto obrázku každá místnost představuje stav a pohyb agenta z jedné místnosti do druhé představuje akci.
V níže uvedeném grafu je stav znázorněn jako uzel, zatímco šipky znázorňují dostupné akce a odměnu spojenou s každou z nich.
Například agent přechází z místnosti číslo 2 do místnosti číslo 5:
- Počáteční stav = stav 2
- Stav 2 -> stav 3
- Stav 3 -> stav (2,1,4)
- Stav 4-> stav (0,5,3)
- Stav 1-> stav (5,3)
- Stav 0 -> stav 4
Posílené učení vs. učení pod dohledem
Nejjasnějším způsobem, jak zařadit posilovací učení, je postavit ho vedle paradigmatu, které většina čtenářů již zná.
| parametry | Posílení učení | Dozorované učení |
|---|---|---|
| Styl rozhodování | Učení s posilováním vám pomáhá činit rozhodnutí postupně. | U této metody se rozhoduje o vstupu zadaném na začátku. |
| Práce na | Funguje interakcí s prostředím. | Pracuje na příkladech nebo daných vzorových datech. |
| Závislost na rozhodnutí | V metodě RL závisí každé rozhodnutí o učení na rozhodnutích předcházejících, takže se vyhodnocuje celá posloupnost rozhodnutí. | In učení pod dohledem Rozhodnutí jsou na sobě nezávislá, takže pro každé rozhodnutí je přiděleno označení. |
| Nejvhodnější | Podporuje a funguje lépe v prostředí s umělou inteligencí, kde je důležitá lidská interakce. | Většinou je provozován pomocí interaktivního softwarového systému nebo aplikací. |
| Příklad | Šachová hra | Rozpoznávání objektů |
Aplikace posilovacího učení
Zde jsou aplikace posilovacího učení:
- Robotika pro průmyslovou automatizaci.
- Plánování obchodní strategie
- Strojové učení a zpracování dat
- Pomáhá vám vytvářet školicí systémy, které poskytují výuku a materiály na míru dle požadavků studentů.
- Řízení letadla a řízení pohybu robota
Proč používat posilovací učení?
Zde jsou hlavní důvody pro použití posilovacího učení:
- Pomůže vám zjistit, která situace vyžaduje akci
- Pomáhá vám zjistit, která akce přináší nejvyšší odměnu za delší dobu
- Posilovací učení také poskytuje učícímu se agentovi funkci odměny.
- To také umožňuje agentovi zjistit nejlepší metodu pro získání velkých odměn.
Kdy nepoužít posilovací učení?
Model posilovacího učení nelze použít v každé situaci. Zde je několik podmínek, za kterých byste jej neměli používat.
- Když máte dostatek označených dat k vyřešení problému metodou řízeného učení
- Učení s posilováním je náročné na výpočetní techniku a čas, zejména když je prostor pro činnost velký.
Výzvy posilovacího učení
Zde jsou hlavní výzvy, kterým budete čelit při učení s posilováním:
- Návrh funkcí a odměn, který může být velmi složitý
- Parametry mohou ovlivnit rychlost učení.
- Realistická prostředí mohou mít částečnou pozorovatelnost.
- Příliš mnoho posilování může vést k přetížení stavů, což může snížit výsledky.
- Realistická prostředí mohou být nestacionární.




