Co je posilovací učení? Typy, Algorithms & Příklad

⚡ Chytré shrnutí

Posilovací učení je metoda strojového učení, ve které se softwarový agent učí tím, že působí v daném prostředí, sbírá odměny nebo penalizace a upravuje své chování tak, aby maximalizoval kumulativní odměnu v průběhu mnoha kroků.

  • 🔘 Jádrová smyčka: Agent pozoruje stav, provede akci, obdrží odměnu a dostane se do nového stavu.
  • ☑️ Tři přístupy: Metody založené na hodnotě, na politice a na modelu se liší v tom, co se agent skutečně naučí.
  • (Tj. Dva modely učení: Markovovy rozhodovací procesy problém formulují; Q-learning jej řeší na základě zkušeností.
  • 🧪 Bez dohledu: Neexistují žádné označené odpovědi, pouze opožděný signál odměny, který musí agent připsat dřívějším akcím.
  • 🛠️ Kam se to hodí: Robotika, hraní her, řízení letadel, adaptivní doučování a plánování obchodní strategie.
  • ⚙️ Známé náklady: Trénink je náročný na výpočetní výkon, návrh odměn je delikátní a reálná prostředí jsou hlučná a nestacionární.

Učení s posilováním: algoritmy, typy a příklady

Co je posilovací učení?

Posílení učení je Strojové učení Metoda zabývající se tím, jak by softwaroví agenti měli v daném prostředí jednat. Agentovi nejsou zobrazovány správné odpovědi; učí se z odměny, kterou obdrží, a upravuje své chování tak, aby maximalizoval kumulativní odměnu.

Učení s posilováním je samo o sobě odvětvím strojového učení, vedle pod dohledem a bez dozoru učení. Pokud je politika nebo hodnotová funkce agenta reprezentována neuronovou sítí, tato kombinace se nazývá hluboké posílení učení — že párování je to, co umožňuje agentovi dosáhnout komplexního cíle nebo maximalizovat specifický rozměr v průběhu mnoha kroků.

Důležité součásti metody posilování učení

Než algoritmy pochopíme, je dobré si jednotlivé části pojmenovat. Níže uvedený diagram ukazuje, jak agent, prostředí, akce a signál odměny zapadají do jedné smyčky.

Smyčka posilovacího učení propojuje agenta, akci, prostředí, stav a odměnu.

Zde jsou některé důležité pojmy používané v učení s posilováním:

  • Činidlo: Entita, která v určitém prostředí vykonává činnosti za účelem získání určité odměny.
  • Prostředí (e): Scénář, kterému musí agent čelit.
  • Odměna (R): Okamžitá odměna poskytnutá agentovi, když provede určitou akci nebo úkol.
  • Státy: Stav odkazuje na současnou situaci navrácenou prostředím.
  • Zásady (π): Strategie použitá agentem k rozhodnutí o další akci na základě aktuálního stavu.
  • Hodnota (V): Očekávaný dlouhodobý výnos se slevou ve srovnání s krátkodobou odměnou.
  • Funkce hodnoty: Určuje hodnotu stavu, tj. celkovou výši odměny, kterou může agent očekávat, že nashromáždí počínaje daným stavem.
  • Model prostředí: Toto napodobuje chování prostředí. Umožňuje vám to vyvozovat závěry a také určit, jak se prostředí bude chovat.
  • Metody založené na modelu: Metody, které řeší problémy učení s posilováním, se nejprve učí nebo používají model prostředí a poté podle něj plánují.
  • Hodnota Q nebo akční hodnota (Q): Hodnota Q je docela podobná hodnotě. Jediný rozdíl mezi nimi je, že má další parametr, aktuální akci.

Jak posilovací učení funguje?

Každodenní analogie objasní mechanismus ještě předtím, než se objeví jakákoli notace.

Představte si scénář, kdy učíte svou kočku novým trikům.

  • Protože kočka nerozumí angličtině ani žádnému jinému lidskému jazyku, nemůžeme jí přímo říkat, co má dělat. Místo toho se řídíme jinou strategií.
  • Napodobíme situaci a kočka se snaží reagovat mnoha různými způsoby. Pokud je kočičí reakce požadovaná, dáme jí rybu.
  • Nyní, kdykoli je kočka vystavena stejné situaci, provádí podobnou akci ještě s větším nadšením v očekávání větší odměny (jídla).
  • To je učení, které kočka získává o tom, „co má dělat“, z pozitivních zkušeností.
  • Zároveň se kočka učí, co nedělat, když čelí negativním zkušenostem.

Příklad posilovacího učení

Obrázek níže mapuje tento kočičí příběh do formální smyčky, kde domácnost je prostředím a ryba odměnou.

Příklad kočky a majitele namapovaný na smyčku agent-prostředí s posilovacím učením
Jak funguje posilovací učení

V tomto případě,

  • Vaše kočka je činitel, který je vystaven vlivům prostředí. V tomto případě je to váš dům. Příkladem stavu může být vaše kočka, která sedí, a vy používáte konkrétní slovo, abyste ji přiměli chodit.
  • Náš agent reaguje provedením akčního přechodu z jednoho „stavu“ do jiného „stavu“.
  • Například vaše kočka přejde ze sezení do chůze.
  • Reakce agenta je akce a politika je metoda výběru akce daného stavu v očekávání lepších výsledků.
  • Po přechodu může agent za to dostat odměnu nebo pokutu.

Posílení učení Algorithms

Existují tři přístupy k implementaci algoritmu posilovacího učení a liší se hlavně v tom, co agent ukládá a učí.

Na základě hodnoty

V metodě učení s posilováním založené na hodnotách se snažíte maximalizovat hodnotovou funkci V(s). V této metodě agent očekává dlouhodobý výnos aktuálních stavů za politiky π.

Na základě zásad

V metodě RL založené na pravidlech se snažíte přijít s takovou politikou, aby akce provedená v každém stavu pomohla v budoucnu získat maximální odměnu.

Existují dva typy metod založených na zásadách:

  • Deterministický: Pro jakýkoli stav je stejná akce vyvolána politikou π.
  • Stochastické: Každá akce má určitou pravděpodobnost, danou následující rovnicí.

Stochastická politika:

π(a|s) = P[At = a | St = s]

Model založený

V této metodě učení s posilováním vytváříte virtuální model pro každé prostředí. Agent se učí, jak v daném prostředí fungovat.

Charakteristika posilovacího učení

Zde jsou důležité charakteristiky posilovacího učení:

  • Neexistuje žádný supervizor, pouze skutečné číslo nebo signál odměny
  • Sekvenční rozhodování
  • Čas hraje v problémech s posilováním zásadní roli
  • Zpětná vazba je často opožděná, nikoli okamžitá
  • Akce agenta určují následující data, která obdrží

Typy posilovacího učení

Slovo „posílení“ je převzato z behaviorální psychologie a má dvě podoby:

Pozitivní:

Je definována jako událost, která nastává v důsledku specifického chování. Zvyšuje sílu a četnost daného chování a pozitivně ovlivňuje akci prováděnou agentem.

Tento typ posilování vám pomáhá maximalizovat výkon a udržet změnu po delší dobu. Příliš mnoho posilování však může vést k nadměrné optimalizaci stavu, což může ovlivnit výsledky.

Negativní:

Negativní posilování je definováno jako posilování chování, ke kterému dochází v důsledku negativní podmínky, která měla být zastavena nebo se jí mělo předejít. Pomáhá definovat minimální standard výkonu. Nevýhodou této metody je však to, že poskytuje pouze tolik, kolik je potřeba k dosažení minimálního chování.

Učební modely posilování

V posilovacím učení existují dva důležité modely učení:

  • Markovův rozhodovací proces
  • Q učení

Markovův rozhodovací proces

K získání řešení se používají následující parametry:

  • Sada akcí – A
  • Sada stavů – S
  • Odměna – R
  • Politika – π
  • Hodnota – V

Matematický přístup k mapěping Řešení v Reinforcement Learning je formalizováno jako Markovův rozhodovací proces neboli MDP. Níže uvedené schéma ukazuje těchto pět parametrů zapojených do stejného cyklu agent-prostředí.

Schéma Markovova rozhodovacího procesu se stavy, akcemi, odměnou a politikou

Q-Learning

Q-učení je metoda založená na hodnotách, která agentovi říká, jakou akci má podniknout.

Pojďme si tuto metodu vysvětlit na následujícím příkladu:

  • V budově je pět místností, které jsou propojeny dveřmi.
  • Každý pokoj je očíslován od 0 do 4
  • Vnější část budovy lze považovat za jeden velký venkovní prostor (5)
  • Dveře číslo 1 a 4 vedou do budovy z místnosti 5

Níže uvedený plánek půdorysu očísluje tyto místnosti a ukazuje, které dveře je spojují.

Půdorys pětipokojové budovy s očíslovanými místnostmi a venkovním prostorem 5

Dále je třeba ke každým dveřím přiřadit hodnotu odměny:

  • Dveře, které vedou přímo k cíli, mají odměnu 100
  • Dveře, které nejsou přímo propojeny s cílovou místností, nedávají žádnou odměnu.
  • Protože jsou dveře obousměrné, jsou pro každou místnost přiřazeny dvě šipky.
  • Každá šipka na obrázku výše nese okamžitou odměnu

Vysvětlení: Na tomto obrázku každá místnost představuje stav a pohyb agenta z jedné místnosti do druhé představuje akci.

V níže uvedeném grafu je stav znázorněn jako uzel, zatímco šipky znázorňují dostupné akce a odměnu spojenou s každou z nich.

Graf stavů pěti místností s hodnotami odměn 0 a 100 při každém přechodu

Například agent přechází z místnosti číslo 2 do místnosti číslo 5:

  • Počáteční stav = stav 2
  • Stav 2 -> stav 3
  • Stav 3 -> stav (2,1,4)
  • Stav 4-> stav (0,5,3)
  • Stav 1-> stav (5,3)
  • Stav 0 -> stav 4

Posílené učení vs. učení pod dohledem

Nejjasnějším způsobem, jak zařadit posilovací učení, je postavit ho vedle paradigmatu, které většina čtenářů již zná.

parametry Posílení učení Dozorované učení
Styl rozhodování Učení s posilováním vám pomáhá činit rozhodnutí postupně. U této metody se rozhoduje o vstupu zadaném na začátku.
Práce na Funguje interakcí s prostředím. Pracuje na příkladech nebo daných vzorových datech.
Závislost na rozhodnutí V metodě RL závisí každé rozhodnutí o učení na rozhodnutích předcházejících, takže se vyhodnocuje celá posloupnost rozhodnutí. In učení pod dohledem Rozhodnutí jsou na sobě nezávislá, takže pro každé rozhodnutí je přiděleno označení.
Nejvhodnější Podporuje a funguje lépe v prostředí s umělou inteligencí, kde je důležitá lidská interakce. Většinou je provozován pomocí interaktivního softwarového systému nebo aplikací.
Příklad Šachová hra Rozpoznávání objektů

Aplikace posilovacího učení

Zde jsou aplikace posilovacího učení:

  • Robotika pro průmyslovou automatizaci.
  • Plánování obchodní strategie
  • Strojové učení a zpracování dat
  • Pomáhá vám vytvářet školicí systémy, které poskytují výuku a materiály na míru dle požadavků studentů.
  • Řízení letadla a řízení pohybu robota

Proč používat posilovací učení?

Zde jsou hlavní důvody pro použití posilovacího učení:

  • Pomůže vám zjistit, která situace vyžaduje akci
  • Pomáhá vám zjistit, která akce přináší nejvyšší odměnu za delší dobu
  • Posilovací učení také poskytuje učícímu se agentovi funkci odměny.
  • To také umožňuje agentovi zjistit nejlepší metodu pro získání velkých odměn.

Kdy nepoužít posilovací učení?

Model posilovacího učení nelze použít v každé situaci. Zde je několik podmínek, za kterých byste jej neměli používat.

  • Když máte dostatek označených dat k vyřešení problému metodou řízeného učení
  • Učení s posilováním je náročné na výpočetní techniku ​​a čas, zejména když je prostor pro činnost velký.

Výzvy posilovacího učení

Zde jsou hlavní výzvy, kterým budete čelit při učení s posilováním:

  • Návrh funkcí a odměn, který může být velmi složitý
  • Parametry mohou ovlivnit rychlost učení.
  • Realistická prostředí mohou mít částečnou pozorovatelnost.
  • Příliš mnoho posilování může vést k přetížení stavů, což může snížit výsledky.
  • Realistická prostředí mohou být nestacionární.

Nejčastější dotazy

Využití opakuje akci, která je v současnosti považována za nejlepší; průzkum se snaží najít něco jiného, ​​aby objevil lepší. Epsilonově chamtivý přístup to řeší náhodným jednáním s pravděpodobností ε a chamtivým jednáním v opačném případě, přičemž ε se s nahromaděnými zkušenostmi snižuje.

Gama koeficient váží budoucí odměny oproti okamžitým. Hodnota blízká 0 činí agenta krátkozrakým a chamtivým po okamžité odměně; hodnota blízká 1 ho činí dostatečně trpělivým, aby přijal malou ztrátu nyní za účelem větší odměny později.

Q-učení je mimo politiku: aktualizuje se směrem k nejlepší možné další akci bez ohledu na to, co agent skutečně provedl. SARSA je v souladu s politikou a aktualizuje se směrem k akci, kterou skutečně provedl, což ho činí opatrnějším v blízkosti rizikových stavů.

Hluboká Q-síť nahrazuje Q-tabulku neuronovou sítí, takže stavy, které se při trénování nikdy neobjevily, lze stále hodnotit. Pro udržení stability trénovacího signálu je přidáno přehrávání zkušeností a samostatná cílová síť.

Agenti bez modelu, jako je Q-learning, se učí čistě ze vzorkovaných zkušeností. Agenti založení na modelu nejprve vytvoří model dynamiky prostředí a podle něj plánují, což vyžaduje mnohem méně reálných interakcí, ale trpí, když je model chybný.

Učení s posilováním z lidské zpětné vazby trénuje model odměny na základě žebříčku lidských preferencí a poté ladí jazykový model podle této odměny. Proto asistenti stavěli na hluboké učení řiďte se pokyny, a ne pouze předvídejte text.

GitHub Copilot je dobrý v základních principech: obalování prostředí, vyrovnávací paměti pro přehrávání, trénovací smyčky a grafy. Shaper odměnping a výběr hyperparametrů stále vyžaduje úsudek, protože tiše chybná odměna vytváří agenta, který se šťastně trénuje a chová se špatně.

Gymnasium poskytuje standardní cvičební prostředí, Stable-Baselines3 poskytuje testované implementace algoritmů a TensorFlow nebo PyTorch dodávají sítě. Než po kterékoli z nich sáhnete, začněte s tabulkovým mřížkovým světem.

Shrňte tento příspěvek takto: