Što je učenje s potkrepljenjem? Vrste, Algorithms & Primjer

⚡ Pametni sažetak

Učenje s potkrepljenjem je metoda strojnog učenja u kojoj softverski agent uči djelujući unutar okruženja, prikupljajući nagrade ili kazne i prilagođavajući svoje ponašanje kako bi maksimizirao kumulativnu nagradu tijekom više koraka.

  • 🔘 Osnovna petlja: Agent promatra stanje, poduzima akciju, prima nagradu i sleti u novo stanje.
  • ☑️ Tri pristupa: Metode temeljene na vrijednosti, metode temeljene na politici i metode temeljene na modelu razlikuju se po tome što agent zapravo uči.
  • Dva modela učenja: Markovljevi procesi odlučivanja uokviruju problem; Q-učenje ga rješava iz iskustva.
  • 🧪 Nije pod nadzorom: Ne postoje označeni odgovori, samo signal odgođene nagrade koji agent mora pripisati ranijim radnjama.
  • 🛠️ Gdje odgovara: Robotika, igranje igara, upravljanje zrakoplovom, adaptivno podučavanje i planiranje poslovne strategije.
  • Poznati troškovi: Trening zahtijeva puno računanja, dizajn nagrada je delikatan, a stvarna okruženja su bučna i nestacionarna.

Učenje s potkrepljenjem: algoritmi, vrste i primjeri

Što je učenje s potkrepljenjem?

Učenje ojačanja je Strojno učenje metoda koja se bavi time kako bi softverski agenti trebali poduzimati radnje u okruženju. Agentu se ne prikazuju točni odgovori; on uči iz nagrade koju prima i prilagođava svoje ponašanje kako bi maksimizirao kumulativnu nagradu.

Učenje s potkrepljenjem je samostalna grana strojnog učenja, uz pod nadzorom i bez nadzora učenje. Kada je agentova politika ili vrijednosna funkcija predstavljena neuronskom mrežom, kombinacija se naziva učenje s dubokim pojačanjem — to sparivanje omogućuje agentu postizanje složenog cilja ili maksimiziranje određene dimenzije tijekom više koraka.

Važne komponente metode učenja s potkrepljenjem

Prije nego što algoritmi dobiju smisao, korisno je imenovati dijelove. Dijagram u nastavku prikazuje kako se agent, okruženje, akcija i signal nagrade uklapaju u jednu petlju.

Petlja učenja s potkrepljenjem koja povezuje agenta, akciju, okolinu, stanje i nagradu

Evo nekih važnih pojmova koji se koriste u učenju s potkrepljenjem:

  • Agent: Entitet koji izvršava radnje u određenom okruženju kako bi ostvario određenu nagradu.
  • Okoliš (e): Scenarij s kojim se agent mora suočiti.
  • Nagrada (R): Trenutni povrat koji se daje agentu kada izvrši određenu radnju ili zadatak.
  • Države): Stanje se odnosi na trenutnu situaciju vraćenu okolinom.
  • Politika (π): Strategija koju agent primjenjuje kako bi odlučio o sljedećoj akciji na temelju trenutnog stanja.
  • Vrijednost (V): Očekivani dugoročni prinos s popustom, u usporedbi s kratkoročnom nagradom.
  • Funkcija vrijednosti: On određuje vrijednost stanja, odnosno ukupan iznos nagrade koju agent može očekivati ​​​​počevši od tog stanja.
  • Model okoline: Ovo oponaša ponašanje okoline. Omogućuje vam donošenje zaključaka i određivanje kako će se okolina ponašati.
  • Metode temeljene na modelu: Metode koje rješavaju probleme učenja s potkrepljenjem prvo učenjem ili korištenjem modela okoline, a zatim planiranjem u skladu s njim.
  • Q vrijednost ili akcijska vrijednost (Q): Q vrijednost je prilično slična vrijednosti. Jedina razlika između njih je u tome što uzima dodatni parametar, trenutnu radnju.

Kako funkcionira učenje s potkrepljenjem?

Svakodnevna analogija razjašnjava mehanizam prije nego što se pojavi bilo kakva oznaka.

Razmotrite scenarij učenja nove trikove vaše mačke.

  • Budući da mačka ne razumije engleski niti bilo koji drugi ljudski jezik, ne možemo joj izravno reći što da radi. Umjesto toga, slijedimo drugačiju strategiju.
  • Oponašamo situaciju, a mačka pokušava reagirati na mnogo različitih načina. Ako je mačji odgovor željeni, dajemo joj ribu.
  • Sada, kad god je mačka izložena istoj situaciji, ona izvodi sličnu radnju još entuzijastičnije, očekujući da će dobiti više nagrade (hrane).
  • To je učenje koje mačka stječe o tome „što treba učiniti“ iz pozitivnih iskustava.
  • Istovremeno, mačka uči i što ne smije činiti kada se suoči s negativnim iskustvima.

Primjer učenja s potkrepljenjem

Donja slika preslikava tu priču o mački na formalnu petlju, s kućanstvom kao okruženjem, a ribom kao nagradom.

Primjer mačke i vlasnika mapiran na petlju agenta i okruženja za učenje s potkrepljenjem
Kako funkcionira učenje potkrepljivanjem

U ovom slučaju,

  • Vaša mačka je subjekt koji je izložen okolini. U ovom slučaju, to je vaša kuća. Primjer stanja može biti vaša mačka koja sjedi, a vi koristite određenu riječ kako biste je natjerali da hoda.
  • Naš agent reagira izvođenjem prijelaza radnje iz jednog "stanja" u drugo "stanje".
  • Na primjer, vaša mačka prelazi iz sjedenja u hodanje.
  • Reakcija agenta je radnja, a politika je metoda odabira radnje u određenom stanju u očekivanju boljih ishoda.
  • Nakon tranzicije, agent može zauzvrat dobiti nagradu ili kaznu.

Učenje ojačanja Algorithms

Postoje tri pristupa implementaciji algoritma učenja s potkrepljenjem, a razlikuju se uglavnom u onome što agent pohranjuje i uči.

Na temelju vrijednosti

U metodi učenja s potkrepljenjem temeljenoj na vrijednosti, pokušava se maksimizirati funkcija vrijednosti V(s). U ovoj metodi agent očekuje dugoročni povrat trenutnih stanja pod politikom π.

Na temelju politike

U RL metodi temeljenoj na pravilima, pokušavate osmisliti pravilo takvo da vam radnja izvršena u svakom stanju pomaže da ostvarite maksimalnu nagradu u budućnosti.

Dvije su vrste metoda temeljenih na politici:

  • deterministički: Za bilo koje stanje, politika π proizvodi istu akciju.
  • Stohastički: Svaka akcija ima određenu vjerojatnost, danu sljedećom jednadžbom.

Stohastička politika:

π(a|s) = P[At = a | St = s]

Na temelju modela

U ovoj metodi učenja s potkrepljenjem, stvarate virtualni model za svako okruženje. Agent uči kako funkcionirati u tom specifičnom okruženju.

Karakteristike učenja s potkrepljenjem

Evo važnih karakteristika učenja s potkrepljenjem:

  • Nema nadzornika, samo pravi broj ili signal nagrade
  • Sekvencijalno donošenje odluka
  • Vrijeme igra ključnu ulogu u problemima pojačanja
  • Povratna informacija je često odgođena, a ne trenutna
  • Radnje agenta određuju naknadne podatke koje prima

Vrste potkrepljenog učenja

Riječ „potkrepljenje“ posuđena je iz bihevioralne psihologije i javlja se u dva oblika:

Pozitivan:

Definira se kao događaj koji se javlja zbog određenog ponašanja. Povećava snagu i učestalost ponašanja te pozitivno utječe na radnju koju poduzima agent.

Ova vrsta potkrepljenja pomaže vam maksimizirati performanse i održati promjenu dulje vrijeme. Međutim, previše potkrepljenja može dovesti do prekomjerne optimizacije stanja, što može utjecati na rezultate.

Negativan:

Negativno potkrepljenje definira se kao jačanje ponašanja koje se javlja zbog negativnog uvjeta koji je trebalo zaustaviti ili izbjeći. Pomaže vam definirati minimalni standard izvedbe. Međutim, nedostatak ove metode je što pruža samo dovoljno za zadovoljavanje minimalnog ponašanja.

Učenje modela potkrepljenja

Postoje dva važna modela učenja u učenju s potkrepljenjem:

  • Markovljev proces odlučivanja
  • Q učenje

Markovljev proces odlučivanja

Za dobivanje rješenja koriste se sljedeći parametri:

  • Skup radnji – A
  • Skup stanja – S
  • Nagrada – R
  • Politika – π
  • Vrijednost – V

Matematički pristup za kartuping Rješenje u učenju s potkrepljenjem formalizirano je kao Markovljev proces odlučivanja ili MDP. Shema u nastavku prikazuje tih pet parametara povezanih u isti ciklus agent-okoliš.

Shema Markovljevog procesa odlučivanja sa stanjima, akcijama, nagradom i politikom

Q-učenje

Q-učenje je metoda pružanja informacija temeljena na vrijednosti koja agentu govori koju radnju treba poduzeti.

Razumjet ćemo ovu metodu sljedećim primjerom:

  • U zgradi postoji pet prostorija koje su povezane vratima.
  • Svaka soba je numerirana od 0 do 4
  • Vanjski dio zgrade može se tretirati kao jedno veliko vanjsko područje (5)
  • Vrata broj 1 i 4 vode u zgradu iz prostorije 5

Donji tlocrt označava te sobe brojevima i pokazuje koja ih vrata povezuju.

Tlocrt zgrade s pet soba s numeriranim sobama i vanjskim prostorom 5

Zatim, svakim vratima trebate dodijeliti vrijednost nagrade:

  • Vrata koja vode izravno do cilja imaju nagradu od 100
  • Vrata koja nisu izravno povezana s ciljanom sobom ne daju nikakvu nagradu
  • Budući da su vrata dvosmjerna, za svaku sobu su dodijeljene dvije strelice.
  • Svaka strelica na gornjoj slici nosi trenutnu nagradnu vrijednost

Objašnjenje: Na ovoj slici svaka soba predstavlja stanje, a kretanje agenta iz jedne sobe u drugu predstavlja akciju.

Na donjem grafu, stanje je nacrtano kao čvor, dok strelice prikazuju dostupne akcije i nagradu vezanu uz svaku od njih.

Grafikon stanja pet soba s vrijednostima nagrada od 0 i 100 na svakom prijelazu

Na primjer, agent prelazi iz sobe broj 2 u sobu broj 5:

  • Početno stanje = stanje 2
  • Stanje 2-> stanje 3
  • Stanje 3 -> stanje (2,1,4)
  • Stanje 4-> stanje (0,5,3)
  • Stanje 1-> stanje (5,3)
  • Stanje 0-> stanje 4

Učenje s potkrepljenjem naspram nadziranog učenja

Najjasniji način za postavljanje učenja s potkrepljenjem jest postavljanje uz paradigmu koju većina čitatelja već poznaje.

Parametri Učenje ojačanja Nadzirano učenje
Stil odluke Učenje s potkrepljenjem pomaže vam da donosite odluke sekvencijalno. U ovoj metodi odluka se donosi na temelju unosa danog na početku.
Radi na Djeluje interakcijom s okolinom. Radi na primjerima ili danim oglednim podacima.
Ovisnost o odluci U RL metodi, svaka odluka o učenju ovisi o prethodnima, tako da se evaluira cijeli niz odluka. In nadzirano učenje Odluke su međusobno neovisne, pa se svakoj odluci daje oznaka.
Najprikladniji Podržava i bolje funkcionira u umjetnoj inteligenciji, gdje prevladava ljudska interakcija. Uglavnom se njime upravlja pomoću interaktivnog softverskog sustava ili aplikacija.
Primjer Igra šaha Prepoznavanje predmeta

Primjene potkrepljenog učenja

Evo primjena učenja s pojačanjem:

  • Robotika za industrijsku automatizaciju.
  • Planiranje poslovne strategije
  • Strojno učenje i obrada podataka
  • Pomaže vam u stvaranju sustava obuke koji pružaju prilagođene upute i materijale prema zahtjevima učenika.
  • Upravljanje zrakoplovom i upravljanje kretanjem robota

Zašto koristiti učenje s pojačanjem?

Evo glavnih razloga za korištenje učenja s potkrepljenjem:

  • Pomaže vam da shvatite koja situacija zahtijeva djelovanje
  • Pomaže vam otkriti koja akcija donosi najveću nagradu tijekom duljeg razdoblja
  • Učenje s potkrepljenjem također pruža agentu učenja funkciju nagrađivanja
  • Također omogućuje agentu da shvati najbolju metodu za dobivanje velikih nagrada

Kada ne koristiti učenje potkrepljivanjem?

Model učenja s potkrepljenjem ne možete primijeniti u svakoj situaciji. Evo nekoliko uvjeta u kojima ga ne biste trebali koristiti.

  • Kada imate dovoljno označenih podataka za rješavanje problema metodom nadziranog učenja
  • Učenje s potkrepljenjem zahtijeva puno računanja i vremena, posebno kada je prostor djelovanja velik.

Izazovi potkrepljenog učenja

Evo glavnih izazova s ​​kojima ćete se suočiti tijekom učenja s potkrepljenjem:

  • Dizajn značajki i nagrada, što može biti vrlo složeno
  • Parametri mogu utjecati na brzinu učenja.
  • Realna okruženja mogu imati djelomičnu vidljivost.
  • Previše potkrepljenja može dovesti do preopterećenja stanjima, što može umanjiti rezultate.
  • Realne okoline mogu biti nestacionarne.

Pitanja i odgovori

Iskorištavanje ponavlja radnju za koju se trenutno smatra da je najbolja; istraživanje pokušava nešto drugo kako bi otkrilo bolju. Epsilonsko-pohlepno djelovanje to rješava nasumično djelujući s vjerojatnošću ε i pohlepno u suprotnom, a zatim smanjujući ε kako se iskustvo akumulira.

Gama ponderira buduće nagrade u odnosu na trenutne. Vrijednost blizu 0 čini agenta kratkovidnim i pohlepnim za trenutnom nagradom; vrijednost blizu 1 čini ga dovoljno strpljivim da prihvati mali gubitak sada za veću isplatu kasnije.

Q-učenje nije u skladu s pravilima: ažurira se prema najboljoj mogućoj sljedećoj akciji bez obzira na to što je agent zapravo učinio. SARSA je u skladu s pravilima i ažurira se prema akciji koju je stvarno poduzeo, što ga čini opreznijim u blizini rizičnih stanja.

Duboka Q-mreža zamjenjuje Q-tablicu neuronskom mrežom, tako da se stanja koja nikada nisu viđena u treningu i dalje mogu bodovati. Dodaju se ponavljanje iskustva i zasebna ciljna mreža kako bi signal treninga bio stabilan.

Agenti bez modela, poput Q-učenja, uče isključivo iz uzorkovanog iskustva. Agenti temeljeni na modelu prvo grade model dinamike okoline i planiraju prema njemu, što zahtijeva puno manje stvarnih interakcija, ali pati kad god je model pogrešan.

Učenje s potkrepljenjem iz ljudskih povratnih informacija trenira model nagrađivanja na rangiranju ljudskih preferencija, a zatim prilagođava jezični model toj nagradi. Zato su asistenti gradili na duboko učenje slijedite upute umjesto da samo predviđate tekst.

GitHub kopilot dobar je u osnovnim postavkama: omotačima okruženja, međuspremnicima za ponavljanje, petljama za učenje i grafikonima. Shaper nagradaping a izbori hiperparametara i dalje zahtijevaju prosudbu, jer tiho pogrešna nagrada stvara agenta koji se sretno obučava, a ponaša se loše.

Gymnasium pruža standardna okruženja za vježbanje, Stable-Baselines3 pruža testirane implementacije algoritama, a TensorFlow ili PyTorch opskrbljuju mreže. Započnite s tabličnim mrežnim svijetom prije nego što posegnete za bilo kojom od njih.

Sažmite ovu objavu uz: