Što je učenje s potkrepljenjem? Vrste, Algorithms & Primjer
⚡ Pametni sažetak
Učenje s potkrepljenjem je metoda strojnog učenja u kojoj softverski agent uči djelujući unutar okruženja, prikupljajući nagrade ili kazne i prilagođavajući svoje ponašanje kako bi maksimizirao kumulativnu nagradu tijekom više koraka.
Što je učenje s potkrepljenjem?
Učenje ojačanja je Strojno učenje metoda koja se bavi time kako bi softverski agenti trebali poduzimati radnje u okruženju. Agentu se ne prikazuju točni odgovori; on uči iz nagrade koju prima i prilagođava svoje ponašanje kako bi maksimizirao kumulativnu nagradu.
Učenje s potkrepljenjem je samostalna grana strojnog učenja, uz pod nadzorom i bez nadzora učenje. Kada je agentova politika ili vrijednosna funkcija predstavljena neuronskom mrežom, kombinacija se naziva učenje s dubokim pojačanjem — to sparivanje omogućuje agentu postizanje složenog cilja ili maksimiziranje određene dimenzije tijekom više koraka.
Važne komponente metode učenja s potkrepljenjem
Prije nego što algoritmi dobiju smisao, korisno je imenovati dijelove. Dijagram u nastavku prikazuje kako se agent, okruženje, akcija i signal nagrade uklapaju u jednu petlju.
Evo nekih važnih pojmova koji se koriste u učenju s potkrepljenjem:
- Agent: Entitet koji izvršava radnje u određenom okruženju kako bi ostvario određenu nagradu.
- Okoliš (e): Scenarij s kojim se agent mora suočiti.
- Nagrada (R): Trenutni povrat koji se daje agentu kada izvrši određenu radnju ili zadatak.
- Države): Stanje se odnosi na trenutnu situaciju vraćenu okolinom.
- Politika (π): Strategija koju agent primjenjuje kako bi odlučio o sljedećoj akciji na temelju trenutnog stanja.
- Vrijednost (V): Očekivani dugoročni prinos s popustom, u usporedbi s kratkoročnom nagradom.
- Funkcija vrijednosti: On određuje vrijednost stanja, odnosno ukupan iznos nagrade koju agent može očekivati počevši od tog stanja.
- Model okoline: Ovo oponaša ponašanje okoline. Omogućuje vam donošenje zaključaka i određivanje kako će se okolina ponašati.
- Metode temeljene na modelu: Metode koje rješavaju probleme učenja s potkrepljenjem prvo učenjem ili korištenjem modela okoline, a zatim planiranjem u skladu s njim.
- Q vrijednost ili akcijska vrijednost (Q): Q vrijednost je prilično slična vrijednosti. Jedina razlika između njih je u tome što uzima dodatni parametar, trenutnu radnju.
Kako funkcionira učenje s potkrepljenjem?
Svakodnevna analogija razjašnjava mehanizam prije nego što se pojavi bilo kakva oznaka.
Razmotrite scenarij učenja nove trikove vaše mačke.
- Budući da mačka ne razumije engleski niti bilo koji drugi ljudski jezik, ne možemo joj izravno reći što da radi. Umjesto toga, slijedimo drugačiju strategiju.
- Oponašamo situaciju, a mačka pokušava reagirati na mnogo različitih načina. Ako je mačji odgovor željeni, dajemo joj ribu.
- Sada, kad god je mačka izložena istoj situaciji, ona izvodi sličnu radnju još entuzijastičnije, očekujući da će dobiti više nagrade (hrane).
- To je učenje koje mačka stječe o tome „što treba učiniti“ iz pozitivnih iskustava.
- Istovremeno, mačka uči i što ne smije činiti kada se suoči s negativnim iskustvima.
Primjer učenja s potkrepljenjem
Donja slika preslikava tu priču o mački na formalnu petlju, s kućanstvom kao okruženjem, a ribom kao nagradom.

U ovom slučaju,
- Vaša mačka je subjekt koji je izložen okolini. U ovom slučaju, to je vaša kuća. Primjer stanja može biti vaša mačka koja sjedi, a vi koristite određenu riječ kako biste je natjerali da hoda.
- Naš agent reagira izvođenjem prijelaza radnje iz jednog "stanja" u drugo "stanje".
- Na primjer, vaša mačka prelazi iz sjedenja u hodanje.
- Reakcija agenta je radnja, a politika je metoda odabira radnje u određenom stanju u očekivanju boljih ishoda.
- Nakon tranzicije, agent može zauzvrat dobiti nagradu ili kaznu.
Učenje ojačanja Algorithms
Postoje tri pristupa implementaciji algoritma učenja s potkrepljenjem, a razlikuju se uglavnom u onome što agent pohranjuje i uči.
Na temelju vrijednosti
U metodi učenja s potkrepljenjem temeljenoj na vrijednosti, pokušava se maksimizirati funkcija vrijednosti V(s). U ovoj metodi agent očekuje dugoročni povrat trenutnih stanja pod politikom π.
Na temelju politike
U RL metodi temeljenoj na pravilima, pokušavate osmisliti pravilo takvo da vam radnja izvršena u svakom stanju pomaže da ostvarite maksimalnu nagradu u budućnosti.
Dvije su vrste metoda temeljenih na politici:
- deterministički: Za bilo koje stanje, politika π proizvodi istu akciju.
- Stohastički: Svaka akcija ima određenu vjerojatnost, danu sljedećom jednadžbom.
Stohastička politika:
π(a|s) = P[At = a | St = s]
Na temelju modela
U ovoj metodi učenja s potkrepljenjem, stvarate virtualni model za svako okruženje. Agent uči kako funkcionirati u tom specifičnom okruženju.
Karakteristike učenja s potkrepljenjem
Evo važnih karakteristika učenja s potkrepljenjem:
- Nema nadzornika, samo pravi broj ili signal nagrade
- Sekvencijalno donošenje odluka
- Vrijeme igra ključnu ulogu u problemima pojačanja
- Povratna informacija je često odgođena, a ne trenutna
- Radnje agenta određuju naknadne podatke koje prima
Vrste potkrepljenog učenja
Riječ „potkrepljenje“ posuđena je iz bihevioralne psihologije i javlja se u dva oblika:
Pozitivan:
Definira se kao događaj koji se javlja zbog određenog ponašanja. Povećava snagu i učestalost ponašanja te pozitivno utječe na radnju koju poduzima agent.
Ova vrsta potkrepljenja pomaže vam maksimizirati performanse i održati promjenu dulje vrijeme. Međutim, previše potkrepljenja može dovesti do prekomjerne optimizacije stanja, što može utjecati na rezultate.
Negativan:
Negativno potkrepljenje definira se kao jačanje ponašanja koje se javlja zbog negativnog uvjeta koji je trebalo zaustaviti ili izbjeći. Pomaže vam definirati minimalni standard izvedbe. Međutim, nedostatak ove metode je što pruža samo dovoljno za zadovoljavanje minimalnog ponašanja.
Učenje modela potkrepljenja
Postoje dva važna modela učenja u učenju s potkrepljenjem:
- Markovljev proces odlučivanja
- Q učenje
Markovljev proces odlučivanja
Za dobivanje rješenja koriste se sljedeći parametri:
- Skup radnji – A
- Skup stanja – S
- Nagrada – R
- Politika – π
- Vrijednost – V
Matematički pristup za kartuping Rješenje u učenju s potkrepljenjem formalizirano je kao Markovljev proces odlučivanja ili MDP. Shema u nastavku prikazuje tih pet parametara povezanih u isti ciklus agent-okoliš.
Q-učenje
Q-učenje je metoda pružanja informacija temeljena na vrijednosti koja agentu govori koju radnju treba poduzeti.
Razumjet ćemo ovu metodu sljedećim primjerom:
- U zgradi postoji pet prostorija koje su povezane vratima.
- Svaka soba je numerirana od 0 do 4
- Vanjski dio zgrade može se tretirati kao jedno veliko vanjsko područje (5)
- Vrata broj 1 i 4 vode u zgradu iz prostorije 5
Donji tlocrt označava te sobe brojevima i pokazuje koja ih vrata povezuju.
Zatim, svakim vratima trebate dodijeliti vrijednost nagrade:
- Vrata koja vode izravno do cilja imaju nagradu od 100
- Vrata koja nisu izravno povezana s ciljanom sobom ne daju nikakvu nagradu
- Budući da su vrata dvosmjerna, za svaku sobu su dodijeljene dvije strelice.
- Svaka strelica na gornjoj slici nosi trenutnu nagradnu vrijednost
Objašnjenje: Na ovoj slici svaka soba predstavlja stanje, a kretanje agenta iz jedne sobe u drugu predstavlja akciju.
Na donjem grafu, stanje je nacrtano kao čvor, dok strelice prikazuju dostupne akcije i nagradu vezanu uz svaku od njih.
Na primjer, agent prelazi iz sobe broj 2 u sobu broj 5:
- Početno stanje = stanje 2
- Stanje 2-> stanje 3
- Stanje 3 -> stanje (2,1,4)
- Stanje 4-> stanje (0,5,3)
- Stanje 1-> stanje (5,3)
- Stanje 0-> stanje 4
Učenje s potkrepljenjem naspram nadziranog učenja
Najjasniji način za postavljanje učenja s potkrepljenjem jest postavljanje uz paradigmu koju većina čitatelja već poznaje.
| Parametri | Učenje ojačanja | Nadzirano učenje |
|---|---|---|
| Stil odluke | Učenje s potkrepljenjem pomaže vam da donosite odluke sekvencijalno. | U ovoj metodi odluka se donosi na temelju unosa danog na početku. |
| Radi na | Djeluje interakcijom s okolinom. | Radi na primjerima ili danim oglednim podacima. |
| Ovisnost o odluci | U RL metodi, svaka odluka o učenju ovisi o prethodnima, tako da se evaluira cijeli niz odluka. | In nadzirano učenje Odluke su međusobno neovisne, pa se svakoj odluci daje oznaka. |
| Najprikladniji | Podržava i bolje funkcionira u umjetnoj inteligenciji, gdje prevladava ljudska interakcija. | Uglavnom se njime upravlja pomoću interaktivnog softverskog sustava ili aplikacija. |
| Primjer | Igra šaha | Prepoznavanje predmeta |
Primjene potkrepljenog učenja
Evo primjena učenja s pojačanjem:
- Robotika za industrijsku automatizaciju.
- Planiranje poslovne strategije
- Strojno učenje i obrada podataka
- Pomaže vam u stvaranju sustava obuke koji pružaju prilagođene upute i materijale prema zahtjevima učenika.
- Upravljanje zrakoplovom i upravljanje kretanjem robota
Zašto koristiti učenje s pojačanjem?
Evo glavnih razloga za korištenje učenja s potkrepljenjem:
- Pomaže vam da shvatite koja situacija zahtijeva djelovanje
- Pomaže vam otkriti koja akcija donosi najveću nagradu tijekom duljeg razdoblja
- Učenje s potkrepljenjem također pruža agentu učenja funkciju nagrađivanja
- Također omogućuje agentu da shvati najbolju metodu za dobivanje velikih nagrada
Kada ne koristiti učenje potkrepljivanjem?
Model učenja s potkrepljenjem ne možete primijeniti u svakoj situaciji. Evo nekoliko uvjeta u kojima ga ne biste trebali koristiti.
- Kada imate dovoljno označenih podataka za rješavanje problema metodom nadziranog učenja
- Učenje s potkrepljenjem zahtijeva puno računanja i vremena, posebno kada je prostor djelovanja velik.
Izazovi potkrepljenog učenja
Evo glavnih izazova s kojima ćete se suočiti tijekom učenja s potkrepljenjem:
- Dizajn značajki i nagrada, što može biti vrlo složeno
- Parametri mogu utjecati na brzinu učenja.
- Realna okruženja mogu imati djelomičnu vidljivost.
- Previše potkrepljenja može dovesti do preopterećenja stanjima, što može umanjiti rezultate.
- Realne okoline mogu biti nestacionarne.




