Какво е обучение с подсилване? Видове, Algorithms & Пример
⚡ Умно обобщение
Обучението с подсилване е метод за машинно обучение, при който софтуерен агент се учи, като действа в дадена среда, събира награди или наказания и коригира поведението си, за да увеличи максимално кумулативната награда в продължение на много стъпки.
Какво е обучение с подсилване?
Укрепване на обучението е Machine Learning метод, свързан с това как софтуерните агенти трябва да предприемат действия в дадена среда. На агента не се показват правилни отговори; той се учи от получената награда и коригира поведението си, за да увеличи максимално кумулативната награда.
Обучението с подсилване е самостоятелен клон на машинното обучение, наред с надзор намлява без надзор обучение. Когато политиката или ценностната функция на агента е представена от невронна мрежа, комбинацията се нарича обучение с дълбоко укрепване — това сдвояване е това, което позволява на агента да постигне сложна цел или да увеличи максимално специфично измерение в рамките на много стъпки.
Важни компоненти на метода на обучение с подсилване
Преди алгоритмите да придобият смисъл, е полезно да назовем частите. Диаграмата по-долу показва как агентът, средата, действието и сигналът за награда се съчетават в един цикъл.
Ето някои важни термини, използвани в обучението с подсилване:
- Агент: Съществото, което извършва действия в дадена среда, за да получи някаква награда.
- Околна среда (e): Сценарий, пред който един агент трябва да се изправи.
- Награда (R): Незабавно възвръщаемост, дадена на агент, когато той изпълни конкретно действие или задача.
- Щат(а): Състоянието се отнася до текущата ситуация, върната от околната среда.
- Политика (π): Стратегията, прилагана от агента, за да определи следващото действие въз основа на текущото състояние.
- Стойност (V): Очакваната дългосрочна възвръщаемост с отстъпка, в сравнение с краткосрочната награда.
- Стойностна функция: Той определя стойността на дадено състояние, т.е. общата сума на възнаграждението, което агентът може да очаква да натрупа, започвайки от това състояние.
- Модел на средата: Това имитира поведението на околната среда. Позволява ви да правите изводи и също така да определяте как ще се държи средата.
- Методи, базирани на модели: Методи, които решават проблеми с обучението с подсилване, като първо се учи или използва модел на средата, а след това се планира спрямо него.
- Q стойност или стойност на действие (Q): Q-стойността е доста подобна на стойността. Единствената разлика между двете е, че приема допълнителен параметър - текущото действие.
Как работи Reinforcement Learning?
Една ежедневна аналогия изяснява механизма, преди да се появи каквато и да е нотация.
Помислете за сценария, в който учите котката си на нови трикове.
- Тъй като котката не разбира английски или друг човешки език, не можем да ѝ кажем директно какво да прави. Вместо това следваме различна стратегия.
- Имитираме ситуация и котката се опитва да реагира по много различни начини. Ако реакцията на котката е желаната, ѝ даваме риба.
- Сега, когато котката е изложена на същата ситуация, тя извършва подобно действие още по-ентусиазирано, в очакване да получи повече награда (храна).
- Това е наученото от котката за това „какво да прави“ чрез положителни преживявания.
- В същото време котката се научава и какво да не прави, когато се сблъсква с негативни преживявания.
Пример за обучение с подсилване
Фигурата по-долу пренася тази история за котката във формалния цикъл, като домакинството е средата, а рибката е наградата.

В такъв случай,
- Вашата котка е агент, който е изложен на околната среда. В този случай това е вашата къща. Пример за състояние може да бъде вашата котка, която седи, а вие използвате конкретна дума, за да я накарате да ходи.
- Нашият агент реагира, като извършва преход на действие от едно „състояние“ в друго „състояние“.
- Например, вашата котка преминава от седнало положение към ходене.
- Реакцията на даден агент е действие, а политиката е метод за избор на действие при дадено състояние в очакване на по-добри резултати.
- След прехода, агентът може да получи награда или наказание в замяна.
Укрепване на обучението Algorithms
Има три подхода за внедряване на алгоритъм за обучение с подсилване и те се различават главно по това какво агентът съхранява и научава.
Базиран на стойност
При метода на обучение с подсилване, базиран на стойност, се опитвате да максимизирате стойностна функция V(s). При този метод агентът очаква дългосрочна възвръщаемост на текущите състояния при политика π.
Базиран на политика
При метод на RL, базиран на политики, се опитвате да измислите политика, такава че действието, извършено във всяко състояние, да ви помогне да получите максимална награда в бъдеще.
Два вида методи, базирани на политики, са:
- Детерминистичен: За всяко състояние, политиката π произвежда същото действие.
- Стохастичен: Всяко действие има определена вероятност, дадена от следното уравнение.
Стохастична политика:
π(a|s) = P[At = a | St = s]
Базиран на модел
При този метод на обучение с подсилване, вие създавате виртуален модел за всяка среда. Агентът се учи да действа в тази специфична среда.
Характеристики на обучението с подсилване
Ето важни характеристики на обучението с подсилване:
- Няма надзорник, само реално число или сигнал за награда
- Последователно вземане на решения
- Времето играе решаваща роля при проблемите с армировката
- Обратната връзка често е със закъснение, а не мигновена
- Действията на агента определят последващите данни, които получава
Видове учене с подсилване
Думата „подкрепление“ е заимствана от поведенческата психология и се среща в две форми:
Положителен:
Дефинира се като събитие, което се случва поради специфично поведение. То увеличава силата и честотата на поведението и влияе положително върху действието, предприето от агента.
Този тип подкрепление ви помага да увеличите максимално производителността и да поддържате промяната за по-дълъг период. Прекалено многото подкрепление обаче може да доведе до свръхоптимизация на състоянието, което може да повлияе на резултатите.
Отрицателни:
Негативното подкрепление се определя като засилване на поведението, което се случва поради негативно условие, което е трябвало да бъде спряно или избегнато. То ви помага да определите минималния стандарт за изпълнение. Недостатъкът на този метод обаче е, че той осигурява само достатъчно, за да отговори на минималното поведение.
Учене на модели на подсилване
Има два важни модела на учене в ученето с подсилване:
- Марков процес на вземане на решение
- Q обучение
Марков процес на вземане на решение
Следните параметри се използват за получаване на решение:
- Набор от действия – А
- Набор от състояния – S
- Награда – R
- Политика – π
- Стойност – V
Математическият подход за картаping Решението в Reinforcement Learning е формализирано като процес на вземане на решения на Марков или MDP. Схемата по-долу показва тези пет параметъра, свързани в един и същ цикъл агент-среда.
Q-обучение
Q обучението е базиран на стойност метод за предоставяне на информация, която казва на агента какво действие да предприеме.
Нека разберем този метод със следния пример:
- В една сграда има пет стаи, които са свързани с врати.
- Всяка стая е номерирана от 0 до 4
- Външната част на сградата може да се третира като едно голямо външно пространство (5)
- Врати номер 1 и 4 водят към сградата от стая 5
Планът по-долу номерира тези стаи и показва кои врати ги свързват.
След това трябва да свържете стойност на наградата с всяка врата:
- Вратите, които водят директно към целта, имат награда от 100
- Вратите, които не са директно свързани с целевата стая, не дават никаква награда.
- Тъй като вратите са двупосочни, за всяка стая са назначени две стрелки.
- Всяка стрелка на изображението по-горе носи незабавна стойност на наградата
Обяснение: На това изображение всяка стая представлява състояние, а движението на агента от една стая в друга представлява действие.
В графиката по-долу състоянието е нарисувано като възел, а стрелките показват наличните действия и наградата, свързана с всяко от тях.
Например, агент преминава от стая номер 2 до стая номер 5:
- Първоначално състояние = състояние 2
- Състояние 2-> състояние 3
- Състояние 3 -> състояние (2,1,4)
- Състояние 4-> състояние (0,5,3)
- Състояние 1-> състояние (5,3)
- Състояние 0-> състояние 4
Обучение с подсилване срещу контролирано обучение
Най-ясният начин да се постави обучението с подсилване е да се постави до парадигмата, която повечето читатели вече познават.
| параметри | Укрепване на обучението | Контролирано обучение |
|---|---|---|
| Стил на решение | Обучението с подсилване ви помага да вземате решенията си последователно. | При този метод решение се взема на базата на въведените данни в началото. |
| Работи върху | Работи чрез взаимодействие с околната среда. | Работи върху примери или дадени примерни данни. |
| Зависимост от решението | В метода RL всяко решение за обучение зависи от предходните, така че цялата поредица от решения е това, което се оценява. | In контролирано обучение Решенията са независими едно от друго, така че за всяко решение се дава етикет. |
| Най-подходящ | Поддържа и работи по-добре в ИИ, където човешкото взаимодействие е преобладаващо. | Най-често се управлява с интерактивна софтуерна система или приложения. |
| Пример | Игра на шах | Разпознаване на обекти |
Приложения на обучението с подсилване
Ето приложенията на Reinforcement Learning:
- Роботика за индустриална автоматизация.
- Планиране на бизнес стратегия
- Машинно обучение и обработка на данни
- Това ви помага да създавате обучителни системи, които предоставят персонализирани инструкции и материали според изискванията на учениците.
- Управление на самолета и управление на движението на робота
Защо да използвате Reinforcement Learning?
Ето основните причини да използвате Reinforcement Learning:
- Помага ви да откриете коя ситуация изисква действие
- Помага ви да откриете кое действие носи най-висока награда за по-дълъг период
- Обучението с подсилване също така предоставя на обучаващия се агент функция за възнаграждение
- Това също така позволява на агента да определи най-добрия метод за получаване на големи награди
Кога не трябва да се използва обучение с подсилване?
Не можете да прилагате модел на обучение с подсилване във всяка ситуация. Ето някои условия, при които не бива да го използвате.
- Когато имате достатъчно етикетирани данни, за да решите проблема с метод на контролирано обучение
- Обучението с подсилване е изчислително и отнема много време, особено когато пространството за действие е голямо.
Предизвикателства на обучението за засилване
Ето основните предизвикателства, с които ще се сблъскате, докато прилагате обучение с подсилване:
- Дизайн на функции и награди, който може да бъде много сложен
- Параметрите могат да повлияят на скоростта на обучение.
- Реалистичните среди могат да имат частична видимост.
- Твърде многото подкрепление може да доведе до претоварване на състоянията, което може да намали резултатите.
- Реалистичните среди могат да бъдат нестационарни.




