Какво е обучение с подсилване? Видове, Algorithms & Пример

⚡ Умно обобщение

Обучението с подсилване е метод за машинно обучение, при който софтуерен агент се учи, като действа в дадена среда, събира награди или наказания и коригира поведението си, за да увеличи максимално кумулативната награда в продължение на много стъпки.

  • 🔘 Основен цикъл: Агентът наблюдава състояние, предприема действие, получава награда и попада в ново състояние.
  • ☑️ Три подхода: Методите, базирани на стойност, базирани на политики и базирани на модели, се различават по това, което агентът действително научава.
  • Два модела на обучение: Процесите на вземане на решения на Марков оформят проблема; Q-обучението го решава от опит.
  • 🧪 Без надзор: Не съществуват етикетирани отговори, а само сигнал за забавена награда, който агентът трябва да отдаде на по-ранни действия.
  • 🛠️ Където е подходящо: Роботика, игри, управление на самолети, адаптивно обучение и планиране на бизнес стратегии.
  • Известни разходи: Обучението изисква големи изчисления, дизайнът на наградите е деликатен, а реалните среди са шумни и нестационарни.

Обучение с подсилване: алгоритми, видове и примери

Какво е обучение с подсилване?

Укрепване на обучението е Machine Learning метод, свързан с това как софтуерните агенти трябва да предприемат действия в дадена среда. На агента не се показват правилни отговори; той се учи от получената награда и коригира поведението си, за да увеличи максимално кумулативната награда.

Обучението с подсилване е самостоятелен клон на машинното обучение, наред с надзор намлява без надзор обучение. Когато политиката или ценностната функция на агента е представена от невронна мрежа, комбинацията се нарича обучение с дълбоко укрепване — това сдвояване е това, което позволява на агента да постигне сложна цел или да увеличи максимално специфично измерение в рамките на много стъпки.

Важни компоненти на метода на обучение с подсилване

Преди алгоритмите да придобият смисъл, е полезно да назовем частите. Диаграмата по-долу показва как агентът, средата, действието и сигналът за награда се съчетават в един цикъл.

Цикъл на обучение с подсилване, свързващ агент, действие, среда, състояние и награда

Ето някои важни термини, използвани в обучението с подсилване:

  • Агент: Съществото, което извършва действия в дадена среда, за да получи някаква награда.
  • Околна среда (e): Сценарий, пред който един агент трябва да се изправи.
  • Награда (R): Незабавно възвръщаемост, дадена на агент, когато той изпълни конкретно действие или задача.
  • Щат(а): Състоянието се отнася до текущата ситуация, върната от околната среда.
  • Политика (π): Стратегията, прилагана от агента, за да определи следващото действие въз основа на текущото състояние.
  • Стойност (V): Очакваната дългосрочна възвръщаемост с отстъпка, в сравнение с краткосрочната награда.
  • Стойностна функция: Той определя стойността на дадено състояние, т.е. общата сума на възнаграждението, което агентът може да очаква да натрупа, започвайки от това състояние.
  • Модел на средата: Това имитира поведението на околната среда. Позволява ви да правите изводи и също така да определяте как ще се държи средата.
  • Методи, базирани на модели: Методи, които решават проблеми с обучението с подсилване, като първо се учи или използва модел на средата, а след това се планира спрямо него.
  • Q стойност или стойност на действие (Q): Q-стойността е доста подобна на стойността. Единствената разлика между двете е, че приема допълнителен параметър - текущото действие.

Как работи Reinforcement Learning?

Една ежедневна аналогия изяснява механизма, преди да се появи каквато и да е нотация.

Помислете за сценария, в който учите котката си на нови трикове.

  • Тъй като котката не разбира английски или друг човешки език, не можем да ѝ кажем директно какво да прави. Вместо това следваме различна стратегия.
  • Имитираме ситуация и котката се опитва да реагира по много различни начини. Ако реакцията на котката е желаната, ѝ даваме риба.
  • Сега, когато котката е изложена на същата ситуация, тя извършва подобно действие още по-ентусиазирано, в очакване да получи повече награда (храна).
  • Това е наученото от котката за това „какво да прави“ чрез положителни преживявания.
  • В същото време котката се научава и какво да не прави, когато се сблъсква с негативни преживявания.

Пример за обучение с подсилване

Фигурата по-долу пренася тази история за котката във формалния цикъл, като домакинството е средата, а рибката е наградата.

Пример за котка и собственик, картографиран върху цикъла агент-среда за обучение с подсилване
Как работи обучението с подсилване

В такъв случай,

  • Вашата котка е агент, който е изложен на околната среда. В този случай това е вашата къща. Пример за състояние може да бъде вашата котка, която седи, а вие използвате конкретна дума, за да я накарате да ходи.
  • Нашият агент реагира, като извършва преход на действие от едно „състояние“ в друго „състояние“.
  • Например, вашата котка преминава от седнало положение към ходене.
  • Реакцията на даден агент е действие, а политиката е метод за избор на действие при дадено състояние в очакване на по-добри резултати.
  • След прехода, агентът може да получи награда или наказание в замяна.

Укрепване на обучението Algorithms

Има три подхода за внедряване на алгоритъм за обучение с подсилване и те се различават главно по това какво агентът съхранява и научава.

Базиран на стойност

При метода на обучение с подсилване, базиран на стойност, се опитвате да максимизирате стойностна функция V(s). При този метод агентът очаква дългосрочна възвръщаемост на текущите състояния при политика π.

Базиран на политика

При метод на RL, базиран на политики, се опитвате да измислите политика, такава че действието, извършено във всяко състояние, да ви помогне да получите максимална награда в бъдеще.

Два вида методи, базирани на политики, са:

  • Детерминистичен: За всяко състояние, политиката π произвежда същото действие.
  • Стохастичен: Всяко действие има определена вероятност, дадена от следното уравнение.

Стохастична политика:

π(a|s) = P[At = a | St = s]

Базиран на модел

При този метод на обучение с подсилване, вие създавате виртуален модел за всяка среда. Агентът се учи да действа в тази специфична среда.

Характеристики на обучението с подсилване

Ето важни характеристики на обучението с подсилване:

  • Няма надзорник, само реално число или сигнал за награда
  • Последователно вземане на решения
  • Времето играе решаваща роля при проблемите с армировката
  • Обратната връзка често е със закъснение, а не мигновена
  • Действията на агента определят последващите данни, които получава

Видове учене с подсилване

Думата „подкрепление“ е заимствана от поведенческата психология и се среща в две форми:

Положителен:

Дефинира се като събитие, което се случва поради специфично поведение. То увеличава силата и честотата на поведението и влияе положително върху действието, предприето от агента.

Този тип подкрепление ви помага да увеличите максимално производителността и да поддържате промяната за по-дълъг период. Прекалено многото подкрепление обаче може да доведе до свръхоптимизация на състоянието, което може да повлияе на резултатите.

Отрицателни:

Негативното подкрепление се определя като засилване на поведението, което се случва поради негативно условие, което е трябвало да бъде спряно или избегнато. То ви помага да определите минималния стандарт за изпълнение. Недостатъкът на този метод обаче е, че той осигурява само достатъчно, за да отговори на минималното поведение.

Учене на модели на подсилване

Има два важни модела на учене в ученето с подсилване:

  • Марков процес на вземане на решение
  • Q обучение

Марков процес на вземане на решение

Следните параметри се използват за получаване на решение:

  • Набор от действия – А
  • Набор от състояния – S
  • Награда – R
  • Политика – π
  • Стойност – V

Математическият подход за картаping Решението в Reinforcement Learning е формализирано като процес на вземане на решения на Марков или MDP. Схемата по-долу показва тези пет параметъра, свързани в един и същ цикъл агент-среда.

Схема на процеса на вземане на решения на Марков със състояния, действия, награда и политика

Q-обучение

Q обучението е базиран на стойност метод за предоставяне на информация, която казва на агента какво действие да предприеме.

Нека разберем този метод със следния пример:

  • В една сграда има пет стаи, които са свързани с врати.
  • Всяка стая е номерирана от 0 до 4
  • Външната част на сградата може да се третира като едно голямо външно пространство (5)
  • Врати номер 1 и 4 водят към сградата от стая 5

Планът по-долу номерира тези стаи и показва кои врати ги свързват.

План на етажа на сграда с пет стаи с номерирани стаи и външната площ 5

След това трябва да свържете стойност на наградата с всяка врата:

  • Вратите, които водят директно към целта, имат награда от 100
  • Вратите, които не са директно свързани с целевата стая, не дават никаква награда.
  • Тъй като вратите са двупосочни, за всяка стая са назначени две стрелки.
  • Всяка стрелка на изображението по-горе носи незабавна стойност на наградата

Обяснение: На това изображение всяка стая представлява състояние, а движението на агента от една стая в друга представлява действие.

В графиката по-долу състоянието е нарисувано като възел, а стрелките показват наличните действия и наградата, свързана с всяко от тях.

Графика на състоянието на петте стаи със стойности на наградите от 0 и 100 за всеки преход

Например, агент преминава от стая номер 2 до стая номер 5:

  • Първоначално състояние = състояние 2
  • Състояние 2-> състояние 3
  • Състояние 3 -> състояние (2,1,4)
  • Състояние 4-> състояние (0,5,3)
  • Състояние 1-> състояние (5,3)
  • Състояние 0-> състояние 4

Обучение с подсилване срещу контролирано обучение

Най-ясният начин да се постави обучението с подсилване е да се постави до парадигмата, която повечето читатели вече познават.

параметри Укрепване на обучението Контролирано обучение
Стил на решение Обучението с подсилване ви помага да вземате решенията си последователно. При този метод решение се взема на базата на въведените данни в началото.
Работи върху Работи чрез взаимодействие с околната среда. Работи върху примери или дадени примерни данни.
Зависимост от решението В метода RL всяко решение за обучение зависи от предходните, така че цялата поредица от решения е това, което се оценява. In контролирано обучение Решенията са независими едно от друго, така че за всяко решение се дава етикет.
Най-подходящ Поддържа и работи по-добре в ИИ, където човешкото взаимодействие е преобладаващо. Най-често се управлява с интерактивна софтуерна система или приложения.
Пример Игра на шах Разпознаване на обекти

Приложения на обучението с подсилване

Ето приложенията на Reinforcement Learning:

  • Роботика за индустриална автоматизация.
  • Планиране на бизнес стратегия
  • Машинно обучение и обработка на данни
  • Това ви помага да създавате обучителни системи, които предоставят персонализирани инструкции и материали според изискванията на учениците.
  • Управление на самолета и управление на движението на робота

Защо да използвате Reinforcement Learning?

Ето основните причини да използвате Reinforcement Learning:

  • Помага ви да откриете коя ситуация изисква действие
  • Помага ви да откриете кое действие носи най-висока награда за по-дълъг период
  • Обучението с подсилване също така предоставя на обучаващия се агент функция за възнаграждение
  • Това също така позволява на агента да определи най-добрия метод за получаване на големи награди

Кога не трябва да се използва обучение с подсилване?

Не можете да прилагате модел на обучение с подсилване във всяка ситуация. Ето някои условия, при които не бива да го използвате.

  • Когато имате достатъчно етикетирани данни, за да решите проблема с метод на контролирано обучение
  • Обучението с подсилване е изчислително и отнема много време, особено когато пространството за действие е голямо.

Предизвикателства на обучението за засилване

Ето основните предизвикателства, с които ще се сблъскате, докато прилагате обучение с подсилване:

  • Дизайн на функции и награди, който може да бъде много сложен
  • Параметрите могат да повлияят на скоростта на обучение.
  • Реалистичните среди могат да имат частична видимост.
  • Твърде многото подкрепление може да доведе до претоварване на състоянията, което може да намали резултатите.
  • Реалистичните среди могат да бъдат нестационарни.

Въпроси и Отговори

Експлоатацията повтаря действието, което в момента се смята за най-добро; изследването опитва нещо друго, за да открие по-добро. Епсилон-алчността се справя с това, като действа произволно с вероятност ε и алчно в противен случай, след което намалява ε с натрупването на опит.

Гама-коефициентът претегля бъдещите награди спрямо непосредствените. Стойност близо до 0 прави агента късоглед и алчен за незабавна награда; стойност близо до 1 го прави достатъчно търпелив, за да приеме малка загуба сега за по-голямо изплащане по-късно.

Q-обучението е извън правилата: то се актуализира към най-доброто възможно следващо действие, независимо от това какво всъщност е направил агентът. SARSA е в съответствие с правилата и се актуализира спрямо действието, което наистина е предприел, което го прави по-предпазлив в близост до рискови състояния.

Дълбоката Q-мрежа замества Q-таблицата с невронна мрежа, така че състояния, които никога не са били наблюдавани по време на обучение, все още могат да бъдат оценявани. Добавят се повторение на опита и отделна целева мрежа, за да се поддържа стабилен обучителен сигнал.

Агентите без модели, като например Q-learning, учат единствено от извадков опит. Агентите, базирани на модели, първо изграждат модел на динамиката на средата и планират спрямо него, което изисква много по-малко реални взаимодействия, но страда, когато моделът е грешен.

Ученето с подсилване от човешка обратна връзка обучава модел на възнаграждение върху човешките предпочитания, след което настройва езиковия модел спрямо това възнаграждение. Ето защо асистентите са изградили дълбоко учене следвайте инструкциите, а не просто предсказвайте текст.

Копилот на GitHub е добър в шаблонните елементи: обвивки на средата, буфери за повторение, обучителни цикли и графики. Формулярът за наградиping и изборът на хиперпараметри все още изисква преценка, защото една тихо грешна награда създава агент, който се обучава щастливо и се държи зле.

Gymnasium предоставя стандартните среди за упражнения, Stable-Baselines3 предоставя тествани алгоритмични реализации, а TensorFlow или PyTorch предоставя мрежите. Започнете с табличен мрежов свят, преди да посегнете към която и да е от тях.

Обобщете тази публикация с: