Що таке навчання з підкріпленням? Види, Algorithms & Приклад
⚡ Розумний підсумок
Навчання з підкріпленням — це метод машинного навчання, в якому програмний агент навчається, діючи в певному середовищі, збираючи винагороди або штрафи та коригуючи свою поведінку для максимізації кумулятивної винагороди протягом багатьох кроків.
Що таке навчання з підкріпленням?
Навчання зміцненню це машинне навчання метод, що стосується того, як програмні агенти повинні діяти в певному середовищі. Агенту не показують правильні відповіді; він навчається на отриманій винагороді та коригує свою поведінку, щоб максимізувати кумулятивну винагороду.
Навчання з підкріпленням є самостійною галуззю машинного навчання, поряд контрольований та без нагляду навчання. Коли політика агента або функція цінності представлена нейронною мережею, ця комбінація називається глибоке навчання з підкріпленням — саме це сполучення дозволяє агенту досягти складної мети або максимізувати певний вимір протягом багатьох кроків.
Важливі компоненти методу навчання з підкріпленням
Перш ніж алгоритми стануть логічними, варто назвати їхні частини. На діаграмі нижче показано, як агент, середовище, дія та сигнал винагороди поєднуються в одному циклі.
Ось деякі важливі терміни, що використовуються в навчанні з підкріпленням:
- Агент: Сутність, яка виконує дії в певному середовищі для отримання певної винагороди.
- Середовище (e): Сценарій, з яким доводиться стикатися агенту.
- Нагорода (R): Негайне відшкодування, що надається агенту, коли він виконує певну дію або завдання.
- Штат(и): Стан відноситься до поточної ситуації, повернутої середовищем.
- Політика (π): Стратегія, що застосовується агентом для визначення наступної дії на основі поточного стану.
- Значення (V): Очікувана довгострокова дохідність зі знижкою порівняно з короткостроковою винагородою.
- Функція значення: Він визначає значення стану, тобто загальну суму винагороди, яку агент може очікувати накопичити, починаючи з цього стану.
- Модель середовища: Це імітує поведінку середовища. Це дозволяє робити висновки, а також визначати, як воно поводитиметься.
- Методи на основі моделей: Методи, що вирішують проблеми навчання з підкріпленням, спочатку навчаючись або використовуючи модель середовища, а потім плануючи відповідно до неї.
- Значення Q або значення дії (Q): Q-значення досить схоже на значення. Єдина відмінність між ними полягає в тому, що воно приймає додатковий параметр – поточну дію.
Як працює навчання з підкріпленням?
Повсякденна аналогія робить механізм зрозумілим ще до появи будь-яких позначень.
Уявіть собі сценарій, коли ви навчаєте свою кішку новим трюкам.
- Оскільки кішка не розуміє англійської чи будь-якої іншої людської мови, ми не можемо безпосередньо їй сказати, що робити. Натомість ми дотримуємося іншої стратегії.
- Ми імітуємо ситуацію, і кішка намагається реагувати різними способами. Якщо реакція кішки є бажаною, ми даємо їй рибу.
- Тепер, коли кішка опиняється в подібній ситуації, вона виконує подібну дію ще більш охоче, очікуючи отримати більше винагороди (їжі).
- Це навчання, яке кішка отримує про те, «що робити», з позитивного досвіду.
- Водночас кішка також дізнається, чого не слід робити, стикаючись із негативним досвідом.
Приклад навчання з підкріпленням
На рисунку нижче історія про кота відображається на формальному циклі, де домогосподарство є середовищем, а рибка — винагородою.

В цьому випадку,
- Ваш кіт – це агент, який піддається впливу навколишнього середовища. У цьому випадку це ваш будинок. Прикладом стану може бути ваш кіт, який сидить, і ви використовуєте певне слово, щоб змусити його ходити.
- Наш агент реагує, виконуючи перехід дії з одного «стану» в інший «стан».
- Наприклад, ваша кішка переходить від сидіння до ходьби.
- Реакція агента — це дія, а політика — це метод вибору дії в певному стані в очікуванні кращих результатів.
- Після переходу агент може отримати винагороду або штраф натомість.
Навчання зміцненню Algorithms
Існує три підходи до реалізації алгоритму навчання з підкріпленням, і вони відрізняються головним чином тим, що агент зберігає та вивчає.
На основі цінностей
У методі навчання з підкріпленням на основі цінностей ви намагаєтеся максимізувати функцію цінності V(s). У цьому методі агент очікує довгострокової віддачі від поточних станів за політики π.
На основі політики
У методі RL на основі політик ви намагаєтеся розробити таку політику, щоб дія, виконана в кожному стані, допомогла вам отримати максимальну винагороду в майбутньому.
Два типи методів на основі політики:
- Детермінований: Для будь-якого стану політика π викликає ту саму дію.
- Стохастичний: Кожна дія має певну ймовірність, яка визначається наступним рівнянням.
Стохастична політика:
π(a|s) = P[At = a | St = s]
На основі моделі
У цьому методі навчання з підкріпленням ви створюєте віртуальну модель для кожного середовища. Агент навчається діяти в цьому конкретному середовищі.
Характеристики навчання з підкріпленням
Ось важливі характеристики навчання з підкріпленням:
- Немає супервізора, тільки реальне число або сигнал винагороди
- Послідовне прийняття рішень
- Час відіграє вирішальну роль у проблемах підкріплення
- Зворотній зв'язок часто надходить із затримкою, а не миттєво
- Дії агента визначають подальші дані, які він отримує
Типи навчання з підкріпленням
Слово «підкріплення» запозичене з поведінкової психології та буває двох форм:
Позитивні:
Це визначається як подія, що відбувається через певну поведінку. Вона збільшує силу та частоту поведінки та позитивно впливає на дії, що виконуються агентом.
Такий тип підкріплення допомагає максимізувати продуктивність та підтримувати зміни протягом тривалішого періоду. Однак надмірне підкріплення може призвести до надмірної оптимізації стану, що може вплинути на результати.
Негативний:
Негативне підкріплення визначається як посилення поведінки, що виникає через негативну умову, яку слід було зупинити або уникнути. Воно допомагає визначити мінімальний стандарт виконання. Однак недоліком цього методу є те, що він забезпечує лише достатньо для задоволення мінімальної поведінки.
Вивчення моделей підкріплення
У навчанні з підкріпленням є дві важливі моделі навчання:
- Марковський процес прийняття рішень
- Q навчання
Марковський процес прийняття рішень
Для отримання рішення використовуються такі параметри:
- Набір дій – А
- Набір станів – S
- Нагорода – R
- Політика – π
- Значення – V
Математичний підхід до картиping Рішення в навчанні з підкріпленням формалізується як процес прийняття рішень Маркова, або MDP. Наведена нижче схема показує ці п'ять параметрів, пов'язаних з одним циклом агент-середовище.
Q-навчання
Q-навчання — це ціннісний метод надання інформації, яка вказує агенту, яку дію слід виконати.
Давайте розберемося з цим методом на наступному прикладі:
- У будівлі є п'ять кімнат, які з'єднані дверима.
- Кожна кімната пронумерована від 0 до 4
- Зовнішню частину будівлі можна розглядати як одну велику зовнішню зону (5)
- Двері номер 1 і 4 ведуть в будівлю з кімнати 5
На плані поверху нижче пронумеровано ці кімнати та показано, які двері їх з'єднують.
Далі вам потрібно пов’язати значення винагороди з кожними дверима:
- Двері, які ведуть прямо до мети, отримують винагороду 100
- Двері, які не пов'язані безпосередньо з цільовою кімнатою, не дають нульової винагороди
- Оскільки двері двосторонні, для кожної кімнати призначено дві стрілки.
- Кожна стрілка на зображенні вище несе миттєву винагороду
Пояснення: На цьому зображенні кожна кімната представляє стан, а переміщення агента з однієї кімнати в іншу представляє дію.
На графіку нижче стан зображено як вузол, а стрілки показують доступні дії та винагороду, пов'язану з кожною з них.
Наприклад, агент переходить з кімнати номер 2 до кімнати номер 5:
- Початковий стан = стан 2
- Стан 2-> стан 3
- Стан 3 -> стан (2,1,4)
- Стан 4-> стан (0,5,3)
- Стан 1-> стан (5,3)
- Стан 0-> стан 4
Навчання з підкріпленням проти навчання під контролем
Найчіткіший спосіб розташувати навчання з підкріпленням – це поставити його поруч із парадигмою, яка вже знайома більшості читачів.
| Параметри | Навчання зміцненню | Навчання під наглядом |
|---|---|---|
| Стиль рішення | Навчання з підкріпленням допомагає вам приймати рішення послідовно. | У цьому методі рішення приймається на основі вхідних даних, наведених на початку. |
| Працює на | Працює, взаємодіючи з навколишнім середовищем. | Працює на прикладах або заданих зразках даних. |
| Залежність від рішення | У методі RL кожне навчальне рішення залежить від попередніх, тому оцінюється вся послідовність рішень. | In контрольоване навчання Рішення незалежні одне від одного, тому кожному рішенню надається мітка. |
| Найкраще підходить | Підтримує та краще працює в умовах штучного інтелекту, де поширена взаємодія з людиною. | Здебільшого він працює за допомогою інтерактивної програмної системи або програм. |
| Приклад | Гра в шахи | Розпізнавання об’єктів |
Застосування навчання з підкріпленням
Ось програми Reinforcement Learning:
- Робототехніка для промислової автоматизації.
- Планування бізнес-стратегії
- Машинне навчання та обробка даних
- Це допомагає вам створювати навчальні системи, які надають індивідуальні інструкції та матеріали відповідно до потреб студентів.
- Керування літальним апаратом і керування рухом робота
Навіщо використовувати Reinforcement Learning?
Ось основні причини використання навчання з підкріпленням:
- Це допомагає вам визначити, яка ситуація потребує дій
- Допомагає вам виявити, яка дія приносить найбільшу винагороду протягом тривалого періоду
- Навчання з підкріпленням також забезпечує навчальний агент функцією винагороди
- Це також дозволяє агенту визначити найкращий метод отримання великих винагород
Коли не слід використовувати навчання з підкріпленням?
Ви не можете застосовувати модель навчання з підкріпленням у кожній ситуації. Ось деякі умови, за яких вам не слід її використовувати.
- Коли у вас достатньо позначених даних для вирішення проблеми за допомогою методу навчання з учителем
- Навчання з підкріпленням вимагає багато обчислювальних ресурсів та часу, особливо коли простір дій великий.
Проблеми навчання з підкріпленням
Ось основні труднощі, з якими ви зіткнетеся під час навчання з підкріпленням:
- Дизайн функцій та винагород, який може бути дуже складним
- Параметри можуть впливати на швидкість навчання.
- Реалістичне середовище може частково спостерігатися.
- Занадто велике підкріплення може призвести до перевантаження станів, що може погіршити результати.
- Реалістичне середовище може бути нестаціонарним.




