Что такое обучение с подкреплением? Типы, Algorithms & Пример
⚡ Умное резюме
Обучение с подкреплением — это метод машинного обучения, при котором программный агент учится, действуя в окружающей среде, получая вознаграждения или штрафы и корректируя свое поведение для максимизации совокупного вознаграждения на протяжении многих шагов.
Что такое обучение с подкреплением?
Усиление обучения - это Машинное обучение Этот метод рассматривает, как программные агенты должны действовать в окружающей среде. Агенту не показываются правильные ответы; он учится на основе полученного вознаграждения и корректирует свое поведение, чтобы максимизировать суммарное вознаграждение.
Обучение с подкреплением — это самостоятельная отрасль машинного обучения, наряду с другими дисциплинами. контролируемый и бесконтрольный Обучение. Когда политика или функция ценности агента представлена нейронной сетью, такая комбинация называется глубокое подкрепление обучения — Именно такое сочетание позволяет агенту достичь сложной цели или максимизировать определенный параметр на протяжении многих шагов.
Важные компоненты метода обучения с подкреплением
Прежде чем алгоритмы станут понятными, полезно дать названия их компонентам. На диаграмме ниже показано, как агент, среда, действие и сигнал вознаграждения взаимодействуют в едином цикле.
Вот некоторые важные термины, используемые в обучении с подкреплением:
- Агент: Сущность, которая совершает действия в окружающей среде с целью получения вознаграждения.
- Окружающая среда (е): Сценарий, с которым приходится столкнуться агенту.
- Награда (R): Немедленная отдача, получаемая агентом за выполнение им определенного действия или задачи.
- Состояния): Состояние относится к текущей ситуации, возвращаемой средой.
- Политика (π): Стратегия, применяемая агентом для принятия решения о следующем действии на основе текущего состояния.
- Значение (В): Ожидаемая долгосрочная доходность с учетом дисконта по сравнению с краткосрочной выгодой.
- Функция значения: Оно определяет значение состояния, то есть общую сумму вознаграждения, которую агент может рассчитывать получить, начиная с этого состояния.
- Модель среды: Это имитирует поведение окружающей среды. Это позволяет делать выводы и определять, как будет вести себя окружающая среда.
- Методы, основанные на моделях: Методы, которые решают задачи обучения с подкреплением, сначала изучая или используя модель окружающей среды, а затем планируя действия на её основе.
- Значение Q или значение действия (Q): Значение Q очень похоже на значение. Единственное различие между ними заключается в том, что оно принимает дополнительный параметр — текущее действие.
Как работает обучение с подкреплением?
Повседневная аналогия проясняет этот механизм еще до появления каких-либо обозначений.
Рассмотрим ситуацию, когда вы обучаете свою кошку новым трюкам.
- Поскольку кошка не понимает английский или какой-либо другой человеческий язык, мы не можем напрямую указывать ей, что делать. Вместо этого мы используем другую стратегию.
- Мы имитируем ситуацию, и кошка пытается отреагировать разными способами. Если реакция кошки желаемая, мы даем ей рыбу.
- Теперь всякий раз, когда кошка оказывается в той же ситуации, она выполняет аналогичное действие с ещё большим энтузиазмом, в ожидании получения большей награды (еды).
- Это тот способ, которым кошка учится «что делать» на основе позитивного опыта.
- В то же время кошка учится тому, чего не следует делать, сталкиваясь с негативными ситуациями.
Пример обучения с подкреплением
На рисунке ниже эта история про кошку представлена в виде формального цикла, где домашнее хозяйство выступает в роли окружающей среды, а рыба — в роли награды.

В этом случае,
- Ваша кошка — это субъект, подвергающийся воздействию окружающей среды. В данном случае это ваш дом. Примером состояния может служить ситуация, когда ваша кошка сидит, а вы используете определенное слово, чтобы заставить ее идти.
- Наш агент реагирует, выполняя переход действия из одного «состояния» в другое «состояние».
- Например, ваша кошка переходит от сидения к ходьбе.
- Реакция агента — это действие, а политика — это метод выбора действия в данном состоянии в ожидании лучших результатов.
- После завершения перехода агент может получить вознаграждение или понести штраф.
Усиление обучения Algorithms
Существует три подхода к реализации алгоритма обучения с подкреплением, и они различаются главным образом тем, что агент хранит и чему учится.
Ценностно-ориентированный
В методе обучения с подкреплением, основанном на ценности, вы пытаетесь максимизировать функцию ценности V(s). В этом методе агент ожидает долгосрочного возврата текущих состояний при политике π.
на основе политики
В методе обучения с подкреплением, основанном на политике, вы пытаетесь разработать такую политику, чтобы действия, выполняемые в каждом состоянии, помогали вам получить максимальное вознаграждение в будущем.
Два типа методов, основанных на политике:
- Детерминированный: Для любого состояния политика π приводит к одному и тому же результату.
- Стохастический: Каждое действие имеет определенную вероятность, которая определяется следующим уравнением.
Стохастическая политика:
π(a|s) = P[At = a | St = s]
на основе модели
В этом методе обучения с подкреплением для каждой среды создается виртуальная модель. Агент учится действовать именно в этой конкретной среде.
Характеристики обучения с подкреплением
Вот важные характеристики обучения с подкреплением:
- Нет супервизора, только реальный номер или сигнал вознаграждения
- Последовательное принятие решений
- Время играет решающую роль в проблемах с подкреплением.
- Обратная связь часто поступает с задержкой, а не мгновенно.
- Действия агента определяют последующие данные, которые он получает
Типы обучения с подкреплением
Слово «подкрепление» заимствовано из поведенческой психологии и существует в двух формах:
Положительный:
Это событие определяется как явление, происходящее в результате определенного поведения. Оно усиливает и увеличивает частоту этого поведения и положительно влияет на действия, предпринимаемые субъектом.
Этот тип подкрепления помогает максимизировать производительность и поддерживать изменения в течение более длительного периода. Однако чрезмерное подкрепление может привести к переоптимизации состояния, что может повлиять на результаты.
Отрицательный:
Отрицательное подкрепление определяется как усиление поведения, возникающего из-за негативного условия, которое следовало бы предотвратить или избежать. Оно помогает определить минимальный стандарт выполнения. Однако недостаток этого метода заключается в том, что он обеспечивает лишь то, что соответствует минимальному уровню поведения.
Модели обучения подкреплению
В обучении с подкреплением есть две важные модели обучения:
- Марковский процесс принятия решений
- Q обучение
Марковский процесс принятия решений
Для получения решения используются следующие параметры:
- Последовательность действий – А
- Множество штатов – S
- Награда – R
- Политика – π
- Значение – V
Математический подход к картеping Решение в обучении с подкреплением формализуется как марковский процесс принятия решений (MDP). На приведенной ниже схеме показаны эти пять параметров, объединенных в один цикл «агент-среда».
Q-обучение
Q-обучение — это основанный на ценностях метод предоставления информации, которая указывает агенту, какое действие следует предпринять.
Давайте разберем этот метод на следующем примере:
- В здании пять комнат, соединенных дверями.
- Каждая комната пронумерована от 0 до 4.
- Внешнюю часть здания можно рассматривать как одну большую внешнюю территорию (5)
- Двери номер 1 и 4 ведут в здание из комнаты 5.
На приведенном ниже плане этажа пронумерованы эти комнаты и указано, какие двери их соединяют.
Далее необходимо присвоить каждой двери значение вознаграждения:
- Двери, ведущие прямо к цели, имеют награду 100.
- Двери, не соединенные напрямую с целевой комнатой, не приносят никакого вознаграждения.
- Поскольку двери двусторонние, для каждой комнаты предусмотрены две стрелки.
- Каждая стрела на изображении выше несет в себе мгновенную награду.
Объяснение: На этом изображении каждая комната представляет собой состояние, а перемещение агента из одной комнаты в другую представляет собой действие.
На графике ниже состояние изображено в виде узла, а стрелки показывают доступные действия и вознаграждение, связанное с каждым из них.
Например, агент перемещается из комнаты номер 2 в комнату номер 5:
- Исходное состояние = состояние 2
- Состояние 2-> состояние 3
- Состояние 3 -> состояние (2,1,4)
- Состояние 4-> состояние (0,5,3)
- Состояние 1-> состояние (5,3)
- Состояние 0-> состояние 4
Обучение с подкреплением и обучение под присмотром
Наиболее понятный способ определить место обучения с подкреплением — это сопоставить его с парадигмой, уже известной большинству читателей.
| Параметры | Усиление обучения | Контролируемое обучение |
|---|---|---|
| Стиль решения | Обучение с подкреплением помогает принимать решения последовательно. | В этом методе решение принимается на основе введенных вначале данных. |
| Работает на | Действует посредством взаимодействия с окружающей средой. | Работает на примерах или заданных образцах данных. |
| Зависимость от решения | В методе обучения с подкреплением каждое решение в процессе обучения зависит от предыдущих, поэтому оценивается вся последовательность решений. | In контролируемое обучение Решения независимы друг от друга, поэтому каждому решению присваивается метка. |
| лучше всего подходит | Обеспечивает поддержку и более эффективную работу ИИ в условиях активного взаимодействия с человеком. | В основном он управляется с помощью интерактивной программной системы или приложений. |
| Пример | Игра в шахматы | Распознавание объектов |
Применение обучения с подкреплением
Вот применения обучения с подкреплением:
- Робототехника для промышленной автоматизации.
- Планирование бизнес-стратегии
- Машинное обучение и обработка данных
- Это помогает создавать системы обучения, которые предоставляют индивидуальные инструкции и материалы в соответствии с потребностями студентов.
- Управление самолетом и управление движением робота
Зачем использовать обучение с подкреплением?
Вот основные причины использования обучения с подкреплением:
- Это помогает определить, в какой ситуации необходимы действия.
- Помогает определить, какое действие приносит наибольшую выгоду в долгосрочной перспективе.
- Обучение с подкреплением также наделяет обучающегося агента функцией вознаграждения.
- Это также позволяет агенту определить наилучший способ получения крупных вознаграждений.
Когда не следует использовать обучение с подкреплением?
Модель обучения с подкреплением не может применяться в каждой ситуации. Вот некоторые условия, при которых её использовать не следует.
- Когда у вас достаточно размеченных данных для решения задачи с помощью метода обучения с учителем.
- Обучение с подкреплением — это ресурсоемкий и трудоемкий процесс, особенно когда пространство действий велико.
Проблемы обучения с подкреплением
Вот основные трудности, с которыми вы столкнетесь при использовании обучения с подкреплением:
- Разработка функций и системы вознаграждений, которая может быть очень сложной.
- Параметры могут влиять на скорость обучения.
- Реалистичная среда может иметь частичную наблюдаемость.
- Чрезмерное подкрепление может привести к перегрузке состояний, что может снизить эффективность результатов.
- Реалистичная среда может быть нестационарной.




