Что такое обучение с подкреплением? Типы, Algorithms & Пример

⚡ Умное резюме

Обучение с подкреплением — это метод машинного обучения, при котором программный агент учится, действуя в окружающей среде, получая вознаграждения или штрафы и корректируя свое поведение для максимизации совокупного вознаграждения на протяжении многих шагов.

  • 🔘 Основной цикл: Агент наблюдает за состоянием, совершает действие, получает вознаграждение и попадает в новое состояние.
  • ☑️ Три подхода: Методы, основанные на ценностях, политике и моделях, различаются тем, чему именно учится агент.
  • Две модели обучения: Марковские процессы принятия решений формулируют проблему; Q-обучение решает её на основе опыта.
  • 🧪 Без надзора: Ответов с пометками не существует, есть только отложенный сигнал вознаграждения, который агент должен соотнести с предыдущими действиями.
  • 🇧🇷 Где это уместно: Робототехника, игры, управление летательными аппаратами, адаптивное обучение и планирование бизнес-стратегий.
  • ⚙️ Известные затраты: Обучение требует больших вычислительных ресурсов, разработка системы вознаграждений — сложный процесс, а реальные условия работы сопровождаются шумом и нестабильностью.

Обучение с подкреплением: алгоритмы, типы и примеры.

Что такое обучение с подкреплением?

Усиление обучения - это Машинное обучение Этот метод рассматривает, как программные агенты должны действовать в окружающей среде. Агенту не показываются правильные ответы; он учится на основе полученного вознаграждения и корректирует свое поведение, чтобы максимизировать суммарное вознаграждение.

Обучение с подкреплением — это самостоятельная отрасль машинного обучения, наряду с другими дисциплинами. контролируемый и бесконтрольный Обучение. Когда политика или функция ценности агента представлена ​​нейронной сетью, такая комбинация называется глубокое подкрепление обучения — Именно такое сочетание позволяет агенту достичь сложной цели или максимизировать определенный параметр на протяжении многих шагов.

Важные компоненты метода обучения с подкреплением

Прежде чем алгоритмы станут понятными, полезно дать названия их компонентам. На диаграмме ниже показано, как агент, среда, действие и сигнал вознаграждения взаимодействуют в едином цикле.

Цикл обучения с подкреплением, связывающий агента, действие, среду, состояние и вознаграждение.

Вот некоторые важные термины, используемые в обучении с подкреплением:

  • Агент: Сущность, которая совершает действия в окружающей среде с целью получения вознаграждения.
  • Окружающая среда (е): Сценарий, с которым приходится столкнуться агенту.
  • Награда (R): Немедленная отдача, получаемая агентом за выполнение им определенного действия или задачи.
  • Состояния): Состояние относится к текущей ситуации, возвращаемой средой.
  • Политика (π): Стратегия, применяемая агентом для принятия решения о следующем действии на основе текущего состояния.
  • Значение (В): Ожидаемая долгосрочная доходность с учетом дисконта по сравнению с краткосрочной выгодой.
  • Функция значения: Оно определяет значение состояния, то есть общую сумму вознаграждения, которую агент может рассчитывать получить, начиная с этого состояния.
  • Модель среды: Это имитирует поведение окружающей среды. Это позволяет делать выводы и определять, как будет вести себя окружающая среда.
  • Методы, основанные на моделях: Методы, которые решают задачи обучения с подкреплением, сначала изучая или используя модель окружающей среды, а затем планируя действия на её основе.
  • Значение Q или значение действия (Q): Значение Q очень похоже на значение. Единственное различие между ними заключается в том, что оно принимает дополнительный параметр — текущее действие.

Как работает обучение с подкреплением?

Повседневная аналогия проясняет этот механизм еще до появления каких-либо обозначений.

Рассмотрим ситуацию, когда вы обучаете свою кошку новым трюкам.

  • Поскольку кошка не понимает английский или какой-либо другой человеческий язык, мы не можем напрямую указывать ей, что делать. Вместо этого мы используем другую стратегию.
  • Мы имитируем ситуацию, и кошка пытается отреагировать разными способами. Если реакция кошки желаемая, мы даем ей рыбу.
  • Теперь всякий раз, когда кошка оказывается в той же ситуации, она выполняет аналогичное действие с ещё большим энтузиазмом, в ожидании получения большей награды (еды).
  • Это тот способ, которым кошка учится «что делать» на основе позитивного опыта.
  • В то же время кошка учится тому, чего не следует делать, сталкиваясь с негативными ситуациями.

Пример обучения с подкреплением

На рисунке ниже эта история про кошку представлена ​​в виде формального цикла, где домашнее хозяйство выступает в роли окружающей среды, а рыба — в роли награды.

Пример с котом и его владельцем, отображенный на цикл «агент-среда» в рамках обучения с подкреплением.
Как работает обучение с подкреплением

В этом случае,

  • Ваша кошка — это субъект, подвергающийся воздействию окружающей среды. В данном случае это ваш дом. Примером состояния может служить ситуация, когда ваша кошка сидит, а вы используете определенное слово, чтобы заставить ее идти.
  • Наш агент реагирует, выполняя переход действия из одного «состояния» в другое «состояние».
  • Например, ваша кошка переходит от сидения к ходьбе.
  • Реакция агента — это действие, а политика — это метод выбора действия в данном состоянии в ожидании лучших результатов.
  • После завершения перехода агент может получить вознаграждение или понести штраф.

Усиление обучения Algorithms

Существует три подхода к реализации алгоритма обучения с подкреплением, и они различаются главным образом тем, что агент хранит и чему учится.

Ценностно-ориентированный

В методе обучения с подкреплением, основанном на ценности, вы пытаетесь максимизировать функцию ценности V(s). В этом методе агент ожидает долгосрочного возврата текущих состояний при политике π.

на основе политики

В методе обучения с подкреплением, основанном на политике, вы пытаетесь разработать такую ​​политику, чтобы действия, выполняемые в каждом состоянии, помогали вам получить максимальное вознаграждение в будущем.

Два типа методов, основанных на политике:

  • Детерминированный: Для любого состояния политика π приводит к одному и тому же результату.
  • Стохастический: Каждое действие имеет определенную вероятность, которая определяется следующим уравнением.

Стохастическая политика:

π(a|s) = P[At = a | St = s]

на основе модели

В этом методе обучения с подкреплением для каждой среды создается виртуальная модель. Агент учится действовать именно в этой конкретной среде.

Характеристики обучения с подкреплением

Вот важные характеристики обучения с подкреплением:

  • Нет супервизора, только реальный номер или сигнал вознаграждения
  • Последовательное принятие решений
  • Время играет решающую роль в проблемах с подкреплением.
  • Обратная связь часто поступает с задержкой, а не мгновенно.
  • Действия агента определяют последующие данные, которые он получает

Типы обучения с подкреплением

Слово «подкрепление» заимствовано из поведенческой психологии и существует в двух формах:

Положительный:

Это событие определяется как явление, происходящее в результате определенного поведения. Оно усиливает и увеличивает частоту этого поведения и положительно влияет на действия, предпринимаемые субъектом.

Этот тип подкрепления помогает максимизировать производительность и поддерживать изменения в течение более длительного периода. Однако чрезмерное подкрепление может привести к переоптимизации состояния, что может повлиять на результаты.

Отрицательный:

Отрицательное подкрепление определяется как усиление поведения, возникающего из-за негативного условия, которое следовало бы предотвратить или избежать. Оно помогает определить минимальный стандарт выполнения. Однако недостаток этого метода заключается в том, что он обеспечивает лишь то, что соответствует минимальному уровню поведения.

Модели обучения подкреплению

В обучении с подкреплением есть две важные модели обучения:

  • Марковский процесс принятия решений
  • Q обучение

Марковский процесс принятия решений

Для получения решения используются следующие параметры:

  • Последовательность действий – А
  • Множество штатов – S
  • Награда – R
  • Политика – π
  • Значение – V

Математический подход к картеping Решение в обучении с подкреплением формализуется как марковский процесс принятия решений (MDP). На приведенной ниже схеме показаны эти пять параметров, объединенных в один цикл «агент-среда».

Схема марковского процесса принятия решений с указанием состояний, действий, вознаграждения и политики.

Q-обучение

Q-обучение — это основанный на ценностях метод предоставления информации, которая указывает агенту, какое действие следует предпринять.

Давайте разберем этот метод на следующем примере:

  • В здании пять комнат, соединенных дверями.
  • Каждая комната пронумерована от 0 до 4.
  • Внешнюю часть здания можно рассматривать как одну большую внешнюю территорию (5)
  • Двери номер 1 и 4 ведут в здание из комнаты 5.

На приведенном ниже плане этажа пронумерованы эти комнаты и указано, какие двери их соединяют.

Планировка пятикомнатного здания с нумерацией комнат и прилегающей территорией (5 комнат на улице).

Далее необходимо присвоить каждой двери значение вознаграждения:

  • Двери, ведущие прямо к цели, имеют награду 100.
  • Двери, не соединенные напрямую с целевой комнатой, не приносят никакого вознаграждения.
  • Поскольку двери двусторонние, для каждой комнаты предусмотрены две стрелки.
  • Каждая стрела на изображении выше несет в себе мгновенную награду.

Объяснение: На этом изображении каждая комната представляет собой состояние, а перемещение агента из одной комнаты в другую представляет собой действие.

На графике ниже состояние изображено в виде узла, а стрелки показывают доступные действия и вознаграждение, связанное с каждым из них.

Граф состояний пяти комнат с наградами в 0 и 100 при каждом переходе

Например, агент перемещается из комнаты номер 2 в комнату номер 5:

  • Исходное состояние = состояние 2
  • Состояние 2-> состояние 3
  • Состояние 3 -> состояние (2,1,4)
  • Состояние 4-> состояние (0,5,3)
  • Состояние 1-> состояние (5,3)
  • Состояние 0-> состояние 4

Обучение с подкреплением и обучение под присмотром

Наиболее понятный способ определить место обучения с подкреплением — это сопоставить его с парадигмой, уже известной большинству читателей.

Параметры Усиление обучения Контролируемое обучение
Стиль решения Обучение с подкреплением помогает принимать решения последовательно. В этом методе решение принимается на основе введенных вначале данных.
Работает на Действует посредством взаимодействия с окружающей средой. Работает на примерах или заданных образцах данных.
Зависимость от решения В методе обучения с подкреплением каждое решение в процессе обучения зависит от предыдущих, поэтому оценивается вся последовательность решений. In контролируемое обучение Решения независимы друг от друга, поэтому каждому решению присваивается метка.
лучше всего подходит Обеспечивает поддержку и более эффективную работу ИИ в условиях активного взаимодействия с человеком. В основном он управляется с помощью интерактивной программной системы или приложений.
Пример Игра в шахматы Распознавание объектов

Применение обучения с подкреплением

Вот применения обучения с подкреплением:

  • Робототехника для промышленной автоматизации.
  • Планирование бизнес-стратегии
  • Машинное обучение и обработка данных
  • Это помогает создавать системы обучения, которые предоставляют индивидуальные инструкции и материалы в соответствии с потребностями студентов.
  • Управление самолетом и управление движением робота

Зачем использовать обучение с подкреплением?

Вот основные причины использования обучения с подкреплением:

  • Это помогает определить, в какой ситуации необходимы действия.
  • Помогает определить, какое действие приносит наибольшую выгоду в долгосрочной перспективе.
  • Обучение с подкреплением также наделяет обучающегося агента функцией вознаграждения.
  • Это также позволяет агенту определить наилучший способ получения крупных вознаграждений.

Когда не следует использовать обучение с подкреплением?

Модель обучения с подкреплением не может применяться в каждой ситуации. Вот некоторые условия, при которых её использовать не следует.

  • Когда у вас достаточно размеченных данных для решения задачи с помощью метода обучения с учителем.
  • Обучение с подкреплением — это ресурсоемкий и трудоемкий процесс, особенно когда пространство действий велико.

Проблемы обучения с подкреплением

Вот основные трудности, с которыми вы столкнетесь при использовании обучения с подкреплением:

  • Разработка функций и системы вознаграждений, которая может быть очень сложной.
  • Параметры могут влиять на скорость обучения.
  • Реалистичная среда может иметь частичную наблюдаемость.
  • Чрезмерное подкрепление может привести к перегрузке состояний, что может снизить эффективность результатов.
  • Реалистичная среда может быть нестационарной.

Часто задаваемые вопросы (FAQ)

Эксплуатация повторяет действие, которое в данный момент считается наилучшим; исследование пробует что-то другое, чтобы обнаружить лучшее. Эпсилон-жадный подход обрабатывает это, действуя случайным образом с вероятностью ε и жадно в остальных случаях, а затем уменьшая ε по мере накопления опыта.

Гамма-коэффициент сопоставляет будущие и немедленные вознаграждения. Значение, близкое к 0, делает агента недальновидным и жадным до мгновенного вознаграждения; значение, близкое к 1, делает его достаточно терпеливым, чтобы смириться с небольшим убытком сейчас ради большей выгоды позже.

Q-обучение работает вне политики: оно обновляется в направлении наилучшего возможного следующего действия независимо от того, что агент фактически сделал. SARSA работает в рамках политики и обновляется в направлении действия, которое он действительно предпринял, что делает его более осторожным вблизи рискованных состояний.

В глубокой Q-сети Q-таблица заменяется нейронной сетью, поэтому состояния, никогда не встречавшиеся в процессе обучения, по-прежнему могут оцениваться. Для поддержания стабильности обучающего сигнала добавлены функция воспроизведения опыта и отдельная целевая сеть.

Агенты, не использующие модели, такие как Q-обучение, учатся исключительно на основе выборочного опыта. Агенты, использующие модели, сначала строят модель динамики окружающей среды и планируют действия, исходя из неё, что требует гораздо меньше реальных взаимодействий, но приводит к проблемам, когда модель оказывается неверной.

Обучение с подкреплением на основе обратной связи от человека обучает модель вознаграждения на основе оценок предпочтений человека, а затем настраивает языковую модель в соответствии с этой оценкой. Именно поэтому были созданы голосовые помощники, построенные на этой модели. глубокое обучение Следуйте инструкциям, а не просто предсказывайте текст.

Второй пилот GitHub Хорошо справляется с рутинными задачами: обертки окружения, буферы воспроизведения, циклы обучения и графики. Награда за распределение ресурсов.ping И выбор гиперпараметров по-прежнему требует обдуманного решения, поскольку незаметно неправильное вознаграждение приводит к тому, что агент обучается с удовольствием, но ведет себя плохо.

Gymnasium предоставляет стандартные среды для тренировок, Stable-Baselines3 — проверенные реализации алгоритмов, а TensorFlow или ПирTorch обеспечивает сети. Начните с табличной сетки, прежде чем обращаться к какой-либо из них.

Подведем итог этой публикации следующим образом: