강화 학습이란 무엇인가? 유형, Algorithms & 예
⚡ 스마트 요약
강화 학습은 소프트웨어 에이전트가 환경 내에서 행동하고 보상이나 벌칙을 획득하며, 여러 단계를 거쳐 누적 보상을 최대화하도록 행동을 조정함으로써 학습하는 기계 학습 방법입니다.
강화 학습이란 무엇입니까?
강화 학습 하는 머신 러닝 소프트웨어 에이전트가 환경에서 어떻게 행동해야 하는지에 관한 방법론입니다. 에이전트에게 정답을 보여주지 않고, 에이전트는 자신이 받은 보상을 통해 학습하고 누적 보상을 최대화하도록 행동을 조정합니다.
강화 학습은 머신 러닝의 한 분야로서, 다른 분야들과 함께 독립적인 학문으로 자리 잡고 있습니다. 감독 감독되지 않은 학습. 에이전트의 정책 또는 가치 함수가 신경망으로 표현될 때, 이러한 조합을 신경망이라고 합니다. 심층 강화 학습 — 바로 그 조합 덕분에 에이전트는 여러 단계를 거쳐 복잡한 목표를 달성하거나 특정 차원을 극대화할 수 있습니다.
강화 학습 방법의 주요 구성 요소
알고리즘을 이해하기 전에 각 구성 요소의 이름을 지정하는 것이 도움이 됩니다. 아래 다이어그램은 에이전트, 환경, 행동 및 보상 신호가 하나의 루프에서 어떻게 연결되는지 보여줍니다.
강화 학습에서 사용되는 몇 가지 중요한 용어는 다음과 같습니다.
- 에이전트: 어떤 보상을 얻기 위해 환경 속에서 행동을 수행하는 개체.
- 환경(e): 상담원이 직면해야 하는 시나리오입니다.
- 보상(R): 에이전트가 특정 행동이나 작업을 수행했을 때 즉시 주어지는 보상.
- 상태: 상태는 환경이 반환한 현재 상황을 나타냅니다.
- 정책(π): 에이전트가 현재 상태를 기반으로 다음 행동을 결정하기 위해 적용하는 전략.
- 값(V): 할인율을 적용한 장기 예상 수익률은 단기 보상과 비교됩니다.
- 가치 기능: 이는 상태의 가치, 즉 에이전트가 해당 상태에서 시작하여 축적할 수 있을 것으로 예상되는 총 보상량을 나타냅니다.
- 환경 모델: 이는 환경의 작동 방식을 모방합니다. 이를 통해 추론을 할 수 있을 뿐 아니라 환경이 어떻게 작동할지 예측할 수도 있습니다.
- 모델 기반 방법: 강화 학습 문제를 해결하는 방법으로, 먼저 환경 모델을 학습하거나 사용한 다음, 그 모델을 기반으로 계획을 수립하는 방식입니다.
- Q값 또는 행동값(Q): Q 값은 value와 매우 유사합니다. 둘의 유일한 차이점은 Q 값이 현재 동작이라는 추가 매개변수를 받는다는 점입니다.
강화 학습은 어떻게 작동하나요?
일상적인 비유를 통해 표기법이 나타나기 전에 작동 원리를 명확히 알 수 있습니다.
고양이에게 새로운 재주를 가르치는 상황을 생각해 보세요.
- 고양이는 영어를 비롯한 어떤 인간 언어도 이해하지 못하기 때문에 직접적으로 무엇을 해야 할지 말해줄 수 없습니다. 그래서 우리는 다른 전략을 사용합니다.
- 우리는 어떤 상황을 모방하고, 고양이는 다양한 방식으로 반응하려고 합니다. 고양이의 반응이 우리가 원하는 것이면 물고기를 줍니다.
- 이제 고양이는 같은 상황에 처할 때마다 더 많은 보상(음식)을 기대하며 훨씬 더 열정적으로 비슷한 행동을 합니다.
- 그것이 바로 고양이가 긍정적인 경험을 통해 "무엇을 해야 하는지" 배우는 방식입니다.
- 동시에 고양이는 부정적인 경험에 직면했을 때 무엇을 하지 말아야 하는지도 배우게 됩니다.
강화 학습의 예
아래 그림은 가정을 환경으로, 물고기를 보상으로 하여 고양이 이야기를 형식적 순환 과정에 적용한 것입니다.

이 경우,
- 고양이는 환경에 노출되는 존재입니다. 이 경우, 환경은 당신의 집입니다. 예를 들어, 고양이가 앉아 있는 상황이나 당신이 특정 단어를 사용하여 고양이를 걷게 하는 상황을 고양이의 상태라고 볼 수 있습니다.
- 에이전트는 하나의 "상태"에서 다른 "상태"로 작업 전환을 수행하여 반응합니다.
- 예를 들어, 고양이는 앉았다가 걷기 시작합니다.
- 에이전트의 반응은 행동이고, 정책은 더 나은 결과를 기대하는 상태에서 행동을 선택하는 방법입니다.
- 전환 후, 에이전트는 그에 대한 보상이나 벌칙을 받을 수 있습니다.
강화 학습 Algorithms
강화 학습 알고리즘을 구현하는 데에는 세 가지 접근 방식이 있으며, 주로 에이전트가 저장하고 학습하는 내용에서 차이가 납니다.
가치 기반
가치 기반 강화 학습 방법에서는 가치 함수 V(s)를 최대화하려고 합니다. 이 방법에서 에이전트는 정책 π 하에서 현재 상태의 장기적인 수익을 기대합니다.
정책 기반
정책 기반 강화 학습 방법에서는 모든 상태에서 수행하는 행동이 미래에 최대 보상을 얻는 데 도움이 되는 정책을 설계하려고 합니다.
두 가지 유형의 정책 기반 방법은 다음과 같습니다.
- 결정적 : 어떤 국가든 정책 π에 의해 동일한 조치가 취해집니다.
- 확률 론적 : 모든 행동에는 다음 방정식으로 주어지는 특정 확률이 있습니다.
확률적 정책:
π(a|s) = P[At = a | St = s]
모델 기반
이 강화 학습 방법에서는 각 환경에 대한 가상 모델을 생성합니다. 에이전트는 해당 특정 환경에서 작동하는 방법을 학습합니다.
강화학습의 특징
강화 학습의 중요한 특징은 다음과 같습니다.
- 감독자는 없고 실수 또는 보상 신호만 있음
- 순차적 의사결정
- 강화 문제에서 시간은 중요한 역할을 합니다.
- 피드백은 즉각적이기보다는 지연되는 경우가 많습니다.
- 에이전트의 작업에 따라 수신되는 후속 데이터가 결정됩니다.
강화 학습의 유형
"강화"라는 단어는 행동 심리학에서 차용한 것으로, 두 가지 형태로 나타납니다.
양:
특정 행동으로 인해 발생하는 사건으로 정의됩니다. 이는 해당 행동의 강도와 빈도를 증가시키고 에이전트가 취하는 행동에 긍정적인 영향을 미칩니다.
이러한 유형의 강화는 성과를 극대화하고 변화를 더 오랜 기간 유지하는 데 도움이 됩니다. 그러나 과도한 강화는 상태의 과최적화를 초래하여 결과에 악영향을 미칠 수 있습니다.
부정:
부정적 강화란, 원래는 중단하거나 피해야 했던 부정적인 상황으로 인해 발생하는 행동을 강화하는 것을 말합니다. 이는 최소한의 행동 기준을 설정하는 데 도움이 되지만, 최소한의 행동 기준만을 충족시키는 데 그친다는 단점이 있습니다.
강화 모델 학습
강화 학습에는 두 가지 중요한 학습 모델이 있습니다.
- 마르코프 결정 과정
- Q학습
마르코프 결정 과정
다음 매개변수는 솔루션을 얻는 데 사용됩니다.
- 일련의 행동 – A
- 상태 집합 – S
- 보상 – R
- 정책 – π
- 값 – V
지도를 위한 수학적 접근 방식ping 강화 학습에서의 해법은 마르코프 결정 과정(MDP)으로 공식화됩니다. 아래 그림은 다섯 가지 매개변수가 동일한 에이전트-환경 순환 과정에 연결된 것을 보여줍니다.
Q- 학습
Q 학습은 에이전트에게 어떤 행동을 취해야 하는지 알려주는 정보를 제공하는 가치 기반 학습 방식입니다.
다음 예시를 통해 이 방법을 이해해 봅시다.
- 한 건물에는 문으로 연결된 XNUMX개의 방이 있습니다.
- 각 방은 0부터 4까지 번호가 매겨져 있습니다.
- 건물의 외부는 하나의 큰 외부 영역으로 취급될 수 있다(5).
- 1번과 4번 문은 5번 방에서 건물로 연결됩니다.
아래 평면도에는 각 방에 번호가 매겨져 있고, 방들을 연결하는 문이 표시되어 있습니다.
다음으로, 각 문에 보상 값을 할당해야 합니다.
- 목표로 직접 연결되는 문은 100의 보상을 받습니다.
- 목표 방과 직접 연결되지 않은 문은 아무런 보상도 주지 않습니다.
- 문은 양방향이므로 각 방에는 두 개의 화살표가 지정됩니다.
- 위 이미지의 각 화살표는 즉시 보상 값을 나타냅니다.
설명 : 이 이미지에서 각 방은 상태를 나타내고, 에이전트가 한 방에서 다른 방으로 이동하는 것은 행동을 나타냅니다.
아래 그래프에서 노드는 상태를 나타내고, 화살표는 가능한 행동과 각 행동에 따른 보상을 보여줍니다.
예를 들어, 요원이 2번 방에서 5번 방으로 이동합니다.
- 초기 상태 = 상태 2
- 상태 2 -> 상태 3
- 상태 3 -> 상태 (2,1,4)
- 상태 4-> 상태 (0,5,3)
- 상태 1-> 상태 (5,3)
- 상태 0 -> 상태 4
강화 학습과 지도 학습
강화 학습을 가장 명확하게 이해하는 방법은 대부분의 독자들이 이미 알고 있는 기존 패러다임과 나란히 놓고 비교하는 것입니다.
| 파라미터 | 강화 학습 | 지도 학습 |
|---|---|---|
| 의사결정 스타일 | 강화 학습은 의사 결정을 순차적으로 내리는 데 도움이 됩니다. | 이 방법에서는 처음에 주어진 입력에 따라 결정이 내려집니다. |
| 에 작동 | 환경과 상호작용하여 작동합니다. | 예제 또는 주어진 샘플 데이터에 대해 작업합니다. |
| 결정에 대한 의존성 | 강화 학습 방법에서는 각 학습 결정이 이전 결정에 따라 달라지므로 전체 결정 시퀀스가 평가 대상이 됩니다. | In 지도 학습 각 결정은 서로 독립적이므로 모든 결정에 레이블이 지정됩니다. |
| 잘 맞는다 | 인간과의 상호작용이 활발한 AI 환경에서 더욱 효과적으로 작동하고 지원합니다. | 대부분 대화형 소프트웨어 시스템이나 애플리케이션으로 운영됩니다. |
| 예시 | 체스 게임 | 물체 인식 |
강화 학습의 응용
강화 학습의 응용 프로그램은 다음과 같습니다.
- 산업 자동화를 위한 로봇공학.
- 사업 전략 기획
- 머신러닝 및 데이터 처리
- 이 도구를 사용하면 학생들의 요구 사항에 따라 맞춤형 교육 및 자료를 제공하는 교육 시스템을 구축할 수 있습니다.
- 항공기 제어 및 로봇 모션 제어
강화 학습을 사용하는 이유는 무엇입니까?
강화 학습을 사용하는 주요 이유는 다음과 같습니다.
- 어떤 상황에 조치가 필요한지 파악하는 데 도움이 됩니다.
- 장기적으로 가장 높은 보상을 가져다주는 행동이 무엇인지 파악하는 데 도움이 됩니다.
- 강화 학습은 학습 에이전트에게 보상 기능도 제공합니다.
- 또한 이를 통해 에이전트는 큰 보상을 얻는 최적의 방법을 찾아낼 수 있습니다.
강화 학습을 사용하지 말아야 할 경우는 언제입니까?
강화 학습 모델을 모든 상황에 적용할 수는 없습니다. 다음은 강화 학습 모델을 사용해서는 안 되는 몇 가지 경우입니다.
- 지도 학습 방법을 사용하여 문제를 해결하기에 충분한 레이블링된 데이터가 있을 때
- 강화 학습은 특히 행동 공간이 클 경우 계산량이 많고 시간이 오래 걸립니다.
강화 학습의 과제
강화 학습을 진행하면서 직면하게 될 주요 과제는 다음과 같습니다.
- 기능 및 보상 설계는 매우 복잡한 작업이 될 수 있습니다.
- 매개변수는 학습 속도에 영향을 미칠 수 있습니다.
- 현실적인 환경에서는 부분적으로 관찰할 수 있습니다.
- 과도한 강화는 상태 과부하를 초래하여 결과를 저하시킬 수 있습니다.
- 현실적인 환경은 고정적이지 않을 수 있습니다.




