Was ist Reinforcement Learning? Arten, Algorithms & Beispiel
โก Intelligente Zusammenfassung
Reinforcement Learning ist eine Methode des maschinellen Lernens, bei der ein Softwareagent lernt, indem er in einer Umgebung agiert, Belohnungen oder Strafen sammelt und sein Verhalten anpasst, um die kumulative Belohnung รผber viele Schritte hinweg zu maximieren.
Was ist Reinforcement Learning?
Verstรคrkung lernen ist eine Maschinelles lernen Die Methode befasst sich damit, wie Softwareagenten in einer Umgebung agieren sollen. Dem Agenten werden keine korrekten Antworten angezeigt; er lernt aus den erhaltenen Belohnungen und passt sein Verhalten an, um die Gesamtbelohnung zu maximieren.
Reinforcement Learning ist ein eigenstรคndiger Zweig des maschinellen Lernens, neben Aufsicht und unbeaufsichtigt Lernen. Wenn die Strategie oder Wertfunktion des Agenten durch ein neuronales Netzwerk dargestellt wird, nennt man diese Kombination Lernen. tiefes Lernen der Verstรคrkung โ Diese Paarung ermรถglicht es einem Akteur, ein komplexes Ziel zu erreichen oder eine bestimmte Dimension รผber viele Schritte hinweg zu maximieren.
Wichtige Komponenten der Reinforcement-Learning-Methode
Bevor die Algorithmen verstรคndlich werden, ist es hilfreich, die einzelnen Bestandteile zu benennen. Das folgende Diagramm veranschaulicht, wie Agent, Umgebung, Aktion und Belohnungssignal in einer Schleife zusammenwirken.
Hier sind einige wichtige Begriffe, die im Reinforcement Learning verwendet werden:
- Agenten: Die Entitรคt, die in einer Umgebung Handlungen ausfรผhrt, um eine Belohnung zu erhalten.
- Umgebung (e): Ein Szenario, dem sich ein Agent stellen muss.
- Belohnung (R): Eine sofortige Gegenleistung, die einem Agenten nach Ausfรผhrung einer bestimmten Handlung oder Aufgabe zuteilwird.
- Zustรคnde): Der Zustand bezieht sich auf die aktuelle Situation, die von der Umgebung zurรผckgegeben wird.
- Richtlinie (ฯ): Die Strategie, die der Agent anwendet, um auf Grundlage des aktuellen Zustands die nรคchste Aktion festzulegen.
- Wert (V): Die erwartete langfristige Rendite mit Abschlag im Vergleich zur kurzfristigen Rendite.
- Wertfunktion: Es legt den Wert eines Zustands fest, also die Gesamtsumme der Belohnung, die ein Agent ausgehend von diesem Zustand erwarten kann.
- Modell der Umgebung: Dadurch wird das Verhalten der Umgebung nachgeahmt. Es ermรถglicht Ihnen, Schlussfolgerungen zu ziehen und auch vorherzusagen, wie sich die Umgebung verhalten wird.
- Modellbasierte Methoden: Methoden, die Probleme des bestรคrkenden Lernens lรถsen, indem sie zunรคchst ein Modell der Umgebung lernen oder verwenden und dann dagegen planen.
- Q-Wert oder Aktionswert (Q): Der Q-Wert ist dem Wert sehr รคhnlich. Der einzige Unterschied zwischen den beiden besteht darin, dass er einen zusรคtzlichen Parameter benรถtigt, die aktuelle Aktion.
Wie funktioniert Reinforcement Learning?
Eine alltรคgliche Analogie verdeutlicht den Mechanismus, noch bevor irgendeine Notation erscheint.
Stellen Sie sich vor, Sie mรถchten Ihrer Katze neue Tricks beibringen.
- Da die Katze weder Englisch noch eine andere menschliche Sprache versteht, kรถnnen wir ihr nicht direkt sagen, was sie tun soll. Stattdessen verfolgen wir eine andere Strategie.
- Wir stellen eine Situation nach, und die Katze versucht, auf verschiedene Weise darauf zu reagieren. Wenn die Reaktion der Katze die gewรผnschte ist, geben wir ihr Fisch.
- Immer wenn die Katze nun mit der gleichen Situation konfrontiert wird, fรผhrt sie eine รคhnliche Handlung noch enthusiastischer aus, in der Erwartung, eine grรถรere Belohnung (Futter) zu erhalten.
- Das ist das Lernen, das die Katze aus positiven Erfahrungen darรผber gewinnt, โwas zu tun istโ.
- Gleichzeitig lernt die Katze aber auch, was sie bei negativen Erfahrungen nicht tun sollte.
Beispiel fรผr Reinforcement Learning
Die untenstehende Abbildung รผbertrรคgt diese Katzengeschichte auf den formalen Kreislauf, wobei der Haushalt die Umgebung und der Fisch die Belohnung darstellt.

In diesem Fall steht:
- Ihre Katze ist ein Faktor, der mit der Umgebung interagiert. In diesem Fall ist es Ihr Haus. Ein Beispiel fรผr einen solchen Zustand wรคre, wenn Ihre Katze sitzt und Sie ein bestimmtes Wort verwenden, um sie zum Laufen zu animieren.
- Unser Agent reagiert, indem er einen Aktionsรผbergang von einem โZustandโ in einen anderen โZustandโ durchfรผhrt.
- Beispielsweise wechselt Ihre Katze vom Sitzen zum Gehen.
- Die Reaktion eines Agenten ist eine Aktion, und die Richtlinie ist eine Methode zur Auswahl einer Aktion in einem gegebenen Zustand in Erwartung besserer Ergebnisse.
- Nach dem รbergang kann der Agent im Gegenzug eine Belohnung oder eine Strafe erhalten.
Verstรคrkung lernen Algorithms
Es gibt drei Ansรคtze zur Implementierung eines Reinforcement-Learning-Algorithmus, die sich hauptsรคchlich darin unterscheiden, was der Agent speichert und lernt.
Wertebasiert
Bei einem wertbasierten Reinforcement-Learning-Verfahren wird versucht, eine Wertfunktion V(s) zu maximieren. In diesem Verfahren erwartet der Agent langfristig den Erhalt der aktuellen Zustรคnde gemรคร der Strategie ฯ.
Richtlinienbasiert
Bei einer richtlinienbasierten RL-Methode versucht man, eine Strategie zu entwickeln, bei der die in jedem Zustand durchgefรผhrte Aktion dazu beitrรคgt, in Zukunft die maximale Belohnung zu erzielen.
Es gibt zwei Arten richtlinienbasierter Methoden:
- Deterministisch: Fรผr jeden Zustand wird durch die Politik ฯ die gleiche Aktion erzeugt.
- Stochastisch: Jeder Aktion ist eine bestimmte Wahrscheinlichkeit zugeordnet, die durch die folgende Gleichung gegeben ist.
Stochastische Politik:
ฯ(a|s) = P[At = a | St = s]
Modellbasiert
Bei dieser Methode des bestรคrkenden Lernens wird fรผr jede Umgebung ein virtuelles Modell erstellt. Der Agent lernt dann, sich in dieser spezifischen Umgebung zu verhalten.
Merkmale des Reinforcement Learning
Hier sind wichtige Merkmale des bestรคrkenden Lernens:
- Es gibt keinen Vorgesetzten, nur eine echte Zahl oder ein Belohnungssignal
- Sequentielle Entscheidungsfindung
- Zeit spielt bei Verstรคrkungsproblemen eine entscheidende Rolle
- Das Feedback erfolgt oft verzรถgert statt unmittelbar.
- Die Aktionen des Agenten bestimmen die nachfolgenden Daten, die er empfรคngt
Arten von Reinforcement Learning
Der Begriff โVerstรคrkungโ stammt aus der Verhaltenspsychologie und tritt in zwei Formen auf:
Positiv:
Es handelt sich um ein Ereignis, das aufgrund eines bestimmten Verhaltens eintritt. Es verstรคrkt und erhรถht die Hรคufigkeit dieses Verhaltens und wirkt sich positiv auf die Handlungen des Akteurs aus.
Diese Art der Verstรคrkung hilft Ihnen, die Leistung zu maximieren und Verรคnderungen lรคngerfristig aufrechtzuerhalten. Zu viel Verstรคrkung kann jedoch zu einer รberoptimierung des Zustands fรผhren, was die Ergebnisse beeintrรคchtigen kann.
Negativ:
Negative Verstรคrkung bezeichnet die Verstรคrkung eines Verhaltens, das aufgrund einer negativen Situation auftritt, die eigentlich hรคtte verhindert oder vermieden werden sollen. Sie hilft dabei, einen Mindeststandard fรผr Leistung festzulegen. Der Nachteil dieser Methode besteht jedoch darin, dass sie lediglich ausreichend Verstรคrkung bietet, um dieses Mindestverhalten zu erreichen.
Lernmodelle der Verstรคrkung
Beim Reinforcement Learning gibt es zwei wichtige Lernmodelle:
- Markov-Entscheidungsprozess
- Q Lernen
Markov-Entscheidungsprozess
Um eine Lรถsung zu erhalten, werden die folgenden Parameter verwendet:
- Handlungsabfolge โ A
- Zustandsmenge โ S
- Belohnung โ R
- Richtlinie โ ฯ
- Wert โ V
Der mathematische Ansatz fรผr die Karteping Eine Lรถsung im Reinforcement Learning wird als Markov-Entscheidungsprozess (MDP) formalisiert. Das folgende Schema zeigt, wie diese fรผnf Parameter in denselben Agenten-Umgebungs-Zyklus eingebunden sind.
Q-Learning
Q-Learning ist eine wertbasierte Methode zur Bereitstellung von Informationen, die einem Agenten mitteilen, welche Aktion er ausfรผhren soll.
Lassen Sie uns diese Methode anhand des folgenden Beispiels verstehen:
- In einem Gebรคude gibt es fรผnf Rรคume, die durch Tรผren miteinander verbunden sind.
- Die Rรคume sind von 0 bis 4 nummeriert.
- Der Auรenbereich des Gebรคudes kann als eine groรe Auรenflรคche betrachtet werden (5).
- Die Tรผren Nr. 1 und 4 fรผhren von Raum 5 in das Gebรคude
Im untenstehenden Grundriss sind die Rรคume nummeriert und die Verbindungstรผren sind eingezeichnet.
Als Nรคchstes mรผssen Sie jeder Tรผr einen Belohnungswert zuordnen:
- Tรผren, die direkt zum Ziel fรผhren, haben eine Belohnung von 100
- Tรผren, die nicht direkt mit dem Zielraum verbunden sind, bringen keine Belohnung.
- Da die Tรผren in beide Richtungen geรถffnet werden kรถnnen, sind jedem Raum zwei Pfeile zugeordnet.
- Jeder Pfeil im obigen Bild reprรคsentiert einen sofortigen Belohnungswert.
Erlรคuterung: In dieser Abbildung reprรคsentiert jeder Raum einen Zustand, und die Bewegung des Agenten von einem Raum zum anderen stellt eine Handlung dar.
Im folgenden Diagramm ist ein Zustand als Knoten dargestellt, wรคhrend die Pfeile die verfรผgbaren Aktionen und die jeweils damit verbundene Belohnung zeigen.
Ein Agent durchlรคuft beispielsweise die Rรคume 2 bis 5:
- Ausgangszustand = Zustand 2
- Zustand 2 -> Zustand 3
- Zustand 3 -> Zustand (2,1,4)
- Zustand 4-> Zustand (0,5,3)
- Zustand 1-> Zustand (5,3)
- Zustand 0 -> Zustand 4
Reinforcement Learning vs. Supervised Learning
Am besten lรคsst sich Reinforcement Learning einordnen, indem man es neben das Paradigma stellt, das den meisten Lesern bereits bekannt ist.
| Kenngrรถรen | Verstรคrkung lernen | รberwachtes Lernen |
|---|---|---|
| Entscheidungsstil | Reinforcement Learning hilft Ihnen dabei, Ihre Entscheidungen schrittweise zu treffen. | Bei dieser Methode wird eine Entscheidung anhand der zu Beginn gegebenen Eingaben getroffen. |
| Funktioniert auf | Funktioniert durch Interaktion mit der Umgebung. | Arbeitet anhand von Beispielen oder gegebenen Beispieldaten. |
| Abhรคngigkeit von der Entscheidung | Bei der RL-Methode hรคngt jede Lernentscheidung von den vorhergehenden Entscheidungen ab, sodass die gesamte Entscheidungssequenz bewertet wird. | In รผberwachtes Lernen Die Entscheidungen sind voneinander unabhรคngig, daher wird jeder Entscheidung ein Etikett zugeordnet. |
| am besten geeignet | Unterstรผtzt und funktioniert besser in KI-Umgebungen, wo menschliche Interaktion vorherrscht. | Die Bedienung erfolgt meist รผber interaktive Softwaresysteme oder Anwendungen. |
| Beispiel | Schachspiel | Objekterkennung |
Anwendungen des Reinforcement Learning
Hier sind Anwendungen des Reinforcement Learning:
- Robotik fรผr die industrielle Automatisierung.
- Planung der Geschรคftsstrategie
- Maschinelles Lernen und Datenverarbeitung
- Es hilft Ihnen dabei, Trainingssysteme zu erstellen, die maรgeschneiderte Anleitungen und Materialien entsprechend den Bedรผrfnissen der Schรผler bereitstellen.
- Flugzeugsteuerung und Roboterbewegungssteuerung
Warum Reinforcement Learning nutzen?
Hier sind die Hauptgrรผnde fรผr den Einsatz von Reinforcement Learning:
- Es hilft Ihnen dabei, herauszufinden, in welcher Situation Handlungsbedarf besteht.
- Hilft Ihnen dabei, herauszufinden, welche Maรnahme langfristig den hรถchsten Nutzen bringt.
- Reinforcement Learning stellt dem Lernagenten auch eine Belohnungsfunktion zur Verfรผgung.
- Es ermรถglicht dem Agenten auรerdem, die beste Methode zur Erzielung hoher Belohnungen zu ermitteln.
Wann sollte Reinforcement Learning nicht eingesetzt werden?
Ein Reinforcement-Learning-Modell lรคsst sich nicht in jeder Situation anwenden. Hier sind einige Bedingungen, unter denen Sie es nicht verwenden sollten.
- Wenn Sie รผber genรผgend gekennzeichnete Daten verfรผgen, um das Problem mit einer รผberwachten Lernmethode zu lรถsen
- Reinforcement Learning ist rechenintensiv und zeitaufwรคndig, insbesondere wenn der Aktionsraum groร ist.
Herausforderungen des Reinforcement Learning
Hier sind die wichtigsten Herausforderungen, denen Sie beim Reinforcement Learning begegnen werden:
- Feature- und Belohnungsdesign, das sehr aufwรคndig sein kann
- Parameter kรถnnen die Lerngeschwindigkeit beeinflussen.
- Realistische Umgebungen kรถnnen teilweise beobachtbar sein.
- Zu viel Verstรคrkung kann zu einer รberlastung der Zustรคnde fรผhren, was die Ergebnisse mindern kann.
- Realistische Umgebungen kรถnnen instationรคr sein.




