Was ist Reinforcement Learning? Arten, Algorithms & Beispiel

โšก Intelligente Zusammenfassung

Reinforcement Learning ist eine Methode des maschinellen Lernens, bei der ein Softwareagent lernt, indem er in einer Umgebung agiert, Belohnungen oder Strafen sammelt und sein Verhalten anpasst, um die kumulative Belohnung รผber viele Schritte hinweg zu maximieren.

  • ๐Ÿ”˜ Kernschleife: Ein Agent beobachtet einen Zustand, fรผhrt eine Aktion aus, erhรคlt eine Belohnung und landet in einem neuen Zustand.
  • โ˜‘๏ธ Drei Ansรคtze: Wertbasierte, politikbasierte und modellbasierte Methoden unterscheiden sich darin, was der Agent tatsรคchlich lernt.
  • โœ… Zwei Lernmodelle: Markov-Entscheidungsprozesse formulieren das Problem; Q-Learning lรถst es aus Erfahrung.
  • ๐Ÿงช Nicht beaufsichtigt: Es gibt keine vorgegebenen Antworten, sondern nur ein verzรถgertes Belohnungssignal, das der Akteur frรผheren Aktionen zuordnen muss.
  • ๏ธ Wo es passt: Robotik, Videospiele, Flugzeugsteuerung, adaptives Tutoring und strategische Geschรคftsplanung.
  • โš™๏ธ Bekannte Kosten: Das Training ist rechenintensiv, die Gestaltung von Belohnungen ist heikel und reale Umgebungen sind unruhig und nicht stationรคr.

Reinforcement Learning: Algorithmen, Typen und Beispiele

Was ist Reinforcement Learning?

Verstรคrkung lernen ist eine Maschinelles lernen Die Methode befasst sich damit, wie Softwareagenten in einer Umgebung agieren sollen. Dem Agenten werden keine korrekten Antworten angezeigt; er lernt aus den erhaltenen Belohnungen und passt sein Verhalten an, um die Gesamtbelohnung zu maximieren.

Reinforcement Learning ist ein eigenstรคndiger Zweig des maschinellen Lernens, neben Aufsicht und unbeaufsichtigt Lernen. Wenn die Strategie oder Wertfunktion des Agenten durch ein neuronales Netzwerk dargestellt wird, nennt man diese Kombination Lernen. tiefes Lernen der Verstรคrkung โ€” Diese Paarung ermรถglicht es einem Akteur, ein komplexes Ziel zu erreichen oder eine bestimmte Dimension รผber viele Schritte hinweg zu maximieren.

Wichtige Komponenten der Reinforcement-Learning-Methode

Bevor die Algorithmen verstรคndlich werden, ist es hilfreich, die einzelnen Bestandteile zu benennen. Das folgende Diagramm veranschaulicht, wie Agent, Umgebung, Aktion und Belohnungssignal in einer Schleife zusammenwirken.

Reinforcement-Learning-Schleife verbindet Agent, Aktion, Umgebung, Zustand und Belohnung

Hier sind einige wichtige Begriffe, die im Reinforcement Learning verwendet werden:

  • Agenten: Die Entitรคt, die in einer Umgebung Handlungen ausfรผhrt, um eine Belohnung zu erhalten.
  • Umgebung (e): Ein Szenario, dem sich ein Agent stellen muss.
  • Belohnung (R): Eine sofortige Gegenleistung, die einem Agenten nach Ausfรผhrung einer bestimmten Handlung oder Aufgabe zuteilwird.
  • Zustรคnde): Der Zustand bezieht sich auf die aktuelle Situation, die von der Umgebung zurรผckgegeben wird.
  • Richtlinie (ฯ€): Die Strategie, die der Agent anwendet, um auf Grundlage des aktuellen Zustands die nรคchste Aktion festzulegen.
  • Wert (V): Die erwartete langfristige Rendite mit Abschlag im Vergleich zur kurzfristigen Rendite.
  • Wertfunktion: Es legt den Wert eines Zustands fest, also die Gesamtsumme der Belohnung, die ein Agent ausgehend von diesem Zustand erwarten kann.
  • Modell der Umgebung: Dadurch wird das Verhalten der Umgebung nachgeahmt. Es ermรถglicht Ihnen, Schlussfolgerungen zu ziehen und auch vorherzusagen, wie sich die Umgebung verhalten wird.
  • Modellbasierte Methoden: Methoden, die Probleme des bestรคrkenden Lernens lรถsen, indem sie zunรคchst ein Modell der Umgebung lernen oder verwenden und dann dagegen planen.
  • Q-Wert oder Aktionswert (Q): Der Q-Wert ist dem Wert sehr รคhnlich. Der einzige Unterschied zwischen den beiden besteht darin, dass er einen zusรคtzlichen Parameter benรถtigt, die aktuelle Aktion.

Wie funktioniert Reinforcement Learning?

Eine alltรคgliche Analogie verdeutlicht den Mechanismus, noch bevor irgendeine Notation erscheint.

Stellen Sie sich vor, Sie mรถchten Ihrer Katze neue Tricks beibringen.

  • Da die Katze weder Englisch noch eine andere menschliche Sprache versteht, kรถnnen wir ihr nicht direkt sagen, was sie tun soll. Stattdessen verfolgen wir eine andere Strategie.
  • Wir stellen eine Situation nach, und die Katze versucht, auf verschiedene Weise darauf zu reagieren. Wenn die Reaktion der Katze die gewรผnschte ist, geben wir ihr Fisch.
  • Immer wenn die Katze nun mit der gleichen Situation konfrontiert wird, fรผhrt sie eine รคhnliche Handlung noch enthusiastischer aus, in der Erwartung, eine grรถรŸere Belohnung (Futter) zu erhalten.
  • Das ist das Lernen, das die Katze aus positiven Erfahrungen darรผber gewinnt, โ€žwas zu tun istโ€œ.
  • Gleichzeitig lernt die Katze aber auch, was sie bei negativen Erfahrungen nicht tun sollte.

Beispiel fรผr Reinforcement Learning

Die untenstehende Abbildung รผbertrรคgt diese Katzengeschichte auf den formalen Kreislauf, wobei der Haushalt die Umgebung und der Fisch die Belohnung darstellt.

Beispiel Katze und Besitzer, abgebildet auf die Agent-Umgebung-Schleife des bestรคrkenden Lernens
Wie Reinforcement Learning funktioniert

In diesem Fall steht:

  • Ihre Katze ist ein Faktor, der mit der Umgebung interagiert. In diesem Fall ist es Ihr Haus. Ein Beispiel fรผr einen solchen Zustand wรคre, wenn Ihre Katze sitzt und Sie ein bestimmtes Wort verwenden, um sie zum Laufen zu animieren.
  • Unser Agent reagiert, indem er einen Aktionsรผbergang von einem โ€žZustandโ€œ in einen anderen โ€žZustandโ€œ durchfรผhrt.
  • Beispielsweise wechselt Ihre Katze vom Sitzen zum Gehen.
  • Die Reaktion eines Agenten ist eine Aktion, und die Richtlinie ist eine Methode zur Auswahl einer Aktion in einem gegebenen Zustand in Erwartung besserer Ergebnisse.
  • Nach dem รœbergang kann der Agent im Gegenzug eine Belohnung oder eine Strafe erhalten.

Verstรคrkung lernen Algorithms

Es gibt drei Ansรคtze zur Implementierung eines Reinforcement-Learning-Algorithmus, die sich hauptsรคchlich darin unterscheiden, was der Agent speichert und lernt.

Wertebasiert

Bei einem wertbasierten Reinforcement-Learning-Verfahren wird versucht, eine Wertfunktion V(s) zu maximieren. In diesem Verfahren erwartet der Agent langfristig den Erhalt der aktuellen Zustรคnde gemรครŸ der Strategie ฯ€.

Richtlinienbasiert

Bei einer richtlinienbasierten RL-Methode versucht man, eine Strategie zu entwickeln, bei der die in jedem Zustand durchgefรผhrte Aktion dazu beitrรคgt, in Zukunft die maximale Belohnung zu erzielen.

Es gibt zwei Arten richtlinienbasierter Methoden:

  • Deterministisch: Fรผr jeden Zustand wird durch die Politik ฯ€ die gleiche Aktion erzeugt.
  • Stochastisch: Jeder Aktion ist eine bestimmte Wahrscheinlichkeit zugeordnet, die durch die folgende Gleichung gegeben ist.

Stochastische Politik:

ฯ€(a|s) = P[At = a | St = s]

Modellbasiert

Bei dieser Methode des bestรคrkenden Lernens wird fรผr jede Umgebung ein virtuelles Modell erstellt. Der Agent lernt dann, sich in dieser spezifischen Umgebung zu verhalten.

Merkmale des Reinforcement Learning

Hier sind wichtige Merkmale des bestรคrkenden Lernens:

  • Es gibt keinen Vorgesetzten, nur eine echte Zahl oder ein Belohnungssignal
  • Sequentielle Entscheidungsfindung
  • Zeit spielt bei Verstรคrkungsproblemen eine entscheidende Rolle
  • Das Feedback erfolgt oft verzรถgert statt unmittelbar.
  • Die Aktionen des Agenten bestimmen die nachfolgenden Daten, die er empfรคngt

Arten von Reinforcement Learning

Der Begriff โ€žVerstรคrkungโ€œ stammt aus der Verhaltenspsychologie und tritt in zwei Formen auf:

Positiv:

Es handelt sich um ein Ereignis, das aufgrund eines bestimmten Verhaltens eintritt. Es verstรคrkt und erhรถht die Hรคufigkeit dieses Verhaltens und wirkt sich positiv auf die Handlungen des Akteurs aus.

Diese Art der Verstรคrkung hilft Ihnen, die Leistung zu maximieren und Verรคnderungen lรคngerfristig aufrechtzuerhalten. Zu viel Verstรคrkung kann jedoch zu einer รœberoptimierung des Zustands fรผhren, was die Ergebnisse beeintrรคchtigen kann.

Negativ:

Negative Verstรคrkung bezeichnet die Verstรคrkung eines Verhaltens, das aufgrund einer negativen Situation auftritt, die eigentlich hรคtte verhindert oder vermieden werden sollen. Sie hilft dabei, einen Mindeststandard fรผr Leistung festzulegen. Der Nachteil dieser Methode besteht jedoch darin, dass sie lediglich ausreichend Verstรคrkung bietet, um dieses Mindestverhalten zu erreichen.

Lernmodelle der Verstรคrkung

Beim Reinforcement Learning gibt es zwei wichtige Lernmodelle:

  • Markov-Entscheidungsprozess
  • Q Lernen

Markov-Entscheidungsprozess

Um eine Lรถsung zu erhalten, werden die folgenden Parameter verwendet:

  • Handlungsabfolge โ€“ A
  • Zustandsmenge โ€“ S
  • Belohnung โ€“ R
  • Richtlinie โ€“ ฯ€
  • Wert โ€“ V

Der mathematische Ansatz fรผr die Karteping Eine Lรถsung im Reinforcement Learning wird als Markov-Entscheidungsprozess (MDP) formalisiert. Das folgende Schema zeigt, wie diese fรผnf Parameter in denselben Agenten-Umgebungs-Zyklus eingebunden sind.

Schema eines Markov-Entscheidungsprozesses mit Zustรคnden, Aktionen, Belohnung und Strategie

Q-Learning

Q-Learning ist eine wertbasierte Methode zur Bereitstellung von Informationen, die einem Agenten mitteilen, welche Aktion er ausfรผhren soll.

Lassen Sie uns diese Methode anhand des folgenden Beispiels verstehen:

  • In einem Gebรคude gibt es fรผnf Rรคume, die durch Tรผren miteinander verbunden sind.
  • Die Rรคume sind von 0 bis 4 nummeriert.
  • Der AuรŸenbereich des Gebรคudes kann als eine groรŸe AuรŸenflรคche betrachtet werden (5).
  • Die Tรผren Nr. 1 und 4 fรผhren von Raum 5 in das Gebรคude

Im untenstehenden Grundriss sind die Rรคume nummeriert und die Verbindungstรผren sind eingezeichnet.

Grundriss eines Fรผnf-Zimmer-Gebรคudes mit nummerierten Zimmern und dem AuรŸenbereich 5

Als Nรคchstes mรผssen Sie jeder Tรผr einen Belohnungswert zuordnen:

  • Tรผren, die direkt zum Ziel fรผhren, haben eine Belohnung von 100
  • Tรผren, die nicht direkt mit dem Zielraum verbunden sind, bringen keine Belohnung.
  • Da die Tรผren in beide Richtungen geรถffnet werden kรถnnen, sind jedem Raum zwei Pfeile zugeordnet.
  • Jeder Pfeil im obigen Bild reprรคsentiert einen sofortigen Belohnungswert.

Erlรคuterung: In dieser Abbildung reprรคsentiert jeder Raum einen Zustand, und die Bewegung des Agenten von einem Raum zum anderen stellt eine Handlung dar.

Im folgenden Diagramm ist ein Zustand als Knoten dargestellt, wรคhrend die Pfeile die verfรผgbaren Aktionen und die jeweils damit verbundene Belohnung zeigen.

Zustandsdiagramm der fรผnf Rรคume mit Belohnungswerten von 0 und 100 bei jedem รœbergang

Ein Agent durchlรคuft beispielsweise die Rรคume 2 bis 5:

  • Ausgangszustand = Zustand 2
  • Zustand 2 -> Zustand 3
  • Zustand 3 -> Zustand (2,1,4)
  • Zustand 4-> Zustand (0,5,3)
  • Zustand 1-> Zustand (5,3)
  • Zustand 0 -> Zustand 4

Reinforcement Learning vs. Supervised Learning

Am besten lรคsst sich Reinforcement Learning einordnen, indem man es neben das Paradigma stellt, das den meisten Lesern bereits bekannt ist.

KenngrรถรŸen Verstรคrkung lernen รœberwachtes Lernen
Entscheidungsstil Reinforcement Learning hilft Ihnen dabei, Ihre Entscheidungen schrittweise zu treffen. Bei dieser Methode wird eine Entscheidung anhand der zu Beginn gegebenen Eingaben getroffen.
Funktioniert auf Funktioniert durch Interaktion mit der Umgebung. Arbeitet anhand von Beispielen oder gegebenen Beispieldaten.
Abhรคngigkeit von der Entscheidung Bei der RL-Methode hรคngt jede Lernentscheidung von den vorhergehenden Entscheidungen ab, sodass die gesamte Entscheidungssequenz bewertet wird. In รผberwachtes Lernen Die Entscheidungen sind voneinander unabhรคngig, daher wird jeder Entscheidung ein Etikett zugeordnet.
am besten geeignet Unterstรผtzt und funktioniert besser in KI-Umgebungen, wo menschliche Interaktion vorherrscht. Die Bedienung erfolgt meist รผber interaktive Softwaresysteme oder Anwendungen.
Beispiel Schachspiel Objekterkennung

Anwendungen des Reinforcement Learning

Hier sind Anwendungen des Reinforcement Learning:

  • Robotik fรผr die industrielle Automatisierung.
  • Planung der Geschรคftsstrategie
  • Maschinelles Lernen und Datenverarbeitung
  • Es hilft Ihnen dabei, Trainingssysteme zu erstellen, die maรŸgeschneiderte Anleitungen und Materialien entsprechend den Bedรผrfnissen der Schรผler bereitstellen.
  • Flugzeugsteuerung und Roboterbewegungssteuerung

Warum Reinforcement Learning nutzen?

Hier sind die Hauptgrรผnde fรผr den Einsatz von Reinforcement Learning:

  • Es hilft Ihnen dabei, herauszufinden, in welcher Situation Handlungsbedarf besteht.
  • Hilft Ihnen dabei, herauszufinden, welche MaรŸnahme langfristig den hรถchsten Nutzen bringt.
  • Reinforcement Learning stellt dem Lernagenten auch eine Belohnungsfunktion zur Verfรผgung.
  • Es ermรถglicht dem Agenten auรŸerdem, die beste Methode zur Erzielung hoher Belohnungen zu ermitteln.

Wann sollte Reinforcement Learning nicht eingesetzt werden?

Ein Reinforcement-Learning-Modell lรคsst sich nicht in jeder Situation anwenden. Hier sind einige Bedingungen, unter denen Sie es nicht verwenden sollten.

  • Wenn Sie รผber genรผgend gekennzeichnete Daten verfรผgen, um das Problem mit einer รผberwachten Lernmethode zu lรถsen
  • Reinforcement Learning ist rechenintensiv und zeitaufwรคndig, insbesondere wenn der Aktionsraum groรŸ ist.

Herausforderungen des Reinforcement Learning

Hier sind die wichtigsten Herausforderungen, denen Sie beim Reinforcement Learning begegnen werden:

  • Feature- und Belohnungsdesign, das sehr aufwรคndig sein kann
  • Parameter kรถnnen die Lerngeschwindigkeit beeinflussen.
  • Realistische Umgebungen kรถnnen teilweise beobachtbar sein.
  • Zu viel Verstรคrkung kann zu einer รœberlastung der Zustรคnde fรผhren, was die Ergebnisse mindern kann.
  • Realistische Umgebungen kรถnnen instationรคr sein.

Hรคufig gestellte Fragen

Exploitation wiederholt die aktuell als beste erachtete Aktion; Exploration versucht, durch andere Aktionen eine bessere zu entdecken. Epsilon-greedy lรถst dieses Problem, indem es mit der Wahrscheinlichkeit ฮต zufรคllig und ansonsten gierig agiert und ฮต mit zunehmender Erfahrung verringert.

Gamma gewichtet zukรผnftige Belohnungen gegen unmittelbare. Ein Wert nahe 0 macht den Agenten kurzsichtig und gierig nach sofortiger Belohnung; ein Wert nahe 1 macht ihn geduldig genug, einen kleinen Verlust jetzt fรผr eine grรถรŸere Auszahlung spรคter in Kauf zu nehmen.

Q-Learning arbeitet richtlinienunabhรคngig: Es aktualisiert sich in Richtung der bestmรถglichen nรคchsten Aktion, unabhรคngig davon, was der Agent tatsรคchlich getan hat. SARSA hingegen arbeitet richtlinienkonform und aktualisiert sich in Richtung der tatsรคchlich durchgefรผhrten Aktion, wodurch es in der Nรคhe risikoreicher Zustรคnde vorsichtiger agiert.

Ein Deep Q-Network ersetzt die Q-Tabelle durch ein neuronales Netzwerk, sodass auch Zustรคnde bewertet werden kรถnnen, die im Training nie vorkamen. Experience Replay und ein separates Zielnetzwerk sorgen fรผr ein stabiles Trainingssignal.

Modellfreie Agenten wie Q-Learning lernen ausschlieรŸlich aus gesammelten Erfahrungen. Modellbasierte Agenten erstellen zunรคchst ein Modell der Umgebungsdynamik und planen darauf basierend. Dies erfordert zwar deutlich weniger reale Interaktionen, ist aber anfรคlliger, wenn das Modell fehlerhaft ist.

Durch bestรคrkendes Lernen mit menschlichem Feedback wird ein Belohnungsmodell anhand menschlicher Prรคferenzrangfolgen trainiert und anschlieรŸend das Sprachmodell auf diese Belohnung abgestimmt. Deshalb basieren Assistenten darauf. tiefe Lernen Folgen Sie den Anweisungen, anstatt lediglich den Text vorherzusagen.

GitHub-Copilot ist gut in Standardprogrammen: Umgebungs-Wrapper, Wiedergabepuffer, Trainingsschleifen und Diagramme. Belohnungsshaping Auch bei der Wahl der Hyperparameter ist noch immer ein gewisses Urteilsvermรถgen gefragt, denn eine stillschweigend falsche Belohnung fรผhrt zu einem Agenten, der zwar gerne trainiert, sich aber schlecht verhรคlt.

Gymnasium stellt die Standard-รœbungsumgebungen bereit, Stable-Baselines3 liefert getestete Algorithmenimplementierungen, und TensorFlow oder PyTorch stellt die Netzwerke bereit. Beginnen Sie mit einer tabellarischen Rasterwelt, bevor Sie sich fรผr eines davon entscheiden.

Fassen Sie diesen Beitrag mit folgenden Worten zusammen: