Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lernen Politikiteration | Dynamische Programmierung
Einführung in Reinforcement Learning mit Python

Politikiteration

Swipe um das Menü anzuzeigen

Die Idee hinter der Policy Iteration ist einfach:

  1. Eine anfängliche π\pi und vv wählen;
  2. Mit der Policy Evaluation vv aktualisieren, bis es mit π\pi konsistent ist;
  3. Mit der Policy Improvement π\pi aktualisieren, bis sie bezüglich vv gierig ist;
  4. Schritte 2-3 wiederholen, bis Konvergenz erreicht ist.

Bei dieser Methode gibt es keine partiellen Aktualisierungen:

  • Während der Policy Evaluation werden die Werte für jeden Zustand aktualisiert, bis sie mit der aktuellen Policy übereinstimmen;
  • Während der Policy Improvement wird die Policy bezüglich der Wertfunktion gierig gemacht.

Pseudocode

Pseudocode für Policy Iteration
question mark

Basierend auf dem Pseudocode: Welche Bedingung führt dazu, dass die äußere Schleife der Policy-Iteration stoppt?

Wählen Sie die richtige Antwort aus

War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 3. Kapitel 7

Fragen Sie AI

expand

Fragen Sie AI

ChatGPT

Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen

Abschnitt 3. Kapitel 7
some-alt