< Torna all'indice dei conenuti
Downside degli off-policy methods: non sampe-efficient: se collezionare dati è costoso, non sono metodi ideali
Osservazioni:
- si aggiunge rumore per esporazione: la policy in questo algoritmo può essere deterministica
- si può stimare
$Q$ con Monte Carlo o con Bootstrap: nell'immagine, bootstrap 1-step - si ottimizza la policy: si shifta la policy in modo che il Q value venga migliorato
- in DDPG non si usa il likelihood-ratio, ma il Q value
- introducendo un replay buffer e idee di DQN si può aumentare stabilità
- si usa una versione con lag (Polyak-averaging) di
$Q_\phi$ e$\pi_\theta$ per calcolare la stima$\hat{Q}$
Vantaggio: DDPG è più sample efficient di TRPO e PPO.
Svantaggio: spesso non è stabile.
Vantaggi:
- aggiunge entropia alla funzione obiettivo di DDPG: maximum-entropy formulation
- milgiore eplorazione e meno overfitting della policy su variazioni della Q-function
Soft policy iteration:
-
soft policy evaluation: fissando la policy, si fa un Bellman backup fino alla convergenza a
$Q^\pi \ \equiv$ passo di SGD per minimizzare il Bellman residual
-
soft policy improvement: aggiorna la policy tramite proiezione di informazione. Si avrà
$Q^{\pi_{new}} \ge Q^{\pi_{old}} \ \equiv$ passo di SGD per minimizzare la KL-divergence
- esegui un'azione nell'ambiente e ripeti
Funzione obiettivo:
Equazioni di update di V-value, Q-value, policy
Osservazione: SAC ha delle ottime learning curves nei robot reali, nei quali i dati sono estratti ad un rateo più basso quindi serve estrarre più informazioni possibili.
