You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
Si modifica la funzione obiettivo per qualsiasi $\theta_{old}$ rispetto a dati ottenuti fin'ora. Se utilizziamo $\theta=\theta_{old}$ abbiamo un meccanismo standard policy gradient.
Step-sizing and Trust Region Policy Optimization (TRPO)
Step-sizing è importante perché il gradiente è un'approssimazione di primo ordine, guarda localmente dove è meglio muoversi. Bisogna capire quanto andare verso la direzione del gradiente.
Cosa succede se si ha uno step-size troppo grande?
apprendimento supervisionato: si può correggere nel prossimo update
reinforcement learning: uno step troppo avanti corrisponde ad una policy di qualità bassa
i prossimi dati collezionati saranno poco informativi
non c'è un modo per correggere lo step-size in maniera ottimale
c'è modo di trovare lo step size ideale?
Step-sizing con ricerca lineare nella direzione del gradiente:
si collezionano dati su lunghezze diverse del gradiente
naive: non valuta la bontà dell'approssimazione di prim'ordine
la loss function valuta la nuova policy senza collezionare altri dati
stima $A^{\pi_{old}}$ dipende dalla old policy
il metodo è buono quando la nuova policy è vicino alla vecchia policy
$KL(\pi \Vert \pi_{old})$ distanza delle policy sotto forma di Kullback-Leibler divergence (calcolo di quanto due distribuzioni di probabilità differiscono tra di loro): si può usare il metodo del gradiente coniugato per calcolarla, siccome è di ordine superiore