Q Learning 一維走法

為什麼叫 Q-Learning

Q 這個字母在強化學習中表示一個動作的期望獎勵。那為什麼叫 Q learning,而不是 R learning、V learning 呢! 應該是一個叫 “阿Q哥” 的人發明的演算法,隨便給個名字而以。反正網路上也查不到發明者,而世上那麼多演算法,有如過街老鼠般的多,就隨便給個名字。

公式

先背一下Q-Learning 的公式
$(Q(s,a)=Q(s,a)+lr[r+\gamma*maxQ(s’)-Q(s,a)])$

🔒 更多內容,請登入會員繼續閱讀。

立即登入

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *