logo

Crowdly

Browser

Add to Chrome

Нехай у поточному кроці взаємодії агента з випадковим середовищем MDP (марківс...

✅ The verified answer to this question is available below. Our community-reviewed solutions help you understand the material better.

Нехай у поточному кроці взаємодії агента з випадковим середовищем MDP (марківський процес прийняття рішення) воно перебувало у стані s, агент здійснив дію а, внаслідок чого середовище перейшло у стан s’, агент отримав виграш R(s,a)=2. Якщо агент обирає дії за методом Q-learning, то чому буде дорівнювати нове значення оціночної ваги Q(s,a), якщо попереднє значення Q(s,a)=16.9, крок навчання alfa=0.1, коефіцієнт послаблення gamma=0.05, а значення оціночних ваг у стані s’: Q(s’,a1)=13.2, Q(s’,a2)=8.1, Q(s’,a3)=17.4, Q(s’,a4)=15.9 (n=4)?
More questions like this

Want instant access to all verified answers on vns.lpnu.ua?

Get Unlimited Answers To Exam Questions - Install Crowdly Extension Now!

Browser

Add to Chrome