✅ Перевірена відповідь на це питання доступна нижче. Наші рішення, перевірені спільнотою, допомагають краще зрозуміти матеріал.
Нехай у поточному кроці взаємодії агента з випадковим середовищем MDP (марківський процес прийняття рішення) воно перебувало у стані s, агент здійснив дію а, внаслідок чого середовище перейшло у стан s’, агент отримав виграш R(s,a)=2. Якщо агент обирає дії за методом Q-learning, то чому буде дорівнювати нове значення оціночної ваги Q(s,a), якщо попереднє значення Q(s,a)=16.9, крок навчання alfa=0.1, коефіцієнт послаблення gamma=0.05, а значення оціночних ваг у стані s’: Q(s’,a1)=13.2, Q(s’,a2)=8.1, Q(s’,a3)=17.4, Q(s’,a4)=15.9 (n=4)?