Crowdly

Додати до Chrome

Our MDP has 3 states: s 1 , s 2 , s 3 . The state transition probabilities are: ...

✅ Перевірена відповідь на це питання доступна нижче. Наші рішення, перевірені спільнотою, допомагають краще зрозуміти матеріал.

Our MDP has 3 states: s₁, s₂, s₃. The state transition probabilities are: p₁₁=0, p₁₂=0.4, p₁₃=0.6. When leaving the state s₁, the agent receives R_s1=2 reward. The state value function of the states s₂ and s₃ are: v₂=8, v₃=4. Calculate the v₁ state value of the state s₁. The discount factor γ=0.5.

Більше питань подібних до цього

Хочете миттєвий доступ до всіх перевірених відповідей на elearning.aua.am?

Отримайте необмежений доступ до відповідей на екзаменаційні питання - встановіть розширення Crowdly зараз!

Додати до Chrome

Telegram Instagram TikTok Question Bank

Умови використання Зв'яжіться з нами