통계 및 빅 데이터 deep-rl

Q-Learning이 테스트 중에 엡실론 욕심을 사용하는 이유는 무엇입니까?

Atari 비디오 게임을위한 Deep Q-Learning에 대한 DeepMind의 논문 ( 여기 )에서는 훈련 중 탐색을 위해 엡실론 탐욕 방법을 사용합니다. 이는 트레이닝에서 동작을 선택할 때 가장 높은 q- 값을 가진 동작으로 선택되거나 임의의 동작으로 선택됨을 의미합니다. 이 두 가지 중에서 선택하는 것은 무작위이며 엡실론의 가치에 근거하며, 엡실론은 훈련 중에 어닐링되어 처음에는 …

18 machine-learning reinforcement-learning q-learning deep-rl

«deep-rl» 태그된 질문