DQN学習における探索率減衰スケジュールの最適化と訓練安定性の向上技法

DQNエージェントの訓練安定性と探索率減衰の必要性 深層Qネットワーク(DQN)を用いたゲーム環境の学習では、広範な状態空間の探索と既に学習した方策の活用のバランスが収束性能を左右します。初期段階ではランダム行動による情報収集が必須であるため高い探索率(ε)が必要ですが、エージェントが局所的な最適解に陥らないよう、学習進捗に応じて探索範囲を段階的に縮小 ...

8月17日 14:27 投稿