« 2024/06 »
일	월	화	수	목	금	토
						1
2	3	4	5	6	7	8
9	10	11	12	13	14	15
16	17	18	19	20	21	22
23	24	25	26	27	28	29
30

2024/06/27 2

강화 학습 알고리즘은 학습을 위한 데이터가 에이전트가 어떤 행동을 하느냐에 따라 달라진다. 따라서 강화학습 알고리즘은 데이터를 잘 수집하는 문제와 알고리즘을 잘 업데이트 하는 문제를 모두 고려해야 한다. 이때 Exploration and Expoitation Trade-off문제가 발생한다. Exploration : 학습을 위해 수집하는 Sample의 다양성을 위해 모험적인 Action을 취하는것 = 미래의 이익을 최대화Exploitaiton : 최적의 Action을 취하는것 = 현재의 이익을 최대

알고리즘

Exploration & Exploitation Trade-Off NEW

2024.06.27

댓글 개
Q-Learning 및 강화학습을 적용할 때 보통 $\epsilon - Greedy$ 라는 기법을 함께 적용한다. 에이전트가 항상 최대 Q값으로 행동하게 되면 데이터 수집과정에서 다양성이 감소하고 이로인해 최대 학습 결과가 Local Optima에 빠질 확률이 높아진다. 따라서 $\epsilon - Greedy$ 기법은 에이전트가 $\epsilon$ 확률로 최적의 행동이 아닌 랜덤한 행동을 하게 하고, 다시 $( 1 - \epsilon )$ 확률로 최적의 행동을 하게 함으로써 에이전트가 다양한 상태를 경험하고 수집할 수 있게 한다. 결과적으로 학습이 끝난 후에 더 좋은 성능을 발휘할 수 있다. 하지만 계속해서 랜덤한 행동을 하도록 할 수는 없음으로 학습 초반에는 $\epsilon$ ..

알고리즘

$\epsilon - Greedy$ NEW

2024.06.27

댓글 개

내 블로그 - 관리자 홈 전환	`Q` `Q`
새 글 쓰기	`W` `W`

글 수정 (권한 있는 경우)	`E` `E`
댓글 영역으로 이동	`C` `C`

이 페이지의 URL 복사	`S` `S`
맨 위로 이동	`T` `T`
티스토리 홈 이동	`H` `H`
단축키 안내	`Shift` + `/` `⇧` + `/`

개인정보

2024/06/27 2

티스토리툴바

단축키

내 블로그

블로그 게시글

모든 영역