Model-Free Policy Evaluation (모델 프리 정책 평가) 규칙을 모를 때, 직접 해보면서 이 상황이 얼마나 좋은지 평가하기 환경의 모델(전이 확률, 보상 함수)을 모르는 상태에서 경험(데이터)을 통해 정책의 가치를 평가하는 방법을 다룬다.
-
몬테카를로 (Monte Carlo, MC)
- 에피소드가 끝날 때까지 기다린 후, 실제 얻은 리턴()의 평균으로 가치를 추정
- 특징: 비편향(Unbiased) 추정량이지만 분산(Variance)이 높음. 에피소드가 끝나야만 학습 가능
-
시간차 학습 (Temporal Difference, TD)
- 에피소드가 끝나지 않아도 다음 스텝의 추정치를 이용해 현재 가치를 업데이트 (Bootstrapping)
- 특징: 편향(Biased)되지만 분산이 낮음, 실시간 학습 가능
-
MC vs TD
- MC는 전체 에피소드 완료 필요, 높은 분산, 편향 없음
- TD는 매 스텝 학습 가능, 낮은 분산, 초기에는 편향 존재