강화학습
Reinforcement learning
다른 표기: RL
행동에 따라 보상을 주고, 보상을 크게 받는 쪽으로 행동을 고쳐 나가게 하는 학습 방식.
게임이나 로봇처럼 순서대로 행동하고 결과가 나중에 오는 문제에 맞습니다. 좋은 수를 미리 알려 주는 대신, 이기면 점수를 주는 식입니다.
언어 모델에도 쓰입니다. 사람이 더 낫다고 고른 답에 높은 점수를 주어 모델을 사람이 선호하는 쪽으로 맞추는 방식을 사람 피드백 기반 강화학습이라고 부릅니다.
보상을 잘못 설계하면 엉뚱한 지름길을 배웁니다. 점수를 어디에 주는지가 곧 목표가 됩니다.
- 보상 설계무엇에 점수를 줄지가 결과를 결정합니다.
- 교육에서아이에게 주는 보상도 같습니다. 정답 수보다 시도와 꾸준함에 점수를 주면 행동이 달라집니다.


