ORBiS TREE DOCUMENT
개념·기술 →Reinforcement Learning from Human Feedback (RLHF)
사람의 선호·평가를 보상 신호로 활용해 모델 행동을 조정하는 학습 접근법.
개요
Reinforcement Learning from Human Feedback(RLHF)는 사람이 제공한 선호나 평가를 모델 학습의 보상 신호로 활용하는 접근법이다. 인간이 두 행동이나 출력 중 어느 쪽을 선호하는지 비교한 데이터를 이용해 보상 모델을 학습하고, 그 신호를 강화학습에 활용하는 연구 흐름이 있다.[1]
언어 모델에서의 사용
주의점
RLHF는 하나의 고정된 알고리즘 이름이라기보다 인간 피드백을 강화학습 과정에 연결하는 여러 설계를 포괄하는 표현으로 쓰인다. 사람의 선호 데이터가 곧 객관적 사실을 의미하는 것은 아니다.
SOURCES
출처
-
Deep reinforcement learning from human preferences DeepMind / OpenAI / arXiv원문 보기 ↗
- 원문 보기 ↗
KNOWLEDGE LINKS