ORBiS Tree

ORBiS TREE DOCUMENT

개념·기술 →

Reinforcement Learning from Human Feedback (RLHF)

사람의 선호·평가를 보상 신호로 활용해 모델 행동을 조정하는 학습 접근법.

최근 수정 2026.08.29 06:47 출처 2

개요

Reinforcement Learning from Human Feedback(RLHF)는 사람이 제공한 선호나 평가를 모델 학습의 보상 신호로 활용하는 접근법이다. 인간이 두 행동이나 출력 중 어느 쪽을 선호하는지 비교한 데이터를 이용해 보상 모델을 학습하고, 그 신호를 강화학습에 활용하는 연구 흐름이 있다.[1]

언어 모델에서의 사용

InstructGPT 연구는 사람이 작성한 시범 데이터로 지도 미세조정을 한 뒤, 모델 출력에 대한 사람의 순위를 수집해 보상 모델과 강화학습을 사용하는 절차를 평가했다.[2]

주의점

RLHF는 하나의 고정된 알고리즘 이름이라기보다 인간 피드백을 강화학습 과정에 연결하는 여러 설계를 포괄하는 표현으로 쓰인다. 사람의 선호 데이터가 곧 객관적 사실을 의미하는 것은 아니다.

SOURCES

출처

  1. 원문 보기 ↗
  2. 원문 보기 ↗