ORBiS
Tree
문서
검색
분류
보완
미작성
최근 변경
로그인
가입
SEARCH
AI 지식 검색
검색
전체
#AI Agent
#AI Assistant
#AI Lab
#AI Research
#AI Safety
#Alignment
#Anthropic
#Attention
#BERT
#Benchmark
#CUDA
#ChatGPT
#Claude
#Context Window
#Data Contamination
#Data Provenance
RESULTS
#Reinforcement Learning 문서
개념·기술
Reinforcement Learning from Human Feedback (RLHF)
사람의 선호·평가를 보상 신호로 활용해 모델 행동을 조정하는 학습 접근법.
#Alignment
#LLM
#RLHF
#Reinforcement Learning
2026.08.29 06:47