Reinforcement Learning from Human Feedback
RLHF
인간의 선호도 평가를 바탕으로 보상 모델을 구축해 LLM의 출력을 인간 의도에 부합하도록 정렬하는 학습 방식
실무 적용 및 상세 가이드
모델이 유용하고 안전하며 사실에 부합하는 답변을 생성하도록 유도 AI 답변이 선호하는 친절하고 명확하며 구조화된 텍스트 톤앤매너 파악
RLHF
인간의 선호도 평가를 바탕으로 보상 모델을 구축해 LLM의 출력을 인간 의도에 부합하도록 정렬하는 학습 방식
모델이 유용하고 안전하며 사실에 부합하는 답변을 생성하도록 유도 AI 답변이 선호하는 친절하고 명확하며 구조화된 텍스트 톤앤매너 파악