검색어를 입력하면 실시간으로 용어와 글을 찾습니다.

AI 검색 & GEO·AEO

Reinforcement Learning from Human Feedback

RLHF

핵심 정의

인간의 선호도 평가를 바탕으로 보상 모델을 구축해 LLM의 출력을 인간 의도에 부합하도록 정렬하는 학습 방식

실무 적용 및 상세 가이드

모델이 유용하고 안전하며 사실에 부합하는 답변을 생성하도록 유도 AI 답변이 선호하는 친절하고 명확하며 구조화된 텍스트 톤앤매너 파악