RLHF (인간 피드백 기반 강화학습, Reinforcement Learning from Human Feedback)
AI 모델이 인간의 피드백을 통해 학습하고 개선되는 과정을 의미하나, 본문에서는 이 과정의 문제점으로 "효과적이거나 세련된 발화로 태그된 구성이 템플릿이 되고, 맥락에 맞지 않게 점점 더 많이 사용되어 상당한 과다 노출로 이어진다"고 지적됨
1 / 2
용례
"인간 훈련사와 보상 모델이 창의적이고 격식 없는 언어를 사용하는 응답에 높은 점수를 부여함."