一個尷尬的事實
基礎 LLM 很聰明,但也很沒禮貌。它不知道什麼話該說、什麼不該說。RLHF(Reinforcement Learning from Human Feedback)就是教它這件事。
RLHF 三步驟
- 收集人類偏好:同一 prompt 生成兩組答案,人類標註哪個比較好
- 訓練 Reward Model:用偏好數據訓練一個模型來模擬人類品味
- PPO 強化學習:用 Reward Model 當裁判,微調 LLM 讓它產出高分的回答
為什麼不是直接叫模型「要有禮貌」?
因為「有禮貌」太難定義了。你需要具體標註:這則回答 helpful / harmless / honest 的程度是幾分。
實務上的取捨
RLHF 會讓模型變得「安全」,但也可能「過度保守」——拒絕回答一些其實沒問題的問題。這就是 alignment tax。
你覺得 ChatGPT 的語氣是剛剛好,還是太像 HR 了?
討論 (0)
— 尚無回覆,登入後參與討論 —
— 登入後參與討論 —