iPAS AI 應用規劃師初級 115 年第三次 科一 第 42 題 詳解
115 年第三次 科一 人工智慧基礎概論
某客服系統開發團隊希望聊天機器人的回覆風格更貼近人類偏好,因此在模型訓練後期導入人類回饋強化學習(Reinforcement Learning from Human Feedback, RLHF)技術。關於RLHF核心作法,下列敘述何者最正確?
- A蒐集人類對不同模型回覆的偏好評比,建立獎勵模型作為模型優化的依據(正確答案)
偏好評比訓練獎勵模型,再用強化學習優化,符合 RLHF 定義。
- B蒐集更大量的公開網路文字重新進行預訓練,以提升模型回答的專業度
重新預訓練是擴充知識量,與對齊人類偏好無關。
- C調整系統提示(System Prompt),引導模型採用指定的回覆風格
調整提示詞屬推論階段操作,未更動模型權重。
- D蒐集高品質問答範例,直接進行監督式微調(Supervised Fine-Tuning, SFT)
SFT 學的是標準答案,缺少獎勵模型與強化學習迴圈。
正確答案:A
RLHF 以人類偏好建立獎勵模型來微調大型語言模型的核心機制 看到訓練方法題,先確認該方法的訊號來源是人類偏好排序、標準答案還是純文本。
用刷8題準備 iPAS AI 應用規劃師初級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題