iPAS AI 應用規劃師初級 115 年第三次 科一 第 42 題 詳解

115 年第三次 科一 人工智慧基礎概論

某客服系統開發團隊希望聊天機器人的回覆風格更貼近人類偏好,因此在模型訓練後期導入人類回饋強化學習(Reinforcement Learning from Human Feedback, RLHF)技術。關於RLHF核心作法,下列敘述何者最正確?

  1. A蒐集人類對不同模型回覆的偏好評比,建立獎勵模型作為模型優化的依據(正確答案)

    偏好評比訓練獎勵模型,再用強化學習優化,符合 RLHF 定義。

  2. B蒐集更大量的公開網路文字重新進行預訓練,以提升模型回答的專業度

    重新預訓練是擴充知識量,與對齊人類偏好無關。

  3. C調整系統提示(System Prompt),引導模型採用指定的回覆風格

    調整提示詞屬推論階段操作,未更動模型權重。

  4. D蒐集高品質問答範例,直接進行監督式微調(Supervised Fine-Tuning, SFT)

    SFT 學的是標準答案,缺少獎勵模型與強化學習迴圈。

正確答案:A

RLHF 以人類偏好建立獎勵模型來微調大型語言模型的核心機制 看到訓練方法題,先確認該方法的訊號來源是人類偏好排序、標準答案還是純文本。

用刷8題準備 iPAS AI 應用規劃師初級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題