iPAS AI 應用規劃師初級 115 年第一次 科一 第 24 題 詳解

115 年第一次 科一 人工智慧基礎概論

某企業導入大型語言模型作為客服助理。模型已具備穩定語言能力,但在回覆偏好一致性與組織規範遵循方面仍需優化,團隊因此規劃導入人類反饋強化學習(RLHF)流程,下列何者最不屬於RLHF階段的典型技術活動?

  1. A透過人工評估方式建立偏好資料,使模型的不同候選輸出可反映人類主觀品質差異

    人工比較候選輸出、建立偏好資料,是 RLHF 第一步。

  2. B訓練一個能依據人類偏好判斷輸出品質的模型,作為模型優化過程中的回饋依據

    訓練獎勵模型當回饋依據,是 RLHF 核心環節。

  3. C依據品質評估結果,調整模型生成策略,使其輸出更符合偏好導向的行為表現

    依獎勵訊號用強化學習調整生成策略,正是最後一步。

  4. D以未標註語料為主進行長週期表示學習訓練,以提升模型基礎語言建模能力(正確答案)

    大量未標註語料的表示學習屬預訓練,與人類回饋無關。

正確答案:D

大型語言模型訓練流程中,RLHF 各階段與預訓練階段的區別。 先問這個動作需不需要人類偏好標註,需要才屬於對齊階段,否則多半是預訓練。

用刷8題準備 iPAS AI 應用規劃師初級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題