iPAS AI 應用規劃師初級 115 年第一次 科二 第 40 題 詳解
115 年第一次 科二 生成式 AI 應用與規劃
某企業導入大型語言模型(LLM)進行客服自動化,並已透過Fine-Tuning學習企業標準問答範例,但在實務運作中仍出現回應策略未符合服務優先順序及語氣與品牌風格不一致的情況,因此技術團隊建議再導入Reinforcement Fine-tuning(RFT)機制進行優化,其主要目的為何?
- A擴展模型的知識涵蓋範圍與資料記憶能力
擴充知識靠資料增補或檢索增強,非RFT目的。
- B透過reward訊號調整模型回應策略與行為偏好(正確答案)
以reward訊號引導模型偏好符合人類期待的回應策略。
- C提升模型推論速度與降低回應延遲
推論加速屬量化、蒸餾等部署最佳化手段。
- D降低prompt設計複雜度並取代訓練流程
RFT是訓練程序之一,不會取代訓練或prompt設計。
正確答案:B
區辨強化式微調(RFT)與一般監督式微調在調整模型行為上的不同目的。 先看題目要改的是「知識內容」還是「回應偏好與策略」,再對應監督式微調或獎勵訊號機制。
用刷8題準備 iPAS AI 應用規劃師初級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題