iPAS AI 應用規劃師初級 115 年第二次 科一 第 29 題 詳解

115 年第二次 科一 人工智慧基礎概論

某AI研究團隊採用GRPO(Group Relative Policy Optimization)作為一種基於強化學習的模型優化方法,用於提升大型語言模型的表現。請問GRPO最適合用來強化模型在哪一類任務上的表現?

  1. A判斷客服留言的情緒傾向,將每則訊息快速歸類為正面、負面或中性

    情緒分類屬監督式分類,用標註資料訓練即可。

  2. B將客服電話錄音即時轉換為文字,供後續人工審閱使用

    語音轉文字是序列轉換任務,與獎勵優化無關。

  3. C針對數學應用題或邏輯謎題,逐步推導出正確解答(正確答案)

    數理推理有可驗證答案,適合用獎勵訊號優化推理路徑。

  4. D分析商品圖片的外觀特徵,自動辨識類別與品項

    影像辨識屬電腦視覺分類,不需策略優化。

正確答案:C

強化學習式優化(如 GRPO)適合強化哪一類模型能力 看該方法是否需要「可評分的最終結果」與多步驟輸出,再判斷任務類型。

用刷8題準備 iPAS AI 應用規劃師初級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題