iPAS AI 應用規劃師初級 115 年第二次 科一 第 29 題 詳解
115 年第二次 科一 人工智慧基礎概論
某AI研究團隊採用GRPO(Group Relative Policy Optimization)作為一種基於強化學習的模型優化方法,用於提升大型語言模型的表現。請問GRPO最適合用來強化模型在哪一類任務上的表現?
- A判斷客服留言的情緒傾向,將每則訊息快速歸類為正面、負面或中性
情緒分類屬監督式分類,用標註資料訓練即可。
- B將客服電話錄音即時轉換為文字,供後續人工審閱使用
語音轉文字是序列轉換任務,與獎勵優化無關。
- C針對數學應用題或邏輯謎題,逐步推導出正確解答(正確答案)
數理推理有可驗證答案,適合用獎勵訊號優化推理路徑。
- D分析商品圖片的外觀特徵,自動辨識類別與品項
影像辨識屬電腦視覺分類,不需策略優化。
正確答案:C
強化學習式優化(如 GRPO)適合強化哪一類模型能力 看該方法是否需要「可評分的最終結果」與多步驟輸出,再判斷任務類型。
用刷8題準備 iPAS AI 應用規劃師初級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題