iPAS AI 應用規劃師初級 115 年第一次 科一 第 19 題 詳解
115 年第一次 科一 人工智慧基礎概論
某物流公司導入強化式學習(Reinforcement Learning)優化車隊調度。模型在系統運行過程中,會依據不同配送狀態動態調整行動選擇方式,使決策結果逐步朝較佳績效收斂。上述模型在學習過程中的調整行為,最符合下列哪一項強化式學習核心機制?
- A調整策略函數以改變行動選擇機率(正確答案)
策略函數依回饋更新行動機率,正是強化式學習的運作核心。
- B更新訓練資料分布以降低模型偏差
調整訓練資料分布屬資料前處理,非模型與環境互動的學習機制。
- C重新分群狀態資料以識別決策類型
狀態重新分群是非監督式的分群做法,不涉及報酬回饋。
- D建立正確決策標籤進行誤差修正
建立正確標籤做誤差修正是監督式學習,強化式沒有標準答案。
正確答案:A
辨識強化式學習以策略函數與回饋訊號調整行動選擇的核心機制。 先看學習訊號來源:有標準答案就是監督式,靠環境回饋累積報酬調整行為就是強化式。
用刷8題準備 iPAS AI 應用規劃師初級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題