iPAS AI 應用規劃師初級 115 年第一次 科一 第 6 題 詳解
115 年第一次 科一 人工智慧基礎概論
資料科學團隊在模型訓練前,需對數值特徵進行正規化(Normalization)或標準化(Standardization)。為確保模型評估結果具真實性並避免資料洩漏(Data Leakage),下列何者為最適當的作法?
- A於資料分割前,先對完整資料集計算統計量並進行標準化處理
全資料先算統計量,測試集資訊滲入訓練,屬典型資料洩漏。
- B先分割訓練資料(Training Data)和測試資料(Test Data),並各自獨立計算統計量後進行標準化
各自算統計量會使兩邊尺度不一致,評估失真。
- C先分割訓練資料(Training Data)和測試資料(Test Data),僅以訓練資料計算統計量,再套用至測試資料(正確答案)
以訓練資料 fit、再 transform 測試資料,正確作法。
- D僅對訓練資料(Training Data)進行標準化處理,測試資料(Test Data)保持原始數值
測試資料未轉換,與模型輸入尺度不符,預測無效。
正確答案:C
資料前處理的標準化必須只用訓練資料統計量,以避免資料洩漏。 看到前處理步驟,先問這個運算有沒有偷看到測試資料的資訊,有就是洩漏。
用刷8題準備 iPAS AI 應用規劃師初級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題