iPAS AI 應用規劃師初級 115 年第三次 科一 第 16 題 詳解

115 年第三次 科一 人工智慧基礎概論

某零售企業的資料科學團隊正在開發高價值會員預測模型。在資料前處理階段,分析師發現特徵欄位「年收入」有約5%的遺漏值(Missing Value)。經資料探索發現,該欄位的數值分佈呈現高度正偏態(右偏分配,Skewness to the Right)。若在不刪除任何會員資料的前提下,欲選擇較適合的遺漏值填補方式,下列何者最為合適?

  1. A填補該欄位的平均值(Mean)

    平均值受右尾高收入極端值拉高,會高估填補結果。

  2. B填補該欄位的眾數(Mode)

    眾數適用類別型變數,連續型收入使用會失真。

  3. C填補該欄位的中位數(Median)(正確答案)

    中位數不受極端值影響,最能代表偏態分佈的集中趨勢。

  4. D將遺漏值直接填補為「0」

    填 0 等於捏造「無收入」,嚴重扭曲分佈與模型。

正確答案:C

考資料前處理中遺漏值填補法的選擇,須依變數分佈型態決定統計量。 先看分佈是否偏態或有極端值,偏態用中位數,近似常態才用平均值,類別型才用眾數。

用刷8題準備 iPAS AI 應用規劃師初級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題