iPAS AI 應用規劃師初級 115 年第二次 科二 第 39 題 詳解

115 年第二次 科二 生成式 AI 應用與規劃

某研究團隊希望評估大型語言模型在不同學科領域的整體理解能力,包含法律、醫學、數學與歷史等,並要求模型在未見過的題型中仍能正確推理與作答。下列何者最符合此類評測設計的核心概念?

  1. A單一領域專業知識記憶測驗

    限單一領域且偏記憶,與跨學科泛化能力的要求相反。

  2. B多領域、多任務之語言理解能力評估(正確答案)

    跨法律、醫學、數學等多任務評估通用理解與推理,正解。

  3. C對話流暢度與語言生成品質測試

    只測生成流暢度,不涉及跨領域知識與推理正確性。

  4. D資料檢索準確率評估

    檢索準確率衡量資訊搜尋系統,非模型理解能力。

正確答案:B

這題考大型語言模型的評測基準(benchmark)設計概念,也就是多領域多任務語言理解能力的衡量方式。 看題幹強調「涵蓋多學科」與「未見過的題型」,就往通用能力評測而非單項效能指標判斷。

用刷8題準備 iPAS AI 應用規劃師初級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題