iPAS AI 應用規劃師初級 115 年第二次 科二 第 39 題 詳解
115 年第二次 科二 生成式 AI 應用與規劃
某研究團隊希望評估大型語言模型在不同學科領域的整體理解能力,包含法律、醫學、數學與歷史等,並要求模型在未見過的題型中仍能正確推理與作答。下列何者最符合此類評測設計的核心概念?
- A單一領域專業知識記憶測驗
限單一領域且偏記憶,與跨學科泛化能力的要求相反。
- B多領域、多任務之語言理解能力評估(正確答案)
跨法律、醫學、數學等多任務評估通用理解與推理,正解。
- C對話流暢度與語言生成品質測試
只測生成流暢度,不涉及跨領域知識與推理正確性。
- D資料檢索準確率評估
檢索準確率衡量資訊搜尋系統,非模型理解能力。
正確答案:B
這題考大型語言模型的評測基準(benchmark)設計概念,也就是多領域多任務語言理解能力的衡量方式。 看題幹強調「涵蓋多學科」與「未見過的題型」,就往通用能力評測而非單項效能指標判斷。
用刷8題準備 iPAS AI 應用規劃師初級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題