iPAS AI 應用規劃師初級 114 年第四次 科二 第 45 題 詳解
114 年第四次 科二 生成式 AI 應用與規劃
下列哪一個資料集專門設計用於測試大型語言模型在多領域、多任務語言理解中,涵蓋人文、科學與社會科學等領域,而非專門用於數學推理或中文專業知識?
- AMMLU(正確答案)
MMLU 橫跨 57 學科,正是多領域多任務語言理解評測。
- BGSM8K
GSM8K 是小學程度數學應用題,只測算術推理。
- CMATH
MATH 收錄競賽級數學題,專攻數學解題能力。
- DC-Eval
C-Eval 針對中文情境的學科知識評測,領域定位不同。
正確答案:A
大型語言模型常見評測基準資料集的用途差異 看題目強調的評測面向是「多領域通識」「數學推理」還是「中文學科」,再對應基準名稱。
用刷8題準備 iPAS AI 應用規劃師初級
每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。
開始刷題