iPAS AI 應用規劃師初級 114 年第四次 科二 第 45 題 詳解

114 年第四次 科二 生成式 AI 應用與規劃

下列哪一個資料集專門設計用於測試大型語言模型在多領域、多任務語言理解中,涵蓋人文、科學與社會科學等領域,而非專門用於數學推理或中文專業知識?

  1. AMMLU(正確答案)

    MMLU 橫跨 57 學科,正是多領域多任務語言理解評測。

  2. BGSM8K

    GSM8K 是小學程度數學應用題,只測算術推理。

  3. CMATH

    MATH 收錄競賽級數學題,專攻數學解題能力。

  4. DC-Eval

    C-Eval 針對中文情境的學科知識評測,領域定位不同。

正確答案:A

大型語言模型常見評測基準資料集的用途差異 看題目強調的評測面向是「多領域通識」「數學推理」還是「中文學科」,再對應基準名稱。

用刷8題準備 iPAS AI 應用規劃師初級

每天隨手刷 8 題,答錯的題目會自動排回來再考一次。不用註冊,打開就能開始。

開始刷題