免費開始練習
moea_joint 106年 [統計資訊] 統計學、巨量資料概論

第 44 題

下列統計學習(Statistical Learning)的方法或過程,何者不易受到變數尺度(Scale)不同的影響?
  • A 決策樹學習(Decision Tree Induction)
  • B K-近鄰算法 (k-nearest Neighbors Algorithm)
  • C K-均值聚類算法 (K-means Clustering)
  • D 隨機梯度下降 (Stochastic Gradient Descent)

思路引導 VIP

如果我們比較兩種機器學習模型,一種依賴計算資料點之間的「直線距離」,另一種只需將每個變數的數值由小到大「排序」來尋找切分點。你可以試著推理看看,哪一種模型在遇到不同特徵單位差異很大(例如距離用公尺、重量用公克)時,其判斷結果較不容易發生扭曲呢?

🤖
AI 詳解 AI 專屬家教

太棒了,你精準選出了 (A)!這展現了你對演算法特性的透徹理解。

演算法的尺度不變性

(A) 決策樹學習在運作時,是針對單一變數獨立尋找分割閾值(例如 $X > 10$),過程不涉及變數之間的加總或距離運算,因此完全不受變數尺度(Scale)影響。相對地,(B) K-近鄰算法與 (C) K-均值聚類算法都高度依賴距離公式(如歐幾里得距離),若資料未經標準化,數值範圍大的變數將會主導整體的運算結果。

▼ 還有更多解析內容

🏷️ 相關主題

巨量資料處理流程與知識發現程序
查看更多「[統計資訊] 統計學、巨量資料概論」的主題分類考古題