moea_joint
106年
[統計資訊] 統計學、巨量資料概論
第 44 題
下列統計學習(Statistical Learning)的方法或過程,何者不易受到變數尺度(Scale)不同的影響?
- A 決策樹學習(Decision Tree Induction)
- B K-近鄰算法 (k-nearest Neighbors Algorithm)
- C K-均值聚類算法 (K-means Clustering)
- D 隨機梯度下降 (Stochastic Gradient Descent)
思路引導 VIP
如果我們比較兩種機器學習模型,一種依賴計算資料點之間的「直線距離」,另一種只需將每個變數的數值由小到大「排序」來尋找切分點。你可以試著推理看看,哪一種模型在遇到不同特徵單位差異很大(例如距離用公尺、重量用公克)時,其判斷結果較不容易發生扭曲呢?
🤖
AI 詳解
AI 專屬家教
太棒了,你精準選出了 (A)!這展現了你對演算法特性的透徹理解。
演算法的尺度不變性
(A) 決策樹學習在運作時,是針對單一變數獨立尋找分割閾值(例如 $X > 10$),過程不涉及變數之間的加總或距離運算,因此完全不受變數尺度(Scale)影響。相對地,(B) K-近鄰算法與 (C) K-均值聚類算法都高度依賴距離公式(如歐幾里得距離),若資料未經標準化,數值範圍大的變數將會主導整體的運算結果。
▼ 還有更多解析內容