🔬
稀有類別是否應合併為「其他」類別?
Reddit 上的一場討論探討了在多類別分類中,將樣本不足的類別合併為統一「其他」類別所帶來的風險。討論質疑異質標籤是否會扭曲決策邊界,以及是否應改用分佈外偵測,或直接將稀有類別排除於訓練之外。
Tag: #class-imbalance5 results
Reddit 上的一場討論探討了在多類別分類中,將樣本不足的類別合併為統一「其他」類別所帶來的風險。討論質疑異質標籤是否會扭曲決策邊界,以及是否應改用分佈外偵測,或直接將稀有類別排除於訓練之外。

這篇ArXiv論文探討Transformer模型的資料增強策略,用以解決NGSS科學解釋AI評分中的類別不平衡問題。使用1,466個學生回應的資料集,涵蓋11個評分類別,SciBERT微調結合GPT-4合成資料、EASE及ALP,優於SMOTE過採樣。ALP等增強方法在嚴重不平衡類別達到完美精準率/召回率,並更貼近人類評分。
重構生產級 Python 應用程式,使用隨機森林偵測 PaySim 資料集信用卡欺詐,處理 0.17% 類別不平衡。具模組化設計、類別權重、完整 pytest 整合測試、審核記錄,並達 0.99 AUC。儲存庫作為專業 ML 專案範本。
一名 Reddit 使用者表示,使用 VinDr dataset 訓練的三個 BI-RADS 偵測模型都逐漸偏向預測 BI-RADS 1。這些模型採用交叉熵、center loss 與類別權重,因此引發對損失函數設計及嚴重類別不平衡是否為主因的討論。
一位從業人員使用 Transformer 模型預測未來 4 天可用性,但高峰日間負載期間總是預測「忙碌」。特徵包括日與時的 sin/cos 編碼加上訊號本身。類別權重調整未能解決不平衡問題。