VeRA:大規模驗證推理資料增強
VeRA 將基準問題轉換為可執行規格,包括模板、產生器和驗證器,以近零成本生成無限驗證變體。VeRA-E 產生等價問題以偵測記憶化,VeRA-H 則強化任務創造新挑戰。在 16 個前沿模型上評估,並完全開源。
Tag: #data-augmentation10 results
VeRA 將基準問題轉換為可執行規格,包括模板、產生器和驗證器,以近零成本生成無限驗證變體。VeRA-E 產生等價問題以偵測記憶化,VeRA-H 則強化任務創造新挑戰。在 16 個前沿模型上評估,並完全開源。

本研究提出了一種利用基於 George Polya 問題解決策略的多元自生成數據,以提升大型語言模型(LLM)在訓練中期階段效能的方法。研究顯示,透過這些多樣化推理路徑訓練的模型,在後續的強化學習(RL)階段,於數學、程式碼及敘事推理任務中均表現更佳。
開發者針對訓練 3,000 張藝術品影像的單類別分割模型,尋求最佳即時數據增強策略。目標是模擬真實的人手操作變異,以提升邊界分割準確度,同時不犧牲模型效能。

NVIDIA NeMo 透過合成數據生成技術,解決了金融數據集不平衡的問題。此方法協助研究人員捕捉在現實新聞中較為罕見的金融事件。

這篇ArXiv論文探討Transformer模型的資料增強策略,用以解決NGSS科學解釋AI評分中的類別不平衡問題。使用1,466個學生回應的資料集,涵蓋11個評分類別,SciBERT微調結合GPT-4合成資料、EASE及ALP,優於SMOTE過採樣。ALP等增強方法在嚴重不平衡類別達到完美精準率/召回率,並更貼近人類評分。

LGESynthNet 是一種潛在擴散框架,用於 LGE 心臟 MRI 的可控疤痕合成,解決數據稀缺問題,並精確控制大小、位置和跨壁程度。只用 429 張圖像(79 名患者)訓練,透過 ControlNet 修補生成逼真且解剖學一致的樣本。使用其過濾輸出增強分割模型,可將分割性能提升最多 6 點,檢測提升 20 點。
這篇 Reddit 貼文主張機器學習中的資料增強常被啟發式使用,建議將每個轉換視為不變性假設。它討論任務特定有效性、最佳強度及腐蝕訓練訊號風險等挑戰,以電腦視覺為例。作者邀請社群分享驗證與最佳實務經驗。
在高解析影像上使用極端像素偏移抖動,產生多個 stride-1 裁剪用於 VAE 訓練。比 LPIPS 或 GAN 提供更好重建保真度,無平滑或幻覺問題。尋求此增強技術的先驗研究。
學生透過新增雜訊重新訓練 GitHub 醫療 IoT 威脅偵測 CNN,僅見輕微改善。質疑是否值得,與手動擴充資料相比。參考特定醫療安全儲存庫。