
為何單純的 SFT 數據過濾無法有效提升安全性?
Google DeepMind 研究人員分析了為何過濾 SFT 輸出往往無法有效移除模型的不良行為。研究指出,「幽靈般」的泛化現象以及教師模型的影響,導致即使經過數據清理,與安全相關的特性仍會持續存在。
Tag: #sft5 results

Google DeepMind 研究人員分析了為何過濾 SFT 輸出往往無法有效移除模型的不良行為。研究指出,「幽靈般」的泛化現象以及教師模型的影響,導致即使經過數據清理,與安全相關的特性仍會持續存在。

AWS 引入了 Self-Distilled Reasoning (SDR),旨在為監督式微調 (SFT) 中缺乏明確推理軌跡的數據集注入推理能力。此方法解決了推理抑制問題,並為提升 Amazon Nova 的模型性能提供了框架。
一位實驗者提出使用對比式目標 SFT 作為機械可解釋性方法,以映射 31B 模型內的因果依賴圖。透過消融特定的能力電路,研究者旨在識別模型內不同維度如何相互作用與影響。

GSI Agent 是一個框架,利用監督微調、來自市政文件的檢索增強生成,以及基於代理的推理管道,提升大型語言模型在綠色雨水基礎設施任務的表現。它引入了適用於真實檢查情境的新 GSI 資料集。實驗顯示,在 GSI 任務上 BLEU-4 分數從 0.090 提升至 0.307,同時一般知識表現保持穩定。
一個涵蓋 8 種語言的 125k 程式碼資料集已在 Hugging Face 上發布,用於訓練和升級程式碼模型。使用隱藏的 Hunter Alpha 模型免費生成。完整 450k 版本即將推出,並開放合作。