🤖較早收集於 9h

用於 LLM 持續適應的 Fast-Slow Training 框架

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning

💡新框架實現了 3 倍的樣本效率提升,並能有效防止 LLM 的災難性遺忘。

⚡ 30-Second TL;DR

有什麼變化

FST 的樣本效率比標準 RL 訓練高出 3 倍。

為什麼重要

此框架為部署能從回饋中學習且無需全參數微調的 LLM 提供了可行路徑,緩解了性能與遺忘之間的權衡。

下一步行動

實作 FST 框架以提升模型在持續學習任務上的表現,同時避免災難性遺忘。

誰應關注:Researchers & Academics

關鍵要點

  • FST 的樣本效率比標準 RL 訓練高出 3 倍。
  • 與基礎模型相比,KL 散度降低了高達 70%。
  • 保留了模型塑性,能更有效地適應後續任務。

🧠 深度解析

Web-grounded analysis with 24 cited sources.

🔑 增強重點摘要

  • Fast-Slow Training (FST) 框架的設計靈感來自於人類認知中的「系統1」(快速、直覺)和「系統2」(慢速、深思熟慮)思維模式,旨在平衡效率與準確性。
  • FST 透過讓「快」權重(來自文本回饋的優化上下文)快速吸收任務特定資訊,同時讓「慢」權重(模型參數)保持接近基礎模型並維持通用推理行為,從而實現持續適應。
  • 相較於僅使用慢速學習(強化學習),FST 在多種推理任務中能持續達到更高的性能漸近線。
  • FST 在任務領域動態變化的持續學習情境中,能夠持續學習新任務,而僅依賴參數的強化學習則會停滯不前。
  • 此框架將性能提升分配給「快」和「慢」兩種元素,避免所有學習都被強制納入模型參數中,這是其減少災難性遺忘的關鍵機制。
📊 競品分析▸ Show
特徵/方法Fast-Slow Training (FST)LoRA (低秩適應)Replay Buffers (重播緩衝區)Elastic Weight Consolidation (EWC)In-Place Test-Time Training (In-Place TTT)
核心機制模型參數為「慢」權重,優化上下文為「快」權重,雙重時間尺度學習。凍結預訓練模型主幹,訓練低秩適配器。將舊數據與新訓練數據混合,以減少遺忘。估計舊任務重要參數,並在學習新任務時施加懲罰。將 MLP 塊的輸出投影指定為可訓練的「快」權重,在推斷時持續適應。
持續適應專為持續適應設計,有效應對動態任務變化。幫助效率,但實踐中未能真正解決災難性遺忘。減少遺忘,但在 LLM 領域因數據量大而昂貴且難以擴展。旨在保留舊知識,但可能引入偏差。在推斷時進行持續適應,無需修改架構或顯著增加計算開銷。
災難性遺忘顯著減少災難性遺忘,KL 散度降低高達 70%。預期可降低敏感性,但實驗顯示未能有效緩解。透過重訪舊數據來緩解遺忘。透過懲罰重要參數的改變來減輕遺忘。旨在克服靜態「訓練-部署」範式,實現上下文演進。
樣本效率比標準強化學習訓練高出 3 倍。透過減少訓練參數來提高效率。效率取決於緩衝區大小和數據混合策略。效率提升不明顯,主要關注知識保留。透過優化更新目標和塊級更新,保持吞吐量和記憶體效率。
模型塑性保持模型塑性,能更有效地適應後續任務。透過適配器實現一定程度的靈活性。透過平衡新舊知識來維持。透過限制重要參數的變化來維持穩定性。允許模型在推斷時動態演進其上下文理解。

🛠️ 技術深入

  • FST 框架將大型語言模型 (LLM) 的參數視為「慢」權重,這些權重透過傳統的梯度下降在大型數據集上緩慢更新,代表模型的長期記憶和通用推理能力。
  • 優化後的上下文被視為「快」權重,這些權重根據文本回饋和近期輸入動態調整,用於快速吸收任務特定資訊和短期記憶。
  • 該方法受到人類認知中「系統1」(快速、直覺)和「系統2」(慢速、深思熟慮)雙重思維過程的啟發,將學習過程分為不同的時間尺度。
  • FST 透過在「快」和「慢」兩種元素之間適當分配性能增益,避免了所有學習都被強制納入模型參數,從而減少了災難性遺忘並保持了基礎模型的通用性。
  • 評估 FST 的實驗在強化學習-價值學習 (RLVR) 設定中進行,涵蓋數學、程式碼和通用推理任務。

🔮 前景展望AI analysis grounded in cited sources

FST 將顯著加速持續適應型 LLM 在動態實際應用中的部署。
其改進的樣本效率和減少的災難性遺忘直接解決了在不斷演變的環境中保持 LLM 相關性的關鍵挑戰。
受人類認知啟發的「快慢」範式將成為未來 LLM 設計中更普遍的架構原則。
FST 在平衡快速適應與穩定性方面的成功,預示著一種生物學上合理且有效的方法,可實現更穩健的人工智慧。
FST 有望實現更個性化和安全的 LLM 代理,允許快速適應使用者偏好,同時不損害核心安全或通用能力。
透過讓「慢」權重保持接近基礎模型,FST 最大限度地減少了通用推理和安全行為的漂移,而「快」權重則處理個性化。

時間線

1981
Von der Malsburg 首次明確強調具有快速變化權重的神經網路的重要性。
1987
Hinton 和 Plaut 提出快權重可用於神經網路中的遞歸,並將權重表示為快慢權重之和。
1991
Schmidhuber 發表了第一個「快權重程式設計師」(Fast Weight Programmers, FWPs),其中一個慢速神經網路學習快速修改另一個神經網路的快權重。
2024-10
研究探討了「快思」與「慢思」如何影響 LLM 層的梯度模式。
2025-08
一篇綜述論文探討了 LLM 推理策略中的「快慢」邊界和工具增強思維。
2026-05
「用於 LLM 持續適應的 Fast-Slow Training (FST) 框架」被提出。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning