用於 LLM 持續適應的 Fast-Slow Training 框架
Fast-Slow Training (FST) 框架透過將模型參數作為「慢」權重、優化後的上下文作為「快」權重來優化 LLM。此方法提高了樣本效率,減少了災難性遺忘,並在持續學習過程中保持了模型的塑性。
Tag: #continual-learning27 results
Fast-Slow Training (FST) 框架透過將模型參數作為「慢」權重、優化後的上下文作為「快」權重來優化 LLM。此方法提高了樣本效率,減少了災難性遺忘,並在持續學習過程中保持了模型的塑性。
DeepMind執行長Demis Hassabis預測AGI約2030年實現,指出預訓練與RLHF等現有範式為基礎,但欠缺持續學習、長程推理及穩健記憶。他批評百萬token上下文僅為「貼膠帶」權宜之計,強調代理人演進先靠人類增強,並點出蒸餾用於邊緣AI及AI在AlphaFold等科學突破的角色。

MindMemOS 是一個可攜式記憶作業層,讓 AI 代理能隨時間調整記憶結構、發掘高階模式、修正儲存資訊,並演化出可重複使用的技能。其在 LOCOMO 上達到 94.03% 準確率、在 PersonaMem 上達到 70.63%,而 MindSkillEvolve 讓 SpreadsheetBench 成功率較初始技能基準提升 9.2 個百分點。

CASCADE 引入部署時學習,利用基於案例的 episodic memory 讓大型語言模型(LLMs)在不改變模型參數下持續改進。它將經驗重用框架為 contextual bandit 問題,實現最佳探索-利用權衡。在 16 項多樣任務中,成功率比 zero-shot prompting 高出 20.9%。

DeepMind 執行長 Demis Hassabis 強調 AGI 需超越上下文視窗擴容,轉向持續學習與記憶機制。他推廣強化學習提升推理、小型端側模型,以及 AI 驅動科學突破。分享 AGI 時程下的創業策略。

AI 研究實驗室 NeoCognition 獲得 4000 萬美元種子輪融資。由 OSU 研究員創立,公司正開發如人類般學習並能在任何領域成為專家的 AI 代理。

Memento-Skills 是一款新框架,讓 AI 代理透過不斷演進的外部記憶體自主開發與更新技能,而無需重新訓練底層 LLM。它克服了固定模型與 RAG 系統中相似度檢索的限制。此舉可大幅降低企業部署代理的運營負擔。

SoLA 提出基於語義路由的 LoRA 框架,用於大型語言模型的終身模型編輯,將每個編輯封裝為獨立的凍結 LoRA 模組,透過語義匹配動態啟動。它防止語義漂移和災難性遺忘,並透過移除路由金鑰實現特定編輯的精確撤銷。這是首個實現可逆回滾的方法,並將端到端決策整合至編輯層。
在有害資料集上進行狹窄微調會侵蝕視覺語言模型的安全對齊,導致在無關任務和模態中廣泛泛化的錯位。Gemma3-4B實驗顯示錯位隨LoRA rank單調增加,多模態評估(70.71%)比純文字評估(41.19%)更嚴重。即使10%有害資料也會引發重大對齊退化。
Panini 提出一種非參數持續學習框架,用於 LLM,透過生成式語義工作空間 (GSW)——一種實體與事件感知的問答網路,持續累積並整合經驗,而不需更新基礎模型。它在六個 QA 基準測試中超越 RAG 基線 5-7%,同時使用 2-30 倍更少的 token,並減少無支持答案。開源程式碼已在 GitHub 上提供。