🤖
將 LLM 模型分解為圖資料庫
Larql 將靜態 LLM 模型分解為圖資料庫,讓各層進行 KNN 遍歷,等同於矩陣乘法。無需重新訓練即可透過插入資料庫更新模型內部事實知識。此工具使用更少記憶體,由 IBM CTO 開發。
Tag: #model-editing5 results
Larql 將靜態 LLM 模型分解為圖資料庫,讓各層進行 KNN 遍歷,等同於矩陣乘法。無需重新訓練即可透過插入資料庫更新模型內部事實知識。此工具使用更少記憶體,由 IBM CTO 開發。

開源 PickyTrain 工具允許無 GPU 或訓練直接外科式編輯 GGUF 模型個別權重。具語意辨識注意力頭等張量、影響警告、漂移護欄及完整回滾。Rust 核心配 Python 綁定支援常見量化;早期釋出尋求貢獻者。
跨 6 種架構複製 Transformer 層實驗,發現 50-56% 深度通用「危險區」,複製即毀能力。最佳複製提升 Hybrid 9B 等弱模型編碼任務 75%。跨模型移植失敗;模型需精確一個危險區層。

SoLA 提出基於語義路由的 LoRA 框架,用於大型語言模型的終身模型編輯,將每個編輯封裝為獨立的凍結 LoRA 模組,透過語義匹配動態啟動。它防止語義漂移和災難性遺忘,並透過移除路由金鑰實現特定編輯的精確撤銷。這是首個實現可逆回滾的方法,並將端到端決策整合至編輯層。
一則 Reddit 討論詢問,現有研究是否曾在神經系統中共同評估持續性的認知暫緩、來源保存、證據觸發的信念修正,以及受控的非相關變更。發文者希望找出選擇性預測、不確定性估計、信念修正、持續學習與模型編輯等領域中的相關術語、部分先例與反例。