📄ArXiv AI•最新收集於 21h
為何 4 位元記憶體會破壞循環模型

#quantization#recurrent-inference#low-precision#state-memoryrecurrent-state-write-backgrulstm
💡4 位元狀態可能凍結循環記憶;了解如何在不重新訓練下恢復準確度。
⚡ 30-Second TL;DR
有什麼變化
確定性的 4 位元循環狀態回寫,使 τ1 的估計誤差增加約 70 倍,τ2 的估計誤差增加約 300 倍。
為什麼重要
研究結果提醒人們,量化循環啟動值不只是數值壓縮問題:狀態回寫規則會改變模型的時間動態。將 GRU 或 LSTM 部署到受限硬體時,實務人員應將狀態更新行為與權重、啟動值精度分開評估。
下一步行動
使用量化循環狀態回寫對你的 GRU 或 LSTM 進行基準測試,然後在進一步降低狀態精度前先測試誤差回饋。
誰應關注:Researchers & Academics
關鍵要點
- •確定性的 4 位元循環狀態回寫,使 τ1 的估計誤差增加約 70 倍,τ2 的估計誤差增加約 300 倍。
- •低於寫入閾值的連續微小更新會被抑制,導致儲存狀態幾乎不變,即使模型仍持續提出更新。
- •誤差回饋、殘差記憶與方向記憶可在無需重新訓練 GRU 的情況下恢復準確度。
- •獨立訓練的 LSTM 也出現類似的粗粒度回寫失效,其中細胞狀態比隱藏狀態更敏感。
- •精度掃描顯示,即使提高狀態精度,也可能傷害固定的循環模型,除非訓練過程與狀態介面相匹配。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: ArXiv AI ↗
每週 AI 簡報
每週一封,可隨時退訂。
