🤖Reddit r/MachineLearning•近期收集於 27h
ParaRNN 平行化非線性 RNN 訓練
#recurrent-networks#parallel-training#newton-scans#long-contextpararnnpararnntritonpytorchrwkv-7vllm
💡Triton 函式庫宣稱非線性 RNN 訓練加速 200 倍,同時保留 O(1) 循環推論。
⚡ 30-Second TL;DR
有什麼變化
使用 Newton-Raphson 求解器與關聯式前綴掃描,平行化跨時間步的循環運算。
為什麼重要
ParaRNN 可能透過降低傳統上使 Transformer 更具優勢的訓練成本,讓非線性 RNN 實驗更實用。若其基準結果能在不同硬體、序列長度與工作負載上重現,可能改善保有 O(1) 循環推論狀態模型的成本效益。
下一步行動
先安裝 pararnn-torch,並在你的 GPU 上重現 CfC、T=2048 的基準,再評估它在實際循環模型工作負載中的準確率與記憶體取捨。
誰應關注:Developers & AI Engineers
關鍵要點
- •使用 Newton-Raphson 求解器與關聯式前綴掃描,平行化跨時間步的循環運算。
- •在 RTX 3060、序列長度 2,048 的 CfC 測試中,報告 2.79 毫秒對比 643 毫秒的結果。
- •支援 sLSTM、RWKV-7、CfC、Titans、Modern Hopfield 與 M²RNN 單元。
- •宣稱直到 131,072 個 token 仍可將 Newton 迭代預算維持在 K ≤ 3,並匹配循序展開的準確度。
- •提供融合式 Triton 核心、torch.compile 全圖支援、確定性的封閉形式 VJP,以及 vLLM 外掛程式。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning ↗
每週 AI 簡報
每週一封,可隨時退訂。