🤖近期收集於 27h

ParaRNN 平行化非線性 RNN 訓練

PostLinkedIn
🤖閱讀原文: Reddit r/MachineLearning
#recurrent-networks#parallel-training#newton-scans#long-contextpararnnpararnntritonpytorchrwkv-7vllm

💡Triton 函式庫宣稱非線性 RNN 訓練加速 200 倍,同時保留 O(1) 循環推論。

⚡ 30-Second TL;DR

有什麼變化

使用 Newton-Raphson 求解器與關聯式前綴掃描,平行化跨時間步的循環運算。

為什麼重要

ParaRNN 可能透過降低傳統上使 Transformer 更具優勢的訓練成本,讓非線性 RNN 實驗更實用。若其基準結果能在不同硬體、序列長度與工作負載上重現,可能改善保有 O(1) 循環推論狀態模型的成本效益。

下一步行動

先安裝 pararnn-torch,並在你的 GPU 上重現 CfC、T=2048 的基準,再評估它在實際循環模型工作負載中的準確率與記憶體取捨。

誰應關注:Developers & AI Engineers

關鍵要點

  • 使用 Newton-Raphson 求解器與關聯式前綴掃描,平行化跨時間步的循環運算。
  • 在 RTX 3060、序列長度 2,048 的 CfC 測試中,報告 2.79 毫秒對比 643 毫秒的結果。
  • 支援 sLSTM、RWKV-7、CfC、Titans、Modern Hopfield 與 M²RNN 單元。
  • 宣稱直到 131,072 個 token 仍可將 Newton 迭代預算維持在 K ≤ 3,並匹配循序展開的準確度。
  • 提供融合式 Triton 核心、torch.compile 全圖支援、確定性的封閉形式 VJP,以及 vLLM 外掛程式。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/MachineLearning

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。