🦙較早收集於 2h

SFM 在長序列超越 Transformer

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#non-transformer#long-sequence#state-slots#benchmarkstate-flow-machinestate-flow-machinesfmascend-910huawei

💡非 Transformer 在長序列維持 62% 準確率—新架構!(18字元)

⚡ 30-Second TL;DR

有什麼變化

4 倍長度(40 運算)準確率 62% vs Transformer 2-3%

為什麼重要

挑戰 Transformer 在長序列狀態任務的主宰,如流程模擬。可啟發超越注意力限制的效率本機架構。

下一步行動

於 Ascend NPU 重現 SFM 基準測試長序列泛化。

誰應關注:Researchers & Academics

關鍵要點

  • 4 倍長度(40 運算)準確率 62% vs Transformer 2-3%
  • 經學習閘控更新的明確可定址狀態槽
  • 961K 參數;基準外推至 320 運算
  • 受 DeltaNet、Mamba 啟發但更明確
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。