🦙Reddit r/LocalLLaMA•較早收集於 2h
SFM 在長序列超越 Transformer
#non-transformer#long-sequence#state-slots#benchmarkstate-flow-machinestate-flow-machinesfmascend-910huawei
💡非 Transformer 在長序列維持 62% 準確率—新架構!(18字元)
⚡ 30-Second TL;DR
有什麼變化
4 倍長度(40 運算)準確率 62% vs Transformer 2-3%
為什麼重要
挑戰 Transformer 在長序列狀態任務的主宰,如流程模擬。可啟發超越注意力限制的效率本機架構。
下一步行動
於 Ascend NPU 重現 SFM 基準測試長序列泛化。
誰應關注:Researchers & Academics
關鍵要點
- •4 倍長度(40 運算)準確率 62% vs Transformer 2-3%
- •經學習閘控更新的明確可定址狀態槽
- •961K 參數;基準外推至 320 運算
- •受 DeltaNet、Mamba 啟發但更明確
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。