Linear Attention 的長距離回憶問題
一項 DNA 序列建模實驗指出,Linear Attention 在百萬 token 上下文的 Needle-in-a-Haystack 檢索任務中表現不佳,經常接近 25% 的隨機基線。HyenaDNA 的測試也出現類似結果,凸顯壓縮狀態表示是否從根本上限制可靠長距離回憶的問題。
Tag: #sequence-modeling9 results
一項 DNA 序列建模實驗指出,Linear Attention 在百萬 token 上下文的 Needle-in-a-Haystack 檢索任務中表現不佳,經常接近 25% 的隨機基線。HyenaDNA 的測試也出現類似結果,凸顯壓縮狀態表示是否從根本上限制可靠長距離回憶的問題。

本研究提出了「能力收斂假說」(CCH),主張模型能力取決於特定的架構存取結構,而非僅僅是規模擴展。研究指出三種限制效能的「資源牆」,並證明結合壓縮狀態與逐字索引通道的混合架構能有效突破這些限制。

狀態空間模型 (SSMs) 在長上下文建模上高效,但理論上無法解決真正長形式生成問題,因記憶體固定大小。Apple 研究人員正式證明此限制,並顯示透過授予 SSMs 互動外部工具存取即可克服。此方法實現長度泛化,恢復 SSMs 相對於 Transformers 的競爭優勢。

蘋果推出獨佔自注意力 (XSA),這是自注意力的簡單修改,排除 token 自身價值向量以改善上下文建模。XSA 在語言建模任務中超越標準自注意力,涵蓋至 2.7B 參數模型。隨著序列長度增加,效能提升更顯著。
Hugging Face 推出 Ulysses 序列並行技術,用於百萬 Token 上下文的模型訓練。它克服長序列訓練的記憶體瓶頸。對推進大型上下文 LLM 至關重要。
這篇 Reddit 討論探討了將 Fast Byte Latent Transformers 中的 Transformer 架構替換為 Mamba 狀態空間模型的可行性。發文者尋求關於這種混合架構在效能提升與架構調整方面的專業見解。

作者介紹了矩陣循環單元 (MRU) 架構的更新,這是一種旨在取代 Attention 機制的線性時間序列模型。透過實作新的矩陣狀態邊界方法,該模型在序列任務上實現了更好的穩定性與效能。

本研究利用 NOAA National Water Model 的數據,比較了編碼器架構的 Transformer 與 LSTM 在無觀測流域流量推論中的表現。結果顯示,對於上游序列重建任務,循環記憶架構仍優於 Transformer。
提議將線上論述升級框架為狀態機,從中性到威脅。特徵包含語言轉變、結構訊號如回覆爆發,以及身份激活。計劃 Reddit 資料集標註用於序列建模分類器。