🦙較早收集於 21m

Kimi 以注意力取代殘差連接提升效率

Kimi 以注意力取代殘差連接提升效率
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#residual-connections#attention-mechanism#model-efficiencykimi-linearkimi-linearkarpathy

💡新注意力殘差以 20% 少計算勝基準—效率突破(18字)

⚡ 30-Second TL;DR

有什麼變化

以基於查詢的注意力取代標準殘差連接

為什麼重要

此架構可降低大型模型訓練成本,使高效 LLM 更易取得。Karpathy 參與顯示潛在產業採用。

下一步行動

在變壓器實驗中實作所述 softmax 機制的 Attention Residuals。

誰應關注:Researchers & Academics

關鍵要點

  • 以基於查詢的注意力取代標準殘差連接
  • 48B Kimi 模型:GPQA-Diamond +7.5、Math +3.6、HumanEval +3.1
  • 額外訓練成本 <4%、推論延遲 <2%
  • 擴展法則下以 1.25 倍少計算達基準損失

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Kimi Linear 採用混合線性注意力架構,將 KDA(Kimi Delta Attention)層與全注意力層以 3:1 比例交錯排列,在長上下文處理中將 KV 快取使用量減少高達 75%[2]
  • Kimi Delta Attention 機制通過引入細粒度通道級遺忘門(相對於 Gated DeltaNet 的粗粒度頭級設計)改進有限狀態 RNN 記憶體管理,在長上下文記憶任務中的準確度遠超先前模型[1][2]
  • 在 1M 上下文長度下,Kimi Linear 實現高達 6 倍的解碼吞吐量提升,同時在短上下文、長上下文和強化學習縮放場景中與全注意力基準模型相匹配或超越[2]

🛠️ 技術深入

Kimi Linear 架構設計

  • 混合注意力結構:KDA 層與多頭潛在注意力(MLA)層以 3:1 比例交錯,KDA 層負責高效序列處理,MLA 層作為全局資訊整合器捕捉長距離依賴[2][3]

  • Kimi Delta Attention 機制:基於 Gated DeltaNet 擴展,引入細粒度通道級遺忘門而非頭級遺忘門,實現更精細的記憶狀態動態調整[1][2]

  • 硬體效率優化:採用專用對角加低秩(DPLR)轉移矩陣,支持分塊並行演算法,相對通用 DPLR 公式大幅降低計算量[2]

  • 記憶體優化:長序列生成期間 KV 快取使用量減少高達 75%,同時通過 MLA 層保留全局資訊流[2]

  • 性能指標:長上下文處理速度提升 2.9 倍,解碼速度提升 6 倍;在迴文和多查詢相關性召回等長上下文記憶任務中表現優異[1]

🔮 前景展望AI analysis grounded in cited sources

線性注意力架構將成為長上下文 LLM 的主流設計範式
Kimi Linear 在保持或超越全注意力性能的同時實現 6 倍解碼吞吐量和 75% 記憶體節省,為百萬級上下文應用提供可行路徑。
混合注意力機制(線性+全注意力)將取代純全注意力架構
3:1 KDA-MLA 混合設計在效率與能力間達到平衡,MLA 層作為全局資訊整合器的角色表明未來模型需要異構注意力層組合。

時間線

2025-10
Moonshot 發佈 Kimi Linear 論文,提出 Kimi Delta Attention 機制和混合線性注意力架構
2025-11
Kimi Linear 模型正式發佈,展示長上下文處理速度提升 2.9 倍、解碼速度提升 6 倍的性能
2026-01
Moonshot 發佈 Kimi K2.5,採用 MLA 注意力機制、1 兆參數 MoE 架構、256K 上下文窗口和原生多模態能力
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。