
Kimi 以注意力取代殘差連接提升效率
Attention Residuals 使用 softmax 注意力取代等權重殘差,實現選擇性擷取。在 48B Kimi Linear 模型中,提升 GPQA +7.5、Math +3.6、HumanEval +3.1,訓練成本 <4%、延遲 <2%。以 1.25 倍少計算匹配基準損失。
Tag: #attention-mechanism19 results

Attention Residuals 使用 softmax 注意力取代等權重殘差,實現選擇性擷取。在 48B Kimi Linear 模型中,提升 GPQA +7.5、Math +3.6、HumanEval +3.1,訓練成本 <4%、延遲 <2%。以 1.25 倍少計算匹配基準損失。

MiniMax 回顧在 MiniMax-Text-01 中放棄混合注意力,因為在大規模多跳推理任務中出現明顯缺陷,儘管基準測試表現良好。新開源模型如 DeepSeek V3.2 和 Qwen3.5-397B-A17B 展示了高效長上下文全注意力。基準測試是洩漏抽象,隱藏了真實成本。
使用者回報 Gemma 4 12B 這款整合音訊、視覺與文字的模型,在搭配長系統提示詞時難以處理音訊輸入。該模型似乎存在注意力飽和限制,導致其忽略音訊資料而優先處理密集的文字指令。

移除自注意力/交叉注意力的位置編碼後,注意力熱圖出現垂直熱線。無 PE 時查詢均勻關注相同鍵。正規化擴散注意力但保留垂直模式;尋求基於查詢的動態注意力方法。
研究人員為25.6M Rust程式碼模型開發混合注意力,在4060 Ti上將推論速度從5.6提升至286 token/秒,達50倍加速。資料集從31MB擴至173MB的收益大於架構變更。困惑度達2.15,驗證損失0.82。
研究人員將因果自注意力以概率方式解釋,將 token 嵌入視為潛在變量,注意力圖誘導變量變換項及退化邊界。這產生穩定邊際解釋、支持 token 及 MAP 式平滑 log-barrier 訓練懲罰。實證上,它提升對輸入擾動的魯棒性,並使學習幾何更集中邊際,乾淨準確率損失小。

文章探討各家新創企業如何追逐大型語言模型的下一個重大發展。文章從 Google 於 2017 年發表的〈Attention Is All You Need〉談起,該論文奠定了現代 Transformer 時代的重要研究基礎。

本文區分了 Transformer 的注意力機制與人的注意力:前者計算詞元之間的上下文相關性,後者則涉及價值、方向、承諾,以及被事物改變的能力。文章認為,平台透過互動系統將注意力商品化,而 AI 可能進一步加深人們對「處理資訊」與「真正體驗世界」之間差異的混淆。
Reddit討論如何將定理、引理及證明融入AI/ML論文,針對經驗背景者。聚焦將直覺想法如注意力不確定性轉為嚴謹依據。尋求實驗與理論橋接資源。