🏠較早收集於 2m

騰訊混元發布 Stem 稀疏注意力算法

騰訊混元發布 Stem 稀疏注意力算法
PostLinkedIn
🏠閱讀原文: IT之家

💡使用騰訊開源的 Stem 稀疏注意力算法,將 LLM 推理成本與延遲降低 3.6 倍。

⚡ 30-Second TL;DR

有什麼變化

在 128K 上下文場景下,首字延遲降低了 3.6 倍。

為什麼重要

這項研究為開發者提供了一條切實可行的路徑,能在不顯著降低模型品質的前提下,優化長上下文 LLM 的推理效率。

下一步行動

請前往 GitHub 克隆 AngelSlimHPC 儲存庫,並在您的長上下文推理任務中測試 Stem+BSA 算子,以評估延遲改善效果。

誰應關注:Researchers & Academics

關鍵要點

  • 在 128K 上下文場景下,首字延遲降低了 3.6 倍。
  • 僅需 25% 的算力預算即可實現接近稠密注意力的精度。
  • 核心創新包括 Token 位置衰減 (TPD) 和輸出感知度量 (OAM)。
  • 配套的 HPC 算子庫已開源,支援真實環境落地。

🧠 深度解析

Web-grounded analysis with 19 cited sources.

🔑 增強重點摘要

  • 騰訊混元Stem稀疏注意力算法已被機器學習頂會ICML-26收錄,這表明其在學術界獲得了高度認可。
  • Stem算法從「因果信息流」的角度重新審視塊級稀疏,將初始token視為信息流的「樹幹」,支撐所有後續信息的傳遞,這是一個獨特的視角。
  • 配套的HPC算子庫HPC-Ops是生產級別的,專為大型語言模型(LLM)推理優化,並支援NVIDIA SM90架構GPU及多種量化策略,包括4bit/8bit混合精度。
  • HPC-Ops不僅提升了騰訊混元模型的性能,在真實場景下也使DeepSeek模型的QPM(每分鐘查詢量)提升了17%,顯示其優化具有普適性。

🛠️ 技術深入

  • Stem算法的核心創新包括Token位置衰減(TPD)和輸出感知度量(OAM)。
  • TPD策略在每一層內應用位置相關的top-k選擇,以保留初始token用於遞歸依賴。
  • OAM則根據近似輸出幅度優先選擇高影響力的token,以保留信息豐富的token。
  • Stem算法重新思考了因果注意力機制中的信息流,將初始token比喻為支撐後續信息傳遞的「樹幹」。
  • 配套的HPC算子庫(HPC-Ops)是騰訊混元AI Infra團隊從零開始,使用CUDA和CuTe構建的。
  • HPC-Ops針對記憶體密集型工作負載進行了優化,並支援擴展的量化策略,如4bit/8bit混合精度。
  • 該算子庫透過將稀疏性判斷和過濾完全前置到循環之外,實現了近乎零開銷的塊級跳過,使得內部計算路徑與稠密注意力幾乎一致。
  • HPC-Ops模組包括融合混合專家系統(FusedMoE)、注意力計算(Attention)、機內/機間通信、歸一化(Norm)、採樣器(Sampler)以及各類小型算子融合。
  • 該庫將任務劃分邏輯與硬體指令進行了深度對齊,以在國內主流推理卡(如H20)上實現更好的性能。
  • Stem算法的論文標題為「Stem: Rethinking Causal Information Flow in Sparse Attention」,已在arXiv上發布。
  • Stem算法的開源地址為https://github.com/Tencent/AngelSlim,HPC算子庫的開源地址為https://github.com/Tencent/hpc-ops

🔮 前景展望AI analysis grounded in cited sources

騰訊混元將在大模型長上下文推理領域取得顯著競爭優勢。
Stem算法結合HPC算子庫,在降低延遲和算力消耗的同時保持高精度,直接解決了長上下文處理的關鍵瓶頸。
稀疏注意力算法的普及將加速AI應用在處理超長文本場景的落地。
Stem等高效稀疏注意力技術降低了長序列處理的計算成本和記憶體需求,使得法律合同分析、基因序列比對等應用更加可行。
騰訊混元將進一步鞏固其在AI基礎設施和開源生態方面的領導地位。
Stem算法被頂會收錄並開源HPC算子庫,不僅展示了其技術實力,也為廣大開發者提供了實用的工具,有助於吸引更多社區貢獻。

時間線

2023-09
騰訊自研混元大模型正式亮相,參數規模超千億,預訓練語料超2萬億tokens,並向國內企業開放API。
2024-11
騰訊混元發布業界最大參數規模的MoE開源模型Hunyuan-Large (Hunyuan-MoE-A52B),總參數3890億,激活參數520億。
2025-04
騰訊宣布對其混元大模型研發體系進行全面重構,成立「大語言模型部」和「多模態模型部」。
2025-09
騰訊混元大模型在過去一年發布了30多個新模型,並全面擁抱開源,包括Hunyuan-A13B推理模型。
2026-01
騰訊混元AI Infra團隊正式開源生產級高性能LLM推理核心算子庫HPC-Ops。
2026-06
騰訊混元發布Stem稀疏注意力算法,已被機器學習頂會ICML-26收錄。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家