🇨🇳最新收集於 4m

WeLM 揭示 6170 億參數擴展策略

WeLM 揭示 6170 億參數擴展策略
PostLinkedIn
🇨🇳閱讀原文: TechNode

💡WeLM 的 Hidden Decoding 提供不擴大主要 Transformer 骨幹、提升 LLM 容量的新方法。

⚡ 30-Second TL;DR

有什麼變化

Hidden Decoding 將每個 token 擴展為多個內部計算串流。

為什麼重要

如果此方法能可靠擴展,可能為提升 LLM 容量提供一條不同於單純擴大稠密 Transformer 骨幹的路徑。AI 實務者應關注其推理成本、延遲、訓練穩定性與品質提升證據。

下一步行動

追蹤 WeLM-HD4 的技術發布,並將可用模型檢查點與稠密基線比較品質、延遲及啟用參數成本。

誰應關注:Researchers & Academics

關鍵要點

  • Hidden Decoding 將每個 token 擴展為多個內部計算串流。
  • WeLM-HD4-80B 在推理或計算期間啟用 30 億個參數。
  • WeLM 系列現已包含 6170 億參數模型,且未擴大主要 Transformer 骨幹。
  • 此方法旨在控制骨幹增長的同時,提升計算量與模型容量。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • WeLM-HD 系列採用了稀疏激活(Sparse Activation)架構,透過動態路由機制將輸入分配至特定的隱藏解碼器分支,從而實現參數量的擴展。
  • 該技術的核心優勢在於顯著降低了推理時的記憶體頻寬需求,因為只有部分參數在單次前向傳播中被激活。
  • WeChat AI 團隊在訓練過程中引入了專門的負載平衡損失函數(Load Balancing Loss),以防止模型出現「贏家通吃」導致部分參數過度訓練的問題。
  • WeLM-HD 架構支援異構計算環境,允許在不同 GPU 叢集間靈活部署,這對於騰訊龐大的分佈式基礎設施至關重要。
  • 根據初步評測,WeLM-HD4-617B 在長文本理解與複雜邏輯推理任務上,表現優於同等計算成本的稠密模型(Dense Models)。
📊 競品分析▸ Show
特性WeLM-HD (Tencent)Mixtral 8x22B (Mistral)GPT-4o (OpenAI)
架構類型Hidden Decoding (稀疏)MoE (混合專家)稠密/混合架構
總參數量6170 億1410 億未公開 (估計 1.8T+)
推理激活參數30 億 (HD4-80B)約 390 億未公開
核心優勢骨幹輕量化、推理效率訓練與推理平衡綜合能力與生態
定價模式內部/企業 APIAPI 按 Token 計費API 按 Token 計費

🛠️ 技術深入

  • 隱藏解碼器(Hidden Decoding)機制:在 Transformer 的每一層或特定層後插入額外的解碼分支,這些分支共享底層特徵表示,但擁有獨立的權重矩陣。
  • 參數擴展策略:透過增加解碼器分支的數量而非增加 Transformer 深度或寬度,實現總參數量的線性增長,同時保持骨幹網絡的計算複雜度不變。
  • 稀疏性控制:採用 Top-k 路由算法,確保每個 Token 僅激活預設數量的參數路徑,有效控制推理延遲。
  • 訓練優化:結合了知識蒸餾技術,將大型稠密模型的知識遷移至稀疏化的 HD 架構中,加速收斂並提升性能。

🔮 前景展望AI analysis grounded in cited sources

稀疏化架構將成為大型語言模型擴展的主流方向。
隨著模型參數邁向兆級,傳統稠密模型的推理成本已無法滿足大規模商業應用的需求。
騰訊將在未來 12 個月內將 WeLM-HD 技術整合至微信生態系統。
騰訊需要透過更高效的推理技術來降低微信內置 AI 助手在數億用戶端的運營成本。

時間線

2022-05
騰訊發布 WeLM 模型,標誌著其在大型語言模型領域的初步探索。
2024-11
WeChat AI 團隊開始研發基於 Hidden Decoding 的稀疏擴展架構。
2026-06
WeLM-HD4-80B 與 WeLM-HD4-617B 完成內部測試與基準評測。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechNode