🇨🇳TechNode•最新收集於 4m
WeLM 揭示 6170 億參數擴展策略

💡WeLM 的 Hidden Decoding 提供不擴大主要 Transformer 骨幹、提升 LLM 容量的新方法。
⚡ 30-Second TL;DR
有什麼變化
Hidden Decoding 將每個 token 擴展為多個內部計算串流。
為什麼重要
如果此方法能可靠擴展,可能為提升 LLM 容量提供一條不同於單純擴大稠密 Transformer 骨幹的路徑。AI 實務者應關注其推理成本、延遲、訓練穩定性與品質提升證據。
下一步行動
追蹤 WeLM-HD4 的技術發布,並將可用模型檢查點與稠密基線比較品質、延遲及啟用參數成本。
誰應關注:Researchers & Academics
關鍵要點
- •Hidden Decoding 將每個 token 擴展為多個內部計算串流。
- •WeLM-HD4-80B 在推理或計算期間啟用 30 億個參數。
- •WeLM 系列現已包含 6170 億參數模型,且未擴大主要 Transformer 骨幹。
- •此方法旨在控制骨幹增長的同時,提升計算量與模型容量。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •WeLM-HD 系列採用了稀疏激活(Sparse Activation)架構,透過動態路由機制將輸入分配至特定的隱藏解碼器分支,從而實現參數量的擴展。
- •該技術的核心優勢在於顯著降低了推理時的記憶體頻寬需求,因為只有部分參數在單次前向傳播中被激活。
- •WeChat AI 團隊在訓練過程中引入了專門的負載平衡損失函數(Load Balancing Loss),以防止模型出現「贏家通吃」導致部分參數過度訓練的問題。
- •WeLM-HD 架構支援異構計算環境,允許在不同 GPU 叢集間靈活部署,這對於騰訊龐大的分佈式基礎設施至關重要。
- •根據初步評測,WeLM-HD4-617B 在長文本理解與複雜邏輯推理任務上,表現優於同等計算成本的稠密模型(Dense Models)。
📊 競品分析▸ Show
| 特性 | WeLM-HD (Tencent) | Mixtral 8x22B (Mistral) | GPT-4o (OpenAI) |
|---|---|---|---|
| 架構類型 | Hidden Decoding (稀疏) | MoE (混合專家) | 稠密/混合架構 |
| 總參數量 | 6170 億 | 1410 億 | 未公開 (估計 1.8T+) |
| 推理激活參數 | 30 億 (HD4-80B) | 約 390 億 | 未公開 |
| 核心優勢 | 骨幹輕量化、推理效率 | 訓練與推理平衡 | 綜合能力與生態 |
| 定價模式 | 內部/企業 API | API 按 Token 計費 | API 按 Token 計費 |
🛠️ 技術深入
- 隱藏解碼器(Hidden Decoding)機制:在 Transformer 的每一層或特定層後插入額外的解碼分支,這些分支共享底層特徵表示,但擁有獨立的權重矩陣。
- 參數擴展策略:透過增加解碼器分支的數量而非增加 Transformer 深度或寬度,實現總參數量的線性增長,同時保持骨幹網絡的計算複雜度不變。
- 稀疏性控制:採用 Top-k 路由算法,確保每個 Token 僅激活預設數量的參數路徑,有效控制推理延遲。
- 訓練優化:結合了知識蒸餾技術,將大型稠密模型的知識遷移至稀疏化的 HD 架構中,加速收斂並提升性能。
🔮 前景展望AI analysis grounded in cited sources
稀疏化架構將成為大型語言模型擴展的主流方向。
隨著模型參數邁向兆級,傳統稠密模型的推理成本已無法滿足大規模商業應用的需求。
騰訊將在未來 12 個月內將 WeLM-HD 技術整合至微信生態系統。
騰訊需要透過更高效的推理技術來降低微信內置 AI 助手在數億用戶端的運營成本。
⏳ 時間線
2022-05
騰訊發布 WeLM 模型,標誌著其在大型語言模型領域的初步探索。
2024-11
WeChat AI 團隊開始研發基於 Hidden Decoding 的稀疏擴展架構。
2026-06
WeLM-HD4-80B 與 WeLM-HD4-617B 完成內部測試與基準評測。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: TechNode ↗


