🐼Pandaily•較早收集於 24m
Model Best 開源 BitCPM-CANN,實現 1.58-bit 模型訓練

💡透過這款全新的國產硬體 1.58-bit 開源訓練框架,將推理記憶體使用量降低 6 倍。
⚡ 30-Second TL;DR
有什麼變化
支援在國產 AI 加速器上進行 1.58-bit 模型訓練。
為什麼重要
此框架可大幅降低依賴國產硬體的團隊之基礎設施成本,並使在記憶體受限的裝置上部署大型模型成為可能。
下一步行動
下載 BitCPM-CANN 儲存庫,並將您目前模型的記憶體佔用量與 1.58-bit 量化版本進行基準測試。
誰應關注:Researchers & Academics
關鍵要點
- •支援在國產 AI 加速器上進行 1.58-bit 模型訓練。
- •相比全精度訓練,推理記憶體需求最高可降低 6 倍。
- •開源框架提供完整的低位元量化訓練流程。
🧠 深度解析
Web-grounded analysis with 14 cited sources.
🔑 增強重點摘要
- •BitCPM-CANN 是首個原生建構於華為昇騰(Huawei Ascend)NPU 硬體上的端到端 1.58 位元(三元)大型語言模型訓練系統,旨在解決在 CUDA 生態系統之外部署極低位元LLM的實際差距。
- •1.58 位元三元量化(ternary quantization)將模型權重壓縮為 {-1, 0, +1} 三種狀態,相較於 BF16 格式,可實現約 90% 的位元寬度縮減。
- •BitCPM-CANN 模型(1B、3B、8B)在 11 項基準測試中,能保持 95.7% 至 97.2% 的全精度性能,且在昇騰 910B NPU 上的訓練吞吐量開銷僅為 4.5%。
- •此框架對於中國 AI 生態系統至關重要,因其為國內 AI 加速器提供了低位元訓練基礎設施,以應對高端 NVIDIA 晶片的出口管制限制。
- •該技術發布的時機具有重要意義,因為 2026 年高頻寬記憶體(HBM)價格飆升超過 165%,使得記憶體頻寬成為大規模模型訓練中最昂貴且稀缺的資源。
🛠️ 技術深入
- 量化方法:採用 1.58 位元三元量化,將每個參數權重壓縮為 {-1, 0, +1} 三種狀態。從資訊理論角度來看,表示三種狀態所需的最小位元數約為 log₂(3) ≈ 1.58 位元。
- 訓練方法:採用量化感知訓練(Quantization-Aware Training, QAT),而非訓練後量化(Post-Training Quantization, PTQ)。QAT 從訓練過程一開始就引入量化約束,使模型能夠在三元約束下自我優化以保持性能。
- 訓練流程:遵循兩階段策略:首先進行完整的 QAT 直至收斂,然後進行訓練後蒸餾,以避免在早期訓練中放大訓練不穩定性。
- 整合與架構:原生建構於華為昇騰 NPU 硬體及其 CANN(Compute Architecture for Neural Networks)軟體堆疊之上。它將 QAT 整合到 Megatron-LM 框架中,並透過 MindSpeed 進行加速。
- 軟硬體堆疊:在昇騰 NPU 上建立的四層垂直堆疊包括:
- QAT 訓練邏輯:帶有 Straight-Through Estimator (STE) 的三元量化器,以及 Megatron-LM 中可插拔的量化層。
- Megatron-LM 量化模型層:整合了權重/激活量化器的張量並行線性層。
- 框架入口層:用於 NPU 執行的
torch_npu和mindspeed.megatron_adaptor注入。 - 昇騰軟硬體堆疊:MindSpeed、CANN、HCCL 通訊、昇騰 910B NPU 硬體。
- 性能指標:
- 相較於 BF16,位元寬度減少約 90%。
- 在昇騰 910B 上,訓練吞吐量相較於全精度訓練僅下降 5%。
- 推理記憶體需求最高可降低 6 倍(權重記憶體約降低 8 倍)。
- 1B、3B 和 8B 模型在 11 項基準測試中保持 95.7% 至 97.2% 的全精度性能。
- 0.5B 模型保持 90.1% 的性能,其性能差距主要集中在數學任務上,表明在十億參數以下規模時,模型容量而非量化器是瓶頸。
🔮 前景展望AI analysis grounded in cited sources
加速中國AI生態系統的自主發展
由於出口管制限制了中國公司獲取高端NVIDIA晶片,BitCPM-CANN在國產AI加速器上的原生支援為國內AI發展提供了關鍵的低位元訓練基礎設施。
推動邊緣AI設備上的大型模型部署
1.58位元量化顯著降低了模型記憶體需求和計算成本,使得大型語言模型能夠在智慧手機、穿戴設備和物聯網終端等資源受限的邊緣設備上運行。
改變AI模型訓練和推理的經濟效益
在HBM記憶體價格飆升的背景下,BitCPM-CANN實現的記憶體和計算效率提升,將大幅降低大型模型訓練和部署的硬體成本和能耗。
⏳ 時間線
2026-05
Model Best 開源 BitCPM-CANN 框架,實現 1.58 位元模型訓練
📎 來源 (14)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily ↗