🐼較早收集於 24m

Model Best 開源 BitCPM-CANN,實現 1.58-bit 模型訓練

Model Best 開源 BitCPM-CANN,實現 1.58-bit 模型訓練
PostLinkedIn
🐼閱讀原文: Pandaily

💡透過這款全新的國產硬體 1.58-bit 開源訓練框架,將推理記憶體使用量降低 6 倍。

⚡ 30-Second TL;DR

有什麼變化

支援在國產 AI 加速器上進行 1.58-bit 模型訓練。

為什麼重要

此框架可大幅降低依賴國產硬體的團隊之基礎設施成本,並使在記憶體受限的裝置上部署大型模型成為可能。

下一步行動

下載 BitCPM-CANN 儲存庫,並將您目前模型的記憶體佔用量與 1.58-bit 量化版本進行基準測試。

誰應關注:Researchers & Academics

關鍵要點

  • 支援在國產 AI 加速器上進行 1.58-bit 模型訓練。
  • 相比全精度訓練,推理記憶體需求最高可降低 6 倍。
  • 開源框架提供完整的低位元量化訓練流程。

🧠 深度解析

Web-grounded analysis with 14 cited sources.

🔑 增強重點摘要

  • BitCPM-CANN 是首個原生建構於華為昇騰(Huawei Ascend)NPU 硬體上的端到端 1.58 位元(三元)大型語言模型訓練系統,旨在解決在 CUDA 生態系統之外部署極低位元LLM的實際差距。
  • 1.58 位元三元量化(ternary quantization)將模型權重壓縮為 {-1, 0, +1} 三種狀態,相較於 BF16 格式,可實現約 90% 的位元寬度縮減。
  • BitCPM-CANN 模型(1B、3B、8B)在 11 項基準測試中,能保持 95.7% 至 97.2% 的全精度性能,且在昇騰 910B NPU 上的訓練吞吐量開銷僅為 4.5%。
  • 此框架對於中國 AI 生態系統至關重要,因其為國內 AI 加速器提供了低位元訓練基礎設施,以應對高端 NVIDIA 晶片的出口管制限制。
  • 該技術發布的時機具有重要意義,因為 2026 年高頻寬記憶體(HBM)價格飆升超過 165%,使得記憶體頻寬成為大規模模型訓練中最昂貴且稀缺的資源。

🛠️ 技術深入

  • 量化方法:採用 1.58 位元三元量化,將每個參數權重壓縮為 {-1, 0, +1} 三種狀態。從資訊理論角度來看,表示三種狀態所需的最小位元數約為 log₂(3) ≈ 1.58 位元。
  • 訓練方法:採用量化感知訓練(Quantization-Aware Training, QAT),而非訓練後量化(Post-Training Quantization, PTQ)。QAT 從訓練過程一開始就引入量化約束,使模型能夠在三元約束下自我優化以保持性能。
  • 訓練流程:遵循兩階段策略:首先進行完整的 QAT 直至收斂,然後進行訓練後蒸餾,以避免在早期訓練中放大訓練不穩定性。
  • 整合與架構:原生建構於華為昇騰 NPU 硬體及其 CANN(Compute Architecture for Neural Networks)軟體堆疊之上。它將 QAT 整合到 Megatron-LM 框架中,並透過 MindSpeed 進行加速。
  • 軟硬體堆疊:在昇騰 NPU 上建立的四層垂直堆疊包括:
    • QAT 訓練邏輯:帶有 Straight-Through Estimator (STE) 的三元量化器,以及 Megatron-LM 中可插拔的量化層。
    • Megatron-LM 量化模型層:整合了權重/激活量化器的張量並行線性層。
    • 框架入口層:用於 NPU 執行的 torch_npumindspeed.megatron_adaptor 注入。
    • 昇騰軟硬體堆疊:MindSpeed、CANN、HCCL 通訊、昇騰 910B NPU 硬體。
  • 性能指標
    • 相較於 BF16,位元寬度減少約 90%。
    • 在昇騰 910B 上,訓練吞吐量相較於全精度訓練僅下降 5%。
    • 推理記憶體需求最高可降低 6 倍(權重記憶體約降低 8 倍)。
    • 1B、3B 和 8B 模型在 11 項基準測試中保持 95.7% 至 97.2% 的全精度性能。
    • 0.5B 模型保持 90.1% 的性能,其性能差距主要集中在數學任務上,表明在十億參數以下規模時,模型容量而非量化器是瓶頸。

🔮 前景展望AI analysis grounded in cited sources

加速中國AI生態系統的自主發展
由於出口管制限制了中國公司獲取高端NVIDIA晶片,BitCPM-CANN在國產AI加速器上的原生支援為國內AI發展提供了關鍵的低位元訓練基礎設施。
推動邊緣AI設備上的大型模型部署
1.58位元量化顯著降低了模型記憶體需求和計算成本,使得大型語言模型能夠在智慧手機、穿戴設備和物聯網終端等資源受限的邊緣設備上運行。
改變AI模型訓練和推理的經濟效益
在HBM記憶體價格飆升的背景下,BitCPM-CANN實現的記憶體和計算效率提升,將大幅降低大型模型訓練和部署的硬體成本和能耗。

時間線

2026-05
Model Best 開源 BitCPM-CANN 框架,實現 1.58 位元模型訓練

📎 來源 (14)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. reddit.com
  2. huggingface.co
  3. houdao.com
  4. reddit.com
  5. huggingface.co
  6. emergentmind.com
  7. metadesignsolutions.com
  8. huggingface.co
  9. reddit.com
  10. huggingface.co
  11. pandaily.com
  12. pandaily.com
  13. arxiv.org
  14. slideshare.net
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Pandaily