🏠最新收集於 5m

Huawei 於首日支援 Ling-3.0-flash 登陸昇騰平台

Huawei 於首日支援 Ling-3.0-flash 登陸昇騰平台
PostLinkedIn
🏠閱讀原文: IT之家

💡了解 Ling-3.0-flash 的昇騰首日部署,以及自動化客製算子開發框架。

⚡ 30-Second TL;DR

有什麼變化

昇騰完成 Ling-3.0-flash 的 0 Day 適配,支援 A2 與 A3 系列產品。

為什麼重要

Ling-3.0-flash 可在模型開源後快速部署到昇騰硬體,有助於降低國產 AI 加速器適配與推理服務上線的時間成本。CANN PyPTO 及其多智能體工作流也可能提升複雜融合算子的開發效率,對昇騰生態系統的模型承接能力具有正面影響。

下一步行動

下載 Huawei 官方 Ling-3.0-flash 部署鏡像,先在符合卡數要求的昇騰 A2 或 A3 環境測試推理效能,再評估以 CANN PyPTO 重寫瓶頸算子。

誰應關注:Developers & AI Engineers

關鍵要點

  • 昇騰完成 Ling-3.0-flash 的 0 Day 適配,支援 A2 與 A3 系列產品。
  • CANN PyPTO 首次亮相,可透過 Tensor 級 API 定義計算邏輯。
  • 官方提供完整部署工程與鏡像,A2 需 8 卡、A3 需 4 卡。
  • CANNBot PyPTO Agent 將算子開發拆分為 7 個階段,涵蓋生成、驗證與調優。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • 螞蟻集團的 Ling-3.0-flash 模型採用了混合專家模型(MoE)架構,旨在平衡推理速度與參數規模,特別針對高併發場景進行了優化。
  • CANN PyPTO 框架的核心優勢在於降低了昇騰算子開發的門檻,允許開發者使用類似 Python 的語法直接調用底層硬體指令,無需深入編寫複雜的 CCE 代碼。
  • 此次適配不僅限於模型推理,還包含了對昇騰 A3 系列特有的 FP8 混合精度訓練與推理加速技術的深度整合。
  • 華為與螞蟻集團的合作標誌著昇騰生態從單純的硬體適配轉向「模型+框架+算子」的全棧協同開發模式。
  • CANNBot PyPTO Agent 引入了自動化調優機制,能根據模型計算圖的拓撲結構,自動選擇最優的算子融合策略,顯著提升了在 A2/A3 平台上的吞吐量。
📊 競品分析▸ Show
特性華為昇騰 (Ling-3.0-flash)NVIDIA (TensorRT-LLM)Google (TPU/JAX)
算子開發PyPTO (Python-based)CUDA/TritonJAX/XLA
部署靈活性昇騰專用 (A2/A3)通用 (H100/A100)TPU 專用
軟體生態CANN 深度綁定CUDA 生態極強JAX 生態優勢

🛠️ 技術深入

  • PyPTO 框架架構:採用編譯器前端技術,將 Python 定義的 Tensor 計算圖映射至昇騰底層的 Cube 與 Vector 核心。
  • 算子開發流程:包含算子定義、自動代碼生成、靜態分析、模擬器驗證、硬體性能分析、自動調優、最終封裝七個階段。
  • 記憶體管理:針對 A2/A3 記憶體層級,PyPTO 實現了自動化的算子融合(Operator Fusion)與記憶體重用機制,減少了數據搬運開銷。
  • 精度支援:原生支援 FP16、BF16 以及針對 A3 系列優化的 FP8 數據格式,確保模型在量化後保持高精度。

🔮 前景展望AI analysis grounded in cited sources

昇騰平台將在 2027 年前實現主流國產大模型 0 Day 適配率達到 90% 以上。
PyPTO 框架的自動化開發流程大幅降低了算子適配難度,將吸引更多模型廠商主動接入昇騰生態。
CANN PyPTO 將成為華為昇騰軟體生態的核心競爭力。
透過簡化算子開發,華為成功解決了長期以來昇騰平台算子庫擴展速度慢的痛點。

時間線

2023-09
華為發布 CANN 7.0 版本,強化對大模型訓練與推理的底層支援。
2024-05
螞蟻集團發布百靈大模型系列,並開始與華為昇騰進行初步技術對接。
2025-03
華為昇騰 A3 系列晶片正式發布,提供更強的算力與能效比。
2026-08
華為與螞蟻集團達成 Ling-3.0-flash 0 Day 適配,並推出 CANN PyPTO 框架。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家