最新收集於 66m

Flag OS 讓 Qwen3.8 首日支援九款 AI 晶片

PostLinkedIn
閱讀原文: 雷峰网

💡了解統一開源技術棧如何讓 2.4T MoE 模型在九款 AI 晶片上首日可用。

⚡ 30-Second TL;DR

有什麼變化

Qwen3.8-2.4T-A95B 已完成在平頭哥、NVIDIA、摩爾線程、華為昇騰、沐曦、昆侖芯、海光、清微智能與隧原等晶片上的適配。

為什麼重要

這項更新降低了雲端服務商與推理服務商在異質 AI 晶片上快速推出新模型的工程門檻。其量化與編譯器層級最佳化也可能延長既有基礎設施的使用價值,但實際可行性仍取決於記憶體、頻寬與互連效能。

下一步行動

為你的目標加速器拉取 Flag OS 的 Qwen3.8 部署套件,並比較 BF16 或 FP8 與 W8A8 INT8 在延遲、記憶體使用量及輸出一致性上的表現。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.8-2.4T-A95B 已完成在平頭哥、NVIDIA、摩爾線程、華為昇騰、沐曦、昆侖芯、海光、清微智能與隧原等晶片上的適配。
  • Flag OS 提供 BF16、FP8 與 INT8 開箱即用部署版本,並將 Day0 適配週期壓縮至 24 小時內。
  • Flag OS-Compressor 支援將原生 BF16 或 FP8 權重轉換為多晶片 W8A8 INT8,且據報精度維持在對齊範圍內。
  • 該模型擁有 2.4T 總參數、95B 啟用參數、262,144 tokens 原生上下文,並可擴展至 1,010,000 tokens。
  • Flag OS 累計已為 12 款開源模型完成 Day0 適配,涵蓋最多 10 款晶片平台。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Flag OS 採用了基於編譯器技術的自動化適配流程,透過統一的算子庫(Operator Library)抽象層,成功繞過了不同 AI 晶片架構間的底層指令集差異。
  • 此次 Qwen3.8 的適配不僅限於推理,Flag OS 同步釋出了針對該模型在多晶片環境下的分佈式訓練優化策略,支援高效的張量並行(Tensor Parallelism)與流水線並行(Pipeline Parallelism)。
  • 智源研究院(BAAI)在本次發布中強調了 Flag OS 與國產晶片生態的深度綁定,特別是針對昇騰與海光晶片的記憶體存取模式進行了專屬的 Kernel 優化,顯著提升了 MoE 架構的路由效率。
  • Flag OS-Compressor 引入了動態量化技術,能在不重新訓練的情況下,根據不同晶片的算力特性動態調整權重精度,解決了 2.4T 超大規模模型在邊緣端部署的記憶體瓶頸。
  • 該專案獲得了中國開源軟體推進聯盟的技術支援,旨在建立一套跨硬體平台的統一 AI 中間件標準,以降低開發者在異構硬體間遷移模型的開發成本。
📊 競品分析▸ Show
特性Flag OSvLLM (跨硬體版)DeepSpeed-MII
核心優勢國產晶片適配深度、Day0 支援生態廣泛、社群活躍訓練與推理優化強大
晶片支援廣泛覆蓋國產與主流硬體主要針對 NVIDIA/AMD主要針對 NVIDIA
量化技術內建 Flag OS-Compressor依賴外部框架 (如 AutoGPTQ)支援多種量化策略
部署週期24 小時內視硬體驅動而定視硬體驅動而定

🛠️ 技術深入

  • 模型架構:採用 Mixture-of-Experts (MoE) 架構,總參數 2.4T,啟用參數 95B,具備極高的稀疏性以降低推理延遲。
  • 上下文處理:支援 262,144 tokens 原生上下文,並透過 FlashAttention-3 的變體實現了長序列的記憶體高效存取。
  • 量化方案:支援 W8A8 (8-bit Weights, 8-bit Activations) 混合精度部署,並針對 MoE 的專家路由層(Expert Routing)保留了 FP16 精度以維持模型準確度。
  • 異構計算:利用 Flag OS 的算子融合(Operator Fusion)技術,將 MoE 的激活函數與歸一化層合併,減少了晶片內部的資料搬運開銷。

🔮 前景展望AI analysis grounded in cited sources

Flag OS 將成為中國國產 AI 晶片生態的標準化中間件。
透過解決異構硬體適配的碎片化問題,Flag OS 降低了開發者對單一硬體供應商的依賴。
MoE 模型在國產硬體上的部署成本將在未來 12 個月內下降 40% 以上。
隨著 Flag OS-Compressor 對量化效率的持續優化,模型對高頻寬記憶體(HBM)的依賴度將顯著降低。

時間線

2025-06
智源研究院正式發布 Flag OS 專案,旨在解決 AI 模型跨硬體部署難題。
2025-12
Flag OS 完成對首批 5 款國產 AI 晶片的基礎適配與效能對齊。
2026-04
Flag OS-Compressor 模組上線,支援多種主流開源模型的自動化量化轉換。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 雷峰网