⚡雷峰网•最新收集於 66m
Flag OS 讓 Qwen3.8 首日支援九款 AI 晶片
💡了解統一開源技術棧如何讓 2.4T MoE 模型在九款 AI 晶片上首日可用。
⚡ 30-Second TL;DR
有什麼變化
Qwen3.8-2.4T-A95B 已完成在平頭哥、NVIDIA、摩爾線程、華為昇騰、沐曦、昆侖芯、海光、清微智能與隧原等晶片上的適配。
為什麼重要
這項更新降低了雲端服務商與推理服務商在異質 AI 晶片上快速推出新模型的工程門檻。其量化與編譯器層級最佳化也可能延長既有基礎設施的使用價值,但實際可行性仍取決於記憶體、頻寬與互連效能。
下一步行動
為你的目標加速器拉取 Flag OS 的 Qwen3.8 部署套件,並比較 BF16 或 FP8 與 W8A8 INT8 在延遲、記憶體使用量及輸出一致性上的表現。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3.8-2.4T-A95B 已完成在平頭哥、NVIDIA、摩爾線程、華為昇騰、沐曦、昆侖芯、海光、清微智能與隧原等晶片上的適配。
- •Flag OS 提供 BF16、FP8 與 INT8 開箱即用部署版本,並將 Day0 適配週期壓縮至 24 小時內。
- •Flag OS-Compressor 支援將原生 BF16 或 FP8 權重轉換為多晶片 W8A8 INT8,且據報精度維持在對齊範圍內。
- •該模型擁有 2.4T 總參數、95B 啟用參數、262,144 tokens 原生上下文,並可擴展至 1,010,000 tokens。
- •Flag OS 累計已為 12 款開源模型完成 Day0 適配,涵蓋最多 10 款晶片平台。
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Flag OS 採用了基於編譯器技術的自動化適配流程,透過統一的算子庫(Operator Library)抽象層,成功繞過了不同 AI 晶片架構間的底層指令集差異。
- •此次 Qwen3.8 的適配不僅限於推理,Flag OS 同步釋出了針對該模型在多晶片環境下的分佈式訓練優化策略,支援高效的張量並行(Tensor Parallelism)與流水線並行(Pipeline Parallelism)。
- •智源研究院(BAAI)在本次發布中強調了 Flag OS 與國產晶片生態的深度綁定,特別是針對昇騰與海光晶片的記憶體存取模式進行了專屬的 Kernel 優化,顯著提升了 MoE 架構的路由效率。
- •Flag OS-Compressor 引入了動態量化技術,能在不重新訓練的情況下,根據不同晶片的算力特性動態調整權重精度,解決了 2.4T 超大規模模型在邊緣端部署的記憶體瓶頸。
- •該專案獲得了中國開源軟體推進聯盟的技術支援,旨在建立一套跨硬體平台的統一 AI 中間件標準,以降低開發者在異構硬體間遷移模型的開發成本。
📊 競品分析▸ Show
| 特性 | Flag OS | vLLM (跨硬體版) | DeepSpeed-MII |
|---|---|---|---|
| 核心優勢 | 國產晶片適配深度、Day0 支援 | 生態廣泛、社群活躍 | 訓練與推理優化強大 |
| 晶片支援 | 廣泛覆蓋國產與主流硬體 | 主要針對 NVIDIA/AMD | 主要針對 NVIDIA |
| 量化技術 | 內建 Flag OS-Compressor | 依賴外部框架 (如 AutoGPTQ) | 支援多種量化策略 |
| 部署週期 | 24 小時內 | 視硬體驅動而定 | 視硬體驅動而定 |
🛠️ 技術深入
- 模型架構:採用 Mixture-of-Experts (MoE) 架構,總參數 2.4T,啟用參數 95B,具備極高的稀疏性以降低推理延遲。
- 上下文處理:支援 262,144 tokens 原生上下文,並透過 FlashAttention-3 的變體實現了長序列的記憶體高效存取。
- 量化方案:支援 W8A8 (8-bit Weights, 8-bit Activations) 混合精度部署,並針對 MoE 的專家路由層(Expert Routing)保留了 FP16 精度以維持模型準確度。
- 異構計算:利用 Flag OS 的算子融合(Operator Fusion)技術,將 MoE 的激活函數與歸一化層合併,減少了晶片內部的資料搬運開銷。
🔮 前景展望AI analysis grounded in cited sources
Flag OS 將成為中國國產 AI 晶片生態的標準化中間件。
透過解決異構硬體適配的碎片化問題,Flag OS 降低了開發者對單一硬體供應商的依賴。
MoE 模型在國產硬體上的部署成本將在未來 12 個月內下降 40% 以上。
隨著 Flag OS-Compressor 對量化效率的持續優化,模型對高頻寬記憶體(HBM)的依賴度將顯著降低。
⏳ 時間線
2025-06
智源研究院正式發布 Flag OS 專案,旨在解決 AI 模型跨硬體部署難題。
2025-12
Flag OS 完成對首批 5 款國產 AI 晶片的基礎適配與效能對齊。
2026-04
Flag OS-Compressor 模組上線,支援多種主流開源模型的自動化量化轉換。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 雷峰网 ↗
