🦙最新收集於 5h

Qwen 3.8 35BA3B 出現在 Swift 提交中

Qwen 3.8 35BA3B 出現在 Swift 提交中
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡一筆儲存庫線索可能在官方公告前,提前揭露即將推出的 Qwen 變體。

⚡ 30-Second TL;DR

有什麼變化

疑似模型名稱為 Qwen 3.8 35BA3B。

為什麼重要

若獲得確認,這個模型可能會受到使用開放權重 Qwen 模型與 ms-swift 部署流程的實務開發者關注。在官方文件或權重出現前,團隊應將其視為早期訊號,而非正式生產版本。

下一步行動

持續追蹤相關 ms-swift 提交,並在官方發布模型權重或設定檔後,再於隔離環境中測試該模型識別名稱。

誰應關注:Developers & AI Engineers

關鍵要點

  • 疑似模型名稱為 Qwen 3.8 35BA3B。
  • 相關參照出現在 ms-swift 的 GitHub 提交中。
  • 目前沒有官方發布公告、基準測試或模型權重可供確認。

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • ms-swift 是由阿里巴巴通義千問團隊維護的開源框架,專門用於輕量級模型微調與推理,其 GitHub 提交紀錄通常被視為官方模型發布的前哨站。
  • 命名規則中的「35BA3B」暗示該模型採用混合專家模型(MoE)架構,其中 35B 可能代表總參數規模,而 3B 可能指代每個 Token 激活的參數數量。
  • Qwen 系列模型在 2026 年的迭代中,重點轉向了提升長文本處理能力與多模態整合效率,以應對 GPT-5 與 Claude 4 等競品的市場壓力。
  • 社群分析指出,Qwen 3.8 版本可能針對邊緣運算(Edge Computing)進行了深度優化,旨在降低在消費級 GPU 上運行 MoE 模型的顯存需求。
  • 阿里巴巴近期在 Hugging Face 的更新頻率顯示,其發布策略傾向於先在生態系工具(如 Swift、ModelScope)中進行隱蔽測試,隨後再進行大規模公開發布。
📊 競品分析▸ Show
模型名稱架構類型預估激活參數主要優勢
Qwen 3.8 35BA3BMoE~3B高推理效率、邊緣部署
Llama 4 (預估)Dense/MoE變動生態系廣度、指令遵循
Mistral Large 3MoE變動歐洲市場合規、多語言能力
DeepSeek-V3MoE變動訓練成本效益、代碼能力

🛠️ 技術深入

  • 架構推測:採用 Sparse MoE (Mixture of Experts) 架構,透過路由機制動態選擇專家層,以在保持模型知識容量的同時降低計算延遲。
  • 參數配置:35B 總參數規模配合 3B 激活參數,顯示其設計目標為在維持中型模型推理速度的同時,具備大型模型的知識廣度。
  • 訓練優化:預計整合了 Grouped Query Attention (GQA) 技術,以進一步優化 KV Cache 的記憶體佔用,提升長序列生成效能。
  • 框架支援:ms-swift 提交紀錄顯示該模型已完成對 FlashAttention-3 的初步適配,支援更高效的算子融合。

🔮 前景展望AI analysis grounded in cited sources

阿里巴巴將於 2026 年第三季末正式發布 Qwen 3.8 系列。
基於開源生態工具的提交頻率與過往模型發布週期,該模型已進入最後的穩定性測試階段。
Qwen 3.8 將顯著提升在端側設備上的多模態推理表現。
MoE 架構與 3B 激活參數的組合是專為在有限算力下實現高效多模態處理而設計的技術路徑。

時間線

2025-09
Qwen 2.5 系列發布,確立了在開源模型領域的基準地位。
2026-03
Qwen 3.0 正式推出,引入了全新的 MoE 架構與長文本處理技術。
2026-06
阿里巴巴更新 ms-swift 框架,強化對 MoE 模型微調的支援。
2026-08
ms-swift GitHub 提交中出現 Qwen 3.8 35BA3B 參照。

📰 事件追蹤

📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA