🦙較早收集於 46m

Qwen 3.5 MoE 35B 指令模式詢問

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#moe#instruct-mode#benchmarkqwen-3.5-moe-35bqwenqwen-3.5

💡社群探討無推理的 Qwen 3.5 MoE 指令效能—適合快速本地推理(38字元)

⚡ 30-Second TL;DR

有什麼變化

詢問 Qwen 3.5 MoE 35B 純指令模式的效能

為什麼重要

Reddit 用戶因辦公室頻寬限制,尋求 Qwen 3.5 MoE 35B 不含推理鏈的指令模式測試結果。對 Qwen 在 2507 發布後重返混合推理模型感到驚訝。社群討論持續中。

下一步行動

從 Hugging Face 下載 Qwen 3.5 MoE 35B,並在你的 GPU 設定上基準測試指令模式。

誰應關注:Researchers & Academics

關鍵要點

  • 詢問 Qwen 3.5 MoE 35B 純指令模式的效能
  • 測試不使用推理/思考提示
  • Qwen2.5 後從混合轉向推理模型令人驚訝
  • u/LinkSea8324 發布,尋求社群基準測試

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B採用MoE架構,總參數35B但僅激活3B參數,每token生成速度達60-100+ t/s於RTX 4090硬體。[1][2]
  • 該模型超越前代Qwen3-235B-A22B效能,並具備混合注意力架構支援線性長上下文擴展至32K+ token。[1][4]
  • Qwen3.5系列包含Flash版本作為生產部署優化,預設1M上下文並內建工具,適用代理工作流程。[1][5]
📊 競品分析▸ Show
模型架構活躍參數速度 (RTX 4090)效能註記
Qwen3.5-35B-A3BMoE3B60-100+ t/s超越Qwen3-235B [1][2]
Qwen3.5-27BDense27B15-25 t/s高品質但速度較慢 [2]
Liquid LFM2-24B-A2BMoE~2.3B未指定優化邊緣推論,32GB足跡 [5]

🛠️ 技術深入

  • MoE架構結合Gated Delta Networks與稀疏專家,僅激活少數專家實現線性計算複雜度,突破傳統Transformer二次方限制。[4]
  • 混合注意力架構支援長上下文線性擴展,推理速度於32K+ token顯著優於前代。[4]
  • 量化版本如Q8_K僅37GB VRAM需求,接近BF16精度,支援SGLang與vLLM於AMD Instinct GPU日零支援。[3][4]
  • 具原生多模態能力,透過DeepStack與3D卷積作為視覺代理處理複雜環境物件辨識。[4]

🔮 前景展望AI analysis grounded in cited sources

Qwen3.5 MoE將加速中小型模型取代巨型dense模型於生產部署
35B-A3B以3B活躍參數超越235B前代,證明MoE+RL降低計算需求同時維持前沿智能。[1]
本地部署MoE模型將普及於消費者GPU
於RTX 3090/4090達高t/s速度與24GB VRAM甜點,適合辦公室頻寬受限情境。[2]
代理工作流程效能將因低延遲MoE提升20倍以上
Flash版本優化高吞吐量,長段落生成從10-20秒降至3秒內。[1][2]

時間線

2026-02-16
發布Qwen3.5系列,包括397B-A17B MoE模型於GitHub。[7]
2026-02-16
AMD宣布Qwen3.5於Instinct GPU日零支援,優化ROCm與vLLM。[4]
2026-02-24
Alibaba Qwen團隊發布Qwen3.5中型系列,含35B-A3B與Flash模型。[1]
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。