🦙較早收集於 3h

Qwen 35B-A3B:在 8GB 筆電 100K 上下文達 26 t/s

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡35B MoE 在 8GB RTX 4060 筆電 100K 上下文達 26 t/s—低 VRAM 突破

⚡ 30-Second TL;DR

有什麼變化

100K 上下文生成 26.18 t/s,提示 330.69 t/s

為什麼重要

證明消費級 8GB GPU 可行長上下文推論,適合隱私敏感本地運行。挑戰 35B MoE 模型 VRAM 限制假設。

下一步行動

在你的 8GB GPU 上使用 llama.cpp 啟用 flash-attn 測試 Qwen3.5-35B-A3B GGUF。

誰應關注:Developers & AI Engineers

關鍵要點

  • 100K 上下文生成 26.18 t/s,提示 330.69 t/s
  • llama.cpp 搭配 flash-attn、-ngl 99、-ncmoe 35 在 RTX 4060 8GB
  • 5K 上下文 34.93 t/s 線性降至 100K 的 26 t/s
  • Lenovo 筆電:i7-14000HX、64GB DDR5 RAM
  • Unsloth 量化 GGUF 模型

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 是 Alibaba Cloud 於 2026 年 2 月發布的多模態基礎模型,支持圖像輸入並具備 262k 原生上下文長度,可擴展至 1M 令牌。
  • 模型在基準測試中表現優異,包括 MMLU-Pro 85.3%、GPQA Diamond 84.2%、SWE-bench Verified 69.2% 及 Terminal-Bench 2.0 40.5%。
  • 在高階硬體如 RTX 3090 或 4090 上,使用者報告生成速度達 60-100+ t/s,遠高於同尺寸密集模型。
  • API 基準顯示輸出速度達 178 t/s,為同類開源模型中速度領先者。
📊 競品分析▸ Show
特徵Qwen3.5 27B (Dense)Qwen3.5-35B-A3B (MoE)
總參數27 Billion35 Billion
活躍參數27 Billion~3 Billion
生成速度 (RTX 3090)15–25 t/s60–100+ t/s
VRAM需求 (Q4)~16–18 GB~20–22 GB
最佳應用複雜編碼、邏輯快速聊天、代理

🛠️ 技術深入

  • 總專家參數:3.0B,專家數量 256,活躍專家 9(8 路由 + 1 共享)。
  • 注意力結構:Grouped-Query Attention,隱藏維度 2048,層數 40,注意力頭 16 (Q) / 2 (KV)。
  • 架構細節:混合 Gated DeltaNet 與稀疏 MoE,隱藏佈局為 10 × (3 × Gated DeltaNet → MoE → 1 × Gated Attention → MoE),頭維度 128 (V) / 256 (Attention),RoPE 位置嵌入。
  • 激活函數:SwigLU,歸一化 RMS,上下文長度原生 262,144 令牌,可擴展至 1,010,000。

🔮 前景展望AI analysis grounded in cited sources

消費者級硬體 MoE 模型將主導本地部署
Qwen3.5-35B-A3B 在 8GB VRAM 達 26 t/s 證明稀疏 MoE 架構大幅降低計算需求,推動更多 35B 級模型在筆電運行。
多模態 MoE 模型基準將在 2026 年超越密集模型
其在 GPQA 84.2% 及 SWE-bench 69.2% 的高分結合高效推理,預期將重塑開源 LLM 效能權衡。
llama.cpp 優化將支持更多 100K+ 上下文 MoE
flash-attn 與 -ngl 99 等旗標已在 RTX 4060 實現線性擴展,預期未來迭代將廣泛適用於類似模型。

時間線

2026-02
Alibaba Cloud 發布 Qwen3.5 系列,包括 35B-A3B 多模態 MoE 模型
2026-02-24
Qwen3.5-35B-A3B 正式上線 Hugging Face,提供開源權重與配置
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。