🦙Reddit r/LocalLLaMA•較早收集於 3h
Qwen 35B-A3B:在 8GB 筆電 100K 上下文達 26 t/s
💡35B MoE 在 8GB RTX 4060 筆電 100K 上下文達 26 t/s—低 VRAM 突破
⚡ 30-Second TL;DR
有什麼變化
100K 上下文生成 26.18 t/s,提示 330.69 t/s
為什麼重要
證明消費級 8GB GPU 可行長上下文推論,適合隱私敏感本地運行。挑戰 35B MoE 模型 VRAM 限制假設。
下一步行動
在你的 8GB GPU 上使用 llama.cpp 啟用 flash-attn 測試 Qwen3.5-35B-A3B GGUF。
誰應關注:Developers & AI Engineers
關鍵要點
- •100K 上下文生成 26.18 t/s,提示 330.69 t/s
- •llama.cpp 搭配 flash-attn、-ngl 99、-ncmoe 35 在 RTX 4060 8GB
- •5K 上下文 34.93 t/s 線性降至 100K 的 26 t/s
- •Lenovo 筆電:i7-14000HX、64GB DDR5 RAM
- •Unsloth 量化 GGUF 模型
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Qwen3.5-35B-A3B 是 Alibaba Cloud 於 2026 年 2 月發布的多模態基礎模型,支持圖像輸入並具備 262k 原生上下文長度,可擴展至 1M 令牌。
- •模型在基準測試中表現優異,包括 MMLU-Pro 85.3%、GPQA Diamond 84.2%、SWE-bench Verified 69.2% 及 Terminal-Bench 2.0 40.5%。
- •在高階硬體如 RTX 3090 或 4090 上,使用者報告生成速度達 60-100+ t/s,遠高於同尺寸密集模型。
- •API 基準顯示輸出速度達 178 t/s,為同類開源模型中速度領先者。
📊 競品分析▸ Show
| 特徵 | Qwen3.5 27B (Dense) | Qwen3.5-35B-A3B (MoE) |
|---|---|---|
| 總參數 | 27 Billion | 35 Billion |
| 活躍參數 | 27 Billion | ~3 Billion |
| 生成速度 (RTX 3090) | 15–25 t/s | 60–100+ t/s |
| VRAM需求 (Q4) | ~16–18 GB | ~20–22 GB |
| 最佳應用 | 複雜編碼、邏輯 | 快速聊天、代理 |
🛠️ 技術深入
- 總專家參數:3.0B,專家數量 256,活躍專家 9(8 路由 + 1 共享)。
- 注意力結構:Grouped-Query Attention,隱藏維度 2048,層數 40,注意力頭 16 (Q) / 2 (KV)。
- 架構細節:混合 Gated DeltaNet 與稀疏 MoE,隱藏佈局為 10 × (3 × Gated DeltaNet → MoE → 1 × Gated Attention → MoE),頭維度 128 (V) / 256 (Attention),RoPE 位置嵌入。
- 激活函數:SwigLU,歸一化 RMS,上下文長度原生 262,144 令牌,可擴展至 1,010,000。
🔮 前景展望AI analysis grounded in cited sources
消費者級硬體 MoE 模型將主導本地部署
Qwen3.5-35B-A3B 在 8GB VRAM 達 26 t/s 證明稀疏 MoE 架構大幅降低計算需求,推動更多 35B 級模型在筆電運行。
多模態 MoE 模型基準將在 2026 年超越密集模型
其在 GPQA 84.2% 及 SWE-bench 69.2% 的高分結合高效推理,預期將重塑開源 LLM 效能權衡。
llama.cpp 優化將支持更多 100K+ 上下文 MoE
flash-attn 與 -ngl 99 等旗標已在 RTX 4060 實現線性擴展,預期未來迭代將廣泛適用於類似模型。
⏳ 時間線
2026-02
Alibaba Cloud 發布 Qwen3.5 系列,包括 35B-A3B 多模態 MoE 模型
2026-02-24
Qwen3.5-35B-A3B 正式上線 Hugging Face,提供開源權重與配置
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。