🦙Reddit r/LocalLLaMA•較早收集於 21h
Qwen3.5 122B 在 3x3090 上 25 tok/s 最佳

#quantization#multi-gpu#inference-speedqwen3.5-122bqwen3.5 122b3090q3_kunsloth
💡122B 模型 3x3090 達 25 tok/s 與 120k 上下文—無迴圈效能設定。(44字)
⚡ 30-Second TL;DR
有什麼變化
3x3090(72GB VRAM)全 GPU 載入達 25 tok/s
為什麼重要
證明高端消費 GPU 適用 122B 模型,無需資料中心降低頂級效能門檻。
下一步行動
將 Qwen3.5 122B 量化至 Q3_K,並套用分享取樣參數於多 GPU 系統。
誰應關注:Developers & AI Engineers
關鍵要點
- •3x3090(72GB VRAM)全 GPU 載入達 25 tok/s
- •Q3_K 量化支援 120k 上下文無需卸載
- •設定:Temp 0.6、Top P 0.8、Repeat 懲罰 1.3 避免迴圈
- •通過「車洗測試」,勝過 GLM Air、GPT-OSS-120B
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 7 個來源。
🔑 增強重點摘要
- •Qwen3.5-122B-A10B 是 MoE 架構,總參數 122B,僅 10B 激活,實現更高效率。
- •在 Artificial Analysis Intelligence Index 上得分 41,高於同尺寸開源模型中位數 14。
- •透過 Alibaba API 輸出速度達 113 tokens/s,超越同類模型中位數 70 t/s。
- •支援推理模式,可顯示逐步思考過程,並在 HLE 基準上得分 25.3,為近期 SOTA。
🛠️ 技術深入
- •MoE (Mixture of Experts) 架構:總 122B 參數,激活 10B 參數,提升推理效率。
- •支援 1M 上下文長度 (Flash 變體),內建工具功能。
- •Artificial Analysis 評測生成 91M tokens,遠高於平均 6.4M,顯示高詳細度。
- •支援 GGUF 量化與 Unsloth 優化,INT4 變體可用於低 VRAM 部署。
- •Ollama 庫支援 qwen3.5:122b,多模態模型家族。
🔮 前景展望AI analysis grounded in cited sources
Qwen3.5-122B-A10B 將加速本地部署開源前沿模型趨勢
其高效 MoE 設計與量化支援允許消費者級硬體如單 GPU 運行,降低雲端依賴。
MoE 架構將主導 100B+ 模型效率競爭
激活參數僅 10B 即達高智慧分數,證明架構優化勝過純參數擴張。
⏳ 時間線
2025-12
Alibaba 發布 Qwen3.5 系列,包括 122B-A10B MoE 模型
2026-01
社區推出 GGUF 量化與 Unsloth 支援,啟用本地運行
2026-02
Artificial Analysis 基準顯示高智慧與速度表現
2026-02
Reddit r/LocalLLaMA 報告 3x3090 上 25 tok/s 最佳效能
📎 來源 (7)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。