🦙較早收集於 21h

Qwen3.5 122B 在 3x3090 上 25 tok/s 最佳

Qwen3.5 122B 在 3x3090 上 25 tok/s 最佳
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#multi-gpu#inference-speedqwen3.5-122bqwen3.5 122b3090q3_kunsloth

💡122B 模型 3x3090 達 25 tok/s 與 120k 上下文—無迴圈效能設定。(44字)

⚡ 30-Second TL;DR

有什麼變化

3x3090(72GB VRAM)全 GPU 載入達 25 tok/s

為什麼重要

證明高端消費 GPU 適用 122B 模型,無需資料中心降低頂級效能門檻。

下一步行動

將 Qwen3.5 122B 量化至 Q3_K,並套用分享取樣參數於多 GPU 系統。

誰應關注:Developers & AI Engineers

關鍵要點

  • 3x3090(72GB VRAM)全 GPU 載入達 25 tok/s
  • Q3_K 量化支援 120k 上下文無需卸載
  • 設定:Temp 0.6、Top P 0.8、Repeat 懲罰 1.3 避免迴圈
  • 通過「車洗測試」,勝過 GLM Air、GPT-OSS-120B

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5-122B-A10B 是 MoE 架構,總參數 122B,僅 10B 激活,實現更高效率。
  • 在 Artificial Analysis Intelligence Index 上得分 41,高於同尺寸開源模型中位數 14。
  • 透過 Alibaba API 輸出速度達 113 tokens/s,超越同類模型中位數 70 t/s。
  • 支援推理模式,可顯示逐步思考過程,並在 HLE 基準上得分 25.3,為近期 SOTA。
📊 競品分析▸ Show
模型智慧指數輸出速度 (t/s)價格 (USD/1M tokens)
Qwen3.5-122B-A10B41113未指定[1]
同尺寸開源模型中位數1470未指定[1]

🛠️ 技術深入

  • MoE (Mixture of Experts) 架構:總 122B 參數,激活 10B 參數,提升推理效率。
  • 支援 1M 上下文長度 (Flash 變體),內建工具功能。
  • Artificial Analysis 評測生成 91M tokens,遠高於平均 6.4M,顯示高詳細度。
  • 支援 GGUF 量化與 Unsloth 優化,INT4 變體可用於低 VRAM 部署。
  • Ollama 庫支援 qwen3.5:122b,多模態模型家族。

🔮 前景展望AI analysis grounded in cited sources

Qwen3.5-122B-A10B 將加速本地部署開源前沿模型趨勢
其高效 MoE 設計與量化支援允許消費者級硬體如單 GPU 運行,降低雲端依賴。
MoE 架構將主導 100B+ 模型效率競爭
激活參數僅 10B 即達高智慧分數,證明架構優化勝過純參數擴張。

時間線

2025-12
Alibaba 發布 Qwen3.5 系列,包括 122B-A10B MoE 模型
2026-01
社區推出 GGUF 量化與 Unsloth 支援,啟用本地運行
2026-02
Artificial Analysis 基準顯示高智慧與速度表現
2026-02
Reddit r/LocalLLaMA 報告 3x3090 上 25 tok/s 最佳效能
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。