
Qwen3.5 122B 在 3x3090 上 25 tok/s 最佳
Qwen3.5 122B 在 72GB VRAM(3x3090)上以 Q3_K 達 25 tok/s,被譽為最佳模型,支援 120k 上下文。分享最佳設定修復迴圈:Temp 0.6、Top P 0.8、Repeat 1.3。在佔用與速度平衡勝出。
Tag: #inference-speed24 results

Qwen3.5 122B 在 72GB VRAM(3x3090)上以 Q3_K 達 25 tok/s,被譽為最佳模型,支援 120k 上下文。分享最佳設定修復迴圈:Temp 0.6、Top P 0.8、Repeat 1.3。在佔用與速度平衡勝出。

使用者在 MacBook Pro M5 MAX 上比較 Qwen 3.6 35B(72 TPS)和 27B(18 TPS)於程式原語。27B 較慢但更精準正確。測試生成完整 HTML 畫布汽車動畫,含視差滾動。
使用者讚揚 Qwen 3.5 27B IQ3 量化版適合 32k 上下文,在 RTX 4080 上以 llama.cpp 達 40+ t/s。探討 Gemma 26B MoE IQ4 搭配 turboquant KV 快取。強調 16GB 卡上量化速度與品質權衡。
討論 397B 參數模型如何達成 1T 令牌效能。推測 Qwen3-Next 架構或合成資料蒸餾改進。