Qwen3.5 27B 在 2x3090 上達 100+ t/s

💡在 2x3090 上解鎖 Qwen3.5 100+ t/s,本地多使用者推論(585 t/s 吞吐)
⚡ 30-Second TL;DR
有什麼變化
使用張量並行和 NVLink 的 vLLM 實現多 GPU 效率
為什麼重要
在消費級硬體上實現高吞吐量本地推論,讓強大 LLM 可供多使用者環境使用,無需企業級 GPU。
下一步行動
從源碼編譯 vLLM,使用張量並行並在你的 3090 設定上測試 MTP=5。
關鍵要點
- •使用張量並行和 NVLink 的 vLLM 實現多 GPU 效率
- •啟用 5 個 token 的 MTP 以達最佳接受長度
- •全注意力層的 int4 量化,利用 3090 硬體加速
- •自訂 vLLM 編譯和引擎調整提升效能
- •8 個同時請求達 585 t/s 吞吐量
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •Qwen3.5 27B 是一個完全密集模型(所有 27B 參數在每次前向傳遞時激活),在 SWE-bench Verified 上達到 72.4 分,與 GPT-5 mini 相匹配,展示了密集架構相比稀疏模型的推理密度優勢[3]
- •該模型採用線性注意力機制以實現快速響應時間,並支援 262K 上下文窗口和多模態輸入(文本、圖像、視頻),使其成為開源權重模型中功能最全面的選項之一[4][6]
- •在標準 API 端點上,Qwen3.5 27B 的解碼速度為 100.2 t/s,但首個 token 時間(TTFT)為 1.38 秒,高於同類開源模型的中位數 0.51 秒,表明在批量推理優化與延遲之間存在權衡[1]
- •與 Qwen3.5 35B-A3B(3B 活躍參數)相比,27B 密集模型在本地部署時速度明顯較慢(Q8 量化下約 7.5 t/s vs 46 t/s),但在互動任務中提供更一致的邏輯完整性[2][5]
📊 競品分析▸ Show
| 特性 | Qwen3.5 27B | Qwen3.5 35B-A3B | Qwen3.5 122B-A10B | GPT-5 mini |
|---|---|---|---|---|
| 參數 | 27B(全密集) | 35B(3B 活躍) | 122B(10B 活躍) | 未公開 |
| 解碼速度(API) | 100.2 t/s | ~46 t/s(本地) | 未指定 | 未指定 |
| SWE-bench Verified | 72.4 | 未指定 | 未指定 | 72.4 |
| 輸入價格 | $0.30/1M tokens | 未指定 | 未指定 | 未指定 |
| 輸出價格 | $2.40/1M tokens | 未指定 | 未指定 | 未指定 |
| 上下文窗口 | 262K | 未指定 | 未指定 | 未指定 |
| 多模態支援 | 是(文本、圖像、視頻) | 是 | 未指定 | 未指定 |
🛠️ 技術深入
• 架構:Qwen3.5 27B 採用線性注意力機制,所有 27.8B 參數在每次前向傳遞時激活,與稀疏混合專家(MoE)模型(如 35B-A3B)形成對比[1][4] • 量化支援:支援 int4 量化,可在 8GB+ VRAM GPU 上運行 GGUF 量化版本,與 Reddit 文章中提及的 int4 量化策略一致[3] • Tokenizer:使用 Qwen3 tokenizer,針對中文和多語言處理進行優化[4] • 推理優化:在 Alibaba API 上達到 100.2 t/s 解碼速度,但首個 token 時間為 1.38 秒,表明批量推理優化優於單次請求延遲[1] • 多模態能力:原生視覺語言模型,支援文本、圖像和視頻輸入,無需單獨的 VLM[4] • 許可證:Apache 2.0 許可證,允許商業使用[1]
🔮 前景展望AI analysis grounded in cited sources
⏳ 時間線
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。