🦙較早收集於 10h

Qwen3.5 27B 在 2x3090 上達 100+ t/s

Qwen3.5 27B 在 2x3090 上達 100+ t/s
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#local-inference#quantization#mtp#tensor-parallelqwen3.5-27bqwen3.5vllm3090

💡在 2x3090 上解鎖 Qwen3.5 100+ t/s,本地多使用者推論(585 t/s 吞吐)

⚡ 30-Second TL;DR

有什麼變化

使用張量並行和 NVLink 的 vLLM 實現多 GPU 效率

為什麼重要

在消費級硬體上實現高吞吐量本地推論,讓強大 LLM 可供多使用者環境使用,無需企業級 GPU。

下一步行動

從源碼編譯 vLLM,使用張量並行並在你的 3090 設定上測試 MTP=5。

誰應關注:Developers & AI Engineers

關鍵要點

  • 使用張量並行和 NVLink 的 vLLM 實現多 GPU 效率
  • 啟用 5 個 token 的 MTP 以達最佳接受長度
  • 全注意力層的 int4 量化,利用 3090 硬體加速
  • 自訂 vLLM 編譯和引擎調整提升效能
  • 8 個同時請求達 585 t/s 吞吐量

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Qwen3.5 27B 是一個完全密集模型(所有 27B 參數在每次前向傳遞時激活),在 SWE-bench Verified 上達到 72.4 分,與 GPT-5 mini 相匹配,展示了密集架構相比稀疏模型的推理密度優勢[3]
  • 該模型採用線性注意力機制以實現快速響應時間,並支援 262K 上下文窗口和多模態輸入(文本、圖像、視頻),使其成為開源權重模型中功能最全面的選項之一[4][6]
  • 在標準 API 端點上,Qwen3.5 27B 的解碼速度為 100.2 t/s,但首個 token 時間(TTFT)為 1.38 秒,高於同類開源模型的中位數 0.51 秒,表明在批量推理優化與延遲之間存在權衡[1]
  • 與 Qwen3.5 35B-A3B(3B 活躍參數)相比,27B 密集模型在本地部署時速度明顯較慢(Q8 量化下約 7.5 t/s vs 46 t/s),但在互動任務中提供更一致的邏輯完整性[2][5]
📊 競品分析▸ Show
特性Qwen3.5 27BQwen3.5 35B-A3BQwen3.5 122B-A10BGPT-5 mini
參數27B(全密集)35B(3B 活躍)122B(10B 活躍)未公開
解碼速度(API)100.2 t/s~46 t/s(本地)未指定未指定
SWE-bench Verified72.4未指定未指定72.4
輸入價格$0.30/1M tokens未指定未指定未指定
輸出價格$2.40/1M tokens未指定未指定未指定
上下文窗口262K未指定未指定未指定
多模態支援是(文本、圖像、視頻)未指定未指定

🛠️ 技術深入

架構:Qwen3.5 27B 採用線性注意力機制,所有 27.8B 參數在每次前向傳遞時激活,與稀疏混合專家(MoE)模型(如 35B-A3B)形成對比[1][4]量化支援:支援 int4 量化,可在 8GB+ VRAM GPU 上運行 GGUF 量化版本,與 Reddit 文章中提及的 int4 量化策略一致[3]Tokenizer:使用 Qwen3 tokenizer,針對中文和多語言處理進行優化[4]推理優化:在 Alibaba API 上達到 100.2 t/s 解碼速度,但首個 token 時間為 1.38 秒,表明批量推理優化優於單次請求延遲[1]多模態能力:原生視覺語言模型,支援文本、圖像和視頻輸入,無需單獨的 VLM[4]許可證:Apache 2.0 許可證,允許商業使用[1]

🔮 前景展望AI analysis grounded in cited sources

密集模型在開源推理優化中的競爭力提升
Qwen3.5 27B 在 SWE-bench 上與 GPT-5 mini 相匹配,同時保持完全開源權重,預示著密集架構在特定工作負載上可能挑戰稀疏模型的主導地位。
本地部署的成本效益轉變
通過 vLLM 優化在 2x3090 上達成 100+ t/s 的能力,加上 int4 量化支援,使得中等規模 GPU 的本地推理成為經濟可行的替代方案。
多模態開源模型的標準化
Qwen3.5 27B 的原生多模態支援(文本、圖像、視頻)和 262K 上下文窗口表明,開源模型正在縮小與專有模型在功能完整性上的差距。

時間線

2026-02
Qwen3.5 27B 發佈,採用線性注意力機制和 262K 上下文窗口
2026-02
Qwen3.5 系列發佈,包括 27B 密集模型、35B-A3B 和 122B-A10B 變體
2026-02
Qwen3.5 27B 在 SWE-bench Verified 上達到 72.4 分,與 GPT-5 mini 相匹配
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。