🦙較早收集於 27m

Qwen 3.5 397B Q4_K_M 在 3060 上達 1.4 t/s

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#local-inference#consumer-gpuqwen3.5-397b-q4_k_mqwen3.5rtx-3060q4_k_m

💡397B 模型在 RTX 3060 本地運行—消費硬體極限證明?

⚡ 30-Second TL;DR

有什麼變化

硬體:Ryzen 5 CPU、48GB RAM、RTX 3060 12GB VRAM

為什麼重要

凸顯量化讓前沿模型能在消費級 GPU 運行,擴大本地 AI 存取。引發巨型 LLM 本地 vs. 雲端實用性討論。

下一步行動

使用 llama.cpp 將 Qwen 3.5 397B 量化至 Q4_K_M,並測試 12GB GPU 推理速度。

誰應關注:Developers & AI Engineers

關鍵要點

  • 硬體:Ryzen 5 CPU、48GB RAM、RTX 3060 12GB VRAM
  • 量化:Q4_K_M,速度 1.4 t/s
  • 儲存:1TB NVMe
  • 討論本地 397B 規模模型價值

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 8 個來源。

🔑 增強重點摘要

  • Qwen3.5-397B-A17B 是 Alibaba Cloud 於 2026 年 2 月 24 日發布的多模態基礎模型,採用混合專家(MoE)架構,總參數 397B,激活參數僅 17B(512 專家中激活 11 個)。[1]
  • 模型支援 262K 令牌上下文長度,可透過 YaRN RoPE 擴展至 1M 令牌,並具備原生視覺語言能力,包括高解析度影像處理(最高 1344x1344 像素)和多語言支援(201 種語言)。[2][4]
  • 在基準測試中表現優異,如 MMLU-Pro 87.8%、GPQA Diamond 88.4%、SWE-bench Verified 80.0%,並在代理性能上較前代 Qwen3 235B 提升顯著(Intelligence Index 45 分)。[1][3]
📊 競品分析▸ Show
模型總參數/激活參數上下文長度關鍵基準 (e.g. Intelligence Index 或類似)
Qwen3.5-397B-A17B397B/17B262K (擴至1M)Intelligence Index 45[3]
Kimi K2.51T/32B未指定~89M 輸出令牌效率[3]
GLM-5744B/40B未指定~110M 輸出令牌效率[3]
DeepSeek V3.2671B/37B未指定未直接比較[3]

🛠️ 技術深入

  • 架構:混合 MoE(Hybrid Mixture-of-Experts),包含 Gated DeltaNet 層(64 線性注意力頭用於 V,16 用於 QK,頭維度 128)和 Gated Attention(32 Q 頭,2 KV 頭,頭維度 256,RoPE 維度 64),60 層布局為 15 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))。[2][4]
  • 視覺編碼:整合 Vision Transformer (ViT) 編碼器,支援早期融合視覺語言訓練,高解析度影像至 1344x1344 像素,像素級 UI 元素偵測。[2][4]
  • 其他規格:詞彙大小 248,320,激活函數 SwigLU,RMS 正規化,Grouped-Query Attention(32 注意力頭,2 KV 頭),隱藏維度 4096,多令牌預測 (MTP) 提升推論吞吐量,解碼速度比 Qwen3-Max 快 8.6x-19x。[1][2][4]

🔮 前景展望AI analysis grounded in cited sources

Q4_K_M 量化使 397B MoE 模型能在消費級 RTX 3060 上以 1.4 t/s 運行
MoE 架構僅激活 17B 參數,大幅降低 VRAM 需求,證明高效量化技術可將巨型模型推向本地部署。[1][2]
多模態代理能力將加速開源 AI 在邊緣設備應用
模型支援視覺理解、代理工作流及 1M 上下文,結合本地運行進展,有助於開發離線多模態代理。[2][4]
中國開源模型將持續挑戰封閉模型主導地位
Qwen3.5 在基準上與領先模型匹敵,並以 Apache 2.0 許可開放權重,促進全球開發者生態。[1][3]

時間線

2026-02
Alibaba Cloud 發布 Qwen3.5 系列,包括 397B-A17B 多模態 MoE 模型
2026-02-16
模型上架 NVIDIA NIM、Hugging Face 和 Together AI 平台
2026-02-24
Qwen3.5-397B-A17B 正式發布,公布架構與基準成績
2026-03-03
Reddit 用戶報告在 RTX 3060 上 Q4_K_M 量化版本達 1.4 t/s 速度
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。