🦙較早收集於 6h

Bartowski 上傳新 Qwen3.5 27B Imaxtrix 量化版本

Bartowski 上傳新 Qwen3.5 27B Imaxtrix 量化版本
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#quantization#nvidia-gpu#local-inferenceqwen3.5-27b-imaxtrixqwen3.5bartowskiimaxtrixllama.cpp

💡5060 Ti 上 450 t/s 讓 Qwen3.5 27B 適合本地編碼/除錯

⚡ 30-Second TL;DR

有什麼變化

Bartowski 發布 Qwen3.5 27B 的新 Imatrix 量化版本

為什麼重要

提升消費者級 NVIDIA GPU 上大型模型的本地部署,讓編碼任務實現更快推論,無需雲端依賴。

下一步行動

從 Hugging Face 下載 Bartowski 的 IQ2_M 量化版本,並在你的 40 系列 GPU 上基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • Bartowski 發布 Qwen3.5 27B 的新 Imatrix 量化版本
  • IQ2_M 在 RTX 5060 Ti 上達 450 t/s pp、20 t/s tg,128k 上下文
  • 除錯效能優於其他 Q2 變體
  • 推論時 GPU 功耗達 170-175W

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 5 個來源。

🔑 增強重點摘要

  • Qwen3.5-27B 採用 Transformer 與線形注意力混合架構,支援多模態輸入(文字+圖像+影片),上下文長度達 256K 或 262K 令牌。
  • 在 Artificial Analysis 的 Intelligence Index 中,Qwen3.5-27B 得分 42,高於 o3-pro (41) 及 Qwen3.5-35B-A3B (37),展現強大推理與代理能力。
  • 商業部署定價為輸入每百萬令牌 0.30 美元、輸出 2.40 美元,具競爭力但西方企業存取性需考量。

🛠️ 技術深入

  • 架構:Transformer + 線形注意力機制混合,提供快速回應並平衡推論速度與效能。
  • 模態:支援文字、圖像、影片輸入至文字輸出,使用 Qwen3 Tokenizer,參數量 27B。
  • 訓練特點:使用數十兆令牌大規模語料,強調數學、程式碼、長文讀解及多模態資料,包含 LLM 自評篩選前處理及縮放法則優化學習排程。
  • 量化效能:在 RTX 3090 (24GB VRAM) 上以 5bit 量化實現實用速度,IQ 量化如 IQ4_XS 品質接近 Q4_K_S 但體積更小。

🔮 前景展望AI analysis grounded in cited sources

Qwen3.5-27B 將主導消費者級硬體本地部署
其小模型尺寸及高效量化允許單張低於 16GB VRAM 顯示卡運行,高於 Q4 量化水準減少智慧損失。
IQ 量化將成本地 LLM 主流選擇
Bartowski 的 Imatrix 版本及社區測試顯示 IQ2_M 在除錯等任務優於傳統 Q2,推動低位元量化普及。

時間線

2025-09
Unsloth 發布 Dynamic 2.0 GGUFs,支持 Qwen 系列量化基準測試
2025-12
社區確認 IQ4_XS 量化品質超越 Q3 及舊 Q4_0
2026-02
Qwen3.5-27B 正式發布,展現 256K 上下文及多模態能力
2026-02
Artificial Analysis 評測 Qwen3.5-27B Intelligence Index 達 42
2026-03
Bartowski 上傳 Qwen3.5-27B Imaxtrix 新量化版本
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。