Qwen 3.5 397B Q4_K_M 在 3060 上達 1.4 t/s
用戶成功在 Ryzen 5、48GB RAM、RTX 3060 12GB 和 1TB NVMe 上運行量化 Qwen 3.5 397B,達 1.4 權杖/秒。質疑本地運行 397B 模型是否值得。徵求社群意見。
Tag: #local-inference188 results
用戶成功在 Ryzen 5、48GB RAM、RTX 3060 12GB 和 1TB NVMe 上運行量化 Qwen 3.5 397B,達 1.4 權杖/秒。質疑本地運行 397B 模型是否值得。徵求社群意見。

Reddit r/LocalLLaMA 貼文宣布 LMStudio 即將為 Qwen 3.5 模型支援 Presence Penalty。此功能懲罰重複 token 以提升本地推論的生成多樣性。使用者可望獲得無重複的更好文字品質。
使用者回報 Unsloth GGUF 量化版本在 Qwen3.5 小型密集模型中無法啟用思考功能,不論傳入何種參數。Unsloth 文件指出 0.8B、2B、4B、9B 模型預設停用推理,可透過 --chat-template-kwargs '{"enable_thinking":true}' 啟用。Bartowski 量化版本則正常運作。

Bartowski 上傳了多個 Qwen3.5 27B Imaxtrix 的新 Imatrix 量化版本。在 RTX 5060 Ti 上,IQ2_M 量化達到 450 t/s pp 和 20 t/s tg,支援 128k 上下文。此版本在除錯任務中優於其他 Q2 量化,但功耗達 170-175W。

貼文回顧 DeepSeek R1 時期進展:原 $6000 設備 5 tps,如今 $600 小型 PC 執行更優 Qwen3-27B Q4 達同速。欲更快 17-20 tps,使用 Qwen3.5-35B-A3B Q4/Q5。預測明年 4B 模型勝 Kimi 2.5。
Reddit 用戶分享 Qwen3.5 模型系列的親身運行經驗,強調其一致的家族特徵、對提示的高度適應性,以及在 llama.cpp 中的設定敏感度。主要建議包括 35B 模型使用 temp 0.6、repeat-penalty 1.4 以防循環,並避免 KV 快取量化。模型透過系統提示可在表面回應外展現更深入分析。

64GB VRAM AI 設備採用雙 AMD Instinct MI50 GPU、Threadripper 2990WX CPU,總成本約 1500 歐元。包含開源 3D 列印 shroud,使用 92mm 風扇實現安靜冷卻。以 llama.cpp 和 ROCm 6.3 運行 GLM 4.7 Q8_0,約 50 t/s。

GPT4All 成為優於 Ollama 的本地 AI 工具,取代作者 Mac 上的使用。它提供驚人簡單的本地 AI 模型執行設定。本文解釋轉換的主要原因。

最新市場追蹤顯示,RTX 50 系列非公版顯示卡近期大幅漲價,溢價最高達 88%,刷新上市以來紀錄。在中國市場,RTX 5060 Ti 16GB 價格據報已遠高於 3,599 元人民幣的建議零售價,達到約 6,000 元。

技嘉推出 AORUS GeForce RTX 5060 ARI 8G,這是其「雕妹」主題產品線的首款顯示卡。顯示卡採用與 B850 AORUS ELITE-P 主機板一致的慵懶可愛設計,並提供最高 2722MHz 的出廠加速頻率。