Gemma 4 E2B 在 Pixel 手機上運行如魔法
用戶讚 Gemma 4 E2B 為 Pixel 10 Pro 日常主力,經 AI Edge Gallery app 使用 CPU 加速,達 32K 上下文。感覺「極度智能」如 7B 模型,生成速快過閱讀並支援函數呼叫。E4B 在手機上太慢。
Tag: #quantization201 results
用戶讚 Gemma 4 E2B 為 Pixel 10 Pro 日常主力,經 AI Edge Gallery app 使用 CPU 加速,達 32K 上下文。感覺「極度智能」如 7B 模型,生成速快過閱讀並支援函數呼叫。E4B 在手機上太慢。
用戶報告無法在 40GB VRAM 上容納 Unsloth Gemma-4-31B-it-UD-Q8(35GB),即使 2K 上下文也需 Q4 KV 量化。與 Qwen3.5-27B 相比不利,後者無需量化即可完整上下文。在基準測試中 Qwen 更優。

Reddit 用戶對 Qwen 3.6B 的 Q2 至 Q8 量化版本進行基準測試。本地 LLM 愛好者可查看結果。由 /u/PraxisOG 發佈於 r/LocalLLaMA。

llama.cpp 最近的 PR 發現現有 q8 KV 量化在 AIME25 基準測試上性能大幅下降。透過 KV 旋轉可幾乎完全恢復性能。這對現有 q8 使用者有益,儘管有些人偏好 fp16。
使用者在 IBM X3650 M4 伺服器(768GB RAM)上測試 unsloth 4-bit 量化 Kimi K2.5(約 620GB),無 GPU 達 1 令牌/秒。計劃跨多台乙太網路連結伺服器分割,以提升頻寬與核心數。伺服器使用 DDR3 RAM,低功耗運行涼爽。
Reddit 用戶詢問最佳 Qwen3.5-27B 量化模型(Q4-Q5,20-24GB),專為編碼任務優化。提及 Unsloth、bartowski 和 mradermacher 等候選。尋求正確比較方法建議。

Nemotron 3 Omni 在 Nvidia keynote 及近期新聞稿中現身。猜測發布時程,作為 Qwen3.5 潛在競爭者。預期具備類似 Nemotron 3 Super 的 NVFP4。
用戶報告 Qwen3.5-122B-A10B 在 Q4 表現良好,但 Q3_K_M 或 UD_Q2_K_XL 急劇退化,毀壞程式碼庫,儘管速度快。它處理工具呼叫和語法但決策失敗。分享警示他人量化 >100B 大模型。
使用者報告 Qwen3.5-9B 在 RTX 3060 12GB VRAM 上進行代理程式碼表現令人印象深刻,能持續長時間會話而不失敗。優於先前 Qwen 程式碼變體,並適合消費級硬體。推薦用於工具呼叫而非更大量化模型。

用戶在 Samsung S25 Ultra(12GB RAM、Snapdragon 8 Elite)測試 Qwen3 9B q4_0 量化。使用 Hexagon NPU 達每秒逾 6 token 生成速度。證明行動裝置上可行推論。