
Gemma 4 31B 對 Qwen 3.5 27B:長上下文最佳者?
使用者於 RTX 3090 Ti 基準測試 Gemma 4 31B 及 Qwen 3.5 27B,長達 70-100K 上下文。Qwen 勝於速度、引用及長輸出;Gemma 幻覺較少但較慢,直至 Unsloth 優化。兩者為 24GB VRAM 本地 SOTA。
Tag: #local-inference188 results

使用者於 RTX 3090 Ti 基準測試 Gemma 4 31B 及 Qwen 3.5 27B,長達 70-100K 上下文。Qwen 勝於速度、引用及長輸出;Gemma 幻覺較少但較慢,直至 Unsloth 優化。兩者為 24GB VRAM 本地 SOTA。
Reddit 用戶分享 ChatGPT 生成的補丁,修復 llama.cpp 中 Gemma 4 工具呼叫及結果問題。解決模板不符及非 JSON 輸出解析崩潰。相容 Qwen 3.5;提供 diff。

在 Intel Lunar Lake iGPU 上對 Qwen3.5-4B GGUF 量化版本進行詳細基準測試,比較 tk/s、KLD 散度、大小與效率。Unsloth 與 Bartowski 量化 KLD 低於 0.01 領先。有助邊緣硬體本地推理的最佳選擇。
基準測試 Google 新 Gemma4 對 Alibaba 的 Qwen3.5,在 RTX 4090 上進行本地代理編碼。Qwen3.5-27B 在程式碼品質、可靠性和效率上表現出色,儘管速度較慢。MoE 變體如 Gemma4-26B 較快但複雜任務準確度較低。
Gemma 4 26b 在 Mac Studio M1 Ultra 上速度匹配 Qwen3.5 35b,於思考鏈連貫性、視覺理解及多語言任務大幅超越。使用者指出 KV 快取龐大及審查風險,但整體表現獲讚。使用 Q4_K_XL 量化測試。

llama.cpp 專案,一個高效 LLM 推理的 C++ 函式庫,已在 GitHub 上達到 10 萬星標。創作者 ggerganov 透過 Twitter 宣布此里程碑。在 r/LocalLLaMA 社群分享。
Nemotron 3 Nano 4B 是一款新型緊湊混合模型,專為高效本地 AI 部署而設計。託管於 Hugging Face,針對邊緣設備降低資源需求。此發布強調在設備端推理場景中的效能。

NVIDIA 的 Nemotron-3-Nano-4B 模型現以 GGUF 格式提供。此量化版本可在消費級硬體上高效本地推論。r/LocalLLaMA 貼文附下載連結。

GLM 5 Turbo 在 Reddit r/LocalLLaMA 貼文中被讚為廉價卻強大的 AI 模型。貼文強調其性價比高。貼文未提供更多細節。
基準測試比較 Hugging Face 上 Qwen3.5-35B GGUF 量化版本(16-22 GiB)的 KLD 差異和速度。使用多語言 FLORES 200 和校準資料集。表格依 KLD 平均值和 99% 排名,在 RTX 3090 上 TG/s 最高達 143。