提升 Gemma 4 視覺效能:提高 token 預算
Gemma 4 的預設視覺預算過低(280 token),影響 OCR 和細節辨識。在 llama.cpp 中設定 --image-min-tokens 560 和 --image-max-tokens 2240,即可達到 SOTA 視覺效能。需將 --batch-size 提高至 4096,雖耗更多 VRAM,但 OCR 表現優於競爭對手。
Tag: #llama-cpp14 results
Gemma 4 的預設視覺預算過低(280 token),影響 OCR 和細節辨識。在 llama.cpp 中設定 --image-min-tokens 560 和 --image-max-tokens 2240,即可達到 SOTA 視覺效能。需將 --batch-size 提高至 4096,雖耗更多 VRAM,但 OCR 表現優於競爭對手。
基準測試顯示 --n-cpu-moe 20 旗標在 16GB GPU 上將 Qwen3.6-35B-A3B 速度提升 54%,優化 MoE 層 VRAM 使用。在消費級硬體上達 79 t/s 生成與 128K 上下文。提供完整 llama.cpp 指令與 VRAM 調校指南。
Unsloth 發布更新版 Gemma 4 GGUF 模型(2B 和 27B),回應 llama.cpp 最新拉取請求。關鍵修復包括異質 iSWA 的 KV-cache、CUDA 緩衝區重疊檢查,以及 Gemma 4 專屬 tokenizer 和 parser 改進。提供 Hugging Face 儲存庫連結。
教學分享使用 MTP GGUF Qwen3.6-27B 在 RTX 3090 上達 50 令牌/秒,搭配 llama.cpp PR #22673 及 100k 上下文。提供精確伺服器指令,使用 Q4 快取、spec-type mtp 及最佳化。提及 MAC 版 mtplx 支援。
使用者在 Devstral small 以 llama.cpp 推測解碼獲 665% 加速 (--spec-type ngram-map-k, ngram-size 24)。依模型而異:Gemma 2 倍、Qwen 3.6 初僅 40%,調整後達 140%。編輯新增重複懲罰與 ngram-mod 改善。
詳細指南使用 llama.cpp 以 Qwen3.5 27B 完全離線運行 Claude Code CLI,包括停用遙測的環境設定和伺服器參數。分享 7 個編碼任務結果,顯示高上下文時速度下降及壓縮問題。
DeepSeekOCR 和 codefuse-ai/F2LLM-v2 模型現已支援 llama.cpp。DeepSeekOCR 需要 b8530 版本,F2LLM-v2 需要 b8526 版本。使用者尋求特徵提取與嵌入模型的使用指導。

Strix Halo(Ryzen AI Max+ 395)基準測試 Minimax M2.5、Step 3.5 Flash、Qwen3-Coder-Next、GLM 4.6V/4.7 Flash 的量化版本,於 30k 上下文下運行。使用 llama.cpp 於 ROCm 7.2,配備 128GB RAM。可依需求測試更多模型。
用戶發現Nemotron 3 Super將自身推理視為用戶輸入,在llama-server搭配Aider中造成無限循環。即使無--special旗標,問題仍存,使用--jinja。範例顯示8k token的元遞迴思考。
使用 llama.cpp 和 OpenCode 測試老舊 Titan X Pascal GPU 於本地 AI 任務。達成 500 令牌/秒提示處理及 25 令牌/秒生成速度,生成速度為 AMD 9070 XT 一半但相當競爭。證明舊硬體仍適用推論。