
Gemma 4 26B 在 262k 上下文表現出色
使用者測試顯示 Gemma 4 26B A4B 使用 llama.cpp 和 Unsloth GGUF,在 262k 上下文的 94% 維持連貫性。它能準確處理如除錯 NVIDIA SMI 腳本的複雜任務。高上下文優化設定防止循環。
Tag: #local-inference187 results

使用者測試顯示 Gemma 4 26B A4B 使用 llama.cpp 和 Unsloth GGUF,在 262k 上下文的 94% 維持連貫性。它能準確處理如除錯 NVIDIA SMI 腳本的複雜任務。高上下文優化設定防止循環。

在 Qwen3.5-9B 基礎上訓練的 LoRA 適配器實現 89.7% 工作流程無干預完成率,對比基礎模型的 0%。它能在 29 個 Kaggle 資料集上自主規劃、執行 Python、視覺化和摘要。權重和推理框架已開源,可在 6-22GB VRAM 上本地運行。
使用 llama-bench 以 Q4_K_M 量化,在 MacBook Air M5 32GB 上全面基準測試 37 款 LLM。強調 MoE 模型如 Qwen 3.5 35B-A3B 達 31 tok/s 為頂尖效能。分享開源工具供社群硬體基準測試。
Gemma-4-26B-A4B-IT-UD-IQ4_XS 在 32GB M5 MacBook Air 上達 300 t/s PP 及 12 t/s 生成,功耗 8W,保持涼爽安靜。用戶報告提示處理比 M1 Max 快 25%,Opencode 代理編碼電池續航 6 小時。本地使用能力強,但比 Claude 等閉源模型需更多引導。

AnythingLLM 的 Tim 測試了 Bonsai 8B 模型,在 M4 Max MacBook Pro 上用於聊天、文件摘要、工具呼叫等任務表現出色,記憶體使用低。比之前的 MSFT BitNet 等 1 位元模型優秀,體積小 14 倍。需要特殊 llama.cpp fork 支援。

llama.cpp 的新 3.5 位元量化格式 TQ3_1S 在 Qwen3.5-27B 上達到接近 Q4_0 的困惑度,體積小 10% 僅 12.9GB。它讓 16GB RTX 5060 Ti 能完整載入 GPU。格式採用 Walsh-Hadamard 旋轉、8 質心量化及雙半區塊尺度,並支援 CUDA。

Ollama 現支援 MLX,在 Apple Silicon Mac 上執行本地 AI 模型更快。此更新優化統一記憶體使用,大幅加速推理效能。
AIfred Intelligence 在審判多代理模式下,對9款模型(80B-235B)進行「狗 vs 貓」辯論基準測試。Qwen3-Next-80B-A3B 僅3B活躍參數,即匹配235B品質且速度快3倍。硬體使用4張GPU共120GB VRAM搭配llama.cpp。

研究人員使用 Google 的 TurboQuant 壓縮方法修補 llama.cpp,在基礎 M4 MacBook Air (16GB) 上運行 Qwen 3.5-9B,支援 20k 令牌上下文。這使得在 Mac Mini 等平價硬體上進行大上下文推論成為可能。MacOS 開源應用程式可在 atomic.chat 下載。
Vera 是一款專為 AI 代理設計的本地優先程式碼索引與搜尋工具,使用 Rust 建置並支援 ONNX 與 63 種語言。它結合 BM25、向量搜尋及交叉編碼器重新排序,提供卓越的擷取準確度。完全嵌入式使用 SQLite 儲存,只需單一二進位檔案且無依賴。