
Redis之父為DeepSeek V4打造Mac推理引擎
Redis之父親自開發專屬DeepSeek V4的推理引擎。此工具讓Mac電腦能本地運行該模型。它為Apple硬體帶來高效本地LLM推理。
Tag: #local-llm172 results

Redis之父親自開發專屬DeepSeek V4的推理引擎。此工具讓Mac電腦能本地運行該模型。它為Apple硬體帶來高效本地LLM推理。

Luce DFlash 是 DFlash 推測解碼的 GGUF 移植版,針對 Qwen3.6-27B,在單張 RTX 3090 上實現高達 2 倍吞吐量,使用基於 ggml 的獨立 C++/CUDA 堆疊。支援 256K 上下文,具 KV 快取壓縮與滑動視窗注意力,在程式碼/數學任務上基準測試達 1.98 倍平均加速。部署簡單,只需 CMake 建置與 Hugging Face 下載,並提供 OpenAI 相容伺服。

使用者以 Unsloth 在雙 3090 上成功用 Qwen3.6-35B/27B 進行 vibe-coding 全棧 Rust 應用。8 小時僅耗電 <$4,對比 Claude API 的 $142。重度使用下硬體回本僅數週。
一名使用者在翻譯中國小說時發現,本地 Gemma 4 31B 勝過退化中的雲端模型如 GPT-5.3 和 Gemini,能維持角色名稱一致性且無審查。封閉模型在更新後出現錯誤與過濾,而 Gemma 提供自然且快速的結果。

llama.cpp 的 llama-server 現支援使用 Gemma-4 E2A 和 E4A 模型進行語音轉文字 (STT)。此更新為本地 LLM 伺服器帶來音訊處理功能。在 r/LocalLLaMA 上發布,附有預覽圖片。

MiniMax 的 Yuan 宣布 M2.7 開放權重將於今日或明日發布。社群興奮,因其與 2.5 同參數,量化版本適合本地運行。盼無延遲,或成最佳本地模型。
Gemma 4 26b A3B 在 RTX 3090 上使用 unsloth q3k_m 量化達到 80-110 令牌/秒且工具呼叫完美。透過 Ollama CPP 與 flash attention 處理 260k 上下文。代理編碼品質媲美 Claude Sonnet,並優於 Perplexity 搜尋。
Nous Research 的 Hermes agent 提供優異的本地模型支援,特別是針對 30B 模型的每個模型工具呼叫解析器。它具備一鍵安裝、多種後端如 Ollama 和 vLLM,以及透過 Honcho 的自我改進技能。v0.6.0 新增多實例設定;22k 星,MIT 授權。

Tiiny AI Pocket Lab外接盒5小時Kickstarter破百萬美元,至今295萬2093支持者,售1399美元起;解決本地100B LLM隱私易用需求,非AI PC或樹莓派替代。基於上交PowerInfer開源引擎。

Qwen3.6-Plus 在 qwen.ai 的新部落格文章中宣布。Chujie Zheng 在 X 上分享細節,並由 /u/Nunki08 發佈至 Reddit r/LocalLLaMA。