
Redis之父為DeepSeek V4打造Mac推理引擎
Redis之父親自開發專屬DeepSeek V4的推理引擎。此工具讓Mac電腦能本地運行該模型。它為Apple硬體帶來高效本地LLM推理。
Tag: #apple-silicon187 results

Redis之父親自開發專屬DeepSeek V4的推理引擎。此工具讓Mac電腦能本地運行該模型。它為Apple硬體帶來高效本地LLM推理。

Phosphene 是開源桌面應用,封裝 Lightricks 的 LTX 2.3 模型,使用 MLX 框架在 Apple Silicon 上原生生成視訊與同步音訊。支援文字轉視訊、圖像轉視訊、畫格插值、延伸及 Gemma 3 提示重寫。依 Mac 記憶體提供階層化品質。

蘋果對其 Mac 的強勁 AI 驅動需求感到驚訝。公司預計 Mac mini、Studio 和 Neo 在下季度仍將供應受限。
獨立創辦人推出 Spiral,使用 INT3 模型壓縮(+0.14 nats)和 2-bit KV 快取,搭配 Apple M 系列的自訂融合 Metal 核心。Qwen 7B 預覽版可透過 brew 安裝。未來將支援 Triton GPU 核心並推出更多 100B 以下模型。
使用 llama-bench 以 Q4_K_M 量化,在 MacBook Air M5 32GB 上全面基準測試 37 款 LLM。強調 MoE 模型如 Qwen 3.5 35B-A3B 達 31 tok/s 為頂尖效能。分享開源工具供社群硬體基準測試。
Gemma-4-26B-A4B-IT-UD-IQ4_XS 在 32GB M5 MacBook Air 上達 300 t/s PP 及 12 t/s 生成,功耗 8W,保持涼爽安靜。用戶報告提示處理比 M1 Max 快 25%,Opencode 代理編碼電池續航 6 小時。本地使用能力強,但比 Claude 等閉源模型需更多引導。

SentrySearch CLI 使用本地 Qwen3-VL 嵌入,對原始影片進行語義搜尋,無需 API 或轉錄。它將影片索引至 ChromaDB 並自動裁剪匹配片段。8B 模型需 18GB RAM,2B 需 6GB,已在 Apple Silicon 和 CUDA 上測試。
經 36 項 autoresearch 實驗,將 Qwen3.5-397B 在 M5 Max 128GB 上推至 20.34 tok/s 解碼,透過 flash-moe 最佳化。關鍵提升來自 IO 執行緒、專家預測及 Q3-GGUF 量化,儘管 209GB 模型從 SSD 串流。建基於 Dan Woods 及 Anemll 工作,新增 Metal 層級調整。
TurboQuant KV 快取壓縮已在 MLX 上實作,使用自訂 Metal 核心於 Qwen2.5-32B。於 M4 Pro 48GB 達成 4.6 倍壓縮與 98% FP16 速度,將 16K 上下文快取從 4.2GB 減至 897MB,品質相同。提供完整文章、程式碼與 MLX-LM PR。

研究人員使用 Google 的 TurboQuant 壓縮方法修補 llama.cpp,在基礎 M4 MacBook Air (16GB) 上運行 Qwen 3.5-9B,支援 20k 令牌上下文。這使得在 Mac Mini 等平價硬體上進行大上下文推論成為可能。MacOS 開源應用程式可在 atomic.chat 下載。