🦙Reddit r/LocalLLaMA•最新收集於 8m
Perplexity 開源 Lily Mac 推理伺服器

#mac-inference#model-serving#githubperplexity-lilyperplexitylilyqwen 3.6apple silicon
💡評估 Perplexity 為 Mac Qwen 推理打造的專用開源高效方案。
⚡ 30-Second TL;DR
有什麼變化
原始碼位於 Perplexity 的 pplx-garden 儲存庫之 lily 目錄。
為什麼重要
Lily 可能降低希望在 Mac 上建立專用本地 Qwen 服務堆疊的開發者門檻。其單一模型設計或許能帶來更高效能,但對需要模型切換或廣泛執行環境相容性的團隊而言,實用性可能受限。
下一步行動
複製 pplx-garden 的 Lily 儲存庫,並在 Mac 上將其 Qwen 3.6 吞吐量與延遲,和目前的 llama.cpp 或 MLX 伺服器進行比較。
誰應關注:Developers & AI Engineers
關鍵要點
- •原始碼位於 Perplexity 的 pplx-garden 儲存庫之 lily 目錄。
- •Lily 專為 Mac 硬體與 Apple Silicon 推理而設計。
- •該伺服器主要針對 Qwen 3.6 最佳化,而非通用的多模型執行環境。
- •此發布為本地 AI 開發者提供另一個高效能 Mac 推理的開源選項。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 9 個來源。
🔑 增強重點摘要
- •Lily 是 Perplexity「混合運算 (Hybrid Compute)」功能的核心組件,該功能於 2026 年 9 月 1 日正式發布。
- •Lily 引擎採用了自定義的 Metal 核心,專門針對稀疏混合模型(如 Qwen3.6-35B-A3B)的不規則工作負載進行了架構優化。
- •系統整合了開源的「隱私閘 (Privacy Gate)」分類器,可在數據傳輸至雲端前自動檢測並過濾個人識別資訊 (PII)。
- •該架構支援自動任務路由,能根據任務性質即時判斷由本地 Lily 引擎處理或轉發至雲端前沿模型,無需使用者手動介入。
- •Lily 引擎支援跨裝置協作,允許使用者透過 iPhone 或 iPad 發起任務,並由處於開機狀態的 Mac 執行本地敏感數據處理。
📊 競品分析▸ Show
| 特性 | Perplexity Lily | Ollama | LM Studio |
|---|---|---|---|
| 核心定位 | 混合運算與隱私路由 | 通用本地推理 | 本地模型測試與開發 |
| 雲端整合 | 原生混合雲端路由 | 無 | 無 |
| 隱私保護 | 內建 PII 隱私閘 | 依賴外部工具 | 依賴外部工具 |
| 硬體最佳化 | Apple Silicon (Metal) | 通用 (llama.cpp) | 通用 (llama.cpp) |
🛠️ 技術深入
- 採用自定義 Metal 核心以最大化 Apple Silicon 的 GPU 效能。
- 專為稀疏混合模型 (Sparse Hybrid Models) 的動態計算路徑設計。
- 支援 24GB 以上統一記憶體配置,建議 32GB 以獲得最佳推理速度。
- 整合自動化編排器 (Orchestrator) 進行雲端與本地的負載平衡。
- 支援模型格式包含 Qwen3.6 系列及 Gemma 4 E4B。
🔮 前景展望AI analysis grounded in cited sources
本地推理將成為企業級 AI 隱私合規的標準配置。
透過 Lily 的隱私閘技術,企業能有效降低敏感數據外洩風險,進而提升對本地 AI 部署的信任度。
混合運算架構將顯著降低 AI 服務供應商的雲端運算成本。
將輕量級或敏感任務轉移至使用者終端執行,能大幅減少伺服器端的 GPU 負載與 API 請求費用。
⏳ 時間線
2026-02
發布 Perplexity Computer,標誌著公司進入本地化 AI 運算領域。
2026-09
正式推出 Hybrid Compute 功能與 Lily 推理引擎,並於 pplx-garden 開源相關技術。
📎 來源 (9)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。

