🦙Reddit r/LocalLLaMA•較早收集於 22h
Qwen3.5-35B-A3B 在 Raspberry Pi 5 上運行

#edge-computing#quantization#arm-inferenceqwen3.5-35b-a3bqwen3.5-35b-a3braspberry-pi-5llama.cpp
💡35B Qwen 在 Pi 5 達 3 t/s—邊緣 LLM 推論突破(24字)
⚡ 30-Second TL;DR
有什麼變化
Raspberry Pi 5 16GB 使用 2-bit 量化達 3+ 令牌/秒
為什麼重要
證明大型 LLM 在低功耗 ARM 硬體的可行性,為經濟邊緣 AI 部署開啟大門。
下一步行動
使用 llama.cpp 在您的 Pi 5 上複製 Qwen3.5-35B-A3B 2-bit 量化。
誰應關注:Developers & AI Engineers
關鍵要點
- •Raspberry Pi 5 16GB 使用 2-bit 量化達 3+ 令牌/秒
- •8GB 版本儘管節流仍達 1.5+ 令牌/秒
- •進行自訂 llama.cpp 與 KleidiAI 實驗
- •速度媲美 4-bit Qwen3-4B-VL
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 5 個來源。
🔑 增強重點摘要
- •Qwen3.5-35B-A3B 採用混合架構整合線性注意力機制,為原生視覺語言模型,支持推理模式顯示逐步思考過程。
- •在 Artificial Analysis Intelligence Index 上得分 37,高於同尺寸開源模型中位數 15,並以 173.6 令牌/秒輸出速度超越中位數 91.9 t/s。
- •模型在語義 SQL 生成與代理任務表現突出,引發對更小 4B 變體的需求。
- •Ollama 庫已支援 qwen3.5:35b-a3b,方便本地部署多模態模型。
🛠️ 技術深入
- •Qwen3.5-35B-A3B 為 Mixture-of-Experts (MoE) 模型,總參數 35B 但推理時僅激活少數專家層(如 118 層提及),比 27B 密集模型更高效處理長上下文。
- •支援推理功能,透過 OpenRouter API 使用 'reasoning' 參數顯示逐步思考,並保留 'reasoning_details' 以持續對話。
- •全量化版本 VRAM 消耗低於 37GB,適合本地 GPU 部署如 A6000/A5000。
- •Artificial Analysis 測試生成 100M 令牌,遠高於平均 12M,展現高智能與速度。
🔮 前景展望AI analysis grounded in cited sources
邊緣設備上大型 MoE 模型將普及
Raspberry Pi 5 實現 3+ t/s 證明低功耗硬體可運行 35B 模型,結合 KleidiAI 等優化將擴大代理應用。
需求驅動 Qwen3.5 4B 變體發布
35B-A3B 在本地 AI 與 SQL 生成的突破性能已引發市場呼聲,更小模型可進一步降低部署門檻。
📎 來源 (5)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
