🦙較早收集於 22h

Qwen3.5-35B-A3B 在 Raspberry Pi 5 上運行

Qwen3.5-35B-A3B 在 Raspberry Pi 5 上運行
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#edge-computing#quantization#arm-inferenceqwen3.5-35b-a3bqwen3.5-35b-a3braspberry-pi-5llama.cpp

💡35B Qwen 在 Pi 5 達 3 t/s—邊緣 LLM 推論突破(24字)

⚡ 30-Second TL;DR

有什麼變化

Raspberry Pi 5 16GB 使用 2-bit 量化達 3+ 令牌/秒

為什麼重要

證明大型 LLM 在低功耗 ARM 硬體的可行性,為經濟邊緣 AI 部署開啟大門。

下一步行動

使用 llama.cpp 在您的 Pi 5 上複製 Qwen3.5-35B-A3B 2-bit 量化。

誰應關注:Developers & AI Engineers

關鍵要點

  • Raspberry Pi 5 16GB 使用 2-bit 量化達 3+ 令牌/秒
  • 8GB 版本儘管節流仍達 1.5+ 令牌/秒
  • 進行自訂 llama.cpp 與 KleidiAI 實驗
  • 速度媲美 4-bit Qwen3-4B-VL

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 5 個來源。

🔑 增強重點摘要

  • Qwen3.5-35B-A3B 採用混合架構整合線性注意力機制,為原生視覺語言模型,支持推理模式顯示逐步思考過程。
  • 在 Artificial Analysis Intelligence Index 上得分 37,高於同尺寸開源模型中位數 15,並以 173.6 令牌/秒輸出速度超越中位數 91.9 t/s。
  • 模型在語義 SQL 生成與代理任務表現突出,引發對更小 4B 變體的需求。
  • Ollama 庫已支援 qwen3.5:35b-a3b,方便本地部署多模態模型。

🛠️ 技術深入

  • Qwen3.5-35B-A3B 為 Mixture-of-Experts (MoE) 模型,總參數 35B 但推理時僅激活少數專家層(如 118 層提及),比 27B 密集模型更高效處理長上下文。
  • 支援推理功能,透過 OpenRouter API 使用 'reasoning' 參數顯示逐步思考,並保留 'reasoning_details' 以持續對話。
  • 全量化版本 VRAM 消耗低於 37GB,適合本地 GPU 部署如 A6000/A5000。
  • Artificial Analysis 測試生成 100M 令牌,遠高於平均 12M,展現高智能與速度。

🔮 前景展望AI analysis grounded in cited sources

邊緣設備上大型 MoE 模型將普及
Raspberry Pi 5 實現 3+ t/s 證明低功耗硬體可運行 35B 模型,結合 KleidiAI 等優化將擴大代理應用。
需求驅動 Qwen3.5 4B 變體發布
35B-A3B 在本地 AI 與 SQL 生成的突破性能已引發市場呼聲,更小模型可進一步降低部署門檻。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。