🦙較早收集於 53m

Qwen3 9B 在 Android 手機上達 6+ token/s

Qwen3 9B 在 Android 手機上達 6+ token/s
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#mobile-inference#quantization#on-deviceqwen3-9bqwen3-9bsamsung-s25-ultrasnapdragon-8-elitehexagon-npu

💡9B LLM 手機達 6t/s—立即解鎖行動 AI(16字)

⚡ 30-Second TL;DR

有什麼變化

q4_0 在 S25 Ultra 12GB RAM 上運行

為什麼重要

顯示如 9B 等大型 LLM 在高端 Android 手機可行,實現無雲端依賴的邊緣 AI 應用。

下一步行動

將 Qwen3 9B 量化至 q4_0,並使用 llama.cpp 在你的 Android 裝置上基準測試。

誰應關注:Developers & AI Engineers

關鍵要點

  • q4_0 在 S25 Ultra 12GB RAM 上運行
  • 生成速度逾 6 token/s
  • 利用 Hexagon NPU 加速
  • 測試於 Snapdragon 8 Elite 晶片

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen3.5 小模型系列包括 0.8B、2B、4B 和 9B 版本,專為邊緣設備設計,支持多模態能力和架構優化。
  • Qwen3.5-9B 在基準測試中於文字辨識、文件理解和影片理解表現優於 gpt-oss-120b 和 gpt-oss-20b。
  • 2B 模型經 6-bit 量化可在 iPhone 上透過 MLX 加速順暢運行,適合離線行動應用。
📊 競品分析▸ Show
模型參數規模基準表現 (推理與編碼)行動裝置適用性
Qwen3.5-9B9B低於 Qwen3-30B-A3B高 (手機 NPU)
Qwen3.5-4B4B低於 Qwen3.5-9B高 (輕量代理)
gpt-oss-120b120B高於 Qwen3.5-9B
Gemini 2.5 Flash-Lite未明高於 Qwen3.5-9B (部分)中等

🛠️ 技術深入

  • Qwen3.5 小模型系列強調「更智能、計算更少」,9B 版本性能接近更大模型,支持 Apache 2.0 授權。
  • 在基準測試中,Qwen3.5-9B 上下文長度達 65,536 tokens,Q8 量化下 VRAM 使用約 15GB。
  • 4B 模型性能類似前代 80B A3B,適合輕量代理應用;2B 模型支援推理切換。

🔮 前景展望AI analysis grounded in cited sources

行動 AI 代理將廣泛部署於個人裝置
Qwen3.5 9B 在手機上達 6+ token/s 證明小模型性能足夠,支持本地化與去中心化部署。
邊緣計算需求將驅動 NPU 硬體升級
Hexagon NPU 加速顯示手機晶片優化將成為標準,解鎖離線複雜任務。

時間線

2026-03
Qwen3.5 小模型系列發布,包括 0.8B 至 9B 版本適用手機
2026-03-02
Qwen 官方分享基準測試,9B 模型在多模態任務領先
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。