🦙較早收集於 3h

Qwen 3.5 2B 在 Android 上運行

Qwen 3.5 2B 在 Android 上運行
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#android#mobile-ai#on-device-inferenceqwen-3.5-2bqwen-3.5-2bchatteruipoco-f5snapdragon-7-gen-2

💡親測:Qwen 3.5 2B 在 Android 手機上—速度測試與提示(24字元)

⚡ 30-Second TL;DR

有什麼變化

ChatterUI v0.8.9-beta9 GitHub 發布支援 Qwen 3.5 2B

為什麼重要

推進行動裝置本機 AI,讓小型 LLM 無需雲端,從業人員受益。

下一步行動

從 GitHub 下載 ChatterUI v0.8.9-beta9,並在你的 Android 裝置上載入 Qwen 3.5 2B。

誰應關注:Developers & AI Engineers

關鍵要點

  • ChatterUI v0.8.9-beta9 GitHub 發布支援 Qwen 3.5 2B
  • 在 Poco F5 Snapdragon 7 Gen 2 硬體上測試
  • 比同尺寸模型慢,但低上下文表現尚可
  • 適合行動裝置 LLM 本機部署

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Qwen 3.5 系列包含多個模型變體,包括 27B 密集模型、35B-A3B MoE 模型(僅 3B 參數活躍)和 397B 旗艦模型,提供從行動裝置到伺服器級部署的靈活選項[2][3][5]
  • Qwen 3.5 35B-A3B 的 MoE 架構在消費級 GPU 上實現 60-100+ tokens/秒的推論速度,相比 27B 密集模型的 15-25 tokens/秒快 5 倍,使行動部署更加可行[2]
  • Qwen 3.5 於 2026 年 2 月 16 日發布,採用 Apache 2.0 開源授權,支援 201 種語言和原生視覺代理功能,推論成本約為 Claude 或 GPT 的十分之一[5]
  • Qwen 3.5 27B 密集模型在 SWE-bench Verified 上達到 72.4 分,與 GPT-5 mini 相當,證明架構和資料品質優化可超越單純的參數規模[3]
📊 競品分析▸ Show
功能Qwen 3.5 27BQwen 3.5 35B-A3BGPT-5 miniClaude Sonnet 4.5
推論速度 (RTX 3090)15-25 t/s60-100+ t/s未公開未公開
VRAM 需求 (Q4)16-18 GB20-22 GB未公開未公開
SWE-bench Verified72.4未公開72.4未公開
授權Apache 2.0Apache 2.0專有專有
API 成本$0.40/M tokens$0.40/M tokens更高更高
語言支援201201未公開未公開

🛠️ 技術深入

MoE 架構:Qwen 3.5 35B-A3B 使用混合專家路由,每個 token 僅啟動 3B 參數,總參數 35B,相比前代 Qwen3-235B-A22B(22B 活躍參數)性能提升[3]線性注意力層:採用線性注意力機制壓縮上下文為固定大小狀態,大幅降低 KV 快取記憶體需求,使 35B-A3B 能在消費級 GPU 上運行[3]上下文窗口:開源模型原生支援 262,144 tokens,可擴展至 1M+ tokens;託管 Qwen3.5-Plus 預設支援 1M tokens[4]量化支援:社群已測試 2-bit 和 3-bit 量化版本在消費級硬體上的可行性,保持可接受的品質[4]多模態能力:原生支援 MCP(Model Context Protocol)、搜尋和程式碼解釋器;GUI 代理功能在 AndroidWorld 達 66.8 分,ScreenSpot Pro 達 65.6 分[4]

🔮 前景展望AI analysis grounded in cited sources

行動 LLM 部署將成為主流應用場景
Qwen 3.5 MoE 架構在消費級硬體上實現邊界推論,結合 Apache 2.0 授權,降低了行動應用開發的技術和成本門檻。
開源模型將在成本敏感型生產環境中取代閉源 API
Qwen 3.5 在性能上與 GPT-5 mini 和 Claude Sonnet 4.5 相當,但 API 成本低 10-17 倍,自託管成本更低,激勵企業遷移至開源方案。
MoE 架構將成為大型語言模型的標準設計模式
Qwen 3.5 35B-A3B 用 3B 活躍參數超越前代 22B 活躍參數模型,證明 MoE 路由效率優於密集模型,預期推動業界採納。

時間線

2026-02
Qwen 3.5 系列發布(2026 年 2 月 16 日),包含 27B、35B-A3B、122B-A10B 和 397B 模型,採用 Apache 2.0 授權
2026-03
ChatterUI v0.8.9-beta9 發布支援 Qwen 3.5 2B 在 Android 裝置上運行,於 Poco F5 Snapdragon 7 Gen 2 硬體測試
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。