🦙較早收集於 62m

Qwen 0.8B 在 7 年老 S10E 上以 12 令牌/秒運行

Qwen 0.8B 在 7 年老 S10E 上以 12 令牌/秒運行
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡微型 Qwen 0.8B 在 7 年老手機達 12 令牌/秒—邊緣 AI 適用舊硬體。(48字)

⚡ 30-Second TL;DR

有什麼變化

Qwen 推出 0.8B 模型

為什麼重要

證明顯微型 LLM 適用於行動/邊緣 AI,降低硬體門檻,支持注重隱私的裝置上推理應用。

下一步行動

在你的 Android 手機 Termux 中使用 llama.cpp 編譯 Qwen3.5-0.8B。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen 推出 0.8B 模型
  • 在 Samsung S10E 上以 12 令牌/秒運行
  • 使用 llama.cpp 和 Termux 修復 C 函式庫
  • 能處理對話和嚴肅任務

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 4 個來源。

🔑 增強重點摘要

  • Qwen3.5-0.8B 是 Qwen 3.5 系列中最小的原生多模態模型,能處理文字、圖像和影片。[1]
  • 模型支援 262K 上下文長度、201 種語言,並採用多令牌預測訓練,Apache 2.0 授權,BF16 需約 1.6GB VRAM,四位元量化僅需 0.5GB。[1]
  • 在 MathVista 得分 62.2、OCRBench 74.5、VideoMME 63.8(含字幕),適合手機應用、嵌入式系統和 Raspberry Pi 等資源受限裝置。[1]

🛠️ 技術深入

  • 0.8B 密集模型,與 2B 共享 24 層堆疊,但隱藏維度減半(1,024 vs 2,048),FFN 較小(3,584 vs 6,144)。[1]
  • 注意力架構相同,包括相同頭維度及 3:1 DeltaNet 對注意力比例。[1]
  • 訓練使用多令牌預測(MTP)和強到弱蒸餾,非思考模式(預設)。[1]
  • 語言基準(非思考模式):MMLU-Pro 29.7、MMLU-Redux 48.5、C-Eval 46.4、SuperGPQA 16.9、IFEval 52.1、MMMLU 34.1。[1]

🔮 前景展望AI analysis grounded in cited sources

邊緣 AI 應用將從 7B 模型轉向 0.8B 多模態模型
一年前提議需 7B 模型與嚴重 GPU,現 0.8B 僅需少量記憶體即可處理截圖、文件及基本影片理解。[1]
IoT 和手機部署將廣泛採用 Qwen3.5-0.8B
其低 VRAM 需求(四位元 0.5GB)和多模態能力適合每 MB 都重要的裝置,如 Raspberry Pi 和嵌入式系統。[1]

時間線

2026-03
Qwen 發布 Qwen3.5-0.8B 模型,原生多模態支援文字圖像影片

📎 來源 (4)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. awesomeagents.ai — Qwen 3 5 0 8b
  2. unsloth.ai — Qwen3
  3. llm-stats.com — Qwen 2.5 Coder 32b Instruct vs Qwen3 32b
  4. ollama.com — Qwen3.5:0
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。