🦙較早收集於 3h

Qwen3.6 35B-A3B 在 780M iGPU 上運行迅捷

PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡35B MoE 在筆電 iGPU 達 282 t/s—本地推論遊戲規則改變者(28字)

⚡ 30-Second TL;DR

有什麼變化

Vulkan 下 1024 提示長度達 282.40 pp/s

為什麼重要

證明 35B MoE 模型可在筆電 iGPU 上運行,降低本地 AI 實驗門檻。提升 AMD 硬體在 LLM 推論的採用率。

下一步行動

使用 llama.cpp Vulkan 在你的 AMD iGPU 上基準測試 Qwen3.6-35B-A3B Q6_K。

誰應關注:Developers & AI Engineers

關鍵要點

  • Vulkan 下 1024 提示長度達 282.40 pp/s
  • 128 令牌生成達 20.74 tg/s
  • 64GB DDR5 RAM 下 Radeon 780M 運行 Q6_K
  • llama.cpp master 建置,ngl=99 層卸載
  • 需調整 GTT 與 hang timeout 核心參數

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Qwen3.6 35B-A3B 採用了先進的稀疏混合專家(MoE)架構,其「A3B」設計意指在 35B 總參數中,每個 Token 僅激活約 3B 參數,這大幅降低了對 VRAM 的頻寬需求,使其能在 iGPU 上實現高推理速度。
  • AMD Radeon 780M 作為 RDNA 3 架構的整合式顯示晶片,透過 llama.cpp 的 Vulkan 後端,成功繞過了傳統 CUDA 生態系的限制,證明了跨平台 API 在邊緣運算(Edge AI)中的普及潛力。
  • 該效能表現高度依賴系統記憶體(RAM)的頻寬,ThinkPad T14 Gen 5 配置的 DDR5 記憶體對於維持 20 tg/s 的生成速度至關重要,若使用較慢的 DDR4 記憶體,效能將會顯著衰減。
📊 競品分析▸ Show
模型/架構參數規模推理架構邊緣運算優勢
Qwen3.6 35B-A3B35B (MoE)稀疏激活 (3B)極高,適合 iGPU
Llama 3.2 11B11B (Dense)稠密計算中等,需較多 VRAM
Mistral NeMo 12B12B (Dense)稠密計算中等,記憶體佔用穩定

🛠️ 技術深入

  • 架構特性:Qwen3.6 35B-A3B 屬於 MoE 模型,透過動態路由機制,在保持 35B 參數知識容量的同時,將計算複雜度控制在 3B 參數等級。
  • Vulkan 實作:利用 llama.cpp 的 Vulkan 支援,將模型權重卸載至 iGPU 的共享記憶體空間,透過調整 GTT (Graphics Translation Table) 大小來避免記憶體溢位。
  • 核心參數調優:為了在 Linux 環境下穩定運行,必須調整 amdgpu.gttsize 以擴大 GPU 可存取的系統記憶體範圍,並透過 amdgpu.lockup_timeout 防止高負載下的驅動程式逾時掛起。

🔮 前景展望AI analysis grounded in cited sources

輕量化 MoE 模型將成為筆記型電腦 AI 推理的主流標準。
隨著 iGPU 效能提升與記憶體頻寬增加,稀疏模型能以極低的功耗提供接近雲端模型的智慧能力。
AMD 的 ROCm 與 Vulkan 生態系將在開源 AI 社群中取得顯著市佔。
開發者對於擺脫 NVIDIA CUDA 依賴的需求,正推動跨平台推理框架的快速成熟。

時間線

2025-09
阿里雲發布 Qwen3 系列模型,引入更高效的 MoE 架構。
2026-01
llama.cpp 針對 Vulkan 後端進行重大優化,提升對 AMD iGPU 的支援度。
2026-03
Qwen3.6 版本釋出,進一步優化了 35B-A3B 等中型 MoE 模型的推理效率。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA