🦙Reddit r/LocalLLaMA•較早收集於 3h
Qwen3.6 35B-A3B 在 780M iGPU 上運行迅捷
💡35B MoE 在筆電 iGPU 達 282 t/s—本地推論遊戲規則改變者(28字)
⚡ 30-Second TL;DR
有什麼變化
Vulkan 下 1024 提示長度達 282.40 pp/s
為什麼重要
證明 35B MoE 模型可在筆電 iGPU 上運行,降低本地 AI 實驗門檻。提升 AMD 硬體在 LLM 推論的採用率。
下一步行動
使用 llama.cpp Vulkan 在你的 AMD iGPU 上基準測試 Qwen3.6-35B-A3B Q6_K。
誰應關注:Developers & AI Engineers
關鍵要點
- •Vulkan 下 1024 提示長度達 282.40 pp/s
- •128 令牌生成達 20.74 tg/s
- •64GB DDR5 RAM 下 Radeon 780M 運行 Q6_K
- •llama.cpp master 建置,ngl=99 層卸載
- •需調整 GTT 與 hang timeout 核心參數
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Qwen3.6 35B-A3B 採用了先進的稀疏混合專家(MoE)架構,其「A3B」設計意指在 35B 總參數中,每個 Token 僅激活約 3B 參數,這大幅降低了對 VRAM 的頻寬需求,使其能在 iGPU 上實現高推理速度。
- •AMD Radeon 780M 作為 RDNA 3 架構的整合式顯示晶片,透過 llama.cpp 的 Vulkan 後端,成功繞過了傳統 CUDA 生態系的限制,證明了跨平台 API 在邊緣運算(Edge AI)中的普及潛力。
- •該效能表現高度依賴系統記憶體(RAM)的頻寬,ThinkPad T14 Gen 5 配置的 DDR5 記憶體對於維持 20 tg/s 的生成速度至關重要,若使用較慢的 DDR4 記憶體,效能將會顯著衰減。
📊 競品分析▸ Show
| 模型/架構 | 參數規模 | 推理架構 | 邊緣運算優勢 |
|---|---|---|---|
| Qwen3.6 35B-A3B | 35B (MoE) | 稀疏激活 (3B) | 極高,適合 iGPU |
| Llama 3.2 11B | 11B (Dense) | 稠密計算 | 中等,需較多 VRAM |
| Mistral NeMo 12B | 12B (Dense) | 稠密計算 | 中等,記憶體佔用穩定 |
🛠️ 技術深入
- 架構特性:Qwen3.6 35B-A3B 屬於 MoE 模型,透過動態路由機制,在保持 35B 參數知識容量的同時,將計算複雜度控制在 3B 參數等級。
- Vulkan 實作:利用
llama.cpp的 Vulkan 支援,將模型權重卸載至 iGPU 的共享記憶體空間,透過調整 GTT (Graphics Translation Table) 大小來避免記憶體溢位。 - 核心參數調優:為了在 Linux 環境下穩定運行,必須調整
amdgpu.gttsize以擴大 GPU 可存取的系統記憶體範圍,並透過amdgpu.lockup_timeout防止高負載下的驅動程式逾時掛起。
🔮 前景展望AI analysis grounded in cited sources
輕量化 MoE 模型將成為筆記型電腦 AI 推理的主流標準。
隨著 iGPU 效能提升與記憶體頻寬增加,稀疏模型能以極低的功耗提供接近雲端模型的智慧能力。
AMD 的 ROCm 與 Vulkan 生態系將在開源 AI 社群中取得顯著市佔。
開發者對於擺脫 NVIDIA CUDA 依賴的需求,正推動跨平台推理框架的快速成熟。
⏳ 時間線
2025-09
阿里雲發布 Qwen3 系列模型,引入更高效的 MoE 架構。
2026-01
llama.cpp 針對 Vulkan 後端進行重大優化,提升對 AMD iGPU 的支援度。
2026-03
Qwen3.6 版本釋出,進一步優化了 35B-A3B 等中型 MoE 模型的推理效率。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗