🦙Reddit r/LocalLLaMA•最新收集於 4h
Qwen3.8-Flash-Next 達成每秒 181 Token

#inference-serving#speculative-decoding#kv-cache#agent-infrastructureqwen3.8-flash-nextqwen3.8-flash-nextnvidia dgx sparkvllmllama-swapconnectx-7
💡了解兩台 DGX Spark 如何為 512K 上下文代理叢集維持每秒 181 Token 的總吞吐量。
⚡ 30-Second TL;DR
有什麼變化
兩個 DGX Spark 節點達到每秒 181 Token 的總吞吐量,單一串流速度則為每秒 30–50 Token。
為什麼重要
這份報告顯示,只要仔細調校記憶體存取與排程,相對緊湊的統一記憶體 AI 系統也能服務高並行代理工作負載。不過,標題中的吞吐量是總量而非單一使用者延遲,而且來自特殊化且由作者自行回報的配置。
下一步行動
在考慮將模型表映射至 NVMe 前,先為自己的 vLLM 部署測試前綴快取、MTP 推測解碼與固定 KV 快取預算。
誰應關注:Developers & AI Engineers
關鍵要點
- •兩個 DGX Spark 節點達到每秒 181 Token 的總吞吐量,單一串流速度則為每秒 30–50 Token。
- •模型以延伸至 512K 的上下文運行,KV 快取池可容納 289 萬個 Token。
- •將 n-gram 嵌入映射至 NVMe、使用 MADV_RANDOM、64 個 gather 執行緒及前綴快取,是主要效能優化。
- •部署採用 200 Gb RoCE 的 TP=2、三 Token 的 MTP 推測解碼,以及 vLLM。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 10 個來源。
🔑 增強重點摘要
- •Qwen3.8-Flash-Next 作為 Qwen4 架構的實驗性預覽版,採用了混合專家模型 (MoE) 架構。
- •模型總參數規模為 125B,並額外配置了 51B 參數的 N-gram 嵌入表,推理時每 Token 僅激活 6B 參數。
- •引入了 Gated DeltaNet (GDN) 與 Qwen Sparse Attention (QSA) 混合機制,以壓縮歷史狀態並降低長上下文延遲。
- •在 SWE-bench Pro 代理編碼基準測試中取得 62.5 分,超越多款更大規模的頂級模型。
- •相比前代 Qwen3.7-Plus,訓練成本大幅降低至原來的 1/9,同時在程式設計與辦公任務表現更佳。
📊 競品分析▸ Show
| 特性 | Qwen3.8-Flash-Next | Llama 4-120B (預估) | Claude 3.5 Opus |
|---|---|---|---|
| 架構 | MoE (6B 激活) | Dense/MoE | 專有架構 |
| 上下文 | 262K (可擴展至 1M) | 128K-256K | 200K |
| 代理能力 | 強 (SWE-bench 62.5) | 中等 | 強 |
| 部署方式 | 本地/雲端混合 | 本地/雲端 | 僅雲端 |
🛠️ 技術深入
- 採用 Gated DeltaNet (GDN) 技術,將長歷史序列壓縮為循環狀態以節省記憶體。
- 實作 Qwen Sparse Attention (QSA),透過微區塊 (micro-block) 層級處理長上下文。
- 支援 51B 參數的 N-gram 嵌入表,可透過非同步預取技術卸載至 NVMe 儲存空間。
- 基礎上下文長度為 262,144 個 Token,並支援透過 YaRN 擴展至 1,000,000 個 Token。
- 採用 MTP (Multi-Token Prediction) 推測解碼,每步預測三個 Token 以提升吞吐量。
🔮 前景展望AI analysis grounded in cited sources
MoE 架構將成為本地部署長上下文模型的標準。
Qwen3.8-Flash-Next 證明了透過極低的激活參數比例 (6B/125B) 即可在消費級或小型叢集上實現高效能推理。
NVMe 嵌入映射技術將消除記憶體容量對模型規模的限制。
將 51B 參數的嵌入表卸載至 NVMe 的成功實作,為在有限 VRAM 環境下運行超大規模模型提供了路徑。
⏳ 時間線
2026-08-26
Qwen3.8-Flash-Next 作為 Qwen4 架構預覽版正式發布。
2026-08-29
社群於 r/LocalLLaMA 報告在 DGX Spark 叢集上達成 181 Token/s 的效能里程碑。
📎 來源 (10)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。


