🦙最新收集於 4h

Qwen3.8-Flash-Next 達成每秒 181 Token

Qwen3.8-Flash-Next 達成每秒 181 Token
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#inference-serving#speculative-decoding#kv-cache#agent-infrastructureqwen3.8-flash-nextqwen3.8-flash-nextnvidia dgx sparkvllmllama-swapconnectx-7

💡了解兩台 DGX Spark 如何為 512K 上下文代理叢集維持每秒 181 Token 的總吞吐量。

⚡ 30-Second TL;DR

有什麼變化

兩個 DGX Spark 節點達到每秒 181 Token 的總吞吐量,單一串流速度則為每秒 30–50 Token。

為什麼重要

這份報告顯示,只要仔細調校記憶體存取與排程,相對緊湊的統一記憶體 AI 系統也能服務高並行代理工作負載。不過,標題中的吞吐量是總量而非單一使用者延遲,而且來自特殊化且由作者自行回報的配置。

下一步行動

在考慮將模型表映射至 NVMe 前,先為自己的 vLLM 部署測試前綴快取、MTP 推測解碼與固定 KV 快取預算。

誰應關注:Developers & AI Engineers

關鍵要點

  • 兩個 DGX Spark 節點達到每秒 181 Token 的總吞吐量,單一串流速度則為每秒 30–50 Token。
  • 模型以延伸至 512K 的上下文運行,KV 快取池可容納 289 萬個 Token。
  • 將 n-gram 嵌入映射至 NVMe、使用 MADV_RANDOM、64 個 gather 執行緒及前綴快取,是主要效能優化。
  • 部署採用 200 Gb RoCE 的 TP=2、三 Token 的 MTP 推測解碼,以及 vLLM。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 10 個來源。

🔑 增強重點摘要

  • Qwen3.8-Flash-Next 作為 Qwen4 架構的實驗性預覽版,採用了混合專家模型 (MoE) 架構。
  • 模型總參數規模為 125B,並額外配置了 51B 參數的 N-gram 嵌入表,推理時每 Token 僅激活 6B 參數。
  • 引入了 Gated DeltaNet (GDN) 與 Qwen Sparse Attention (QSA) 混合機制,以壓縮歷史狀態並降低長上下文延遲。
  • 在 SWE-bench Pro 代理編碼基準測試中取得 62.5 分,超越多款更大規模的頂級模型。
  • 相比前代 Qwen3.7-Plus,訓練成本大幅降低至原來的 1/9,同時在程式設計與辦公任務表現更佳。
📊 競品分析▸ Show
特性Qwen3.8-Flash-NextLlama 4-120B (預估)Claude 3.5 Opus
架構MoE (6B 激活)Dense/MoE專有架構
上下文262K (可擴展至 1M)128K-256K200K
代理能力強 (SWE-bench 62.5)中等
部署方式本地/雲端混合本地/雲端僅雲端

🛠️ 技術深入

  • 採用 Gated DeltaNet (GDN) 技術,將長歷史序列壓縮為循環狀態以節省記憶體。
  • 實作 Qwen Sparse Attention (QSA),透過微區塊 (micro-block) 層級處理長上下文。
  • 支援 51B 參數的 N-gram 嵌入表,可透過非同步預取技術卸載至 NVMe 儲存空間。
  • 基礎上下文長度為 262,144 個 Token,並支援透過 YaRN 擴展至 1,000,000 個 Token。
  • 採用 MTP (Multi-Token Prediction) 推測解碼,每步預測三個 Token 以提升吞吐量。

🔮 前景展望AI analysis grounded in cited sources

MoE 架構將成為本地部署長上下文模型的標準。
Qwen3.8-Flash-Next 證明了透過極低的激活參數比例 (6B/125B) 即可在消費級或小型叢集上實現高效能推理。
NVMe 嵌入映射技術將消除記憶體容量對模型規模的限制。
將 51B 參數的嵌入表卸載至 NVMe 的成功實作,為在有限 VRAM 環境下運行超大規模模型提供了路徑。

時間線

2026-08-26
Qwen3.8-Flash-Next 作為 Qwen4 架構預覽版正式發布。
2026-08-29
社群於 r/LocalLLaMA 報告在 DGX Spark 叢集上達成 181 Token/s 的效能里程碑。

📎 來源 (10)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. reddit.com
  2. qwen.ai
  3. reddit.com
  4. huggingface.co
  5. github.com
  6. nvidia.com
  7. ollama.com
  8. datacamp.com
  9. datacamp.com
  10. huggingface.co
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。