🦙Reddit r/LocalLLaMA•最新收集於 10h
Qwen3.8-Flash-Next 重塑高效長上下文 AI

#long-context#ngram-embedding#mixture-of-expertsqwen3.8-flash-nextqwen3.8-flash-nextqwen
💡Qwen 的全新開放權重架構,主打降低長上下文延遲並改善記憶體受限加速器上的擴展性。
⚡ 30-Second TL;DR
有什麼變化
以在微區塊上運作的 Qwen Sparse Attention 取代 token 級稀疏選擇,預算最高為 512 個區塊或 2,048 個 token。
為什麼重要
此架構的重點在於實際推理效率,而不只是最大化稠密模型規模。區塊級稀疏注意力與適合卸載的 embedding,可能有助於在受限加速器上運行需要長上下文的代理應用。
下一步行動
在目標加速器上執行 Qwen3.8-Flash-Next,並在 128K 或更長上下文下,將區塊級稀疏注意力延遲與目前的 Qwen 部署比較。
誰應關注:Developers & AI Engineers
關鍵要點
- •以在微區塊上運作的 Qwen Sparse Attention 取代 token 級稀疏選擇,預算最高為 512 個區塊或 2,048 個 token。
- •在擴寬的殘差串流中加入閘控殘差,使用資料依賴的讀取閘與每分支純量寫入閘。
- •加入 510 億參數的雙元與三元 n-gram embedding,提供比增加 MoE 容量更適合卸載的擴展路徑。
- •語言模型總計 1,250 億參數、每次啟用 60 億參數,另含單層多步預測頭與原生 262,144 token 上下文長度。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 13 個來源。
🔑 增強重點摘要
- •Qwen3.8-Flash-Next 作為 Qwen4 系列的實驗性架構預覽,旨在驗證新一代模型設計的可行性。
- •該模型總磁碟佔用空間為 1800 億參數,其中包含 510 億參數的 N-gram 嵌入表與 40 億參數的多步預測模組。
- •透過 YaRN (Yet another RoPE for Transformers) 技術,原生 262,144 token 的上下文長度可進一步擴展至 1,000,000 token。
- •訓練成本僅為前代 Qwen3.7-Plus 的九分之一,同時在程式編寫與辦公自動化任務中表現更優。
- •模型支援將 N-gram 嵌入表卸載至系統 RAM 或 SSD,使得在具備 75GB 以上記憶體的消費級硬體上運行成為可能。
📊 競品分析▸ Show
| 特性 | Qwen3.8-Flash-Next | Claude 4.6 Opus | DeepSeek-V4-Flash |
|---|---|---|---|
| 架構 | MoE (6B 啟用) | 閉源 | MoE |
| 上下文長度 | 262k (可擴至 1M) | 200k+ | 128k+ |
| 部署優勢 | 支援 N-gram 卸載 | 雲端 API | 高效能推理 |
| 定位 | 極致成本效益 | 頂尖推理能力 | 高性價比 |
🛠️ 技術深入
- 採用 Gated DeltaNet (GDN) 進行歷史資訊壓縮,提升長上下文處理效率。
- 殘差串流擴展為四個平行分支,透過資料依賴讀取閘與每分支純量寫入閘進行動態控制。
- N-gram 嵌入表包含 2000 萬個條目,專為記憶體受限環境下的卸載優化設計。
- 整合單層多步預測頭 (Multi-token Prediction Head),提升生成吞吐量與邏輯連貫性。
- 支援 vLLM 與 Unsloth 等主流推理框架的零時差部署。
🔮 前景展望AI analysis grounded in cited sources
N-gram 嵌入技術將成為大型模型降低 VRAM 依賴的主流方案。
該模型證明了將龐大嵌入表卸載至系統記憶體而不顯著犧牲推理速度的可行性。
Qwen4 系列將全面採用 Gated Residual 與 Gated DeltaNet 架構。
Qwen3.8-Flash-Next 作為架構預覽,其核心組件已展現出優於傳統 Transformer 的訓練效率與穩定性。
⏳ 時間線
2026-08
發布 Qwen3.8-Flash-Next 並於 Hugging Face 與 ModelScope 開源
📎 來源 (13)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗
每週 AI 簡報
每週一封,可隨時退訂。
