🦙最新收集於 5h

DFlash 2 讓 Qwen 程式碼生成速度翻倍

DFlash 2 讓 Qwen 程式碼生成速度翻倍
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#speculative-decoding#livecodebench#throughputdflash-2dflash 2llama.cppqwen 3.8 27binco ai

💡真實程式碼基準測試顯示 2.26 倍加速,搭配適當 n-gram 草稿器更可達 4.68 倍。

⚡ 30-Second TL;DR

有什麼變化

DFlash 2 將 LiveCodeBench 吞吐量從每秒 67.97 個 token 提升至 153.91 個,增幅為 2.26 倍。

為什麼重要

DFlash 2 可能在不需要額外小型語言模型草稿器的情況下,大幅降低本地程式碼助理的推理延遲。結果也顯示推測解碼效能高度取決於工作負載,因此生產團隊應使用自身的提示分布進行基準測試,而非依賴合成測試的峰值。

下一步行動

建置 llama.cpp PR #27342,並在部署前使用真實程式碼提示測試 DFlash 2、草稿寬度 5,以及單一 ngram-map-k4v 表格的組合。

誰應關注:Developers & AI Engineers

關鍵要點

  • DFlash 2 將 LiveCodeBench 吞吐量從每秒 67.97 個 token 提升至 153.91 個,增幅為 2.26 倍。
  • DFlash 2 搭配一個 n-gram 查找表,在 18 輪程式設計建置階段達到 4.68 倍加速。
  • DFlash 2 的部署約需額外 2.7 GB VRAM。
  • 在 8K 程式碼提示上,草稿寬度 5 比建議的寬度 7 快約 11%。
  • 最高 8.47 倍的合成測試結果源自重複性基準測試異常,不應視為代表性數據。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 15 個來源。

🔑 增強重點摘要

  • DFlash 2 由 Inco AI 於 2026 年 8 月 18 日發布,旨在解決大型語言模型推論中的序列瓶頸問題。
  • 該技術引入了成對候選選擇器(Pairwise Candidate Selector)與雙抽頭動態卷積(Two-tap Dynamic Convolutions),有效緩解了草稿區塊末端的「後綴衰減」現象。
  • DFlash 2 具備無損解碼特性,在貪婪解碼模式下能確保輸出與目標模型完全一致,並在採樣過程中保留原始機率分佈。
  • 該技術已成功整合至 SGLang、vLLM 及 llama.cpp 等主流推論引擎中,擴展了其在不同開發環境下的適用性。
  • 儘管在程式碼生成與文件重現任務中表現卓越,但在推理密集型工作負載中,由於輸出預測難度較高,其加速效果會顯著下降。
📊 競品分析▸ Show
技術/產品核心機制基準測試增益適用場景
DFlash 2投機解碼 (草稿模型)2.26x - 3.4x程式碼生成、文件重現
Multi-Token Prediction (MTP)模型內建多 token 預測視模型架構而定通用推論加速
DSpark投機解碼變體數據未詳列輕量化部署環境

🛠️ 技術深入

  • 採用成對候選選擇器以提升 token 接受率,單次驗證通過的 token 數量增加超過 20%。
  • 透過雙抽頭動態卷積技術優化草稿模型骨幹,僅增加約 1% 的週期延遲。
  • 草稿模型本體佔用約 1.1 GB VRAM,但在特定硬體配置下可能產生預填充(prefill)效能懲罰。
  • 支援與現有模型架構並行運作,針對 Qwen 3.8-27B 等開放權重模型進行了專門優化。

🔮 前景展望AI analysis grounded in cited sources

投機解碼將成為本地端程式碼代理(Coding Agents)的標準配置。
DFlash 2 在程式碼生成任務中展現的顯著吞吐量提升,能有效降低開發者在多輪對話中的等待時間。
未來推論引擎將更依賴混合加速策略。
由於 DFlash 2 在推理密集型任務中效果有限,引擎需根據任務類型動態切換 MTP 或投機解碼技術。

時間線

2026-08-18
Inco AI 正式發布 DFlash 2 投機解碼器。
2026-08-20
DFlash 2 完成對 SGLang 與 vLLM 的初步整合。
2026-08-23
Reddit r/LocalLLaMA 社群發布針對 Qwen 3.8 27B 的基準測試報告。

📎 來源 (15)

Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.

  1. kompozy.io
  2. nvidia.com
  3. ascii.co.uk
  4. mindstudio.ai
  5. huggingface.co
  6. enzolombardi.net
  7. huggingface.co
  8. youtube.com
  9. youtube.com
  10. reddit.com
  11. reddit.com
  12. reddit.com
  13. reddit.com
  14. modal.com
  15. reddit.com
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。