
DeepSeek 推出 DSpark,推理速度提升 85%
DeepSeek 發布了 DSpark 技術報告與程式碼庫,為 V4 模型引入了推測解碼模組。此更新在無需更換底座模型的情況下,顯著提升了推理速度。
Tag: #latency-reduction7 results

DeepSeek 發布了 DSpark 技術報告與程式碼庫,為 V4 模型引入了推測解碼模組。此更新在無需更換底座模型的情況下,顯著提升了推理速度。
GPUHedge 是一款全新的開源工具,利用推測執行技術在多個 Serverless GPU 供應商之間進行對沖。透過啟動備援請求,它將 p95 冷啟動延遲從 117 秒大幅降低至 30 秒。

這項研究提出將記憶體檢索移至代理的推理循環內,以消除網路延遲。透過使用進程內存儲,檢索時間從毫秒級降至微秒級,使代理能夠維持持久且高速的工作記憶。

DeepSeek 發布了 DSpark,這是一項旨在優化大型模型推理效能的新解決方案。該更新解決了延遲問題,確保 AI 回應能更流暢地生成。

NVIDIA 引入了 DFlash 推測解碼技術,旨在解決自回歸大型語言模型 (LLM) 的延遲瓶頸。該技術透過輕量級模型來預測生成 Token,顯著提升了 Blackwell 架構上的吞吐量。

Google 推出了 Gemini 3.5 Flash,這是一款針對高效率與速度進行優化的模型。Google 將此更新定位為實現響應式代理型 AI 應用的關鍵組件。

DeepMind 推出 Gemini 3.1 Flash Live,這是最新語音模型,具備更高的精準度和更低的延遲。它讓語音互動更流暢、自然且精準。