
TensorCast 大幅降低 LLM 啟動延遲
北京大學、StepFun 與北京郵電大學推出 TensorCast,這是一套用於大型模型基礎設施的可程式化張量生命週期管理抽象層。在高併發、多輪代理工作負載中,據稱可將中位數首個 Token 時間最多降低 93.2%,並將模型實例啟動速度提升最多 228.6 倍。
Tag: #llm-serving10 results

北京大學、StepFun 與北京郵電大學推出 TensorCast,這是一套用於大型模型基礎設施的可程式化張量生命週期管理抽象層。在高併發、多輪代理工作負載中,據稱可將中位數首個 Token 時間最多降低 93.2%,並將模型實例啟動速度提升最多 228.6 倍。

Netflix 詳細介紹其以 NVIDIA Triton 與 vLLM 為核心建構的內部大型語言模型服務平台。該平台為大型企業如何在內部架構與運行 LLM 服務提供了實務案例。

SGLang 在 NVIDIA GB300 硬體上成功將 DeepSeek-V4 的服務吞吐量提升了 5 倍。此項優化在保持互動性的同時,顯著提升了推論效率。
Hugging Face 引入了用於 Continuous Batching 的非同步處理機制,旨在提升推論吞吐量。此方法將請求處理與批次執行解耦,有效降低高負載環境下的延遲。
Together AI 的快取感知預填充-解碼分離(CPD)將溫熱預填充與冷解碼工作負載分離,以實現高效推理。它提供高達 40% 的更高吞吐量,並大幅降低首 token 時間。長提示現在能實現更快回應,而無延遲。
Hugging Face 部落格探討 vLLM 從 V0 到 V1 的演進,在強化學習工作流程中優先考慮正確性而非修正。文章強調建構可靠 LLM 伺服系統的關鍵原則。提供平衡準確性和效率在 RL 應用中的洞見。
PyTorch 團隊在大規模生產 LLM 服務中遭遇 Python GIL 瓶頸。他們開發 Shepherd Model Gateway,並主張將 CPU 與 GPU 分離以克服這些限制。此方法可提升高吞吐量推論的資源利用率。

Docker Model Runner 現支援透過新 vllm-metal 後端在 macOS Apple Silicon 上運行 vLLM 推理。此前已支援 Linux NVIDIA GPU 及 Windows WSL2。此更新讓 Mac 開發者能進行高效 LLM 服務。
ParetoBandit 引入預算節奏自適應路由,用於非穩定 LLM 服務環境。在 r/MachineLearning 分享,可能為新研究論文或方法。專注動態條件下服務最佳化。
在低 VRAM 環境下,使用 llama-server 的 -np 1 旗標限制單進程,提升速度。停用 Firefox 硬體加速釋放 VRAM。在 6700XT GPU 上 Qwen2.5-32B 達 90+ t/s。