🐯虎嗅•最新收集於 21m
SGLang 將萬億模型冷啟動縮至 32 秒
💡據稱 16 倍的啟動提升,可能改變大型模型叢集處理自動擴展與突發流量的方式。
⚡ 30-Second TL;DR
有什麼變化
SGLang 將據稱的萬億級模型啟動時間縮短至 32 秒。
為什麼重要
若這項成果能被重現,將有助於降低閒置算力需求,並讓突發性推論工作負載更容易部署。對管理大型模型的基礎設施團隊而言,這可能緩解模型初始化與權重載入造成的自動擴展限制。
下一步行動
請在目標萬億級模型檢查點與硬體上測試 SGLang 的冷啟動,並分別記錄權重載入、初始化與首 token 延遲。
誰應關注:Developers & AI Engineers
關鍵要點
- •SGLang 將據稱的萬億級模型啟動時間縮短至 32 秒。
- •此前冷啟動時間約為 8 分 48 秒。
- •據稱相較原有基準,啟動速度提升近 16 倍。
- •更快的啟動速度有望改善大型模型推論部署的彈性。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 8 個來源。
🔑 增強重點摘要
- •此项技术突破由蚂蚁集团基础设施团队、阿里巴巴及SGLang团队共同研发,核心组件为“权重缓存守护进程”(Weight Cache Daemon)。
- •技术核心在于利用CUDA IPC(进程间通信)零拷贝映射技术,使模型权重能直接在GPU显存间共享,彻底规避了从NVMe SSD重复加载权重的物理瓶颈。
- •该成果是“快速引擎恢复框架”的第一阶段,旨在实现生产环境LLM服务的秒级冷重启与亚秒级热备切换,以满足严苛的SLA要求。
- •SGLang目前已在生产环境中支撑超过40万张GPU的运行,并已完成对AMD MI30x及MI35x等非NVIDIA硬件平台的生产级适配。
- •SGLang在2026年进行了大规模架构重构,通过RFC #188将引擎核心代码行数从3.3万行精简至1万行,并引入了“可中断CUDA图”技术以提升灵活性。
📊 競品分析▸ Show
| 特性 | SGLang | vLLM | TensorRT-LLM |
|---|---|---|---|
| 核心优势 | 结构化编程与超大模型冷启动优化 | 广泛的生态兼容性与PagedAttention | NVIDIA硬件极致性能优化 |
| 万亿模型支持 | 针对性优化(如Kimi K3适配) | 支持,但冷启动依赖传统加载 | 支持,依赖编译优化 |
| 硬件支持 | NVIDIA, AMD (MI30x/35x) | 多平台支持 | 专注于NVIDIA GPU |
🛠️ 技術深入
- 权重缓存守护进程:引入持久化GPU进程,将量化权重常驻显存。
- CUDA IPC零拷贝映射:通过内存映射技术,实现新引擎实例对现有权重空间的直接访问。
- 可中断CUDA图:允许在推理过程中动态调整计算图,提升复杂多步推理任务的响应速度。
- 架构精简:通过RFC #188重构,大幅降低引擎组件复杂度,减少运行时开销。
🔮 前景展望AI analysis grounded in cited sources
万亿参数模型将实现生产环境下的秒级弹性伸缩。
权重缓存技术消除了磁盘I/O瓶颈,使得大规模模型能够像轻量级模型一样快速响应流量突发。
推理引擎将从单一的计算优化转向计算与存储协同优化。
通过持久化权重缓存守护进程,推理引擎的架构设计开始将显存管理提升至与计算调度同等重要的地位。
⏳ 時間線
2026-08
SGLang团队发布权重缓存守护进程,将万亿模型冷启动缩短至32秒。
2026-05
SGLang完成RFC #188架构重构,大幅精简引擎代码库并引入可中断CUDA图。
📎 來源 (8)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: 虎嗅 ↗
每週 AI 簡報
每週一封,可隨時退訂。



