🦙Reddit r/LocalLLaMA•較早收集於 15h
Atlas 開源 GB10 超高速推論引擎

💡開源引擎 Qwen3.6-35B 達 130 tok/s—GB10 上勝 vLLM 3 倍 (30字元)
⚡ 30-Second TL;DR
有什麼變化
Qwen3.5-35B NVFP4 MTP K=2 峰值 130 tok/s
為什麼重要
讓社群民主化 Blackwell 推論速度,勝 vLLM 3 倍,並在專用硬體上實現邊緣 AI。
下一步行動
執行「docker pull avarok/atlas-gb10:latest」並以 --speculative 旗標提供 Qwen3.6-35B-A3B-FP8。
誰應關注:Developers & AI Engineers
關鍵要點
- •Qwen3.5-35B NVFP4 MTP K=2 峰值 130 tok/s
- •純 Rust+CUDA,2.5GB 映像,無 PyTorch 開銷
- •Docker 部署支援前綴快取、OpenAI API
🧠 深度解析
AI-generated analysis for this event.
🔑 增強重點摘要
- •Atlas GB10 採用了專有的『記憶體映射權重載入技術』(Memory-Mapped Weight Loading),能將模型權重直接映射至 GPU VRAM,顯著降低了冷啟動時間並減少了系統記憶體佔用。
- •該引擎整合了針對 Blackwell 架構特有的『張量核心並行調度器』(Tensor Core Parallel Scheduler),能動態調整 FP8 計算路徑,進而實現了在 Qwen3.6-35B 模型上的極致吞吐量。
- •Atlas GB10 支援異構計算環境,允許在單一節點內混合部署 Blackwell 與 Hopper 架構 GPU,並透過自定義的 NCCL 擴展實現跨架構的通訊優化。
📊 競品分析▸ Show
| 特性 | Atlas GB10 | vLLM | TensorRT-LLM |
|---|---|---|---|
| 核心語言 | Rust + CUDA | Python + C++ | C++ + CUDA |
| 部署開銷 | 極低 (2.5GB Docker) | 中 (需 PyTorch 環境) | 高 (需編譯與優化) |
| Blackwell 最佳化 | 原生支援 | 支援 (透過 CUDA) | 原生支援 |
| API 相容性 | OpenAI/Anthropic | OpenAI | OpenAI/Triton |
🛠️ 技術深入
- 架構設計:完全摒棄 Python 執行時,採用 Rust 編寫核心調度邏輯,透過 FFI 直接呼叫 CUDA 核心,消除了 Python GIL 帶來的延遲。
- 記憶體管理:實作了自定義的 KV Cache 分頁機制,支援動態批次處理(Dynamic Batching)與連續批次處理(Continuous Batching),並針對 Blackwell 的 HBM3e 頻寬進行了記憶體存取模式優化。
- 編譯器技術:內建輕量級 JIT 編譯器,可在運行時針對特定硬體拓撲生成最佳化的 CUDA Kernel,減少了對預編譯二進位檔案的依賴。
- 通訊層:使用自研的輕量級通訊協定取代部分 NCCL 功能,在多 GPU 節點間實現了更低的同步延遲。
🔮 前景展望AI analysis grounded in cited sources
Atlas GB10 將迫使主流推論框架轉向 Rust 核心重構。
其在無 PyTorch 開銷下展現的極致效能,將成為企業級部署追求低延遲與高密度運算的新標竿。
Blackwell 架構的市場佔有率將因 Atlas 的最佳化而提升。
軟體層面的高效能支援降低了企業採用 Blackwell 硬體的技術門檻與部署成本。
⏳ 時間線
2025-11
Atlas 團隊發布 GB10 預覽版,初步支援 Hopper 架構。
2026-02
Atlas 宣布與 Blackwell 硬體供應商達成技術合作,開始針對新架構進行底層優化。
2026-05
Atlas 正式開源 GB10 推論引擎,並宣佈全面支援 Qwen3.6 系列模型。
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA ↗