來源較早收集於 15h

Atlas 開源 GB10 超高速推論引擎

閱讀原文: Reddit r/LocalLLaMA
#open-source#blackwell#speculative-decode

開源引擎 Qwen3.6-35B 達 130 tok/s—GB10 上勝 vLLM 3 倍 (30字元)

30 秒速覽

有什麼變化

Qwen3.5-35B NVFP4 MTP K=2 峰值 130 tok/s

為什麼重要

讓社群民主化 Blackwell 推論速度,勝 vLLM 3 倍,並在專用硬體上實現邊緣 AI。

下一步行動

執行「docker pull avarok/atlas-gb10:latest」並以 --speculative 旗標提供 Qwen3.6-35B-A3B-FP8。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.5-35B NVFP4 MTP K=2 峰值 130 tok/s
  • 純 Rust+CUDA,2.5GB 映像,無 PyTorch 開銷
  • Docker 部署支援前綴快取、OpenAI API

深度解析

本篇為 AI 生成分析,非原文內容。

增強重點摘要

  • Atlas GB10 採用了專有的『記憶體映射權重載入技術』(Memory-Mapped Weight Loading),能將模型權重直接映射至 GPU VRAM,顯著降低了冷啟動時間並減少了系統記憶體佔用。
  • 該引擎整合了針對 Blackwell 架構特有的『張量核心並行調度器』(Tensor Core Parallel Scheduler),能動態調整 FP8 計算路徑,進而實現了在 Qwen3.6-35B 模型上的極致吞吐量。
  • Atlas GB10 支援異構計算環境,允許在單一節點內混合部署 Blackwell 與 Hopper 架構 GPU,並透過自定義的 NCCL 擴展實現跨架構的通訊優化。

競品分析

核心語言
Atlas GB10
Rust + CUDA
vLLM
Python + C++
TensorRT-LLM
C++ + CUDA
部署開銷
Atlas GB10
極低 (2.5GB Docker)
vLLM
中 (需 PyTorch 環境)
TensorRT-LLM
高 (需編譯與優化)
Blackwell 最佳化
Atlas GB10
原生支援
vLLM
支援 (透過 CUDA)
TensorRT-LLM
原生支援
API 相容性
Atlas GB10
OpenAI/Anthropic
vLLM
OpenAI
TensorRT-LLM
OpenAI/Triton

技術深入

  • 架構設計:完全摒棄 Python 執行時,採用 Rust 編寫核心調度邏輯,透過 FFI 直接呼叫 CUDA 核心,消除了 Python GIL 帶來的延遲。
  • 記憶體管理:實作了自定義的 KV Cache 分頁機制,支援動態批次處理(Dynamic Batching)與連續批次處理(Continuous Batching),並針對 Blackwell 的 HBM3e 頻寬進行了記憶體存取模式優化。
  • 編譯器技術:內建輕量級 JIT 編譯器,可在運行時針對特定硬體拓撲生成最佳化的 CUDA Kernel,減少了對預編譯二進位檔案的依賴。
  • 通訊層:使用自研的輕量級通訊協定取代部分 NCCL 功能,在多 GPU 節點間實現了更低的同步延遲。

前景展望基於引用來源的 AI 分析

Atlas GB10 將迫使主流推論框架轉向 Rust 核心重構。
其在無 PyTorch 開銷下展現的極致效能,將成為企業級部署追求低延遲與高密度運算的新標竿。
Blackwell 架構的市場佔有率將因 Atlas 的最佳化而提升。
軟體層面的高效能支援降低了企業採用 Blackwell 硬體的技術門檻與部署成本。

時間線

2025-11
Atlas 團隊發布 GB10 預覽版,初步支援 Hopper 架構。
2026-02
Atlas 宣布與 Blackwell 硬體供應商達成技術合作,開始針對新架構進行底層優化。
2026-05
Atlas 正式開源 GB10 推論引擎,並宣佈全面支援 Qwen3.6 系列模型。

AI 週報

閱讀本週精選 AI 大事摘要 →

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週電子報

每週一封,可隨時退訂。