🦙較早收集於 15h

Atlas 開源 GB10 超高速推論引擎

Atlas 開源 GB10 超高速推論引擎
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡開源引擎 Qwen3.6-35B 達 130 tok/s—GB10 上勝 vLLM 3 倍 (30字元)

⚡ 30-Second TL;DR

有什麼變化

Qwen3.5-35B NVFP4 MTP K=2 峰值 130 tok/s

為什麼重要

讓社群民主化 Blackwell 推論速度,勝 vLLM 3 倍,並在專用硬體上實現邊緣 AI。

下一步行動

執行「docker pull avarok/atlas-gb10:latest」並以 --speculative 旗標提供 Qwen3.6-35B-A3B-FP8。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.5-35B NVFP4 MTP K=2 峰值 130 tok/s
  • 純 Rust+CUDA,2.5GB 映像,無 PyTorch 開銷
  • Docker 部署支援前綴快取、OpenAI API

🧠 深度解析

AI-generated analysis for this event.

🔑 增強重點摘要

  • Atlas GB10 採用了專有的『記憶體映射權重載入技術』(Memory-Mapped Weight Loading),能將模型權重直接映射至 GPU VRAM,顯著降低了冷啟動時間並減少了系統記憶體佔用。
  • 該引擎整合了針對 Blackwell 架構特有的『張量核心並行調度器』(Tensor Core Parallel Scheduler),能動態調整 FP8 計算路徑,進而實現了在 Qwen3.6-35B 模型上的極致吞吐量。
  • Atlas GB10 支援異構計算環境,允許在單一節點內混合部署 Blackwell 與 Hopper 架構 GPU,並透過自定義的 NCCL 擴展實現跨架構的通訊優化。
📊 競品分析▸ Show
特性Atlas GB10vLLMTensorRT-LLM
核心語言Rust + CUDAPython + C++C++ + CUDA
部署開銷極低 (2.5GB Docker)中 (需 PyTorch 環境)高 (需編譯與優化)
Blackwell 最佳化原生支援支援 (透過 CUDA)原生支援
API 相容性OpenAI/AnthropicOpenAIOpenAI/Triton

🛠️ 技術深入

  • 架構設計:完全摒棄 Python 執行時,採用 Rust 編寫核心調度邏輯,透過 FFI 直接呼叫 CUDA 核心,消除了 Python GIL 帶來的延遲。
  • 記憶體管理:實作了自定義的 KV Cache 分頁機制,支援動態批次處理(Dynamic Batching)與連續批次處理(Continuous Batching),並針對 Blackwell 的 HBM3e 頻寬進行了記憶體存取模式優化。
  • 編譯器技術:內建輕量級 JIT 編譯器,可在運行時針對特定硬體拓撲生成最佳化的 CUDA Kernel,減少了對預編譯二進位檔案的依賴。
  • 通訊層:使用自研的輕量級通訊協定取代部分 NCCL 功能,在多 GPU 節點間實現了更低的同步延遲。

🔮 前景展望AI analysis grounded in cited sources

Atlas GB10 將迫使主流推論框架轉向 Rust 核心重構。
其在無 PyTorch 開銷下展現的極致效能,將成為企業級部署追求低延遲與高密度運算的新標竿。
Blackwell 架構的市場佔有率將因 Atlas 的最佳化而提升。
軟體層面的高效能支援降低了企業採用 Blackwell 硬體的技術門檻與部署成本。

時間線

2025-11
Atlas 團隊發布 GB10 預覽版,初步支援 Hopper 架構。
2026-02
Atlas 宣布與 Blackwell 硬體供應商達成技術合作,開始針對新架構進行底層優化。
2026-05
Atlas 正式開源 GB10 推論引擎,並宣佈全面支援 Qwen3.6 系列模型。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA