🦙較早收集於 11h

Atlas 解鎖 DGX Spark 102 tok/s

Atlas 解鎖 DGX Spark 102 tok/s
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA

💡新 Rust 引擎:DGX Spark 上 Qwen MoE 模型比 vLLM 快 2.3 倍。

⚡ 30-Second TL;DR

有什麼變化

Qwen3.5-35B-A3B 達 102 tok/s (K=2 時 127 MTP),vLLM 2.3 倍

為什麼重要

革新 DGX Spark 可用性,讓 AI 建置者在桌面硬體上快速本地推論 80B+ MoE 模型。

下一步行動

從源碼下載 Atlas,並在 DGX Spark GB10 上基準測試 Qwen3.5-35B-A3B。

誰應關注:Developers & AI Engineers

關鍵要點

  • Qwen3.5-35B-A3B 達 102 tok/s (K=2 時 127 MTP),vLLM 2.3 倍
  • Qwen3-Next-80B-A3B 達 82 tok/s,vLLM 僅 36.4
  • 純 Rust、自訂 CUTLASS 3.8 核心、2GB 映像、2 分鐘冷啟動
  • 無 PyTorch/Docker,GB10 最佳化 NVFP4

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 7 個來源。

🔑 增強重點摘要

  • Atlas 採用「核心超編譯」(Kernel Hypercompilation) 哲學,在 Rust 中實現 20+ 自訂核心,相比 vLLM 的 40+ 秒冷啟動時間,Atlas 從原始碼編譯到首個推論令牌僅需 2 分鐘[1]
  • Atlas 在 32/32 基準測試中擊敗 PyTorch 基線,包括 RoPE 快 18 倍、門控 Delta 規則快 8 倍、256 專家 MoE W4A16 量化快 3.9 倍[1]
  • 純 Rust 架構完全消除 Python、PyTorch、Docker 和外部框架依賴,Atlas 掌控從核心到 HTTP 伺服器層的整個堆疊,解決 vLLM 使用者長期面臨的依賴鏈除錯和版本不匹配問題[1]
📊 競品分析▸ Show
特性AtlasvLLMQORA
語言RustPythonRust
冷啟動時間~2 分鐘40+ 秒未公開
Qwen3-Next-80B 吞吐量82 tok/s~36.4 tok/sN/A
框架依賴PyTorch
目標硬體DGX Spark (SM121)通用 GPUCPU 專用
模型支援Qwen 系列廣泛SmolLM3-3B
社群狀態即將發布已成熟已發布

🛠️ 技術深入

核心架構:20+ 自訂 CUDA 核心直接編譯至 SM121 架構,針對 DGX Spark GB10 GPU 最佳化[1]量化策略:支援 NVFP4 (NVIDIA 浮點 4 位元) 和 W4A16 (4 位元權重、16 位元啟動) 量化,256 專家 MoE 配置[1]編譯方法:Kernel Hypercompilation 搭配 Rust 抽象層,無需 PyTorch 或複雜配方,所有元件整合在單一位置[1]效能基準:RoPE (旋轉位置編碼) 相比 PyTorch 快 18 倍、門控 Delta 規則快 8 倍、MoE W4A16 快 3.9 倍[1]推論延遲:Qwen3-Next-80B 在單個 GB10 GPU 上達 82 tok/s (無推測解碼),Qwen3.5-35B 達 102 tok/s[1]

🔮 前景展望AI analysis grounded in cited sources

Rust 原生推論引擎將成為邊界部署的標準
Atlas 和 QORA 的成功表明,消除 Python/PyTorch 依賴可大幅降低部署複雜性,預期 2026 年將有更多生產系統採用 Rust 推論堆疊[1][4]
DGX Spark 將成為邊界 AI 推論的主流平台
Atlas 專為 DGX Spark 最佳化,達成 2.3 倍 vLLM 加速,表明該硬體平台正吸引專業推論軟體開發者投資[1]
推論成本優化將從單純吞吐量轉向成本效率指標
業界分析指出 2026 年真正的競爭優勢在於「每美元效能」和「每瓦特吞吐量」,而非單純的令牌/秒速度[3]

時間線

2026-02
Atlas 推論引擎在 NVIDIA 開發者論壇宣布,展示 Qwen3-Next-80B 達 82 tok/s 效能
2026-02-28
QORA (SmolLM3-3B 純 Rust 推論引擎) 在 HuggingFace 發布,展示 CPU 專用推論可行性
2026-01
Claude Opus 4.5 和 GPT-5.2 推理模型發布,推動代碼生成能力新高峰,間接刺激推論優化需求
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。