Search

直接匹配不多,已補上最新動態。

Tag: #moe-optimization3 results

Atlas 解鎖 DGX Spark 102 tok/s

Atlas 解鎖 DGX Spark 102 tok/s

Atlas 是純 Rust LLM 推論引擎,針對 GB10 的 SM121 架構自訂 CUDA 核心,在 Qwen3.5-35B-A3B 上達 102 安定 tok/s,比 vLLM 快 2.3 倍。具 2 分鐘冷啟動、僅 2GB 映像,並在 Qwen3-Next-80B-A3B 上達 82 tok/s。解決 DGX Spark 的軟體問題,實現桌面 petaflop 運算。

Reddit r/LocalLLaMACommunityMar 4#inference-engine#rust-llm#moe-optimization