
JetSpec:透過平行樹狀推測解碼實現 1000 TPS
JetSpec 引入了一種用於推測解碼的平行樹狀草擬方法,在 LLM 推論上實現了高達 9.64 倍的速度提升。它在保持無損生成品質的同時,於單張 B200 GPU 上達到了每秒 1000 個 Token 的速度。
Tag: #cuda17 results

JetSpec 引入了一種用於推測解碼的平行樹狀草擬方法,在 LLM 推論上實現了高達 9.64 倍的速度提升。它在保持無損生成品質的同時,於單張 B200 GPU 上達到了每秒 1000 個 Token 的速度。
研究顯示,AI 生成的 CUDA 核心可能通過基準測試,卻在實際生產訓練中導致靜默數值錯誤。這些錯誤常表現為損失函數發散,容易被誤認為是研究方向錯誤。

Elon Musk 表示,SpaceX 與 xAI 將僅使用 Nvidia AI 加速器進行訓練與推論,因為兩家公司認為 Nvidia 的架構是目前最佳選擇。Musk 另表示,經最佳化的 Vera Rubin NVL72 系統將於明年發射升空。
本系列教學深入探討 FlashAttention 的理論基礎,將其定義為一種隱含結合律的運算。文中探討了這種數學視角如何實現 GPU 排程優化與高效的 CUDA 核心實作。
Picotron 是一個 LLM 訓練框架的全新重構版本,移除了強制性的硬體特定依賴,使其能在 T4 或 V100 等舊款 GPU 上運行。它預設使用標準 PyTorch SDPA,同時保留了對 FlashAttention-2 的選用支援。

ParallelKernelBench 評估了 LLM 在 87 個真實多 GPU CUDA 工作負載上的表現。儘管大多數模型表現不佳,但部分生成的 Kernel 效能已超越現有的公開實作。
cuTile Rust 引入了一種基於 Tile 的程式設計模型,利用 Rust 的所有權和借用檢查機制來確保 GPU 核心的記憶體安全與無資料競爭。研究團隊開發了 Grout 推論引擎,在 Qwen3 模型上展現了與 vLLM 和 SGLang 相當的效能。

Unsloth 調查 MiniMax-M2.7 GGUF 量化中 21-38% 的 NaN,歸因於 llama.cpp 特定區塊溢位。修復其 UD-Q4_K_S 等量化於 unsloth/MiniMax-M2.7-GGUF。基準確認良好 PPL/KLD;註記 CUDA 13.2 問題。

RotorQuant 利用 Clifford 轉子進行向量量化,比 TurboQuant 快 10-19 倍,參數僅 1/44。它在 Qwen2.5-3B KV 快取上餘弦相似度近乎相同(0.990),並在融合 CUDA/Metal 核心中表現出色。程式碼與論文現已開放。

NVIDIA 開發者部落格詳細說明使用 cuTile Python 實作 Flash Attention,這是現代 AI 的關鍵工作負載,以達峰值效能。它涵蓋透過 quickstart 文件的環境設定,以及 transformer 模型核心的 attention 機制。從業者可學習優化 token 處理的技巧。