
Qwen3.8-27B 在雙 RTX 3090 上達 218 Token/秒
社群基準測試顯示,Qwen3.8-27B 在兩張 RTX 3090 上搭配 vLLM、INT4 量化與 DFlash2 推測解碼,最高可達每秒 218.3 token。該配置支援最高 131K 上下文,首 token 延遲約 168–178 毫秒,每張顯示卡峰值 VRAM 使用量為 22.3 GB。
Tag: #gpu-optimization50 results

社群基準測試顯示,Qwen3.8-27B 在兩張 RTX 3090 上搭配 vLLM、INT4 量化與 DFlash2 推測解碼,最高可達每秒 218.3 token。該配置支援最高 131K 上下文,首 token 延遲約 168–178 毫秒,每張顯示卡峰值 VRAM 使用量為 22.3 GB。
分析顯示,在 8xB200 節點上使用 NVFP4 精度搭配 TP=4 副本配置,效能顯著優於標準的 TP=8 配置。此方法可使節點吞吐量翻倍並改善每位使用者的延遲。

本文探討了 AI 領域推理成本的關鍵挑戰,強調了記憶體管理與高效調度對於商業可持續性的重要性。

PyTorch 已將 Primus-Turbo 的 AMD 最佳化功能上游整合至 TorchTitan 與 TorchAO,讓兩者可直接支援 AMD Instinct GPU。此更新提供開箱即用且具競爭力的 FP8 訓練效能,並延續超過 1,000 張 GPU 的擴展成果。
一位開發者報告在 NVIDIA T4 上執行點追蹤模型時,效能比 A100 慢了 170 倍。調查重點在於使用 FP32 精度時,4D 相關體積與 Transformer 層架構可能產生的瓶頸。

ExLlamaV3 迎來首個正式生產版本,針對推論速度與硬體效率進行了重大優化。此次更新包含全新的注意力與 GEMV 核心,並增強了對現代模型架構的支援。
GPUHedge 是一款全新的開源工具,利用推測執行技術在多個 Serverless GPU 供應商之間進行對沖。透過啟動備援請求,它將 p95 冷啟動延遲從 117 秒大幅降低至 30 秒。
Picotron 是一個 LLM 訓練框架的全新重構版本,移除了強制性的硬體特定依賴,使其能在 T4 或 V100 等舊款 GPU 上運行。它預設使用標準 PyTorch SDPA,同時保留了對 FlashAttention-2 的選用支援。

NVIDIA 探討了優化鳥瞰圖 (BEV) 池化運算的方法,這對自動駕駛和機器人技術至關重要。本文詳細說明如何改進空間特徵投影,以增強即時感知與規劃能力。

本文探討了 NVIDIA NeMo AutoModel 如何簡化 Transformer 模型微調的過程。文中強調了提高訓練效率以及降低特定任務模型適配複雜度的技術。