
更快速的 Qwen3.8 27B NVFP4 量化模型
全新的 Blackwell 原生、針對 prefill 最佳化的 Qwen3.8 27B NVFP4 量化模型,據稱比相同記憶體占用的 Q4 量化快達 50%。在 RTX 5090 上,它也比其他 NVFP4 量化版本快 4–7%,並附帶量化的 MTP 草稿頭。
Tag: #blackwell13 results

全新的 Blackwell 原生、針對 prefill 最佳化的 Qwen3.8 27B NVFP4 量化模型,據稱比相同記憶體占用的 Q4 量化快達 50%。在 RTX 5090 上,它也比其他 NVFP4 量化版本快 4–7%,並附帶量化的 MTP 草稿頭。

IBM 透過與 Together AI 的多年合作協議投入 2.4 億美元,將 Nvidia Blackwell 系統導入 IBM Cloud。這項策略聚焦於降低推理成本,並利用開源技術與超大規模雲端業者競爭。

GB10 Solution 的 Atlas 推論引擎全 Rust+CUDA 開源,在 Qwen3.6-35B-FP8 上 MTP 達 100+ tok/s。針對 DGX Spark Blackwell GPU 最佳化,支援 OpenAI/Anthropic API,並以簡單 Docker 指令運行。

NVIDIA 推出 RTX PRO 4500 Blackwell Server Edition 和 vGPU 20,以擴展 AI 就緒資料中心。這些產品透過安全的虛擬機器解決 GPU 運算瓶頸,讓 Microsoft Office 和設計工具等企業應用整合 AI。這將資料中心從單一用途轉向多功能 AI 基礎設施。

DeepSeek 更新其 DeepGEMM 儲存庫,新增對 Mega MoE 的測試支援,包括 P4 量化、分佈式通訊、Blackwell 適配以及 HyperConnection 訓練。這暗示正準備部署比 V3 更大的 MoE 模型,可能為 DeepSeek V4,需要 FP4 以實現高效推論。此更新僅限 DeepGEMM 開發,與內部模型發布無關。

英偉達執行長老黃親自登門,將首台DGX GB300 AI超級電腦送給卡帕西。這標誌著英偉達最新高效能AI基礎設施系統的初步推出。此事件突顯了GB300平台的熱度。
對 Qwen3.5-397B NVFP4 在 4x RTX PRO 6000 上花 8 小時基準測試 MoE 後端,使用 Marlin TP=4 達 50.5 tok/s。NVIDIA CUTLASS 核心在 SM120 初始化失敗,迫使 FP16 回退。MTP 效能倒退 22%。

英偉達GB10晶片裸片圖曝光,採用台積電3nm工藝,由聯發科負責CPU,海爾貢獻GPU部分,但GPU區域面積比5nm版本更大。分析指為提升良率採寬鬆密度設計,支持2.5GHz加速頻率,高於B200的2.1GHz。採用SM 12.1架構,與先前模型不同。

Nvidia 的 96GB RTX PRO 6000 Blackwell 目前建議售價為 16,000 美元,是上市初期價格的兩倍。這次漲價反映 AI 資料中心的強勁需求,且相比幾個月前又上漲了 20%。

技嘉發布了 AORUS RTX 5080 INFINITY 系列顯卡,包含標準版與具備木紋外觀的 WOOD 限定版。該系列採用 NVIDIA Blackwell 架構並配備先進散熱系統,旨在慶祝公司成立 40 週年。