Search

直接匹配不多,已補上最新動態。

Tag: #gemm3 results

⚙️

MXFP8 GEMM 達 cuBLAS 99% 效能

Meta/PyTorch 工程師詳述 CUDA + PTX 中的 MXFP8 GEMM 核心設計,儘管 FP8 限制仍達 cuBLAS 99% 效能。包含挑戰深度剖析與 PyTorch 整合連結,用於 B200 GPU 的 DeepSeek-V3 訓練。

Reddit r/MachineLearningCommunityMar 30#fp8#gemm#nvidia-b200
DeepGEMM nv_dev_c491439 開發版本發布

DeepGEMM nv_dev_c491439 開發版本發布

DeepSeek 在 GitHub 上發布 DeepGEMM 的 nv_dev_c491439 開發更新。此版本無詳細發布說明或變更日誌。可能針對 NVIDIA GPU 的矩陣乘法進行 AI 工作負載優化。

DeepSeek (GitHub Releases: DeepGEMM)MediaApr 22#nvidia#gpu#gemm
Ox Alpha:神秘模型公開亮相

Ox Alpha:神秘模型公開亮相

Ox Alpha 是一款透過 OpenRouter 與 OpenCode 提供的匿名模型,具備 100 萬 token 上下文、圖片與影片輸入、工具呼叫及免費使用等能力。早期測試顯示其推理與程式設計表現強勁,但開發者、參數量、訓練資料與正式基準排名仍未獲確認。