Search

Tag: #inference127 results

⚙️

Triton MoE 核心擊敗 Megablocks

純 Triton 的融合 MoE 分派核心在 Mixtral-8x7B 推理批次大小下擊敗 CUDA 優化的 Megablocks(32 個 token 時快 131%)。透過融合操作減少 35% 記憶體流量,並支援 NVIDIA 與 AMD 硬體的多模型。GitHub 有程式碼與文章。

Reddit r/MachineLearningCommunityApr 5#moe#inference#kernels
Page 7 of 13