富士通開發 PHOTON:效率比 Transformer 高出 475 倍
富士通開發了一種名為 PHOTON 的新型 LLM 架構,能顯著提升 GPU 的處理吞吐量。此創新旨在減少運行大型語言模型所需的 GPU 數量,從而大幅降低營運成本。
Tag: #gpu-optimization50 results
富士通開發了一種名為 PHOTON 的新型 LLM 架構,能顯著提升 GPU 的處理吞吐量。此創新旨在減少運行大型語言模型所需的 GPU 數量,從而大幅降低營運成本。

SGLang 在 NVIDIA GB300 硬體上成功將 DeepSeek-V4 的服務吞吐量提升了 5 倍。此項優化在保持互動性的同時,顯著提升了推論效率。

NVIDIA 引入了 DFlash 推測解碼技術,旨在解決自回歸大型語言模型 (LLM) 的延遲瓶頸。該技術透過輕量級模型來預測生成 Token,顯著提升了 Blackwell 架構上的吞吐量。

ParallelKernelBench 評估了 LLM 在 87 個真實多 GPU CUDA 工作負載上的表現。儘管大多數模型表現不佳,但部分生成的 Kernel 效能已超越現有的公開實作。

NVIDIA 探討如何利用先進的融合核心(fusion kernels)來優化 Mixture-of-Experts (MoE) 模型的訓練。此方法透過提升大規模 AI 系統的運算利用率,解決了訓練效率的挑戰。

Google DeepMind 發布了針對 NVIDIA 硬體優化的 DiffusionGemma 模型。此更新旨在解決聊天機器人與代理工作流等即時 AI 應用中的延遲問題。

NVIDIA Dynamo Snapshot 解決了 Kubernetes 推論部署中的冷啟動問題,大幅縮短了啟動時間。此解決方案可避免擴展期間的 GPU 空轉,確保更好的資源利用率並符合 SLA 要求。
本文探討 PyTorch 編譯器如何透過 Kernel Fusion 技術實現高達 10 倍的效能提升。文中解釋了從執行單一 GPU Kernel 到優化融合運算的技術轉變。
PyTorch 2.12 已正式發布,為深度學習工作流程帶來了顯著的效能優化。此次更新特別針對 CUDA 硬體上的 batched linalg.eigh 操作,實現了高達 100 倍的速度提升。

面壁智能發布MiniCPM-o 4.5技術報告,強調其在消費級顯卡上快速上手運行。該模型下載量已突破25萬,顯示高度人氣。