
DCP 加速可變長度序列訓練
Data-Centric Parallel(DCP)會根據每個批次的序列長度,動態調整平行化規模、梯度累積與重計算等執行設定。該方法在 32 張 H200 GPU 上最高可達 2.88 倍加速,且據稱只需約 10 行程式碼即可整合至模型中。
Tag: #gpu-optimization50 results

Data-Centric Parallel(DCP)會根據每個批次的序列長度,動態調整平行化規模、梯度累積與重計算等執行設定。該方法在 32 張 H200 GPU 上最高可達 2.88 倍加速,且據稱只需約 10 行程式碼即可整合至模型中。

Cursor 釋出採用 Apache 2.0 授權、針對 NVIDIA B200 GPU 的 MoE 訓練 megakernel。該專案宣稱端到端訓練速度提升約 40%、前向傳播速度提升約 140%,但 Reddit 貼文提醒仍需進行獨立基準測試。

Nvidia 已成為 Gears of War: E-Day 的獨家 PC 合作夥伴。該遊戲將支援 DLSS 4.5、光線追蹤,並針對著色器卡頓進行優化。
HexGrid Cloud 邀請 AI 社群建議開源權重模型與硬體配置,以進行嚴格的效能基準測試。他們旨在為各種 GPU 設定提供透明的指標,如吞吐量、首字延遲 (TTFT) 及每百萬 token 成本。

本文探討如何利用 NVIDIA Nsight 開發者工具來優化 Omniverse NuRec 管線。重點在於提升從 lidar 和攝影機等感測器數據進行 3D 環境重建的效能。
一個記錄 GPU 基礎設施、LLM 和電腦視覺複雜性的新教學系列。內容涵蓋硬體架構差異以及進階核心程式設計技術。

NVIDIA 引入了對 Vulkan Descriptor Heaps 的端到端支援,旨在簡化 Shader 存取 GPU 資源的方式。此更新致力於優化高效能渲染中複雜的資源綁定協定。

本文探討了優化 Transformer 架構的技術,旨在提高訓練效率。內容強調低精度訓練如何減少 GPU 資源消耗並加速實驗迭代週期。

阿里巴巴的 PAI(AI 平台)正整合 ATH 以解決算力空轉與內部效率低下的問題,重點在於自我救贖而非單純的硬體升級。

Together AI 聚焦其 kernels 團隊,這是 FlashAttention 和 ThunderKittens 的幕後推手。這些研究人員優化 GPU kernels,以彌補硬體限制與生產級 AI 需求之間的差距。此工作提升真實世界 AI 部署的效率。