🔬
梯度累積可能拖慢訓練速度
TraceML 使用 Qwen3-1.7B 搭配 LoRA 進行基準測試,發現即使有效批次大小相同,實體批次大小與累積步數不同,也可能造成顯著的訓練時間差異。在 100 次最佳化更新中,4×1 相較於 1×4 在 T4 上快 17%,在 L4 上快 41%。
Tag: #gpu-performance5 results
TraceML 使用 Qwen3-1.7B 搭配 LoRA 進行基準測試,發現即使有效批次大小相同,實體批次大小與累積步數不同,也可能造成顯著的訓練時間差異。在 100 次最佳化更新中,4×1 相較於 1×4 在 T4 上快 17%,在 L4 上快 41%。

NVIDIA 承認 Rubin GPU 在最大吞吐量下相較前代僅有 2 倍效能提升,儘管記憶體頻寬達 3 倍、FP4 效能達 5 倍。此蘋果對蘋果比較顯示 R200 (2300W) 比 B200 (1000W) 耗電 2.3 倍僅換來些微增益。生產環境效能效率引發疑慮。

高通發表 Snapdragon 6 Gen 5 具下一代 AI 相機功能,以及 Snapdragon 4 Gen 5 提供大幅 GPU 效能提升。兩者皆含 Smooth Motion UI 技術,用於平價手機。此針對中階裝置強化 AI 能力。

MSI 推出了一款全新的 QD-OLED 螢幕,能夠在三種不同的解析度和更新率模式之間切換。這讓使用者能根據遊戲或創作任務的特定需求,優化顯示效能。

Nvidia 已推出修復 PC 遊戲中惱人的「編譯著色器」等待時間的方案。Microsoft 和 Intel 也在開發自己的解決方案來處理此問題。