⚙️
除錯極端效能瓶頸:T4 與 A100 的效能差異
一位開發者報告在 NVIDIA T4 上執行點追蹤模型時,效能比 A100 慢了 170 倍。調查重點在於使用 FP32 精度時,4D 相關體積與 Transformer 層架構可能產生的瓶頸。
Tag: #performance-tuning9 results
一位開發者報告在 NVIDIA T4 上執行點追蹤模型時,效能比 A100 慢了 170 倍。調查重點在於使用 FP32 精度時,4D 相關體積與 Transformer 層架構可能產生的瓶頸。
本文探討 PyTorch 編譯器如何透過 Kernel Fusion 技術實現高達 10 倍的效能提升。文中解釋了從執行單一 GPU Kernel 到優化融合運算的技術轉變。

Weaviate 推出了查詢分析功能,協助開發者識別效能瓶頸。此功能可針對慢查詢提供每個階段與分片的詳細耗時分析。

本文探討了優化 Transformer 架構的技術,旨在提高訓練效率。內容強調低精度訓練如何減少 GPU 資源消耗並加速實驗迭代週期。

針對 llama.cpp 的一項新合併請求,旨在移除填充(padding)與多餘的 D2D(裝置對裝置)複製操作,以提升多 token 預測(MTP)的效能。

Cloudflare 在處理 PB 級 ClickHouse 叢集時,因查詢規劃器中的隱藏瓶頸導致計費管線延遲。他們發現問題源於分區變更期間的鎖定競爭,並透過開發上游修補程式解決了此問題。

使用者證實 Qwen3.6 在複雜工作負載上性能大幅提升,可媲美 Opus 和 Codex 層級。在 M5 Max 上正確配置後速度驚人。關鍵是啟用 `preserve_thinking` 旗標。

作者根據數十年測試,找出 2026 年 Linux 效能的最佳 RAM。此甜蜜點來自個人經驗,提供最佳效能指引。

Samsung 的 One UI 8.5 更新為用戶帶來了適應期,導致出現各種性能與穩定性回報。本文概述了排查並解決這些軟體相關問題的初步步驟。