
KernelArc 協調多代理最佳化 GPU 核心
KernelArc 是一套面向異質工作負載、自主最佳化 GPU 核心的多代理框架。在 NVIDIA H100 與 B200 GPU 上,其實作於 2026 年 7 月 30 日的 SOL-ExecBench 快照中,於代表性的 L1、L2、Quantization 與 FlashInfer 任務排名第一。
Tag: #gpu-kernels6 results

KernelArc 是一套面向異質工作負載、自主最佳化 GPU 核心的多代理框架。在 NVIDIA H100 與 B200 GPU 上,其實作於 2026 年 7 月 30 日的 SOL-ExecBench 快照中,於代表性的 L1、L2、Quantization 與 FlashInfer 任務排名第一。
Cloudflare 的 Unweight 以無損方式壓縮 LLM 15-22%,在 H100 GPU 上為 Llama-3.1-8B 節省約 3GB VRAM。GPU 核心已上 GitHub 並發布技術論文;接下來壓縮注意力權重。

PyTorch 推出廣義點積注意力 (GDPA),這是標準點積注意力 (SDPA) 的變體,將 softmax 操作替換以解決 GPU 訓練核心的現實挑戰。此核心設計提升 transformer 模型訓練效率。

NVIDIA 的 cuda.compute 讓 Python 開發者無需 C++ 即可撰寫高效能 GPU 核心,並登頂 GPU MODE 核心排行榜。此技術消除了 ML 工作流程中自訂 C++ 核心與 Python 綁定的需求。PyTorch 等框架傳統上仰賴手寫 CUDA C++ 以達高速能。
Reddit 討論新手 GPU 核心與 LLM 推論工程師應學舊 C++ CuTe/CUTLASS,還是優先 NVIDIA 的 CuTeDSL Python DSL。NVIDIA 推 CuTeDSL 效能相同、無模板、更快迭代,並整合 TorchInductor。FlashAttention-4、FlashInfer 和 SGLang 路線圖顯示轉變。

PyTorch 宣布將於 2026 年 3 月 16-19 日在聖荷西 NVIDIA GTC 2026 展會強勢亮相,Meta 攤位 #338 提供示範。重點包括 Helion 自訂核心編寫實作體驗,以及 ExecuTorch 邊緣裝置推論展示。核心維護者 Alban Desmaison 將演講 PyTorch 如何從核心到叢集驅動高效能 AI。