
KernelArc 協調多代理最佳化 GPU 核心
KernelArc 是一套面向異質工作負載、自主最佳化 GPU 核心的多代理框架。在 NVIDIA H100 與 B200 GPU 上,其實作於 2026 年 7 月 30 日的 SOL-ExecBench 快照中,於代表性的 L1、L2、Quantization 與 FlashInfer 任務排名第一。
Tag: #kernel-optimization6 results

KernelArc 是一套面向異質工作負載、自主最佳化 GPU 核心的多代理框架。在 NVIDIA H100 與 B200 GPU 上,其實作於 2026 年 7 月 30 日的 SOL-ExecBench 快照中,於代表性的 L1、L2、Quantization 與 FlashInfer 任務排名第一。

PyTorch-Triton 3.7 版本引入了全新的插件擴充框架。此系統允許開發者將自定義編譯器傳遞、方言 (dialects) 以及 DSL 擴充功能動態載入至上游 Triton 中。

PyTorch 為機器學習核心的領域特定語言 Helion 引入了 LLM 引導的自動調優技術。此方法將效能調優所需的時間從幾分鐘大幅縮短至幾秒鐘。

Meta 的 Ranking Engineer Agent 推出 KernelEvolve,自主優化廣告排名模型的低階 AI 基礎設施。本系列第二篇部落格文章,接續代理的 ML 探索功能,用於設計與分析實驗。它加速 Meta 廣告排名的創新。
kernel-anvil 在 AMD GPU 上剖析 GGUF 模型形狀,並產生最適 llama.cpp 核心配置,無需重新編譯即可實現解碼速度提升 2 倍。它針對 RDNA3 GPU 如 7900 XTX,在 Qwen3.5-27B Q4_K_M 上達到 27 tok/s。使用方式為快速剖析並套用小型 llama.cpp 修補。

Google 將 AutoFDO 優化方法整合至 Android 核心,使用熱門應用程式的真實使用資料。目的是讓作業系統運行更快、更有效率。此變更針對核心效能改善。