
PyTorch-Triton 3.7 推出插件擴充系統
PyTorch-Triton 3.7 版本引入了全新的插件擴充框架。此系統允許開發者將自定義編譯器傳遞、方言 (dialects) 以及 DSL 擴充功能動態載入至上游 Triton 中。
Tag: #gpu-programming9 results

PyTorch-Triton 3.7 版本引入了全新的插件擴充框架。此系統允許開發者將自定義編譯器傳遞、方言 (dialects) 以及 DSL 擴充功能動態載入至上游 Triton 中。

一個涵蓋 LLM 開發全堆疊的綜合工作坊,從數學直覺、Transformer 架構到 GPU 編程與強化學習。內容專為偏好透過程式碼與實作範例學習,而非依賴繁重理論基礎的開發者設計。
cuTile Rust 引入了一種基於 Tile 的程式設計模型,利用 Rust 的所有權和借用檢查機制來確保 GPU 核心的記憶體安全與無資料競爭。研究團隊開發了 Grout 推論引擎,在 Qwen3 模型上展現了與 vLLM 和 SGLang 相當的效能。

NVIDIA 推出了 CCCL Runtime,這是 CUDA Core Compute Libraries 的一個新組件。它提供了現代化的 C++ 抽象,使開發人員的 CUDA 編程更加安全且便捷。

NVIDIA 的 cuTile 提供基於圖塊的 GPU 核心程式設計模型,使用高階操作如載入、儲存和矩陣乘法累加。cuTile.jl 將此模型擴展至 Julia,讓使用者無需低階執行緒管理即可撰寫自訂 GPU 核心。AI 代理自動化從 cuTile Python 至 cuTile.jl 的翻譯,簡化開發流程。

Nvidia 的 CUDA 工具包慶祝 20 週年,成為 GPU 加速 AI 和高效能運算的基礎。架構師 Stephen Jones 強調其從平行程式設計工具演進至驅動 ChatGPT 及機器人等新興領域。其通用設計確保適應快速 AI 進展。

NVIDIA 已推出 CUDA Tile 程式設計對 BASIC 語言的支援。CUDA 13.1 引入此磚塊式 GPU 範式,提升細粒度並行處理的可及性。此功能讓任何程式語言皆可針對 CUDA Tile,滿足開發者強烈需求。

NVIDIA CUDA Tile 解鎖張量核心與專用硬體,用於高效能 GPU 核心。繼今年早些 cuTile for Python 後,cuTile.jl 現為 Julia 開發者帶來相同程式模型,实现自然 GPU 程式設計。
開發者僅用 Apple 的 metal-cpp 庫建構 2 層 MNIST MLP,在 Apple Silicon 上優化 GPU 效能。透過更好緩衝與同步的迭代版本,在小批次訓練速度超越 MLX。提供儲存庫供實驗。