🔥PyTorch Blog•較早收集於 55m
PyTorch 2.11 簡化 aarch64 Linux 上的 CUDA 部署

💡別再為 ARM 建置苦惱;官方支援 aarch64 的 PyTorch CUDA wheels 終於推出了。
⚡ 30-Second TL;DR
有什麼變化
現在可透過 PyPI 取得適用於 aarch64 的官方 CUDA 支援 PyTorch wheels。
為什麼重要
此變更簡化了在 NVIDIA Jetson 或雲端 ARM 執行個體等 ARM 硬體上部署 AI 應用程式的流程。它降低了管理跨平台 AI 環境的 DevOps 團隊的維護成本。
下一步行動
如果您正在 ARM 架構硬體上部署 AI 模型,請更新您的 requirements.txt,直接從 PyPI 使用官方的 PyTorch 2.11+ wheels。
誰應關注:Developers & AI Engineers
關鍵要點
- •現在可透過 PyPI 取得適用於 aarch64 的官方 CUDA 支援 PyTorch wheels。
- •無需再使用自訂套件索引或複雜的建置解決方案。
- •大幅改善了基於 ARM 架構的 AI 基礎設施開發體驗。
🧠 深度解析
Web-grounded analysis with 19 cited sources.
🔑 增強重點摘要
- •PyTorch 2.11 將 PyPI 上的 CUDA wheels 預設為 CUDA 13.0 版本,同時支援 x86_64 和 aarch64 Linux,這相較於之前主要提供 CUDA 12.x 且僅限 x86_64 的 PyPI wheels 是一個重大升級。
- •此更新特別有利於基於 ARM 的雲端實例,例如 AWS Graviton、Microsoft Cobalt、NVIDIA Grace 和 Google Axion,透過利用 ARM 架構的 NEON 和 SVE 等功能,實現高效執行大型語言模型 (LLM) 和 Transformer 等 AI 推理工作負載,從而提供更具成本效益和可擴展性的解決方案。
- •過去,在 NVIDIA Jetson 等 ARM 設備上安裝支援 CUDA 的 PyTorch 需要專門編譯的 wheels,並且通常涉及複雜的手動步驟或依賴社群維護的鏡像,而現在官方 PyPI 支援大大簡化了這一過程。
- •PyTorch 2.11 的預設 CUDA 13.0 版本不再支援較舊的 GPU 架構(如 Volta、Pascal 和 Maxwell),但使用者仍可透過 CUDA 12.6 版本獲得對舊版硬體的相容性。
- •PyTorch 在 2026 年將發布週期從每季一次增加到每兩個月一次,這表明其開發和功能整合的速度正在加快。
📊 競品分析▸ Show
| Feature/Framework | PyTorch (2.11+) | TensorFlow (2.10+) | JAX (最新版本) |
|---|---|---|---|
| aarch64 CUDA PyPI Wheels | 官方支援,直接透過 PyPI 安裝 CUDA 13.0 wheels | CPU 版本由 AWS 維護,GPU 版本通常需自行編譯或依賴第三方 | 提供 aarch64 CUDA wheels,但特定 CUDA 版本或新架構可能仍需自行編譯 |
| 部署複雜度 | 大幅簡化,無需自訂套件索引或複雜建置 | 相對複雜,特別是 GPU 支援 | 可能需要自行編譯以獲得完整 GPU 支援 |
| 目標硬體平台 | NVIDIA Jetson、AWS Graviton、Microsoft Cobalt、NVIDIA Grace、Google Axion 等 ARM 雲端與邊緣設備 | NVIDIA Drive/Jetson 平台 (CPU 版本由 AWS 維護) | NVIDIA GPU (SM 7.5+ for CUDA 13), 支援 Linux aarch64 |
🛠️ 技術深入
- PyTorch 2.11 版本將 PyPI 上的 CUDA wheels 穩定版本過渡到 CUDA 13.0,同時適用於 x86_64 和 aarch64 二進制文件。
- 此更新要求原始碼建置的編譯器和建置配置支援 C++20,並且不再支援使用 CUDA 12.6 之前版本進行原始碼建置。
- 對於 aarch64,CUDA 13.0 和 13.2(PyTorch 2.12 的實驗性版本)除了支援 Ampere (8.0) 和 Hopper (9.0) 外,還增加了對 Blackwell 架構 (SM 10.0, 11.0, 12.0) 的支援。
- 較舊的 ARMv8.0 處理器(例如 Cortex-A53/A72/A73)在使用 PyTorch 2.10.0 時可能會遇到問題(SIGILL 崩潰),這是由於
libc10.so中包含的 LSE (Large System Extensions) 指令在 ARMv8.0 上不受支援,這表明在編譯時需要仔細設定編譯旗標以確保更廣泛的 ARM 相容性。 - 該整合利用 ARM 架構的 NEON 和 SVE (Scalable Vector Extensions) 等功能來提升性能,特別是在卷積、激活和量化運算子方面,並增強了 TorchInductor 和 ARM 後端的向量化正確性。
🔮 前景展望AI analysis grounded in cited sources
ARM 架構 AI 基礎設施的採用將顯著加速。
aarch64 Linux 上簡化的 CUDA 部署消除了開發人員和企業的一個主要障礙,使 ARM 平台在雲端和邊緣運算中的 AI 開發和部署更具吸引力。
基於 ARM 的 NVIDIA Jetson 設備上的邊緣 AI 開發將變得更容易。
消除 CUDA 啟用 PyTorch 在 aarch64 上複雜的手動建置過程,直接有利於 Jetson 等平台,從而促進嵌入式和邊緣 AI 應用程式的創新。
PyTorch 在基於 ARM 的 AI 工作負載中的市場份額將相對於競爭對手增加。
透過為 aarch64 上的 CUDA 提供官方、易於安裝的 PyPI wheels,PyTorch 在開發者體驗方面相對於仍需要複雜建置過程或依賴第三方套件的框架獲得了顯著優勢。
⏳ 時間線
2016-09
PyTorch 首次發布。
2018-03
Caffe2 併入 PyTorch。
2022-09
Meta 宣布 PyTorch 將由獨立的 PyTorch 基金會管理。
2023-03
PyTorch 2.0 發布,引入 TorchDynamo 並顯著提升性能。
2025-04
PyTorch 2.7 發布,為 Linux x86 和 arm64 架構提供 CUDA 12.8 的預建 wheels。
2026-03
PyTorch 2.11 發布,將 CUDA 13.0 作為 PyPI 上 x86_64 和 aarch64 Linux wheels 的預設版本。
📎 來源 (19)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: PyTorch Blog ↗