☁️較早收集於 4m

Neuron Agentic Development 加速 AWS Trainium 核心優化

Neuron Agentic Development 加速 AWS Trainium 核心優化
PostLinkedIn
☁️閱讀原文: AWS Machine Learning Blog

💡使用全新的 AI 驅動代理工作流程,自動化 AWS Trainium 和 Inferentia 的複雜核心調校。

⚡ 30-Second TL;DR

有什麼變化

引入 AI 代理以自動化核心開發工作流程

為什麼重要

這大幅降低了開發者利用 AWS 自研晶片的門檻,有望提高 Trainium 在大規模模型訓練中的採用率。

下一步行動

如果您正在 AWS Trainium 上訓練模型,請查閱 Neuron 文件,將這些代理整合到您的 CI/CD 流程中。

誰應關注:Developers & AI Engineers

關鍵要點

  • 引入 AI 代理以自動化核心開發工作流程
  • 專為 AWS Trainium 和 Inferentia 硬體設計
  • 消除 ML 模型手動核心調校的需求

🧠 深度解析

Web-grounded analysis with 26 cited sources.

🔑 增強重點摘要

  • Neuron Agentic Development 於 2026 年 4 月以 Beta 版形式推出,是一個開源的 AI 功能套件,旨在加速 AWS Trainium 和 Inferentia 上的開發工作。
  • 此工具包含 AI 代理和技能,能夠編寫、偵錯、分析和剖析 Neuron Kernel Interface (NKI) 核心,並支援透過自然語言或 PyTorch/NumPy 參考實作進行核心開發。
  • 除了核心開發,Neuron Agentic Development 還支援將 HuggingFace 模型移植到 NxD Inference,並驗證移植模型的數值等效性。
  • 該工具旨在整合到現有的代理編碼環境中,例如 Claude Code 和 Kiro,讓開發人員能夠在不需深入學習 Neuron 特定工具的情況下,協調 NKI 翻譯、裝置編譯、剖析和目標分析。
  • Neuron Agentic Development 的功能涵蓋核心編寫、編譯錯誤偵錯、文件查詢、效能剖析捕捉及分析,並能識別核心效率低下的問題,例如中間資料溢出和冗餘的 TensorEngine 轉置。
📊 競品分析▸ Show
特性/平台AWS Trainium/InferentiaGoogle TPU (v5e/Ironwood)NVIDIA GPU (H100/A100)
主要用途Trainium 用於高效能模型訓練;Inferentia 用於低成本、高吞吐量推論。TPU v5e 用於訓練和推論,特別針對大型語言模型 (LLM);Ironwood (TPU v7) 專為訓練和推論設計。H100/A100 用於通用 AI 訓練和推論,提供最高單晶片效能和廣泛的生態系統。
成本效益Trainium 訓練成本比 A100 低約 54%;Inferentia 推論成本比傳統 GPU 低高達 70%。TPU v5e 在 LLM 推論方面提供比 H100 高達 4 倍的每美元效能;訓練大型模型時,每十億個 token 的成本比 H100 低 50-70%。H100 的世代速度提升伴隨高昂價格,其每美元效能僅略優於或與 A100 持平。
效能 (FP8)Trainium3 單晶片提供 2.52 PFLOPS;Trainium2 提供 1,299 TFLOPS。Inferentia2 提供 380 INT8 TOPS。TPU v5e 8 晶片在 Llama2-70B 上每秒生成約 2,175 個 token;Ironwood 單晶片提供 4,614 TFLOPS。H100 GPU 提供高達約 1,000 TFLOPS。
記憶體 (HBM)Trainium3 配備 144 GB HBM3e,頻寬 4.9 TB/s;Trainium2 配備 96 GiB,頻寬 2.9 TB/s。Inferentia2 配備 32 GB HBM,頻寬 9.8 TB/s。Ironwood 配備 192 GB HBM,頻寬 7.37 TB/s;TPU v5e 每晶片 16 GB HBM。H100 配備 80GB HBM3,頻寬 3.35 TB/s。
生態系統/框架透過 Neuron SDK 深度整合 PyTorch 和 JAX,支援 HuggingFace、vLLM 等。緊密整合 TensorFlow 和 JAX/XLA 生態系統。CUDA 是 AI 開發的通用語言,廣泛支援多種框架。
架構理念混合式方法,開發自有晶片同時與 NVIDIA 深度合作,提供客戶靈活性。垂直整合堆疊,硬體與軟體及雲端基礎設施緊密耦合。通用型 GPU,提供廣泛的應用彈性。

🛠️ 技術深入

  • Neuron Agentic Development 概述:這是一個開源的 AI 代理和技能套件,用於在 AWS Trainium 和 Inferentia 上進行開發。它在 Claude Code 和 Kiro 等代理編碼環境中運行,允許開發人員使用自然語言或 PyTorch/NumPy 實作來驅動核心開發。
  • Neuron Kernel Interface (NKI):NKI 是 Trainium 和 Inferentia 的低階程式設計介面,允許開發人員直接存取硬體的 Tensor 引擎、向量引擎和 DMA 子系統,以實現超越框架級編譯的效能。
  • 代理和技能
    • neuron-nki-agent:NKI 開發的統一入口點,根據請求自動選擇工作流程(編寫、偵錯、剖析或文件查詢)。
    • neuron-nki-writing-agent:專注於核心編寫,將 PyTorch、NumPy 或自然語言描述轉換為 NKI 程式碼。
    • neuron-nki-debugging:使用 NCC 錯誤碼的分類索引解決 NKI 編譯錯誤。
    • neuron-nki-profiling:捕捉硬體上的執行追蹤並提取 JSON 指標。
    • neuron-nki-profile-querying:對剖析資料執行 SQL 查詢,以計算效能界限並識別瓶頸。
    • neuron-nki-docs:在代理對話中查詢 NKI 文件、API 參考、教學和錯誤碼。
    • neuron-framework-autoport:將 HuggingFace 模型端到端移植到 NxD Inference。
    • neuron-framework-equivalence:驗證移植模型的數值等效性。
  • Trainium 晶片架構
    • Trainium2:包含八個 NeuronCore-v3 核心,提供 1,299 FP8 TFLOPS 和 96 GiB 裝置記憶體,頻寬 2.9 TB/s。支援邏輯 NeuronCore 配置 (LNC) 和 NeuronLink-v3 晶片間互連。
    • Trainium3:採用台積電 3nm 製程,整合八個 NeuronCore-v4 運算核心,單晶片提供 2.52 PFLOPS 的 FP8 運算能力,配備 144 GB HBM3e 記憶體,頻寬 4.9 TB/s。
  • Inferentia 晶片架構
    • Inferentia1:包含四個 NeuronCore,具有專為深度學習推論操作優化的硬體區塊。
    • Inferentia2:每個晶片包含兩個 NeuronCore-v2 核心,提供 380 INT8 TOPS 和 32GiB 高頻寬裝置記憶體,頻寬 9.8 TB/s。支援 NeuronLink-v2 晶片間互連。
  • NeuronCore-v2/v3/v4:這些是 Neuron 晶片的核心運算單元,包含 Tensor、Vector 和 Scalar 引擎,以及 GPSIMD 引擎,用於實現自訂操作。
  • 資料類型支援:Trainium 和 Inferentia 晶片支援多種精度格式,包括 FP8、BF16/FP16/TF32、FP32 和 INT8,以平衡準確性和效能。
  • Neuron SDK:包含 Neuron Compiler (將模型圖編譯為 NEFF 檔案)、Neuron Runtime (在 Neuron 裝置上執行編譯模型)、ML 框架整合 (PyTorch 和 JAX) 以及開發人員工具 (Neuron Explorer 用於剖析和偵錯)。

🔮 前景展望AI analysis grounded in cited sources

自訂核心開發的門檻將顯著降低。
Neuron Agentic Development 透過 AI 代理自動化低階 NKI 核心的編寫、偵錯和優化,使更多開發人員能夠利用 AWS 自研晶片的全部潛力,而無需深入的硬體專業知識。
AWS Trainium 和 Inferentia 晶片的採用率將加速增長。
透過簡化模型優化和移植流程,Neuron Agentic Development 降低了使用 AWS 自研晶片的複雜性和時間成本,使其對尋求成本效益和高效能的企業更具吸引力。
AI 代理將成為機器學習工作流程中不可或缺的一部分,超越傳統自動化工具。
Neuron Agentic Development 展示了 AI 代理如何處理複雜、決策密集型的機器學習優化任務,從而將被動操作轉變為主動、智慧的系統,這預示著 AI 代理在整個 ML 開發生命週期中的更廣泛應用。

時間線

2015
AWS 收購 Annapurna Labs,開始自研晶片策略
2018
AWS Inferentia 推論晶片首次發布
2020
AWS Trainium 訓練晶片首次發布
2022
Inferentia2 推論晶片發布
2023-11
Trainium2 訓練晶片在 AWS re:Invent 2023 上發布
2024-09
AWS Neuron 引入 Neuron Kernel Interface (NKI)
2025-12
Trainium3 訓練晶片在 AWS re:Invent 2025 上發布
2026-04
Neuron Agentic Development 以 Beta 版形式推出
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: AWS Machine Learning Blog