🇨🇳較早收集於 13h

Apple M4 神經引擎限制被逆向工程解鎖

Apple M4 神經引擎限制被逆向工程解鎖
PostLinkedIn
🇨🇳閱讀原文: cnBeta (Full RSS)
#hardware#npu#reverse-engineering#local-llmapple-m4-chipapplem4neural engine

💡繞過 Apple 的軟體限制,解鎖 M4 晶片高達 15.8 TFLOPS 的 AI 算力。

⚡ 30-Second TL;DR

有什麼變化

成功繞過 Apple 的軟體鎖定神經引擎。

為什麼重要

這一突破使開發者能夠在不使用 Apple 專有軟體堆疊的情況下,直接在 M4 硬體上運行高性能 AI 模型。這為 Mac 設備上的本地 LLM 推理和邊緣計算開闢了新可能。

下一步行動

探索該自定義 MIL 實現,以測試您的 M4 Mac 硬體上的本地模型推理性能。

誰應關注:Developers & AI Engineers

關鍵要點

  • 成功繞過 Apple 的軟體鎖定神經引擎。
  • 實現了 15.8 TFLOPS 的原始 AI 計算性能。
  • 開發了自定義 MIL 以繞過 CoreML 和 Metal 的依賴。

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 35 個來源。

🔑 增強重點摘要

  • 此次解鎖特別使 M4 晶片的神經網路引擎能夠進行 AI 模型訓練,包括完整的正向傳播和反向傳播,這與蘋果官方原先僅開放推理使用的限制形成對比。
  • 所實現的 15.8 TFLOPS 算力是在 FP16 精度下測得,這與蘋果官方宣稱的 38 TOPS (INT8) 存在精度差異,且 M4 ANE 的底層架構主要針對卷積運算進行優化,而非通用矩陣乘法。
  • 該實作方案將所有資料和狀態保留在 RAM 中運行,以避免 NAND 快閃記憶體寫入速度較慢的瓶頸,並採用了 exec() 機制,在訓練過程卡住時能重新啟動進程以繼續訓練。
  • 開發者已將相關程式碼開源至 GitHub,為社群提供了直接與 M4 硬體底層互動的技術參考。
  • M4 神經網路引擎在訓練單層 Transformer 模型時展現出高效能功耗比,能效比高達 6.6 TFLOPS/W,且功耗低於 1 瓦。
📊 競品分析▸ Show
晶片/平台AI 算力 (NPU)備註
Apple M438 TOPS (INT8, 官方) / 15.8 TFLOPS (FP16, 解鎖)官方主要用於推理,解鎖後可進行訓練。
Qualcomm Snapdragon X Elite45 TOPS (NPU, INT4/INT8)總平台 AI 算力可達 70 TOPS。
Intel Lunar Lake48 TOPS (NPU, INT8)總平台 AI 算力超過 100 TOPS (CPU+GPU+NPU)。
NVIDIA Jetson AGX Orin高達 275 TOPS (INT8)針對邊緣 AI 和機器人應用。
NVIDIA Jetson Orin Nano Super100 TOPS (INT8)針對入門級邊緣 AI 應用。

🛠️ 技術深入

  • 該實作方案透過從零開發的自定義 Model Intermediate Language (MIL) 直接與 M4 晶片硬體通信,繞過了蘋果的 CoreML 和 Metal API 依賴。
  • 為了提高速度和穩定性,所有資料和狀態在訓練過程中都保留在 RAM 中,避免了對速度較慢的 NAND 快閃記憶體的寫入操作。
  • 方案中包含一個 exec() 機制,用於在訓練進程卡住時重新啟動,確保訓練的連續性。
  • M4 神經網路引擎的底層架構主要針對卷積運算進行優化,而非通用的矩陣乘法單元,這意味著它在處理 Transformer 注意力機制等特定 AI 任務時表現出色,但在其他場景可能受限。
  • M4 ANE 內建約 32MB 的片上 SRAM,需要透過計算圖編譯(16-64 個操作鏈)才能達到約 94% 的硬體利用率。
  • 該技術已透過 GitHub 開源,允許其他開發者檢視和利用其底層實現。

🔮 前景展望AI analysis grounded in cited sources

開發者將獲得更大的裝置端 AI 訓練自由度。
繞過蘋果的軟體限制,使開發者能夠直接利用 M4 晶片的全部 AI 訓練能力,從而促進新的本地 AI 應用程式開發和創新。
蘋果可能面臨壓力,需官方開放更多 NPU 功能。
此次成功解鎖證明了硬體潛在的訓練能力,這可能會促使蘋果在未來的 M 系列晶片(如 M5)或 CoreML 更新中提供更靈活的官方 API。
AI 模型訓練將變得更加普及和易於存取。
在 iPad 或 Mac 等消費級裝置上實現 15.8 TFLOPS 的 AI 訓練能力,降低了對昂貴專用電腦或高階 NVIDIA GPU 的依賴,使 AI 開發更加平民化。

時間線

2017-09
Apple A11 Bionic 晶片首次引入神經網路引擎 (Neural Engine)。
2020-11
Apple M1 晶片發布,將神經網路引擎帶入 Mac 產品線。
2022-06
Apple M2 晶片發布,其神經網路引擎提供 15.8 TOPS (INT8) 算力。
2024-05-07
Apple M4 晶片正式發表,其神經網路引擎宣稱可達 38 TOPS (INT8) 算力。
2024-10-30
Apple M4 Pro 和 M4 Max 晶片發布。
2026-03
開發者(如 Manjeet Singh)初步成功逆向工程 M4 ANE,首次在 Mac 裝置上實現本地 AI 模型訓練。
2026-06-16
新聞報導開發者(如 @0x0SojalSec)成功繞過 Apple M4 神經引擎軟體限制,解鎖 15.8 TFLOPS 的 AI 訓練算力,並公開自定義 MIL 方案。
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: cnBeta (Full RSS)

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。