🏠IT之家•較早收集於 5h
開發者成功解鎖 Apple M4 晶片 15.8TFLOPS AI 算力

#apple-silicon#ai-hardware#local-trainingapple-m4-chipapplem4neural-engine
💡繞過 Apple 軟體限制,解鎖 M4 晶片的完整 AI 訓練潛力,實現高效能本地模型開發。
⚡ 30-Second TL;DR
有什麼變化
繞過 M4 神經網路引擎的軟體鎖定,實現直接模型訓練。
為什麼重要
這項突破可能將 Apple Silicon 裝置轉變為便攜式 AI 訓練工作站,大幅降低本地模型實驗的門檻。
下一步行動
關注該開發者的 GitHub 儲存庫,評估此自定義 MIL 方法是否能應用於您在 M4 硬體上的本地微調工作流程。
誰應關注:Developers & AI Engineers
關鍵要點
- •繞過 M4 神經網路引擎的軟體鎖定,實現直接模型訓練。
- •開發自定義 MIL 以繞過 Core ML 或 Metal 直接與硬體通訊。
- •透過在 RAM 中運行訓練流程,實現 15.8TFLOPS 的 AI 處理效能。
🧠 深度解析
背景與延伸:來自公開資料,非原文內容。引用 31 個來源。
🔑 增強重點摘要
- •Apple M4 神經網路引擎的官方規格為 38 TOPS (每秒兆次運算) 用於 AI 推論,這顯著高於開發者在訓練中實現的 15.8 TFLOPS,表明推論與訓練能力之間存在差異,或開發者解鎖了特定的訓練吞吐量。
- •此次繞過限制是透過逆向工程 Apple 的私有 API 實現的,具體而言是直接存取
_ANEClientAPI,並破解了記憶體內模型中間語言 (MIL) 的編譯路徑和 E5 二進位格式,從而無需 Core ML 即可直接與硬體通訊。 - •M4 神經網路引擎在架構上是一個 16 核心的圖形執行引擎,專為以原子操作方式執行整個編譯神經網路圖而優化,其特點是具有 127 個評估請求的佇列深度和獨立的動態電壓/頻率調整 (DVFS) 功能。
- •開發者自定義的 MIL 實作了「重新生成以繼續訓練」的機制,利用
exec()命令來處理訓練過程中的停滯,並且整個過程完全在 RAM 中運行,以避免較慢的 NAND 快閃記憶體寫入,從而實現了極高的執行速度。
📊 競品分析▸ Show
| 特性/晶片 | Apple M4 (神經網路引擎) | Qualcomm Snapdragon X Elite (NPU) | Intel Lunar Lake (NPU) | NVIDIA Jetson AGX Thor (嵌入式) |
|---|---|---|---|---|
| AI 算力 (TOPS/TFLOPS) | 38 TOPS (推論), 15.8 TFLOPS (訓練, 開發者解鎖) | 45 TOPS (INT4) | 48 TOPS | 2070 FP4 TFLOPS (AI 運算) |
| 記憶體架構 | 統一記憶體架構 (UMA) | LPDDR5x (最高 136GB/s 頻寬) | LPDDR5x (板載記憶體) | 128 GB 統一記憶體 |
| 典型應用 | 裝置端 AI 推論與訓練 (解鎖後) | 裝置端 AI PC、LLM 推論 | 裝置端 AI PC、Copilot+ PC | 嵌入式系統、生成式 AI 模型 |
| 功耗 | 高效率設計 | 低功耗、多日電池續航 | 降低 SoC 功耗 | 130W 功耗範圍 |
🛠️ 技術深入
- M4 神經網路引擎採用 16 核心設計,具備 38 TOPS (每秒兆次運算) 的推論能力。
- 該引擎本質上是一個圖形執行引擎,專為以原子操作方式執行完整的編譯神經網路圖而設計,而非通用型 GPU 或 CPU。
- 開發者透過逆向工程取得對私有
_ANEClientAPI 的直接存取權,並破解了記憶體內 MIL (模型中間語言) 編譯路徑和 E5 二進位格式,從而繞過 Core ML 實現直接硬體通訊。 - 自定義 MIL 透過在 RAM 中執行整個訓練流程,避免了較慢的 NAND 快閃記憶體寫入,並利用
exec()命令實現「重新生成以繼續訓練」的機制,以處理訓練過程中的停滯。 - M4 晶片採用台積電第二代 3 奈米製程 (TSMC N3E) 製造,整合了 280 億個電晶體。
- 晶片採用統一記憶體架構 (UMA),CPU、GPU 和神經網路引擎共享同一記憶體池,顯著降低了資料傳輸延遲和複製開銷。M4 Max 提供 400 GB/s 的記憶體頻寬。
- M4 的 CPU 核心支援 ARMv9.2-A 指令集,並包含 Scalable Matrix Extension (SME),該擴展在 512 位元向量暫存器上運作,並支援 BFloat16 資料類型,有助於加速神經網路推論。
🔮 前景展望AI analysis grounded in cited sources
Apple 可能會更積極地開放其神經網路引擎的低階存取權限,以鼓勵裝置端 AI 訓練。
開發者成功繞過限制證明了硬體能力,可能促使 Apple 重新評估其軟體策略,以吸引更多 AI 開發者並擴大其 AI 生態系統。
裝置端 AI 模型訓練的普及將加速個人化 AI 應用和隱私保護的發展。
能夠在本地裝置上訓練模型,意味著使用者資料無需上傳至雲端,從而增強了資料隱私,並能根據個人使用模式提供更客製化的 AI 體驗。
Apple Silicon 在 AI 訓練方面的潛力將對傳統依賴雲端 GPU 的 AI 開發模式構成挑戰。
儘管 M4 晶片在訓練大型模型方面可能仍不及 NVIDIA 高階 GPU,但其在裝置端實現高效能訓練的能力,為中小型 AI 模型和邊緣 AI 應用提供了更具成本效益和效率的替代方案。
⏳ 時間線
2017-09
Apple A11 Bionic 首次引入 Neural Engine (2 核心,0.6 TOPS)。
2020-11
Apple M1 晶片發布,其 Neural Engine 與 A14 相似 (16 核心,11 TOPS)。
2022-06
Apple M2 晶片發布,其 16 核心 Neural Engine 達到 15.8 TOPS。
2023-09
Apple A17 Pro 晶片發布,其 16 核心 Neural Engine 達到 35 TOPS。
2024-05-07
Apple 推出 M4 晶片,搭載 16 核心 Neural Engine,宣稱可達 38 TOPS。
2026-06-15
開發者成功解鎖 Apple M4 晶片 15.8 TFLOPS AI 算力 (文章事件日期)。
📎 來源 (31)
Factual claims are grounded in the sources below. Forward-looking analysis is AI-generated interpretation.
- wikipedia.org
- grokipedia.com
- apple.com
- tomshardware.com
- medium.com
- substack.com
- patsnap.com
- appleinsider.com
- daily.dev
- wccftech.com
- tomshardware.com
- hothardware.com
- pcmag.com
- notebookcheck.net
- qualcomm.com
- cnet.com
- laptopmag.com
- logicstechnology.com
- wccftech.com
- forbes.com
- nvidia.com
- simplifycpp.org
- mayhemcode.com
- roboflow.com
- evetech.co.za
- webai.com
- localaimaster.com
- like2byte.com
- fandom.com
- youtube.com
- fandom.com
📰
AI 週報
閱讀本週精選 AI 大事摘要 →
👉相關動態
AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: IT之家 ↗
每週 AI 簡報
每週一封,可隨時退訂。
