🦙較早收集於 5h

React Native ExecuTorch 新增 Gemma 4 支援

React Native ExecuTorch 新增 Gemma 4 支援
PostLinkedIn
🦙閱讀原文: Reddit r/LocalLLaMA
#mobile-ai#on-device-inference#cross-platformreact-native-executorchgooglegemmareact-nativeexecutorchapple

💡透過 Android 和 iOS 的硬體加速,直接在行動裝置上部署高效能 LLM。

⚡ 30-Second TL;DR

有什麼變化

React Native 應用程式全面支援離線運行 Gemma 4

為什麼重要

顯著降低了行動開發者將高效能本地 LLM 整合到跨平台應用程式中的門檻。

下一步行動

複製 react-native-executorch 儲存庫並在您的 Android 或 iOS 裝置上測試範例應用程式,以評估本地推論效能。

誰應關注:Developers & AI Engineers

關鍵要點

  • React Native 應用程式全面支援離線運行 Gemma 4
  • 透過 Android 的 Vulkan 委派實現 GPU 加速
  • 透過 Apple Silicon 的 MLX 委派實現 GPU 加速

🧠 深度解析

背景與延伸:來自公開資料,非原文內容。引用 26 個來源。

🔑 增強重點摘要

  • ExecuTorch 是 PyTorch 針對裝置端 AI 部署的統一解決方案,為 Meta 旗下的 Instagram、WhatsApp、Quest 3 和 Ray-Ban Meta 智慧眼鏡等產品提供裝置端 AI 支援,強調隱私、效能和可攜性。
  • Gemma 4 是 Google DeepMind 推出的多模態開源 AI 模型系列,提供多種尺寸(E2B、E4B、26B A4B MoE、31B Dense 和 12B Unified),並支援長達 256K tokens 的長上下文。
  • 此整合讓 React Native 開發者能夠建構注重隱私、快速且可離線運行的 AI 應用程式,透過 ExecuTorch 輕量級的 C++ 運行時和 JavaScript/TypeScript API 層實現。
  • ExecuTorch 採用預先編譯 (AOT) 技術,將 PyTorch 模型準備好用於邊緣部署,將其轉換為緊湊的 .pte 檔案格式,以實現高效的裝置端執行。
  • 針對 Apple Silicon 的 MLX 委派(delegate)顯著提升了效能,在生成式 AI 工作負載方面,其吞吐量比 macOS 上現有的 ExecuTorch 委派高出 3-6 倍。
📊 競品分析▸ Show
框架/運行時主要特點適用場景
React Native ExecuTorch- PyTorch 原生模型部署。
  • 輕量級 C++ 運行時 (50KB)。
  • 支援多種硬體加速器 (CPU, GPU, NPU)。
  • 預先編譯 (AOT) 優化。
  • 支援離線運行和隱私保護。 | - React Native 應用程式的裝置端 AI 推理。
  • 需要高效能、低延遲的行動和邊緣 AI 應用。
  • 部署 PyTorch 模型到智慧型手機、穿戴裝置和微控制器。 | | MediaPipe (Google) | - Google 生態系統支援。
  • 提供預製的視覺、音訊和文字 AI 構建塊。
  • 易於與 Kotlin/Java 整合。
  • 支援 CPU 和 GPU 加速 (Android)。 | - 快速整合 Google 支援的 AI 模型到 Android 應用程式。
  • 視覺、音訊和文字處理的現成解決方案。 | | Llama.cpp | - 輕量級 C/C++ 核心。
  • 廣泛的 GGUF 模型支援。
  • 社群活躍,高度靈活。 | - 需要最大靈活性來運行量化開源模型。
  • 開發者希望對整個堆疊有更多控制權。 | | TensorFlow Lite | - Google 支援,成熟度高。
  • 廣泛的 API 和 GPU 支援。
  • 針對行動和嵌入式裝置優化。 | - 部署 TensorFlow 模型到行動和邊緣裝置。
  • 需要穩定且廣泛支援的行動 AI 框架。 | | ONNX Runtime | - 跨平台部署。
  • 統一的推理後端 (行動、桌面、雲端)。
  • 優異的硬體靈活性。 | - 需要在不同平台和硬體上保持一致的推理後端。 | | Core ML (Apple) | - Apple 平台原生支援。
  • 針對 Apple Silicon 晶片優化 (CPU, GPU, 神經引擎)。 | - 專注於 iOS/macOS 應用程式的裝置端 AI 推理。 | | OpenVINO (Intel) | - 針對 Intel CPU/GPU/NPU 優化。
  • 支援直接 PyTorch 轉換。 | - 部署 AI 模型到 Intel 硬體平台,包括 CPU、Arc GPU 和 NPU。 |

🛠️ 技術深入

  • ExecuTorch 核心架構: ExecuTorch 是 PyTorch 的裝置端 AI 解決方案,透過預先編譯 (AOT) 將 PyTorch 模型轉換為輕量級的 .pte 檔案格式,該格式包含模型圖、優化和量化資訊,並由一個最小的 C++ 運行時(基礎佔用空間約 50KB)在裝置端執行。
  • 委派機制 (Delegates): ExecuTorch 採用委派機制,允許模型的部分子圖被卸載到專門的硬體加速器(如 GPU、NPU)上執行,以提高效能和效率。對於不支援的操作,則會回退到 CPU 執行。
  • Vulkan 委派 (Android): 針對 Android 裝置,Vulkan 委派是基於跨平台 Vulkan GPU API 標準的原生 GPU 委派。它封裝了一個 Vulkan Compute Library,該庫透過 GLSL 計算著色器為 PyTorch 運算子提供 GPU 實現。
  • MLX 委派 (Apple Silicon): 針對 Apple Silicon 裝置,MLX 委派是一個新的 ExecuTorch 後端,它利用 Apple 的 MLX 框架在 Apple Silicon GPU 上編譯和運行 PyTorch 模型。它與 PyTorch 2 匯出堆疊無縫整合,並支援多種量化選項,包括 BF16、FP16、FP32、2/4/8 位元仿射和 NVFP4。
  • Gemma 4 模型特性: Gemma 4 模型是多模態的,能夠處理文字、圖像和音訊輸入,並生成文字輸出。它支援長上下文(小型模型最高 128K tokens,中型模型最高 256K tokens),並採用 Dense 和 Mixture-of-Experts (MoE) 兩種架構。
  • Gemma 4 12B Unified 模型架構: Gemma 4 12B Unified 模型採用無編碼器 (encoder-free) 架構,直接將多模態數據輸入到 LLM 骨幹中,從而減少了多模態處理的延遲和記憶體碎片化。

🔮 前景展望AI analysis grounded in cited sources

增強的隱私和離線功能將推動 AI 在敏感應用中的更廣泛採用。
裝置端推理確保數據不會離開裝置,使其成為處理個人內容而無需雲端暴露的理想選擇,並在低頻寬或離線環境中實現功能。
簡化的 PyTorch 原生工作流程將加速 AI 模型在邊緣裝置上的部署。
ExecuTorch 允許開發人員從研究到生產使用熟悉的 PyTorch API,無需手動 C++ 重寫或中間格式轉換,從而加快了開發週期。
增加的硬體加速支援將帶來更複雜和響應更快的行動 AI 體驗。
利用 Vulkan 和 MLX 等 GPU/NPU 委派顯著提高了推理速度和效率,從而在消費設備上實現了即時、複雜的 AI 功能。

時間線

2023-10
ExecuTorch Alpha 版本在 PyTorch 大會上發布
2024-02-21
Gemma 初始版本發布 (2B 和 7B 尺寸)
2024-06-27
Gemma 2 發布 (9B 和 27B 尺寸)
2025-03-12
Gemma 3 發布 (1B, 4B, 12B 和 27B 尺寸)
2025-10-22
ExecuTorch 1.0 正式發布 (GA),高通和 Arm 做出貢獻
2026-04-02
Google 發布 Gemma 4 (Apache 2.0 許可證)
2026-05-18
ExecuTorch MLX 委派支援 Apple Silicon GPU
2026-06-03
Gemma 4 12B Unified 模型發布
2026-06-15
React Native ExecuTorch 宣布支援 Gemma 4,並提供 Vulkan 和 MLX 加速
📰

AI 週報

閱讀本週精選 AI 大事摘要 →

👉相關動態

AI 策展新聞聚合。所有內容版權歸原始發布者所有。
原始來源: Reddit r/LocalLLaMA

這是摘要,不是原文。去看原站,或訂閱每週簡報。

每週 AI 簡報

每週一封,可隨時退訂。