
iPhone本地跑Gemma 4超40 token/秒
Google Gemma 4開源模型,包括E2B/E4B,可在iPhone本地以MLX達40+ token/秒,上下文128K。官方Google AI Edge Gallery App簡易部署。預示本地AI侵蝕雲端token銷售。
Tag: #mobile-inference6 results

Google Gemma 4開源模型,包括E2B/E4B,可在iPhone本地以MLX達40+ token/秒,上下文128K。官方Google AI Edge Gallery App簡易部署。預示本地AI侵蝕雲端token銷售。
新型1位元8B參數LLM僅需1.15GB記憶體,即可與Llama3 8B在基準測試中匹敵。它在RTX 4090上達440 tok/s、在M4 Pro上136 tok/s、在iPhone上約40 tok/s。該模型已上架Hugging Face,由Caltech衍生公司推出。

一位開發者將 Microsoft 的 BitNet 移植到 iOS,在 iPhone 14 Pro Max 上使用 0.7B 模型達到 45-46 tok/s,僅需 200MB 記憶體。BitNet 使用 1-bit 權重(-1、0、+1)使模型極小且快速運行。計畫很快開源指令微調的 2B 模型。
文章分析 Google TurboQuant KV 快取壓縮(3-4 位元,零損失)對本地設定與移動推論的影響。探討產出增益、消費 GPU 擴展,以及手機 RAM/電池影響。尋求 mlx/llama.cpp fork 的基準測試。

標準版 iPhone 18 可能搭載 12GB RAM,取代先前傳出的 9GB 配置。額外記憶體或能支援更多 Apple 的裝置端 AI 功能。

用戶在 Samsung S25 Ultra(12GB RAM、Snapdragon 8 Elite)測試 Qwen3 9B q4_0 量化。使用 Hexagon NPU 達每秒逾 6 token 生成速度。證明行動裝置上可行推論。