
Gemma 4 Runs 40+ t/s on iPhone Locally
Google's Gemma 4 open models, including E2B/E4B, run locally on iPhones at over 40 tokens/sec with 128K context via MLX. Official Google AI Edge Gallery app enables easy deployment. Signals shift toward local AI eroding cloud token sales.


