
Gemma 4 發布:多模態開放模型
Google DeepMind 推出 Gemma 4,這是開放權重多模態模型,尺寸包括 E2B、E4B、26B A4B 和 31B。它們處理文字、圖像、影片和音訊,具備高達 256K 上下文,並強化推理、程式設計和代理功能。提供 Dense 和 MoE 變體,適合裝置端部署。
Tag: #on-device36 results

Google DeepMind 推出 Gemma 4,這是開放權重多模態模型,尺寸包括 E2B、E4B、26B A4B 和 31B。它們處理文字、圖像、影片和音訊,具備高達 256K 上下文,並強化推理、程式設計和代理功能。提供 Dense 和 MoE 變體,適合裝置端部署。

Liquid AI 發布了 LFM2.5-230M,這是一款專為邊緣裝置高效數據提取而設計的 2.3 億參數模型。它採用 LFM2 架構,在保持低於 400MB 記憶體佔用的同時,效能超越了多款規模更大的模型。

Google 的 Gemma 4 模型現以 Apache 2.0 完全開源。支援伺服器、手機和 Raspberry Pi 等裝置的離線多模態 AI。開發者獲得邊緣與本地部署的完全控制權。
新型1位元8B參數LLM僅需1.15GB記憶體,即可與Llama3 8B在基準測試中匹敵。它在RTX 4090上達440 tok/s、在M4 Pro上136 tok/s、在iPhone上約40 tok/s。該模型已上架Hugging Face,由Caltech衍生公司推出。

Apple 正與新創公司 PrismML 進行初步洽談,計畫利用其技術將大型 AI 模型壓縮至裝置端執行。此舉旨在減少 Siri 等功能對雲端處理的依賴。

Microsoft 發布了「Foundry Local」,這是一個讓開發者能將 AI 功能直接整合至使用者裝置的平台。此機制消除了對雲端的依賴,降低網路延遲,並省去了 Token 使用費用。

Google 正在為 Android 引入代理式 AI 和氛圍編碼小工具。Gemini Intelligence 將包含基於 Gboard 的語音輸入和表單填寫功能。這提升了裝置上的 AI 互動體驗。
AI 新創轉向小型端側模型,因雲端 LLM 如 OpenAI 虧損2120億美元。小型1-7B模型如 Phi-3、Llama 3.2、MiniCPM 離線匹敵巨頭於手機。終端廠商如 Apple 以 NPU 整合領先。

PokeClaw 是首款完全本機應用,使用 Gemma 4 透過 Accessibility 服務自主控制 Android 手機,無需雲端依賴。它完全在手機 CPU 上運行,使用 LiteRT,確保資料永不離開裝置的絕對隱私。可在 GitHub 下載模型,一次性安裝後完全離線使用。

展示使用 Gemma E2B 在 M3 Pro Mac 上實現即時音頻/視頻輸入與語音輸出,適合語言學習如對準物體拍照。模型支援多語言,可回退至母語。提供儲存庫供複製。