
僅用 264KB RAM 執行的 Diffusion Model
一名開發者訓練了可生成 32×32 像素影像的 diffusion model,並部署在僅有 264KB SRAM 的 Shrike Lite micro控制器上。雖然大量量化讓專案成為可能,但受記憶體限制的 I/O 使 FPGA 加速版本反而比僅使用 MCU 的實作更慢。
Tag: #edge-inference33 results

一名開發者訓練了可生成 32×32 像素影像的 diffusion model,並部署在僅有 264KB SRAM 的 Shrike Lite micro控制器上。雖然大量量化讓專案成為可能,但受記憶體限制的 I/O 使 FPGA 加速版本反而比僅使用 MCU 的實作更慢。

Liquid AI 發布 LFM2.5-2.6B,這是一款具備 128K 上下文、工具呼叫功能,並針對多步驟代理工作流程進行後訓練的 26.9 億參數模型。Liquid 宣稱其在手機上最高可達每秒 30 個 token,記憶體使用量低於 2.5 GB,但仍需要獨立測試。

Qwen3.5-4B 在 Ryzen AI 7 350 XDNA2 NPU(32GB RAM)測試,使用 Lemonade v10.0.1 與 FastFlowLM v0.9.36。低功耗低於 50°C、工具呼叫、最高 256k 權重、VLMEvalKit 85.6%。支援所有 XDNA2 NPU。

NVIDIA TensorRT Edge-LLM 是邊緣優先 LLM 的高效能 C++ 推論運行時,用於實體 AI。它針對自動駕駛車輛和人形機器人,實現嚴格功率與延遲限制下的即時多模態互動、推理與軌跡規劃。

Hugging Face 推出 LFM2.5-VL-3B,這是一款旨在為邊緣裝置提供更佳、更快速視覺能力的視覺語言模型。此次更新強調適合需要本地端或低延遲多模態推理的應用情境。

韓國 NPU 公司 Mobilint 推出 USB 外接式邊緣 AI 加速器 MLD-R1,產品採用其 REGULUS AI SoC。裝置以 3W 功耗提供 10 TOPS INT8 算力,支援主流機器學習框架、Windows、Linux,以及 x86、Arm 和 RISC-V 主機。

Google 的 Antigravity 團隊打造了一款可完全離線運作於 Raspberry Pi 5 的語音翻譯器原型。Gemma Translator 採用小型開放權重模型 Gemma 4 E2B,在本機處理語音,不需要連接雲端。

據報導,NVIDIA 正與包括 Jiaxian Communication 在內的中國基地台供應商洽談,開發可結合行動通訊與本地 AI 處理能力、面向海外市場的 6G 系統。此外,NVIDIA 與 Nokia 的公開合作正朝商業試驗推進。

Hugging Face 推出 LFM2.5-2.6B,定位為可在各種裝置與環境中部署本地代理的模型。公告強調廣泛的本地部署能力,但提供的文章摘錄未包含基準測試或實作細節。

Cloudflare 使用自家產品如 AI Gateway 與 Workers AI 打造內部 AI 工程堆疊。處理 20 百萬請求、2410 億令牌,並服務超過 3,683 名用戶。文章詳述其實作方式。