
NVIDIA 將完整語音堆疊帶到裝置端
NVIDIA 的 NeMo-Speech.cpp 支援在本機執行經 GGUF 量化的語音辨識、文字轉語音與編解碼元件。列出的堆疊包括 Magpie-TTS、Nemotron Speech、Nemotron ASR、Parakeet 模型及 NanoCodec。
Tag: #on-device-inference14 results

NVIDIA 的 NeMo-Speech.cpp 支援在本機執行經 GGUF 量化的語音辨識、文字轉語音與編解碼元件。列出的堆疊包括 Magpie-TTS、Nemotron Speech、Nemotron ASR、Parakeet 模型及 NanoCodec。

react-native-executorch 函式庫現在支援完全離線運行 Gemma 4 模型。它透過 Android 上的 Vulkan 和 Apple Silicon 上的 MLX 提供 GPU 加速。
清華大學團隊創立的萬格智元獲數千萬元融資,發布端側推理引擎cPilot與智能平台Amis。這些工具旨在通過優化大模型本地部署,降低硬件成本與Token消耗。

PyTorch 推出 ExecuTorch 作為跨平台裝置端音頻推理基礎,用於語音代理。它支援轉錄、即時串流、分講者識別、語音活動偵測及即時翻譯等關鍵工作負載。這為快速增長的開源語音模型提供跨裝置統一原生推理。
LiveTranscriber 是一款開源 iOS 應用程式,可在裝置上執行 Whisper、Qwen3-ASR、NVIDIA Nemotron Streaming、MOSS Multi-Speaker 與 Qwen3。它提供離線轉錄、說話者分離、摘要、翻譯、Apple Watch 錄音同步及可搜尋的轉錄紀錄。

一名開發者展示 LFM2.5-2.6B 僅使用 OnePlus 13 的 CPU 執行,速度約為每秒 17 個 token。該配置使用 Q4_K_M GGUF 模型、自製的 450 KB 推理引擎,以及基於 ADB 的裝置探測工具,目標速度約為每秒 30 個 token。

MacPaw 正與 Liquid AI 合作,為在其應用程式商店開發 App 的開發者提供裝置端推論能力。MacPaw 也正使用 Liquid AI 模型開發 AI 助理 Eney 的本機版本。

開發人員已在筆電上本地執行 LLM,規避雲端安全控制。得益於強大硬體、量化技術與輕鬆分發,這為 CISO 製造完整性、來源與合規盲點。傳統 DLP 無法偵測離線推論。
SpruceChat 使用 llama.cpp 將 Qwen2.5-0.5B LLM 移植到 Miyoo A30 等掌上遊戲裝置,完全本地運行無需網路。首次啟動模型載入約 60 秒,生成速度 1-2 個 token/秒。GitHub 儲存庫包含多裝置的 armhf 和 aarch64 二進位檔。

Qwen 發布了新的 0.8B 模型,可在 7 年老的 Samsung S10E 上使用 llama.cpp 和 Termux 以 12 令牌/秒本地運行。解決缺失的 C 函式庫後,它能有效處理對話和複雜任務。此示範突顯強大微型 LLM 在邊緣裝置上的潛力。