
Mistral 推出適用穿戴裝置的開源 TTS
Mistral 發布全新開源語音生成模型。此輕量模型可在智慧手錶和智慧型手機等資源受限裝置上高效運行。
Tag: #on-device36 results

Mistral 發布全新開源語音生成模型。此輕量模型可在智慧手錶和智慧型手機等資源受限裝置上高效運行。

Mistral AI 發表了 Voxtral Transcribe 2,這是一款可在本地運行的日語支援語音辨識模型。它包含兩個變體:一個針對高精度、低成本的批次處理,另一個針對超低延遲的即時轉錄。

Apple 推出 Ferret-UI Lite,一款適用於行動裝置、網頁與桌面平台的緊湊型 3B GUI 代理。它利用精選真實與合成 GUI 資料、思考鏈推理及視覺工具使用,提升小型裝置端模型效能。本文分享其開發關鍵經驗。

社群實作展示 VibeVoice 1.5B 在 iPhone 本機運行,記憶體使用量約 2.2 GB,速度最高可達即時速度的 1.28 倍。模型已上傳至 audio.cpp 的 Hugging Face 儲存庫,xcframework 與程式碼分支預計在 audio.cpp 0.6 版發布後提供。

中國科技公司正將重心從龐大的雲端模型轉向專為手機和筆電設計的輕量化 AI。此策略旨在透過繞過高耗能的資料中心,提升處理速度並強化數據隱私。

Gemini 整合至 Chrome,將於六月登陸 Android 裝置。裝置需至少 4GB RAM 才能使用此功能。

Google 推出了一款完全離線運作的 AI 應用程式,非常適合連線不良地區如偏遠旅遊地點的使用者。作者將其與依賴雲端的工具如 MyMind 和 Lex 對比,後者在無網路時失效。智慧型手機的強大性能可支援特定任務如轉錄的裝置端 AI,不同於需要龐大雲端資源的通用模型。

Gemma 4 模型在 LiteRT 檔案中包含用於推測解碼的 MTP 權重,但 Google 故意移除以確保更廣泛的相容性。一名 Google 員工在 Pixel 9 上出現錯誤後確認此事。社群呼籲發布完整模型或反向工程。

開發者優化 Kokoro TTS 用於 iOS,採用純 CPU 管線,透過拆分模型並使用 Apple Accelerate 框架,達到 20 倍即時速度且無過熱問題。避開 Metal 以支援背景音頻。發布為 Morph Books EPUB 閱讀器應用。

Apple 正在開發類似 Grammarly 的寫作工具,直接整合至鍵盤。這些 AI 輔助功能旨在提升 Apple 裝置上的文字撰寫與編輯。