
Kyutai 發布 Pocket TTS,實現 CPU 語音複製
Kyutai 發布了 Pocket TTS,這是一個 1 億參數的模型,僅需 5 秒音訊即可在 CPU 上進行零樣本語音複製。它允許使用者自訂語音而無需微調,在靈活性上超越了競爭對手。
Tag: #cpu-inference13 results

Kyutai 發布了 Pocket TTS,這是一個 1 億參數的模型,僅需 5 秒音訊即可在 CPU 上進行零樣本語音複製。它允許使用者自訂語音而無需微調,在靈活性上超越了競爭對手。

一個開發中的 llama.cpp PR 為 Q2_0 × Q8_0 點積加入 AVX-VNNI 與 AVX-512 VNNI 實作。受控基準測試顯示 CPU 吞吐量提升約 3 至 3.6 倍,其中 8B 解碼速度由每秒 2.39 個 token 提升至 8.20 個。

AI焦點從GPU訓練轉向推理與部署效率,提升CPU角色。英特爾DCAI營收增長22%,CPU/GPU比例收緊至1:4。智能體放大CPU在編排中的重要性。

一名開發者展示 LFM2.5-2.6B 僅使用 OnePlus 13 的 CPU 執行,速度約為每秒 17 個 token。該配置使用 Q4_K_M GGUF 模型、自製的 450 KB 推理引擎,以及基於 ADB 的裝置探測工具,目標速度約為每秒 30 個 token。

llama.cpp 的一項新 PR 為 CPU 後端引入了 Q2_0 量化支援。此更新旨在讓 Ternary Bonsai 模型 (1.7B, 4B, 8B) 能夠在本地硬體上高效運行。

GGML 引入 Q1_0 1 位元量化支援 CPU 推論。Bonsai 8B 模型壓縮至 1.15GB,完全可在 CPU 運行。HF 收藏:prism-ml/bonsai。

開發者優化 Kokoro TTS 用於 iOS,採用純 CPU 管線,透過拆分模型並使用 Apple Accelerate 框架,達到 20 倍即時速度且無過熱問題。避開 Metal 以支援背景音頻。發布為 Morph Books EPUB 閱讀器應用。
軟銀與Ampere Computing啟動聯合項目,提升CPU運行小型AI模型效率。專注低時延、高效率推理環境。作為下一代AI基礎設施關鍵技術。
Project Zero 是一個以零相依性 C99 開發的 1.58-bit BitNet 推論引擎,在四執行緒 Intel Xeon 上達到每秒 36.25 個 Token。其主要發現是,批次大小為 1 的解碼瓶頸在 DRAM 記憶體頻寬,而非計算吞吐量。
使用者尋求在支援 AVX2 的消費級 CPU 上運行大型 MoE 模型的建議。討論重點在於如何平衡 RAM 容量與運算頻寬,以達到可用的 Token 生成速度。