
Qwen3-TTS 語音複製正式加入主線 llama.cpp
主線 llama.cpp 現已透過 llama-tts 二進位檔支援本機 Qwen3-TTS-12Hz-1.7B-Base 語音複製。它接受 WAV 或 MP3 說話者參考音訊並支援 10 種語言,但伺服器整合與更多模型支援仍未完成。
Tag: #local-inference187 results

主線 llama.cpp 現已透過 llama-tts 二進位檔支援本機 Qwen3-TTS-12Hz-1.7B-Base 語音複製。它接受 WAV 或 MP3 說話者參考音訊並支援 10 種語言,但伺服器整合與更多模型支援仍未完成。

MiniMax 已開源 H3-Base,這是一款擁有 330 億參數的稠密單流 Omni-Transformer。據報其可與 Seedance 2.0 進行基準比較,API 價格僅為其三分之一,並能在兩張 RTX 5090 GPU 上本地執行。

Hugging Face 推出了專為邊緣運算環境優化的全新模型 Cosmos 3 Edge。此版本旨在於資源受限的環境中提供高效能的 AI 能力。

研究人員開發了一種基於 Transformer 的模型,能在消費級硬體上將圖像轉化為可玩的遊戲。該模型利用因果架構與 KV 快取,無需雲端資料中心即可實現即時互動。

一位開發者創建了一個完全本地、即時的語音對話機器人,由 Qwen3.5-397B、Whisper 與 Orpheus TTS 驅動。該系統具備可中斷回應功能,並能為長時間對話保持上下文。

Unsloth 發布了全新的 Cohere 30B A3B 模型 GGUF 版本,使其能夠進行本地推論。此發布可能與 llama.cpp 生態系統近期為提升模型相容性所做的更新有關。

Asus 發表了 2026 年版 ROG Strix Scar 18,搭載強大的 RTX 5090 GPU 與 320W 總功耗設計,並首發全球首款 18 吋 4K 240Hz Mini LED 顯示器。
後續最佳化讓 Qwen3.6-27B 在單張 RTX 3090 上達 ~218K 上下文、50-66 TPS。經 PN12 修補後,工具呼叫穩定支援 25K 權重元輸出。也支援 198K 視覺上下文。

Mahoraga 是一個開源協調器,使用 LinUCB 樂團劫匪在本地和雲端 AI 代理之間路由任務。在 192 個程式碼任務測試中,Qwen3 4B 在 MacBook Pro 上以優異品質分數勝過雲端代理。系統使用關鍵字分類和樂團劫匪路由實現高效本地優先推論。

使用者實驗顯示,使用 llamacpp 的推測解碼,Qwen-3.6-27B 推論速度從 13.6 t/s 提升至 136.75 t/s。模型迭代生成水族箱程式的完整程式碼、修復錯誤並新增功能。在具 40GB VRAM 的硬體上實現,並需更新 llama.cpp。