
更快速的 Qwen3.8 27B NVFP4 量化模型
全新的 Blackwell 原生、針對 prefill 最佳化的 Qwen3.8 27B NVFP4 量化模型,據稱比相同記憶體占用的 Q4 量化快達 50%。在 RTX 5090 上,它也比其他 NVFP4 量化版本快 4–7%,並附帶量化的 MTP 草稿頭。
Tag: #gguf30 results

全新的 Blackwell 原生、針對 prefill 最佳化的 Qwen3.8 27B NVFP4 量化模型,據稱比相同記憶體占用的 Q4 量化快達 50%。在 RTX 5090 上,它也比其他 NVFP4 量化版本快 4–7%,並附帶量化的 MTP 草稿頭。
一名 LocalLLaMA 使用者分享了在 Windows 上,於約 16GB VRAM 內執行 Qwen3.8 27B IQ4-XS-MTP GGUF 模型的配置。該設定透過將多模態元件與特定張量移至系統 RAM,以量化品質與速度換取 90K–100K 的上下文視窗。

QwenMix-3.7 是一項實驗性合併,將 Qwen3.8-27B 與 Qwen3.6-27B 模型結合。作者表示模型通過基本冒煙測試,但目前尚未進行具意義的完整評估。

Luth-2-0.8B 與 Luth-2-2B 是針對法語、非推理用途設計的新型語言模型,適合本地與裝置端使用。開發團隊表示,兩者在多項法語基準測試中創下同規模最佳成績;模型、GGUF 檔案、訓練資料與程式碼現已開放。

NVIDIA 的 NeMo-Speech.cpp 支援在本機執行經 GGUF 量化的語音辨識、文字轉語音與編解碼元件。列出的堆疊包括 Magpie-TTS、Nemotron Speech、Nemotron ASR、Parakeet 模型及 NanoCodec。

主線 llama.cpp 現已透過 llama-tts 二進位檔支援本機 Qwen3-TTS-12Hz-1.7B-Base 語音複製。它接受 WAV 或 MP3 說話者參考音訊並支援 10 種語言,但伺服器整合與更多模型支援仍未完成。

Unsloth 發布了全新的 Cohere 30B A3B 模型 GGUF 版本,使其能夠進行本地推論。此發布可能與 llama.cpp 生態系統近期為提升模型相容性所做的更新有關。
基準測試比較 Nvidia RTX 3090 和 Intel Arc Pro B70,使用 llama.cpp 在 Vulkan 和 SYCL 後端測試多個 GGUF 模型。Arc Pro B70 的提示處理平均慢 71%,令牌生成慢 53%。SYCL 後端在某些 Arc 結果優於 Vulkan。

Qwen3.6-27B-UD-Q6_K_XL.gguf 在 RTX 5090 上以 llama.cpp 達 50 tok/s、200k 上下文。擅長困難規劃任務,比先前本地模型有前景。

使用者指示 Qwen3.6-35B 使用 MCP 截圖建構塔防遊戲,它成功實作並測試升級功能。模型自行偵測並修復畫布渲染與波次完成錯誤。對即將推出的 Qwen Coder 模型充滿期待。