Qwen 3.8 27B 在超低量化下仍表現亮眼
一名 Reddit 使用者表示,Qwen 3.8 27B 即使採用 Q3_xxs 量化,仍保有很強的能力,能一次完成多項嚴肅的程式設計任務。據稱它在 RTX 4060 Ti 16GB 上完整載入 VRAM 時可達每秒 30–35 個 token,但在基本計數、排序與日常對話中偶爾表現較弱。
Tag: #gpu-inference11 results
一名 Reddit 使用者表示,Qwen 3.8 27B 即使採用 Q3_xxs 量化,仍保有很強的能力,能一次完成多項嚴肅的程式設計任務。據稱它在 RTX 4060 Ti 16GB 上完整載入 VRAM 時可達每秒 30–35 個 token,但在基本計數、排序與日常對話中偶爾表現較弱。
使用 vLLM v0.18.0 在 12 節點 96 個 B200 GPU 上達 1,103,941 tok/s。優化包括 DP=8 優於 TP=8、4K 上下文、FP8 KV 快取及 MTP-1 推測解碼提升使用率。無自訂核心下達 96.5% 擴展效率。

Together AI 使用 Goose 和專用容器推理,讓使用者能部署並推理任何 Hugging Face 模型。只需一個提示,即可跳過設定複雜度,在生產級 GPU 環境中運行模型。發布當天即可使用。

新型無損 12 位 BF16 格式將權重壓縮至 1.33 倍更小,使用位元組對齊儲存,99.97% 權重僅需單一整數 ADD 解碼。在 RTX 5070 Ti 上,Llama 和 Mistral 模型的多使用者推論比 vLLM 快至 2.93 倍。支援 AMD 和 NVIDIA GPU,位元完美重建,跨大型模型逃逸率低。

Microsoft 可能最快於 9 月發布下一代 Maia 300 AI 晶片,顯示其持續加碼自研 AI 基礎設施。報導同時指出,Alibaba Cloud 計畫將全球資料中心產能提升兩倍以上,Meta 也發布了可在單張 GPU 上運行的輕量化 AI 模型。

使用者實現 397B 模型 35% REAP 壓縮。在 96GB GPU 上運行具潛在可用品質。貼文連結 r/LocalLLaMA 細節。
FlagOS 鏡像正式登陸騰訊雲 HAI 社區。支援 OpenClaw 快速部署,實現「養蝦」自由。此舉簡化使用者在消費級硬體上的 AI 推理環境建置。

法國新創公司 Kog 認為,GPU 可能比普遍認知更適合支援 AI 代理工作流程。該公司的方法著重於從現有 GPU 基礎設施中榨取更多推論效能。

使用者基準測試 Qwen 3.6 35B A3B 在 RTX 5090 32GB 上以 Q5 K S 量化達 187 權杖/秒。使用 120K 脈絡大小、關閉思考模式及溫度 0.1。在新 NVIDIA 硬體上展現高本地推理速度。

一名 LocalLLaMA 使用者分享了在 32GB Tesla V100 PCIe GPU 上,透過 llama.cpp 執行 Qwen3.6 27B 的設定,支援 128K 上下文與推測解碼。這篇文章主要是設定與效能交流請求,文字中提供了詳細參數,但沒有列出數值化的基準測試結果。