
Qwen3.8-27B 在雙 RTX 3090 上達 218 Token/秒
社群基準測試顯示,Qwen3.8-27B 在兩張 RTX 3090 上搭配 vLLM、INT4 量化與 DFlash2 推測解碼,最高可達每秒 218.3 token。該配置支援最高 131K 上下文,首 token 延遲約 168–178 毫秒,每張顯示卡峰值 VRAM 使用量為 22.3 GB。
Tag: #local-inference187 results

社群基準測試顯示,Qwen3.8-27B 在兩張 RTX 3090 上搭配 vLLM、INT4 量化與 DFlash2 推測解碼,最高可達每秒 218.3 token。該配置支援最高 131K 上下文,首 token 延遲約 168–178 毫秒,每張顯示卡峰值 VRAM 使用量為 22.3 GB。

一名 Reddit 使用者表示,透過 llama.cpp,他在 RTX 5060 Ti 16GB 上讓 Qwen3.8-27B 執行 73,728-token 的上下文視窗。在代理式程式設計測試中,模型處理超過 100 萬個 tokens,僅用三個提示就完成了可運作的 REST API 與 MCP Server。

一項 pull request 提議在 llama.cpp 中新增 Kimi-K3 文字模型支援。若成功合併,這項變更將讓使用本地端及以 CPU/GPU 為核心的 ggml 生態系開發者更容易運行 Kimi-K3。

一名 Reddit 使用者在 8GB VRAM 系統上測試 Unsloth 的 Qwen3.8 27B 1-bit 量化版本。作者以幽默方式形容結果嚴重劣化,突顯極端壓縮所帶來的取捨。

QwenMix-3.7 是一項實驗性合併,將 Qwen3.8-27B 與 Qwen3.6-27B 模型結合。作者表示模型通過基本冒煙測試,但目前尚未進行具意義的完整評估。

2026 年顯示卡價格持續高漲,記憶體成本也仍在上升,短期內預計難以下降。據報 NVIDIA RTX 50 系列的售價至少高於 MSRP 27%,八款顯示卡中 RTX 5050 的溢價最低。
llama.cpp 已發布 v0.1.0,這是該專案首次採用語意版本編號的版本。據報導,專案將逐步從 b10456 等連續建置編號轉向語意版本管理。

Intel 的 Arc Pro B70 工作站 GPU 在一個月內漲價最高達 48%,價格接近 2,000 美元。其 32GB 記憶體容量對需要較大型模型或資料集的 AI 工作負載尤其具吸引力。

PC Partner 警告,隨著記憶體成本上升與供應收緊,顯示卡價格可能在 2026 年下半年進一步上漲。入門級顯示卡預計承受最大壓力,而分析師 Jon Peddie 認為製造商可能將價格漲幅提高到超過記憶體成本增加的程度。

Huawei 已開始向 Mate 80、Mate 70 等系列推送 HarmonyOS 7.0.0.102 SP8,系統包大小約為 6.79 GB。支援端側 AI 的裝置可查看本地模型版本、參數大小與服務場景,並新增 3D 空間壁紙及戶外探索模式等功能。