
Qwen3.8-27B Q6 持續維持每秒 60+ Tokens
一名 Reddit 使用者表示,Qwen3.8-27B Q6 已連續近 20 小時執行目標導向的代理式程式設計。模型在 RTX 3090 與 RTX 3060 的配置上,持續維持約每秒 60–63 個 tokens 的速度。
Tag: #throughput7 results

一名 Reddit 使用者表示,Qwen3.8-27B Q6 已連續近 20 小時執行目標導向的代理式程式設計。模型在 RTX 3090 與 RTX 3060 的配置上,持續維持約每秒 60–63 個 tokens 的速度。

LG 推出 Laser Direct Imaging 設備,進軍晶片封裝市場,用於製作精細互連圖案。這套無光罩系統以部分解析度換取更高吞吐量,鎖定晶片封裝與高密度 PCB,正值 TSMC CoWoS 產能持續受限之際。

NVIDIA 推出使用 QAD 與 NVIDIA Model Optimizer 開發的 Nemotron 3.5 Lightning NVFP4 checkpoint。在維持準確度的同時,模型大小從 66 GB 降至 22 GB,吞吐量最高提升 4 倍。
研究實驗室使用 vLLM 和 LiteLLM 堆疊,在 2x H200 GPU 上本地運行 GPT-OSS-120B,每日處理超過 10 億權杖。解碼吞吐量達 ~220-250 tok/s,優於其他測試模型。設定包含 Docker、PostgreSQL 和 Prometheus 監控。

Together AI 已擴展其微調服務,新增工具呼叫、推理及視覺語言模型的原生支援。現在支援 100B+ 參數模型訓練,提供最高 6 倍吞吐量,並附工作成本與 ETA 估計。
mlx-lm PR 為 Qwen 3.5 系列新增多令牌預測 (MTP) 支援,吞吐量增 1.5 倍 (15.3 至 23.3 tok/s),接受率 80.6%。在 M4 Pro 上基準測試 Qwen3.5-27B 4-bit。早期實作對 Apple Silicon 使用者有顯著提升。
一項小型本地程式設計實驗發現,Qwen3.6 35B-A3B MoE 的生成速度約為 Qwen3.6 27B dense 的 3.9 倍,約每秒 116 對 30 個 Token。兩個模型在例行維護任務上的表現相近,但 dense 模型在隱含不變量、邊界案例與更廣泛後果方面具有優勢。