Qwen 3.5 27B 在 B200 上達 1.1M tok/s
使用 vLLM v0.18.0 在 12 節點 96 個 B200 GPU 上達 1,103,941 tok/s。優化包括 DP=8 優於 TP=8、4K 上下文、FP8 KV 快取及 MTP-1 推測解碼提升使用率。無自訂核心下達 96.5% 擴展效率。
Tag: #high-throughput7 results
使用 vLLM v0.18.0 在 12 節點 96 個 B200 GPU 上達 1,103,941 tok/s。優化包括 DP=8 優於 TP=8、4K 上下文、FP8 KV 快取及 MTP-1 推測解碼提升使用率。無自訂核心下達 96.5% 擴展效率。

NVIDIA 推出 Nemotron 3 Super,這是一款 1200 億參數開放模型,僅啟用 120 億活躍參數,專為大規模複雜代理式 AI 系統優化。該模型提供 5 倍更高吞吐量,並具備先進推理能力,以高準確度完成自主代理任務。Perplexity 現為用戶提供該模型存取權。
Hugging Face 推出了原生速度的 vLLM 模型後端,旨在優化推論效能。此整合讓開發者能直接在 Transformers 生態系統中利用 vLLM 的高吞吐量服務能力。

由於收到超過 6.6 萬份申請,小米決定延長提供 1000 tokens/s 推理能力的 UltraSpeed 模式試用期,讓更多開發者能進行接入與測試。

Hugging Face 發布 Holotron-12B,這是一個 12B 參數模型,設計為高吞吐量電腦使用代理。針對高效自動化電腦互動。現已在 Hugging Face 平台上可用。

H Company 發布 Holotron-12B,這是與 NVIDIA 合作開發的開源多模態模型,專為電腦使用代理設計。效能與 Holo2/Qwen 相當,但吞吐量高 2 倍。提供 Hugging Face、技術深入解析和 X 貼文連結。
Taalas 推出免費聊天機器人示範與 API,使用自製 ASIC 晶片運行 Llama 3.1 8B 達 16,000 令牌/秒,作為概念驗證。速度感覺即時;API 適合高令牌負載。公司計畫推出更大模型。