B200 GPU 上 Qwen 3.5 達 1M 令牌/秒
使用 vLLM v0.18.0 在 96 個 B200 GPU 上實現 Qwen 3.5 27B(FP8)總 1.1M 令牌/秒。DP=8 比 TP=8 效能高 4 倍;MTP-1 提升利用率,MTP-5 崩潰。97% 擴展效率,但 Inference Gateway 增加 35% 開銷。
Tag: #inference127 results
使用 vLLM v0.18.0 在 96 個 B200 GPU 上實現 Qwen 3.5 27B(FP8)總 1.1M 令牌/秒。DP=8 比 TP=8 效能高 4 倍;MTP-1 提升利用率,MTP-5 崩潰。97% 擴展效率,但 Inference Gateway 增加 35% 開銷。

Google 的 TurboQuant 壓縮 LLM 推論中的 KV 快取及向量搜尋,在 Nvidia H100 上對 Gemma/Mistral 模型實現 6 倍記憶體節省及 8 倍加速。它解決關鍵瓶頸,提升硬體效率而不損準確度。分析師強調擴展潛力,但指出可能增加使用而非節省。

NVIDIA 的 gpt-oss-puzzle-88B 經 Puzzle NAS 從 gpt-oss-120b 衍生,參數減至 88B,在 8x H100 長上下文下吞吐量提升 1.63 倍。它匹配母模型準確度,透過 MoE 架構調整優化 H100 推論。專為推理工作負載設計。

以色列新創 NeuReality 聘請前 Google AI 產品主管 Shalini Agarwal,帶領 NR-NEXUS 推論作業系統進軍市場。呼應 Jensen Huang 在 GTC 將資料中心視為「token 工廠」的願景。凱薩利亞公司鎖定 AI 推論基礎設施。
阿里巴巴集團控股有限公司正推出專為代理式 AI 和推論運算設計的新晶片。此舉強化其半導體產品組合,以推動 AI 野心並因應需求激增。

LLM代理從稀疏、非識別提示結合公開資料重建真實身份。在Netflix(79.2%成功率)、AOL、InferLink基準及文字文物上評估。即使在良性任務中,推斷連結也會出現,呼籲重新評估隱私風險。

Nvidia 執行長 Jensen Huang 在 GTC 大會上稱 AI 令牌為招募、預算與生產力的新貨幣。他推出 Rubin GPU、Vera CPU 與 Groq 推論晶片融合,token 生成率提升 350 倍至 7 億。這些驅動 AI 工廠,營收與每瓦 token 效率掛鉤。

Nvidia 在 GTC 2026 推出 Groq 3 語言處理單元 (LPU),這是一款具快速記憶體與低延遲的 AI 推理加速器。它加劇了 AI 推理競賽,尤其在 OpenClaw 等 AI 代理興起的市場中。分析師認為這對中國半導體產業構成挑戰與機會。

Nvidia 選用 Intel Xeon 6 處理器(具體為 Xeon 6776P)作為 DGX Rubin NVL8 AI 系統的主機 CPU,結合八個 Rubin GPU 用於大規模代理式 AI 工作負載。此設定利用 NVLink 實現快速 GPU 通訊,並確保 x86 相容性以適用企業環境。此決定反映 Nvidia CPU 擴張(如 Grace 和 Vera)下的系統級 coopetition。

《The Register》預覽 Nvidia 的 GTC 2026 大會,稱之為 AI Burning Man,預期討論 Groq 的 tokenomics、OpenClaw 及相關矽晶技術。Nvidia 的 GPU 在生成式 AI 工作負載如程式碼助理和代理系統中,難以高速處理大量令牌。活動將提供解決推理瓶頸的洞見。