Search

Tag: #inference127 results

Google TurboQuant 加速 AI 推論

Google TurboQuant 加速 AI 推論

Google 的 TurboQuant 壓縮 LLM 推論中的 KV 快取及向量搜尋,在 Nvidia H100 上對 Gemma/Mistral 模型實現 6 倍記憶體節省及 8 倍加速。它解決關鍵瓶頸,提升硬體效率而不損準確度。分析師強調擴展潛力,但指出可能增加使用而非節省。

ComputerworldMediaMar 26#kv-cache#inference#optimization
NVIDIA Puzzle 優化 88B LLM

NVIDIA Puzzle 優化 88B LLM

NVIDIA 的 gpt-oss-puzzle-88B 經 Puzzle NAS 從 gpt-oss-120b 衍生,參數減至 88B,在 8x H100 長上下文下吞吐量提升 1.63 倍。它匹配母模型準確度,透過 MoE 架構調整優化 H100 推論。專為推理工作負載設計。

Reddit r/LocalLLaMACommunityMar 26#moe#nas#h100
Nvidia 推出 Rubin GPU 與 Vera CPU

Nvidia 推出 Rubin GPU 與 Vera CPU

Nvidia 執行長 Jensen Huang 在 GTC 大會上稱 AI 令牌為招募、預算與生產力的新貨幣。他推出 Rubin GPU、Vera CPU 與 Groq 推論晶片融合,token 生成率提升 350 倍至 7 億。這些驅動 AI 工廠,營收與每瓦 token 效率掛鉤。

ComputerworldMediaMar 17#tokenomics#ai-factories#inference
Nvidia DGX Rubin NVL8 採用 Intel Xeon 6

Nvidia DGX Rubin NVL8 採用 Intel Xeon 6

Nvidia 選用 Intel Xeon 6 處理器(具體為 Xeon 6776P)作為 DGX Rubin NVL8 AI 系統的主機 CPU,結合八個 Rubin GPU 用於大規模代理式 AI 工作負載。此設定利用 NVLink 實現快速 GPU 通訊,並確保 x86 相容性以適用企業環境。此決定反映 Nvidia CPU 擴張(如 Grace 和 Vera)下的系統級 coopetition。

GTC 2026 預測:Nvidia 解決令牌速度問題

GTC 2026 預測:Nvidia 解決令牌速度問題

《The Register》預覽 Nvidia 的 GTC 2026 大會,稱之為 AI Burning Man,預期討論 Groq 的 tokenomics、OpenClaw 及相關矽晶技術。Nvidia 的 GPU 在生成式 AI 工作負載如程式碼助理和代理系統中,難以高速處理大量令牌。活動將提供解決推理瓶頸的洞見。

The Register - AI/MLMediaMar 13#gtc-2026#inference#tokenomics
Page 8 of 13