
Waypoint-1.5:日常GPU更高保真互動世界
Waypoint-1.5 是新版本更新,能在日常 GPU 上實現更高保真的互動世界。由 Hugging Face 發布,它讓先進模擬更容易取得。此版本強調無需高階硬體即可高性能運行。
Tag: #gpu-optimization50 results

Waypoint-1.5 是新版本更新,能在日常 GPU 上實現更高保真的互動世界。由 Hugging Face 發布,它讓先進模擬更容易取得。此版本強調無需高階硬體即可高性能運行。

NVIDIA 的神經紋理壓縮技術將顯存需求降低 85%,從 6.5GB 降至 970MB,同時保持相同的畫質。這項創新解決了 3A 大作中高解析度紋理體積暴增的問題,這些紋理常導致 8GB 顯卡爆顯存、畫面卡頓或強制降畫質。它重振主流硬體應對現代遊戲需求的能力。

NVIDIA 強調 AI 工廠的經濟風險,1% GPU 時間損失等於每小時數百萬 token 流失。擁塞與機架級功率超額認購會侵蝕大規模產出。統一服務與即時 AI 可防範這些問題,實現最大效能。

英偉達23人夢之隊打造AI,在7天內幹翻自家GPU專家。連續運行7天,探索500+方向,生成10萬行程式碼,展現AI自寫程式碼與進化能力。

NVIDIA 介紹在 Kubernetes 上部署拆分式 LLM 推論工作負載,解決單一單體服務過程的限制。預填充與解碼階段具有不同計算特性,傳統部署強迫使用相同硬體,導致 GPU 閒置與擴展不靈活。拆分式服務將推論管線分離,提升 GPU 利用率與擴展性。

英偉達旗艦B200 GPU在典型使用中浪費60%的算力。普林斯頓研究人員開發技術,將利用率提升至71%,解決關鍵低效問題。甚至英偉達執行長黃仁勳也參考了他們的工作。

Krasis LLM Runtime 針對 GPU 全載預填充與解碼優化,在單一 5090 上達 llama.cpp 的 8.9 倍預填充與 4.7 倍解碼。支援如 122B-A10B 等大型 Qwen 模型,RAM 使用極少。GitHub 一行安裝,相容 OpenAI 伺服器。

PyTorch 團隊發布 KernelAgent,這是一個開放代理系統,在所有 250 個 L1/L2/L3 KernelBench 任務中達成 100% 正確率。該系統透過多代理協作實現硬體導向的 GPU 核心最佳化。本文延伸先前工作,新增強化功能。
DeepSeek 更新開源 DeepGEMM 函式庫,整合 mHC 並初步支援 NVIDIA Blackwell (SM100) 與 FP4 精度。此舉確認 DeepSeek V4 的次世代硬體最佳化。連結至重大 GitHub 提交。

此架構透過 Curvine 將快取儲存延伸至共享分散式 NVMe 集區,為 Amazon SageMaker HyperPod 加入分層 KV 快取。多個副本可接近本機磁碟的速度重用快取資料,降低使用超大型 GPU 執行個體的需求。