
多 GPU UMAP 將大規模分析縮短至數分鐘
NVIDIA 展示可使用多 GPU 的 UMAP 實作,旨在數分鐘內處理大規模資料集,同時不犧牲準確度。此功能鎖定探索性資料分析、主題建模與單細胞分析等需要反覆執行的工作流程。
Tag: #multi-gpu20 results

NVIDIA 展示可使用多 GPU 的 UMAP 實作,旨在數分鐘內處理大規模資料集,同時不犧牲準確度。此功能鎖定探索性資料分析、主題建模與單細胞分析等需要反覆執行的工作流程。

AIRA_2 解決 AI 研究代理的三個瓶頸:單 GPU 限制、驗證泛化差距,以及固定 LLM 操作員。它採用異步多 GPU 工作池、隱藏一致評估協議,以及 ReAct 代理,提升產出與可靠性。在 MLE-bench-30 上,24 小時達 71.8% 百分位,72 小時升至 76.0%,超越先前最佳。

新函式庫利用 GPU NVENC 即時壓縮張量,解決多 GPU PCIe 瓶頸。在擴散模型激活達 6.1 倍壓縮,LLM KV 快取 2.7 倍。包含 PCA 預處理及純 ctypes SDK 包裝。

AutoSP 自動將標準 Transformer 訓練程式碼轉換為序列並行程式碼,用於多 GPU 上的長上下文 LLM 高效訓練。由 UIUC 的 SSAIL Lab、Anyscale 和 Snowflake 開發,整合至 PyTorch。
Qwen3.5-122B NVFP4 在 2x RTX PRO 6000 Blackwell 上達 198 tok/s,經 SGLang 驗證。公開資料含至 150K 令牌上下文擴展,解碼無減速。關鍵:PCIe 交換器低延遲 MoE。

JohannesGaessler 的 PR #19378 於 ggml-org/llama.cpp 中實現後端無關張量並行,由 Greganov 批准。實現跨後端高效多 GPU 擴展。
karpathy/autoresearch 的分支引入 Weber 電動力學優化器,透過物理啟發的速度與加速度調整學習率。新增 RTL-SDR 硬體熵種子、多供應商 AI 代理框架具工具支援,以及多 GPU 相容性。合併社群實驗將基準 val/bpb 從 0.9979 提升至 0.9697。

一項新的 PR 旨在使 llama.cpp 的 Vulkan 後端中的 Tensor Parallelism 變得可行。此更新是改善非 Nvidia 硬體多 GPU 效能的重要一步。
用戶詳述 Gemma 4 26b 與 E4B 如何取代其基於 Qwen 的多模型路由設定(RTX 3090),修復語意路由錯誤、過度思考及工具呼叫問題。此系統現無需關鍵字覆寫即可完美路由任務,多數情況超越 ChatGPT 與 Claude Code。
x570 主機板上的非對稱 x16/x4 PCI-E 通道預設讓 CUDA0 使用慢速 x4 槽,導致 llama.cpp 提示處理瓶頸。設定 export CUDA_VISIBLE_DEVICES="1,0" 優先使用 x16 GPU,將 MoE 模型速度從 70 t/s 提升至 140 t/s。使用 nvtop 或 lspci 驗證通道後再套用。