
Run:ai 與 NIM 提升 GPU 使用率
部署 LLM 的組織面臨多樣推理工作負載挑戰,小型嵌入模型僅需數 GB,而 70B+ 參數 LLM 需多 GPU,導致低利用率、高成本與不可預測延遲。NVIDIA Run:ai 與 NIM 透過有效打包工作負載優化資源分配。此整合最大化推理的 GPU 效率。
直接匹配不多,已補上最新動態。
Tag: #gpu-scheduling3 results

部署 LLM 的組織面臨多樣推理工作負載挑戰,小型嵌入模型僅需數 GB,而 70B+ 參數 LLM 需多 GPU,導致低利用率、高成本與不可預測延遲。NVIDIA Run:ai 與 NIM 透過有效打包工作負載優化資源分配。此整合最大化推理的 GPU 效率。
開發者重構 verl 框架,提升 LLM 後訓練編排層的封裝、測試與程式碼清晰度。移除未用依賴並新增 GPU 排程器,打造自成一體模組。推出影片系列分享過程,儘管社群反應冷淡。
討論定義跨提供商便攜 AI GPU 工作負載,無需特定設定以利可用性及成本轉移。批判 K8s 多節點池、Terraform 及自訂層的隱藏複雜性。主張將工作負載需求定義與基礎設施綁定分離,透過排程層處理。
中誠華隆推出 HL200 推理晶片及配套超節點智算叢集方案。該晶片最高可提供 4P FP4 算力,能效比達 5.12 TFLOPS/W,叢集規模則可擴展至 10,240 張卡。

美國當局警告,威脅行為者正鎖定用於供水系統及其他關鍵基礎設施的 Siemens S7 PLC。相關機構表示,攻擊者可能使用 AI 工具產生漏洞利用腳本,並敦促營運者更新系統,且在可行時讓系統與網際網路隔離。

Kling AI 是快手疲弱第二季業績中唯一的亮點,營收超過人民幣 8.5 億元,年增逾 200%,全球用戶數突破 1 億。產品推出原生 4K 影片輸出,並從消費者訂閱模式拓展至影視與廣告等專業工作流程,但高昂算力成本及 Seedance 的競爭仍是重大挑戰。

受元件成本高漲影響,桌上型 CPU 出貨量下滑 20%,市場環境日益艱困。Intel 提高資料中心與筆記型電腦處理器產量,但 AMD 成長速度超越 Intel,並創下歷史最高市占率。

Eon 使用漏積分放電(LIF)模型,將果蠅大腦重建為數位系統。中國團隊據稱進一步採用精細神經元建模,以及支援跨身體遷移的平台,推進具身智慧研究。

據報導,UBTECH 已在 WRC 內以 1:1 比例重建客戶產線。此舉為具身智慧提供更實際的驗證與部署路徑,強調產線效能與系統整合,而非機器人出貨量。

Outer Biosciences 脫離隱身模式,開發出一套能讓手術切除的人類皮膚存活最長一個月的方法。該新創將組織產生的資料輸入 AI 模型,以預測可能有用的化合物,目前已籌得約 2,300 萬美元。