
NVIDIA DSX MaxLPS 聚焦 AI 每瓦效能
NVIDIA 介紹 DSX MaxLPS,旨在提升受電力限制的 AI 工廠中,AI 推論在應用層級的每瓦效能。此策略強調將可產生營收的 AI 輸出,與運算、配電及冷卻所消耗的總電力進行比較。
Tag: #inference-efficiency13 results

NVIDIA 介紹 DSX MaxLPS,旨在提升受電力限制的 AI 工廠中,AI 推論在應用層級的每瓦效能。此策略強調將可產生營收的 AI 輸出,與運算、配電及冷卻所消耗的總電力進行比較。

OpenAI 推出 GPT-5.4 mini 與 nano 模型,基準測試接近完整 GPT-5.4。它們運行更快、成本更低,標誌小型模型轉向真實世界應用。

Tencent 正將 AI agent Xiaowei 整合至 WeChat,讓它在中國主流超級應用程式中自動執行各類任務。文章透過長達 24 小時的實測,檢視該 agent 的優勢與限制;Tencent 則強調其隱私保護與推理效率。

NVIDIA Nemotron 3.5 Lightning 是一款開放的 300 億參數混合專家模型,僅啟用 30 億參數,專為長時間運行 AI Agent 的執行層打造。它針對工具呼叫、結果驗證與子代理委派等高頻任務,降低每個步驟都使用前沿推理模型所帶來的成本與延遲。

Apple 研究人員推出了 Length Value Model (LenVM),這是一個在 Token 層級對剩餘生成長度進行建模的框架。透過將長度建模視為帶有負獎勵的價值估計問題,它提升了對生成長度和推理效率的控制能力。

KV-PRM 提出了一種透過直接讀取 LLM 的 KV cache 而非重新編碼文字來進行流程獎勵建模的方法。此方法在維持或超越傳統文字型 PRM 效能的同時,顯著降低了長上下文多代理系統的計算開銷。

Step-1 Flash 模型顯著提升了運算效率,任務成本僅為 Claude 3 Opus 的 1/9。此次更新將該模型定位為高效能解決方案,而不僅僅是旗艦模型的平替。

CVPR 2026 多模態論文重定義視覺智能:VideoAuto-R1 實現按需推理,LIVR 在潛在空間無語言視覺推理,ARC 重新定位為視覺任務。趨勢強調高效隱式推理而非恆定鏈式。評估轉向開放任務與結構化數據。

此新框架針對大型語言模型聯合調整測試時計算分配與生成分佈。暖身階段識別簡單查詢並從測試集建構初始問答對。適應階段集中計算於未解查詢,使用語義相近成功回應的演化式脈絡示範,在數學、程式與推理基準上超越基線且耗用更少推論計算。

Weaviate 為 Query Agent 的 Search Mode 推出 medium、high 與 ultrahigh 三種努力層級。這項更新讓實務使用者可依據搜尋品質與資源需求調整測試時運算量。