
使用 NVIDIA MPS 將 ASR GPU 成本降低 75%
NVIDIA CUDA Multi-Process Service(MPS)結合 Amazon EC2 GPU 執行個體上的 NVIDIA Triton Inference Server,可將 ASR GPU 基礎設施成本降低 75%。此方法在維持次秒級延遲的同時,每個 GPU 可達到每秒 92.1 個請求。
直接匹配不多,已補上最新動態。
Tag: #inference-serving2 results

NVIDIA CUDA Multi-Process Service(MPS)結合 Amazon EC2 GPU 執行個體上的 NVIDIA Triton Inference Server,可將 ASR GPU 基礎設施成本降低 75%。此方法在維持次秒級延遲的同時,每個 GPU 可達到每秒 92.1 個請求。

這項研究使用真實硬體分析 masked diffusion LLM 的服務行為,發現 CPU 調度而非 GPU 計算主導延遲。研究顯示,同步批次處理可帶來 16 倍吞吐量提升,而短輸出基準測試會掩蓋顯著的服務延遲差異。

Vellum Mobile 的 iOS 應用程式現可作為行動 AI 助理,提供原生 Voice Mode、相機擷取、鎖定畫面活動與 Mac 控制功能。此次更新讓應用程式從聊天延伸至免持操作、多模態及跨裝置工作流程。
Nvidia 發布強勁的 AI 驅動預測,推升市場並重新引發外界對企業 AI 採用速度的討論。節目也探討 AI 代理安全性、企業需求,以及 Kevin Warsh 即將在 Jackson Hole 發表的演說。
OpenAI、Anthropic、Google 及超過 100 個組織在一封公開信中警告,AI 驅動的網路攻擊可能即將大規模出現。他們呼籲政府與企業把握仍有的準備時間,加強防禦能力。
OpenAI、Anthropic 以及超過 100 家科技與金融服務組織警告,企業與政府必須強化準備,以應對 AI 驅動的駭客攻擊。隨著 AI 模型能力提升,攻擊者可能利用這些模型擴大網路攻擊的規模與效率。

SK Hynix 已在印第安納州 West Lafayette 動工興建一座超過 40 億美元的記憶體封裝工廠。這將是該公司首個用於封裝高頻寬記憶體的美國基地,預計於 2029 年下半年投產。

Google、Microsoft、OpenAI 與近 100 家企業呼籲強化網路防禦。聯署信警告,運用 AI 的網路攻擊可能在數月內變得更加複雜與精密。

據報導,YMTC 目標在 2027 年底前超越 Samsung 與 SK hynix,成為全球最大的 NAND 製造商。若要達成目標,YMTC 必須在 16 個月內將市佔率提高近一倍。

WIRED 審閱的程式碼顯示,OpenAI 正在為 Codex 開發持續運作模式。這項功能可讓程式設計代理主動持續工作,直到使用者讓它進入「休眠」狀態。