Search

Tag: #gpu-optimization50 results

Kubernetes 上拆分式 LLM 推論部署

Kubernetes 上拆分式 LLM 推論部署

NVIDIA 介紹在 Kubernetes 上部署拆分式 LLM 推論工作負載,解決單一單體服務過程的限制。預填充與解碼階段具有不同計算特性,傳統部署強迫使用相同硬體,導致 GPU 閒置與擴展不靈活。拆分式服務將推論管線分離,提升 GPU 利用率與擴展性。

NVIDIA Developer BlogOfficialMar 23#llm-inference#gpu-optimization
Page 3 of 5