什麼是推論微服務?
NVIDIA 推論微服務™ 是 NVIDIA AI Enterprise 的一部分,提供容器化環境,以便在雲端、資料中心和工作站上自行託管針對預訓練及自定義 AI 模型的 GPU 加速推論微服務。透過單一指令部署後,推論微服務會提供業界標準 API,以便輕鬆整合至 AI 應用程式、開發框架和工作流程中。推論微服務建構於 NVIDIA 及社群提供的預優化推論引擎(包括 NVIDIA TensorRT™ 與 TensorRT-LLM),可針對執行時偵測到的基礎模型與 GPU 系統組合,自動優化回應延遲與吞吐量。推論微服務容器還提供標準的可觀測性數據饋送,並內建對 GPU 上 Kubernetes 自動擴展的支援。
