# NVIDIA Triton Inference Server HTTP API

**Canonical:** https://apis.io/apis/scalable-inference-serving/nvidia-triton-inference-server-http-api/  
**Provider:** Scalable Inference Serving — https://apis.io/providers/scalable-inference-serving/

NVIDIA Triton Inference Server HTTP API is one of 9 APIs that [Scalable Inference Serving](https://apis.io/providers/scalable-inference-serving/) publishes on the [APIs.io](https://apis.io/) network. Tagged areas include GPU, Inference, Model Serving, NVIDIA, and Open-Source. The published artifact set on APIs.io includes API documentation, a getting-started guide, and an API reference.

NVIDIA Triton Inference Server is an open-source inference serving software that implements the KServe Open Inference Protocol (V2). Supports TensorRT, ONNX, TensorFlow, PyTorch, and Python backends. Provides dynamic batching, model ensembles, model analyzers, and GPU/CPU inference. Used extensively in production ML pipelines requiring maximum throughput.

## Machine-readable artifacts (4)

- **Documentation** — https://docs.nvidia.com/deeplearning/triton-inference-server/user-guide/docs/
- **GitHub** — https://github.com/triton-inference-server/server
- **GettingStarted** — https://github.com/triton-inference-server/tutorials
- **APIReference** — https://docs.nvidia.com/deeplearning/triton-inference-server/user-guide/docs/customization_guide/inference_protocols.html

## Other Scalable Inference Serving APIs (8)

- [BentoML REST API](https://apis.io/apis/scalable-inference-serving/bentoml-rest-api/)
- [vLLM OpenAI-Compatible API](https://apis.io/apis/scalable-inference-serving/vllm-openai-compatible-api/)
- [MLflow Model Registry REST API](https://apis.io/apis/scalable-inference-serving/mlflow-model-registry-rest-api/)
- [Ray Serve REST API](https://apis.io/apis/scalable-inference-serving/ray-serve-rest-api/)
- [Scalable Inference Serving Health API](https://apis.io/apis/scalable-inference-serving/scalable-inference-serving-health-api/)
- [Scalable Inference Serving Inference API](https://apis.io/apis/scalable-inference-serving/scalable-inference-serving-inference-api/)
- [Scalable Inference Serving Metadata API](https://apis.io/apis/scalable-inference-serving/scalable-inference-serving-metadata-api/)
- [Scalable Inference Serving Models API](https://apis.io/apis/scalable-inference-serving/scalable-inference-serving-models-api/)

## Tags

GPU, Inference, Model Serving, NVIDIA, Open-Source, TensorRT, Triton

---

Profiled by [API Evangelist](https://apievangelist.com) and published on [APIs.io](https://apis.io/apis/scalable-inference-serving/nvidia-triton-inference-server-http-api/). The API's provider profile, Kin Score and agent-readiness rating are at https://apis.io/providers/scalable-inference-serving/.
