Performance
This section shows the latency and throughput numbers for Llama models powered by NVIDIA NIM. Please see Using AIPerf to Benchmark for the benchmark process.
For specifications of the hardware on which these measurements were collected, see the Hardware Specifications section.
Llama-3.3-70b-instruct Results
- NIM Container: Llama-3.3-70b-Instruct
Version: 1.8.0
2 x H100 80G
2 x H200 141GB
4 x H100 80GB
8 x A100 80GB
8 x H100 80GB
fp8 TP2
5000 Input Tokens / 500 Output Tokens
500 Input Tokens / 2000 Output Tokens
200 Input Tokens / 200 Output Tokens
1000 Input Tokens / 1000 Output Tokens
20000 Input Tokens / 2000 Output Tokens
Version: 1.5.0
4 x H100 80G
fp16 TP4
5000 Input Tokens / 500 Output Tokens
500 Input Tokens / 2000 Output Tokens
200 Input Tokens / 200 Output Tokens
1000 Input Tokens / 1000 Output Tokens
2500 Input Tokens / 300 Output Tokens
2000 Input Tokens / 2000 Output Tokens
Llama-3.1-8b-instruct Results
- NIM Container: Llama-3.1-8b-Instruct
Version: 1.8.0
1 x H100 80G
1 x H200 141GB
1 x L40s 48GB
fp8 TP1
bf16 TP1
200 Input Tokens / 200 Output Tokens
500 Input Tokens / 2000 Output Tokens
1000 Input Tokens / 1000 Output Tokens
5000 Input Tokens / 500 Output Tokens
20000 Input Tokens / 2000 Output Tokens
Version: 1.3.0
1 x H100 80G
fp8 TP1
fp16 TP1
200 Input Tokens / 200 Output Tokens
500 Input Tokens / 2000 Output Tokens
1000 Input Tokens / 1000 Output Tokens
5000 Input Tokens / 500 Output Tokens
20000 Input Tokens / 2000 Output Tokens
Llama-3.1-70b-instruct Results
- NIM Container: llama-3.1-70b-instruct