aitune.torch.backend.tensorrt.onnx_autocast
aitune.torch.backend.tensorrt.onnx_autocast
NVIDIA ModelOpt ONNX quantization module for TensorRT backend.
Module Contents
Classes
Functions
Data
API
NVIDIA ModelOpt ONNX autocast for TensorRT backend.
This class provides functionality to autocast ONNX models using NVIDIA ModelOpt.
Autocast the ONNX model using NVIDIA ModelOpt.
Parameters:
Path to the input ONNX model
Path to the output ONNX model
ONNXAutoCastConfig
Optional calibration dataset for quantization. If None, random data will be used for calibration
Graph specification containing input names mapping
Returns: Path
Path to the autocasted ONNX file
Raises:
ValueError: If unsupported precision is specifiedRuntimeError: If autocast fails
Configuration for mixed precision quantization.
Parameters:
Mixed precision quantization precision (“fp16”, “bf16”)
Validate precision after initialization.
Convert dict to MixedPrecisionConfig.
Validate that precision is a supported value for autocast.