Working with Transformers#

TensorRT provides built-in layers and fusions for common transformer workloads, so attention, position embeddings, and expert routing map onto dedicated APIs instead of hand-built subgraphs.

In this guide