core.inference.moe#
Submodules#
Package Contents#
Classes#
Backend for grouped GEMM operations during inference. |
API#
- class core.inference.moe.InferenceGroupedGemmBackend(*args, **kwds)#
Bases:
enum.EnumBackend for grouped GEMM operations during inference.
The string values match the
inference_grouped_gemm_backendconfig field.Initialization
- FLASHINFER#
‘flashinfer’
- TORCH#
‘torch’
- VLLM#
‘vllm’
- classmethod from_config(
- value: str | core.inference.moe.InferenceGroupedGemmBackend,
Convert a config value to a grouped-GEMM backend.
- Parameters:
value – Backend name or an already-converted enum member.
- Returns:
The corresponding grouped-GEMM backend.
- Raises:
ValueError – If
valueis not a supported backend.