nemo_rl.models.generation.trtllm.config#

Module Contents#

Classes#

API#

class nemo_rl.models.generation.trtllm.config.TrtllmSpecificArgs#

Bases: typing.TypedDict

tensor_parallel_size: int#

None

model_name: NotRequired[str]#

None

gpu_memory_utilization: NotRequired[float]#

None

max_model_len: int#

None

precision: str#

None

max_batch_size: int#

None

max_num_tokens: int#

None

expose_http_server: NotRequired[bool]#

None

async_engine: NotRequired[bool]#

None

moe_tensor_parallel_size: NotRequired[int]#

None

moe_expert_parallel_size: NotRequired[int]#

None

in_flight_weight_updates: NotRequired[bool]#

None

recompute_kv_cache_after_weight_updates: NotRequired[bool]#

None

default_chat_template_kwargs: NotRequired[dict[str, Any]]#

None

tool_parser: NotRequired[str]#

None

reasoning_parser: NotRequired[str]#

None

class nemo_rl.models.generation.trtllm.config.TrtllmConfig#

Bases: nemo_rl.models.generation.interfaces.GenerationConfig

trtllm_cfg: nemo_rl.models.generation.trtllm.config.TrtllmSpecificArgs#

None

trtllm_kwargs: NotRequired[dict[str, Any]]#

None