nemo_rl.modelopt.models.generation.vllm_quant_worker#

Module Contents#

Classes#

Functions#

Data#

API#

nemo_rl.modelopt.models.generation.vllm_quant_worker._EXTRA_ENV_VARS#

(‘VLLM_QUANT_CFG’, ‘VLLM_MODELOPT_REAL_QUANT’, ‘PYTHONPATH’)

nemo_rl.modelopt.models.generation.vllm_quant_worker._quant_cfg_for_worker_env(quant_cfg: str) str#
nemo_rl.modelopt.models.generation.vllm_quant_worker._configure_quant_engine_kwargs(
cfg: nemo_rl.models.generation.vllm.config.VllmConfig,
llm_kwargs: dict[str, Any],
) None#
class nemo_rl.modelopt.models.generation.vllm_quant_worker.VllmQuantGenerationWorker(*args, **kwargs)#

Bases: nemo_rl.models.generation.vllm.vllm_worker.VllmGenerationWorkerImpl

_create_engine(llm_kwargs: dict[str, Any]) None#
get_quantizer_stats() dict[str, Any]#

Return quantizer statistics. Mirrors MegatronQuantPolicyWorker.get_quantizer_stats().

get_weight_snapshot(name: str) Any#

Return a CPU copy of a named parameter for before/after comparison.

class nemo_rl.modelopt.models.generation.vllm_quant_worker.VllmQuantAsyncGenerationWorker(*args, **kwargs)#

Bases: nemo_rl.models.generation.vllm.vllm_worker_async.VllmAsyncGenerationWorkerImpl

_create_engine(llm_kwargs: dict[str, Any]) None#
async get_quantizer_stats() dict[str, Any]#

Return quantizer statistics. Mirrors MegatronQuantPolicyWorker.get_quantizer_stats().

async get_weight_snapshot(name: str) Any#

Return a CPU copy of a named parameter for before/after comparison.