nemo_rl.modelopt.models.generation.vllm_quant_worker#
Module Contents#
Classes#
Functions#
Data#
API#
- nemo_rl.modelopt.models.generation.vllm_quant_worker._EXTRA_ENV_VARS#
(‘VLLM_QUANT_CFG’, ‘VLLM_MODELOPT_REAL_QUANT’, ‘PYTHONPATH’)
- nemo_rl.modelopt.models.generation.vllm_quant_worker._quant_cfg_for_worker_env(quant_cfg: str) str#
- nemo_rl.modelopt.models.generation.vllm_quant_worker._configure_quant_engine_kwargs(
- cfg: nemo_rl.models.generation.vllm.config.VllmConfig,
- llm_kwargs: dict[str, Any],
- class nemo_rl.modelopt.models.generation.vllm_quant_worker.VllmQuantGenerationWorker(*args, **kwargs)#
Bases:
nemo_rl.models.generation.vllm.vllm_worker.VllmGenerationWorkerImpl- _create_engine(llm_kwargs: dict[str, Any]) None#
- get_quantizer_stats() dict[str, Any]#
Return quantizer statistics. Mirrors MegatronQuantPolicyWorker.get_quantizer_stats().
- get_weight_snapshot(name: str) Any#
Return a CPU copy of a named parameter for before/after comparison.
- class nemo_rl.modelopt.models.generation.vllm_quant_worker.VllmQuantAsyncGenerationWorker(*args, **kwargs)#
Bases:
nemo_rl.models.generation.vllm.vllm_worker_async.VllmAsyncGenerationWorkerImpl- _create_engine(llm_kwargs: dict[str, Any]) None#
- async get_quantizer_stats() dict[str, Any]#
Return quantizer statistics. Mirrors MegatronQuantPolicyWorker.get_quantizer_stats().
- async get_weight_snapshot(name: str) Any#
Return a CPU copy of a named parameter for before/after comparison.