NeMo RL Documentation#
Welcome to the NeMo RL documentation. NeMo RL is an open-source post-training library developed by NVIDIA, designed to streamline and scale reinforcement learning methods for multimodal models (LLMs, VLMs, etc.).
This documentation provides comprehensive guides, examples, and references to help you get started with NeMo RL and build powerful post-training pipelines for your models.
Getting Started#
Learn about NeMo RL’s architecture, design philosophy, and key features that make it ideal for scalable reinforcement learning.
Get up and running quickly with examples for both DTensor and Megatron Core training backends.
Step-by-step instructions for installing NeMo RL, including prerequisites, system dependencies, and environment setup.
Explore the current features and upcoming enhancements in NeMo RL, including distributed training, advanced parallelism, and more.
Troubleshooting common issues including missing submodules and memory fragmentation.
Training and Generation#
Learn about DTensor and Megatron Core training backends, their capabilities, and how to choose the right one for your use case.
Discover supported algorithms including GRPO, PPO, SFT, DPO, RM, on-policy distillation, and multi-teacher on-policy distillation (MOPD) with detailed guides and examples.
Learn how to evaluate your models using built-in evaluation datasets and custom evaluation pipelines.
Configure and launch NeMo RL on multi-node Slurm or Kubernetes clusters for distributed computing.
Guides and Examples#
Reproduce DeepscaleR results with NeMo RL using GRPO on mathematical reasoning tasks.
Step-by-step guide for supervised fine-tuning on the OpenMathInstruct2 dataset.
Post-train Nemotron 3 Ultra with RLVR, teacher training, and MOPD stages on GB200 NVL72 hardware.
Create custom reward environments and integrate them with NeMo RL training pipelines.
Configure offline and online Eagle3 draft-model workflows to accelerate rollout generation with vLLM.
Train Qwen2.5-Omni-3B with GRPO on AVQA and evaluate on MMAU, following the R1-AQA approach.
Train Qwen2.5-Omni-7B with GRPO on PhilipC/IntentTrain (audio-visual intent recognition) and evaluate on Daily-Omni, following HumanOmniV2’s joint audio-visual setup.
Train Qwen3-30B-A3B-Thinking into a SWE agent with a pivot stage plus end-to-end agentic RL on SWE-bench.
Learn how to add support for new model architectures in NeMo RL.
Parameter-efficient fine-tuning with LoRA: backend support, DTensor vs Megatron schema comparison, config examples, and recipes.
Extend a model’s context window with YaRN RoPE scaling on the Megatron backend for SFT, GRPO, and other workflows.
Off-policy distillation across mismatched tokenizers — build a (student, teacher) projection matrix and run x-token KD via CUDA-IPC teacher logits.
Choose among colocated IPC, NCCL, sparse delta, and NIXL refit transports.
Use NIXL checkpoint-engine refit to update non-colocated vLLM generation workers from policy workers.
Advanced Topics#
Deep dive into NeMo RL’s architecture, APIs, and design decisions for scalable RL.
Tools and techniques for debugging distributed Ray applications and RL training runs.
Optimize large language models with FP8 quantization for faster training and inference.
Run quantization-aware GRPO and distillation using NVIDIA ModelOpt. Includes NVFP4 W4A4 and W4A16 real rollout.
Build and use Docker containers for reproducible NeMo RL environments.
API Reference#
Comprehensive reference for all NeMo RL modules, classes, functions, and methods. Browse the complete Python API with detailed docstrings and usage examples.
Full Documentation Index#
The complete table of contents below lists all pages, including guide, development, and design-doc pages that are not shown in the cards above.
About
Environment Start
E2E Examples
Guides
- Nemotron 3 Nano
- Nemotron 3 Nano Omni
- Nemotron 3 Super
- Nemotron 3 Ultra
- Add New Models
- Model Diagnostics
- Supervised Fine-Tuning in NeMo RL
- Direct Preference Optimization in NeMo RL
- An in-depth Walkthrough of DAPO in NeMo RL
- LoRA (Low-Rank Adaptation)
- An in-depth Walkthrough of CISPO in NeMo RL
- An In-Depth Walkthrough of ProRLv2 in NeMo RL
- Quickstart: Launch a ProRLv2 Run
- DAPO: Dynamic Sampling
- Decoupled local/global advantage normalization
- Reward Shaping: “Stop properly” Penalty (Truncation Penalty)
- Loss: Decoupled (Asymmetric) Clipping
- Loss: Token-level Policy Gradient
- Importance Sampling Correction and MoE Stability
- Full Example Configs
- Practical Overrides
- What to Monitor
- References
- Two-Stage SWE RL for Qwen3-30B-A3B-Thinking
- An In-depth Walkthrough of GRPO in NeMo RL
- An In-Depth Walkthrough of PPO in NeMo RL
- GRPO on DeepScaler
- Solve a Sliding Puzzle Using GRPO
- Audio Post-training with NeMo RL
- Audio-Visual GRPO with Qwen2.5-Omni-7B
- Reward Model Training in NeMo RL
- Environments for GRPO Training
- Evaluation
- DeepSeek-V3
- Model Guides
- Qwen
- Qwen3.5
- Model Quirks
- Train with Async GRPO
- Quantization-Aware RL (QARL)
- Overview
- Verified Configurations
- ModelOpt Layer Spec Toggle
- Quantization-Aware GRPO (QA-GRPO)
- Real-Quant NVFP4 Rollout (W4A4 and W4A16)
- Quantization-Aware Distillation (On-Policy QAD)
- Quantization Parameters
- Megatron Checkpoint Directory
- Differences from FP8 Training
- Supported Quantization Formats
- Exporting Megatron Checkpoints
- Limitations
- Train with Eagle3 Speculative Decoding
- YaRN Long-Context Training
- Cross-Tokenizer (X-Token) Off-Policy Distillation
- Weight Refit: Choosing a Transport
- Checkpoint-Engine Refit
- Router Replay
- Muon Optimizer
- DTensor Tensor Parallel Accuracy Issue
- Fault Tolerance Launcher Guide
Containers
Development
- CI/CD
- Test NeMo RL
- Documentation Development
- Debug NeMo RL Applications
- Profile GPU with Nsys
- FP8 Quantization in NeMo RL
- Experiment with Custom vLLM
Design Docs
- Design and Philosophy
- Padding in NeMo RL
- Logger
- uv in NeMo RL
- Dependency Management
- Data Format
- Generation Interface
- Remote Sparse-Delta vLLM Refit
- Checkpoint Engine Design
- Exporting Checkpoints to Hugging Face Format
- Loss functions in NeMo RL
- FSDP2 Parallel Plan
- Training Backends
- Sequence Packing and Dynamic Batching
- Environment Variable Precedence in NeMo RL
- NeMo Gym Integration
- ModelOpt Real-Quant Refit Architecture
- NCCL Reshard Refit (Experimental)
API Reference
- API Reference
nemo_rl- Subpackages
nemo_rl.models- Subpackages
nemo_rl.models.value- Subpackages
nemo_rl.models.value.workers- Submodules
nemo_rl.models.value.workers.dtensor_value_worker_v2nemo_rl.models.value.workers.megatron_value_worker
- Submodules
- Submodules
nemo_rl.models.value.interfacesnemo_rl.models.value.config- Module Contents
- Classes
- API
ValueConfigmodel_nametokenizertrain_global_batch_sizetrain_micro_batch_sizelogprob_batch_sizeprecisionreward_model_cfgdtensor_cfgmegatron_cfghf_config_overridesdynamic_batchingsequence_packingmake_sequence_length_divisible_bymax_total_sequence_lengthmax_grad_normdequantize_base_checkpointoptimizerscheduler
- Module Contents
nemo_rl.models.value.lm_value
- Package Contents
- Subpackages
nemo_rl.models.automodel- Submodules
nemo_rl.models.automodel.datanemo_rl.models.automodel.checkpointnemo_rl.models.automodel.train- Module Contents
- Classes
- Functions
- Data
- API
PostProcessingFunction_needs_kv_cache_for_shared_layers()model_forward()extract_logits()apply_temperature_scaling()apply_top_k_top_p_filtering_for_local_logits()redistribute_logits_for_cp()prepare_data_for_cp()forward_with_post_processing_fn()automodel_forward_backward()LossPostProcessorLogprobsPostProcessorTopkLogitsPostProcessorFullLogitsPostProcessorScorePostProcessoraggregate_training_statistics()
- Module Contents
nemo_rl.models.automodel.confignemo_rl.models.automodel.setup
- Submodules
nemo_rl.models.megatron- Subpackages
nemo_rl.models.megatron.draft- Submodules
nemo_rl.models.megatron.draft.eaglenemo_rl.models.megatron.draft.hidden_capturenemo_rl.models.megatron.draft.utils- Module Contents
- Classes
- Functions
- Data
- API
StateDictCheckpointLoader_CHECKPOINT_CANDIDATE_NAMES_HF_SNAPSHOT_ALLOW_PATTERNS_HF_SNAPSHOT_IGNORE_PATTERNS_MODEL_LAYER_QKV_KEY_PATTERN_CHECKPOINT_LAYER_KEY_PATTERN_EagleLayerLayout_resolve_optional_key()_EagleModelLayout_qkv_head_dims()_interleave_qkv()_deinterleave_qkv()_combine_or_shard_weight_parts()_PendingLayerWeights_get_num_aux_hidden_states()_all_gather_tp_shards()_gather_tp_qkv_weight()_gather_tp_gate_up_weight()_gather_tp_weight_if_needed()_extract_tensor_state_dict()_load_safetensors_file()_load_torch_file()_merge_checkpoint_shards()_load_index_checkpoint()_load_checkpoint_file()_load_checkpoint_from_directory()_load_checkpoint_state()_normalize_hf_key()_parse_layer_checkpoint_key()_get_tp_rank()_build_split_axis_by_parameter()_shard_to_local_tp()_assign_optional_layer_weight()_map_layer_hf_weight()_map_hf_state_to_eagle_state()load_hf_weights_to_eagle()_require_state_tensor()find_draft_owner_chunk()get_attached_draft_model()_export_layer_weights_to_hf()export_eagle_weights_to_hf()get_policy_lm_head_weight()_get_draft_output_layer()_get_draft_to_target_token_mapping()copy_policy_lm_head_to_draft()DRAFT_GRAD_NORM_GROUPregister_draft_grad_norm_group()build_draft_model()
- Module Contents
- Package Contents
- Submodules
- Submodules
nemo_rl.models.megatron.commonnemo_rl.models.megatron.data- Module Contents
- Classes
- Functions
- API
ProcessedInputsProcessedMicrobatchmake_processed_microbatch_iterator()get_microbatch_iterator()get_ltor_masks_and_position_ids()process_microbatch()_make_r3_trace_token_identity()_verify_r3_trace_cp_token_alignment()_fill_routed_experts_padding()process_global_batch()_prepare_vlm_batch_for_megatron()_pack_sequences_for_megatron()_shard_routed_experts_for_cp()_get_pack_sequence_parameters_for_megatron()_unpack_sequences_from_megatron()get_and_validate_seqlen()
- Module Contents
nemo_rl.models.megatron.community_importnemo_rl.models.megatron.trainnemo_rl.models.megatron.confignemo_rl.models.megatron.setup- Module Contents
- Classes
- Functions
- Data
- API
_HF_CONFIG_PATCHED_NEMOTRON_OMNI_EXPANDED_SEQUENCE_CONTRACT_patch_hf_config_double_instantiation()_force_sync_optimizer_fp32_from_model()TokenizerTypedestroy_parallel_state()setup_distributed()validate_and_set_config()_canonicalize_hf_config_overrides()_get_hf_config_overrides_hash()_resolve_iter_dir_from_root()validate_model_paths()setup_model_config()_apply_parallelism_config()_apply_moe_config()_apply_mtp_config()_apply_precision_config()_apply_performance_config()_validate_optimizer_config()_validate_chunking_config()_create_checkpoint_config()_validate_training_config()_validate_dtype_config()_create_megatron_config()_create_draft_pre_wrap_hook()_BRIDGE_SIGNAL_HANDLER_PATCHED_patch_bridge_signal_handler_for_worker_threads()setup_model_and_optimizer()handle_model_import()setup_reference_model_state()finalize_megatron_setup()MoEFloat16Modulemake_policy_like_config()
- Module Contents
nemo_rl.models.megatron.router_replay- Module Contents
- Functions
- Data
- API
_ROUTER_REPLAY_VALIDATE_ENV_MISSING_ROUTE_SENTINEL_MISSING_ROUTE_FALLBACK_PATCH_ATTRrouter_replay_enabled()configure_vllm_for_router_replay()validate_router_replay_config()_iter_model_modules()_unwrap_model_config()_global_moe_layer_numbers()_router_replay_instances_for_model()_local_layer_numbers_for_model()_normalize_routed_experts_for_mcore()_payload_indices_for_moe_layers()_router_replay_validation_enabled()_validate_replay_tensor()_install_missing_route_fallback_patch()_get_tensor_model_parallel_world_size()_get_tensor_model_parallel_rank()_split_for_sequence_parallel()build_router_replay_tensors()build_router_replay_assignments()set_router_replay_forward()set_router_replay_backward()clear_router_replay()clear_global_router_replay_instances()
- Module Contents
nemo_rl.models.megatron.pipeline_parallel
- Subpackages
nemo_rl.models.huggingfacenemo_rl.models.policy- Subpackages
nemo_rl.models.policy.workers- Submodules
nemo_rl.models.policy.workers.megatron_remote_sparse_refitnemo_rl.models.policy.workers.checkpoint_enginenemo_rl.models.policy.workers.dtensor_policy_worker- Module Contents
- Classes
- Functions
- API
dtensor_params_generator()_attach_context_parallel_hooks()unshard_fsdp2_model()get_cpu_state_dict()DTensorPolicyWorkerImpl__repr__()_get_replica_group()_local_coords()create_context_parallel_ctx()_apply_temperature_scaling()_apply_top_k_top_p_filtering()train_context()train()get_logprobs()score()get_topk_logits()use_reference_model()_add_noise_to_weights()return_state_dict()return_model_config()prepare_refit_info()calibrate_qkv_fp8_scales()stream_weights_via_ipc_zmq()_checkpoint_engine_params()broadcast_weights_for_collective()prepare_for_lp_inference()prepare_for_training()offload_before_refit()offload_after_refit()move_optimizer_to_device()move_to_device()move_buffer_to_device()move_to_cuda()move_to_cpu()save_checkpoint()load_checkpoint()
DTensorPolicyWorker
- Module Contents
nemo_rl.models.policy.workers.dtensor_policy_worker_v2- Module Contents
- Classes
- Functions
- API
dtensor_params_generator()_maybe_merge_lora_weight()_maybe_adapt_tensor_to_hf()get_train_context()DTensorPolicyWorkerV2Impl__repr__()_get_replica_group()_local_coords()_update_moe_gate_bias_if_supported()set_rollout_num_gpus_per_engine()train()get_logprobs()score()get_topk_logits()get_full_logits_ipc()release_ipc_buffer()use_reference_model()_add_noise_to_weights()return_state_dict()return_model_config()prepare_refit_info()calibrate_qkv_fp8_scales()stream_weights_via_ipc_zmq()stream_weights_via_http()_checkpoint_engine_params()broadcast_weights_for_collective()prepare_for_lp_inference()prepare_for_training()finish_inference()offload_before_refit()offload_after_refit()move_optimizer_to_device()move_to_device()move_buffer_to_device()move_to_cuda()move_to_cpu()save_checkpoint()load_checkpoint()_init_checkpoint_manager()
DTensorPolicyWorkerV2
- Module Contents
nemo_rl.models.policy.workers.megatron_policy_worker- Module Contents
- Classes
- Functions
- Data
- API
logTokenizerType_should_use_router_replay()_model_self_packs_for_cp()_model_self_packs_mtp_loss_mask()_model_slices_context_parallel_inputs()_estimate_refit_tensor_size_in_bytes()_meta_tensor_alloc_context()MegatronPolicyWorkerImpl_train_step_state_remote_sparse_refit_async_checkpoint_cuda_cache_active__repr__()_local_coords()_get_replica_group()configure_worker()enable_forward_pre_hook()disable_forward_pre_hook()_forward_pre_hook_enabled()_disable_forward_pre_hook_until_next_train_step()_copy_main_params_to_param_buffer()_uses_mxfp8_overlap_shared_param_buffer()_get_model_extra_state_dict()_restore_model_extra_state_dict()train()_compute_moe_grad_scale()_set_moe_grad_scale_func()get_reference_policy_logprobs()_split_step_state_init()_assert_step_open()_restore_saved_grad_sync_func()begin_train_step()train_microbatch()_train_microbatch_body()finish_train_step()_finish_train_step_body()abort_train_step()get_logprobs()_apply_state_dict_to_model()use_reference_model()get_topk_logits()prepare_refit_info()_collect_mtp_metrics()_set_mtp_grad_scale_func()_get_model_config()init_remote_sparse_delta_baseline()stream_remote_sparse_weights()_require_remote_sparse_refit()finish_remote_sparse_delta_sync()_is_fp8_export()_build_refit_conversion_tasks()_calculate_refit_param_info()_iter_params_with_optional_kv_scales()_iter_local_hf_param_shards()stream_weights_via_ipc_zmq()broadcast_weights_for_collective()_build_layer_to_pp_stage()prepare_nccl_reshard_refit_info()_build_expert_groups()_group_experts()build_hf_to_local_param_map()nccl_reshard_refit()_broadcast_misc_params_packed()prepare_for_lp_inference()prepare_for_training()finish_inference()_clear_fp8_caches()offload_before_refit()offload_after_refit()move_model()move_optimizer()save_checkpoint()_requires_nvrx_cuda_cache_release()finalize_async_save()load_checkpoint()check_tensor_parallel_attributes()calibrate_qkv_fp8_scales()
MegatronPolicyWorker
- Module Contents
nemo_rl.models.policy.workers.base_policy_worker- Module Contents
- Classes
- API
AbstractPolicyWorkerinit_collective()init_nccl_reshard_comm_group()prepare_nccl_reshard_refit_info()nccl_reshard_refit()is_alive()reset_peak_memory_stats()get_gpu_info()report_device_id()get_zmq_address()maybe_init_zmq()get_free_memory_bytes()shutdown()start_gpu_profiling()stop_gpu_profiling()report_node_ip_and_gpu_id()get_reference_policy_logprobs()finalize_async_save()finish_training()
- Module Contents
nemo_rl.models.policy.workers.patches
- Submodules
- Submodules
nemo_rl.models.policy.interfaces- Module Contents
- Classes
- API
LogprobOutputSpecReferenceLogprobOutputSpecScoreOutputSpecTopkLogitsOutputSpecPolicyInterfaceColocatablePolicyInterfaceinit_collective()offload_before_refit()offload_after_refit()offload_to_cpu()prepare_refit_info()stream_weights_via_ipc_zmq()stream_weights_via_http()set_rollout_num_gpus_per_engine()broadcast_weights_for_collective()prepare_nccl_reshard_refit_info()nccl_reshard_refit()prepare_for_lp_inference()
- Module Contents
nemo_rl.models.policy.teacher_worker_groupnemo_rl.models.policy.tq_policy- Module Contents
- Classes
- Functions
- API
_aggregate_train_results()TQPolicyshutdown()prepare_step()prepare_val_partition()discard_samples()finish_step()_stamp_pad_seqlen()read_from_dataplane()write_to_dataplane()_packing_args()_logprob_dispatch()get_logprobs_from_meta()get_reference_policy_logprobs_from_meta()train_from_meta()begin_train_step()train_microbatches_from_meta()finish_train_step()abort_train_step()
- Module Contents
nemo_rl.models.policy.lm_policy- Module Contents
- Classes
- Functions
- Data
- API
PathLike_aggregate_megatron_flops_metrics()Policydata_parallel_sizerun_all_workers_single_data()run_all_workers_multiple_data()init_collective()init_collective_mcore_generation()preinit_nvshmem()swap_weights_via_reshard()_shard_for_logprob()_shard_for_train()get_logprobs()get_reference_policy_logprobs()get_topk_logits()get_full_logits_ipc()release_ipc_buffer()train()generate()score()prepare_for_generation()finish_generation()prepare_for_training()prepare_for_lp_inference()invalidate_kv_cache()prepare_refit_info()finish_inference()finish_training()calibrate_qkv_fp8_scales()get_free_memory_bytes()stream_weights_via_ipc_zmq()stream_weights_via_http()set_rollout_num_gpus_per_engine()broadcast_weights_for_collective()init_nccl_reshard_comm_group()prepare_nccl_reshard_refit_info()nccl_reshard_refit()offload_before_refit()offload_after_refit()offload_to_cpu()save_checkpoint()finalize_async_save()shutdown()__del__()start_gpu_profiling()stop_gpu_profiling()print_node_ip_and_gpu_id()
- Module Contents
nemo_rl.models.policy.utils- Module Contents
- Classes
- Functions
- Data
- API
AUTOMODEL_FACTORYIPCProtocolPOLICY_WORKER_OVERRIDESresolve_policy_worker_cls()resolve_model_class()is_vllm_v1_engine_enabled()get_gpu_info()configure_dynamo_cache()get_runtime_env_for_policy_worker()get_megatron_checkpoint_dir()get_handle_from_tensor()ensure_teacher_ipc_buffer()aggregate_per_sample_handles()calculate_aligned_size()stream_weights_via_ipc_zmq_impl()rebuild_cuda_tensor_from_ipc()_ensure_ipc_topology()_flush_bucket()stream_weights_via_http_impl()
- Module Contents
- Package Contents
- Classes
- Functions
- Data
- API
_patch_transformers_tokenizer_class_set()LoRAConfigDisabledLoRAConfigAutomodelBackendConfigAutomodelFreezeConfigAutomodelKwargsDTensorConfigDisabledMoEParallelizerOptionsDTensorConfigSequencePackingConfigDisabledSequencePackingConfigRewardModelConfigMegatronPeftConfigDisabledMegatronPeftConfigMegatronOptimizerConfigMegatronSchedulerConfigMegatronDDPConfigFp8ConfigMegatronConfigDisabledMegatronCheckpointConfigMegatronConfigenabledenv_varsempty_unused_memory_levelactivation_checkpointingrecompute_granularityrecompute_modulestensor_model_parallel_sizepipeline_model_parallel_sizenum_layers_in_first_pipeline_stagenum_layers_in_last_pipeline_stagecontext_parallel_sizepipeline_dtypesequence_parallelfreeze_moe_routerexpert_tensor_parallel_sizeexpert_model_parallel_sizedefer_fp32_logitsapply_rope_fusionbias_activation_fusionforce_reconvert_from_hfattention_backendmoe_per_layer_loggingmoe_enable_deepepmoe_token_dispatcher_typeinference_moe_token_dispatcher_typeinference_grouped_gemm_backendmoe_router_num_groupsmoe_router_group_topktransformer_implcuda_graph_implmoe_pad_experts_for_cuda_graph_inferencemoe_shared_expert_overlapuse_gloo_process_groupsmoe_grouped_gemmmoe_flex_dispatcher_backendmoe_hybridep_num_smshybridep_num_ranks_per_nvlink_domainhybridep_use_mnnvlpeftoptimizerschedulerdistributed_data_parallel_configcheckpointgradient_accumulation_fusionuse_fused_weighted_squared_reluuse_fused_linear_logprobsfused_linear_logprobs_chunk_sizemtp_num_layersmtp_loss_scaling_factormtp_use_repeated_layermtp_detach_headsclear_memory_caches_before_refitfp8_cfg
DraftConfigDisabledDraftConfigTokenizerConfigPytorchOptimizerConfigSinglePytorchSchedulerConfigSinglePytorchMilestonesConfigSchedulerMilestonesDynamicBatchingConfigDisabledDynamicBatchingConfigRouterReplayConfigDisabledRouterReplayConfigPolicyConfigmodel_nametokenizertrain_global_batch_sizetrain_micro_batch_sizelogprob_batch_sizelogprob_chunk_sizegenerationgeneration_batch_sizeprecisionreward_model_cfgdtensor_cfgmegatron_cfgdraftpretrained_checkpointrouter_replayhf_config_overridesdynamic_batchingsequence_packingmake_sequence_length_divisible_bymax_total_sequence_lengthmax_grad_normrefit_buffer_size_gboptimizerschedulerquant_cfgquant_calib_dataquant_calib_sizequant_batch_sizequant_sequence_lengthdisable_modelopt_layer_specis_vlm
- Subpackages
nemo_rl.models.generation- Subpackages
nemo_rl.models.generation.trtllm- Submodules
nemo_rl.models.generation.trtllm.trtllm_backendnemo_rl.models.generation.trtllm.trtllm_http_servernemo_rl.models.generation.trtllm.config- Module Contents
- Classes
- API
TrtllmSpecificArgstensor_parallel_sizemodel_namegpu_memory_utilizationmax_model_lenprecisionmax_batch_sizemax_num_tokensexpose_http_serverasync_enginemoe_tensor_parallel_sizemoe_expert_parallel_sizein_flight_weight_updatesrecompute_kv_cache_after_weight_updatesdefault_chat_template_kwargstool_parserreasoning_parser
TrtllmConfig
- Module Contents
nemo_rl.models.generation.trtllm.trtllm_generation- Module Contents
- Classes
- API
TrtllmGenerationinit_cluster_placement_groups()_get_tied_worker_bundle_indices()_report_dp_openai_server_base_urls()_report_device_id()init_collective()generate()generate_async()prepare_for_generation()finish_generation()prepare_refit_info()start_gpu_profiling()stop_gpu_profiling()update_weights_from_collective()update_weights_via_ipc_zmq()invalidate_kv_cache()clear_logger_metrics()get_logger_metrics()shutdown()__del__()
- Module Contents
nemo_rl.models.generation.trtllm.trtllm_worker_async- Module Contents
- Classes
- API
TrtllmAsyncGenerationWorkerImplconfigure_worker()__repr__()is_alive()post_init_async()shutdown()start_http_server()stop_http_server()report_dp_openai_server_base_url()init_collective_async()prepare_refit_info_async()update_weights_from_collective_async()update_weights_via_ipc_zmq_async()report_device_id_async()_weights_tags()_all_sleep_tags()_resolve_wake_tags()sleep_async()wake_up_async()reset_prefix_cache_async()start_gpu_profiling_async()stop_gpu_profiling_async()generate_async()_resolve_end_id()_build_sampling_params()
TrtllmAsyncGenerationWorker
- Module Contents
- Submodules
nemo_rl.models.generation.megatron- Submodules
nemo_rl.models.generation.megatron.megatron_worker- Module Contents
- Classes
- API
MegatronGenerationMixin_init_inference_engine_state()_initialize_inference_engine()_start_inference_coordinator()_sleep()_sleep_engine()_wake()_wake_engine()_start_inference_loop_thread()_setup_openai_api_server()_run_async_coordinator_start()finish_generation()prepare_for_generation()report_dp_openai_server_base_url()_build_sampling_params()_merge_stop_strings()_prepare_data_for_generation()_parse_result_to_batched_data_dict()generate()generate_async()_generate_with_persistent_engine()
MegatronGenerationRefitMixin
- Module Contents
nemo_rl.models.generation.megatron.config- Module Contents
- Classes
- API
MCoreGenerationSpecificArgsasync_engineexpose_http_serverparsersbuffer_size_gbblock_size_tokensmax_tokensmax_model_lennum_cuda_graphsuse_cuda_graphs_for_non_decode_stepscuda_graph_implinference_cuda_graph_scopematerialize_only_last_token_logitsenable_chunked_prefillenable_prefix_cachingrefit_backendnum_speculative_tokensmamba_inference_ssm_states_dtypemamba_inference_conv_states_dtypekv_cache_management_modelogging_step_interval
MCoreGenerationConfig
- Module Contents
nemo_rl.models.generation.megatron.megatron_generation- Module Contents
- Classes
- API
MegatronGenerationeffective_megatron_cfg()nvlink_domain_span()init_cluster_placement_groups()init_collective()update_weights_from_collective()generate()generate_async()prepare_for_generation()finish_generation()preinit_nvshmem_collective()suspend_for_refit()resume_after_refit()prepare_refit_info()start_gpu_profiling()stop_gpu_profiling()shutdown()__del__()
- Module Contents
nemo_rl.models.generation.megatron.utils
- Package Contents
- Submodules
nemo_rl.models.generation.vllm- Submodules
nemo_rl.models.generation.vllm.refit_loadernemo_rl.models.generation.vllm.checkpoint_enginenemo_rl.models.generation.vllm.config- Module Contents
- Classes
- Functions
- Data
- API
VllmRefitTransportNameVllmRefitSelectorVLLM_SPARSE_REFIT_TRANSPORTSVllmSpecificArgstensor_parallel_sizepipeline_parallel_sizeexpert_parallel_sizegpu_memory_utilizationmax_model_lenskip_tokenizer_initasync_engineload_formatprecisionlogprobs_modecap_max_tokens_to_contextis_mxkv_cache_dtypeenforce_eagerenable_return_routed_expertsuse_tqdmexpose_http_serverhttp_refit_api_key_env_varhttp_refit_server_portzmq_refit_server_porthttp_server_serving_chat_kwargstool_parser_pluginenv_varsreasoning_parser_plugin
VllmDeltaCompressionConfigVllmRefitStorageConfigVllmRefitBaselineConfigVllmRefitTuningConfigVllmSparseRefitConfigVllmNixlRefitConfigVllmCheckpointEnginePluginConfigVllmRefitConfigVllmConfignormalize_vllm_refit_config()
- Module Contents
nemo_rl.models.generation.vllm.vllm_worker_async- Module Contents
- Classes
- Data
- API
LOGGERVllmAsyncGenerationWorkerImpl_return_routed_experts_enabled()_reserve_port()load_model()_create_engine()_install_engine_input_socket_lock()_start_vllm_metrics_logger()get_vllm_logger_metrics()clear_vllm_logger_metrics()post_init_async()get_reserved_url()report_dp_openai_server_base_url()_setup_vllm_openai_api_server()_setup_vllm_server()init_collective_async()generate_async()generate_text_async()report_device_id_async()prepare_refit_info_async()update_weights_via_ipc_zmq_async()update_weights_from_collective_async()init_nccl_reshard_comm_group_async()prepare_nccl_reshard_refit_info_async()nccl_reshard_refit_async()reset_prefix_cache_async()sleep_async()wake_up_async()shutdown()
VllmAsyncGenerationWorker
- Module Contents
nemo_rl.models.generation.vllm.worker_utilsnemo_rl.models.generation.vllm.vllm_sparse_deltanemo_rl.models.generation.vllm.vllm_backend- Module Contents
- Classes
- Functions
- Data
- API
loggerWeightUpdateTransportWeightUpdateFinalizer_format_refit_key_error()IPCWeightManifestError_IPCWeightManifestNixlVllmWorkerfix_gemma3_vision_weight_name()_read_mtp_layer_weights_from_checkpoint()VllmInternalWorkerExtension_mtp_drafter_from_disk_sparse_delta_applier_nrl_named_parameters_get_named_parameters()_load_full_hf_weights()_load_hf_weights()bind_numa()init_collective()init_nccl_reshard_comm_group()report_device_id()report_node_hostname()get_zmq_address()maybe_init_zmq()prepare_refit_info()prepare_sparse_delta_refit_info()_uses_fp8_kv_cache()_maybe_process_fp8_kv_cache()_split_policy_and_draft_weights()_trim_vocab_padding()_get_drafter_model()_load_draft_weights()_mtp_drafter_refit_enabled()_maybe_refit_mtp_drafter()_maybe_process_mtp_drafter_after_loading()load_mtp_weights_from_disk()_load_weights()_get_sparse_delta_applier()_weight_update_lifecycle()_weight_update_errors_are_fatal()_synchronize_before_ipc_data_ack()update_weights_via_ipc_zmq()update_weights_from_collective()update_weights_from_decoded_sparse_payload()synchronize_device()finish_sparse_delta_refit()prepare_nccl_reshard_refit_info()build_hf_to_local_param_map()_build_hf_to_gen_backend_mapping()nccl_reshard_refit()_receive_and_load_misc_params()cleanup()start_gpu_profiling()stop_gpu_profiling()
VllmInternalWorkerExtensionWithCheckpointEngine
- Module Contents
nemo_rl.models.generation.vllm.vllm_worker- Module Contents
- Classes
- Functions
- Data
- API
logger_context_capped_max_new_tokens()_resolve_enable_prefix_caching()_merge_fp8_kwargs()BaseVllmGenerationWorker__repr__()configure_worker()_init_config()_load_model()llm()is_alive()_merge_stop_strings()_build_sampling_params()start_gpu_profiling()stop_gpu_profiling()_spec_decode_max_tokens()_request_max_new_tokens()_patch_vllm_nsight_config()_get_raw_spec_counters()report_refit_server_base_url()start_zmq_sparse_refit_relay()configure_zmq_sparse_refit_relay()stop_zmq_sparse_refit_relay()
VllmGenerationWorkerImpl_create_engine()post_init()init_collective()generate()generate_text()report_device_id()prepare_refit_info()update_weights_via_ipc_zmq()update_weights_from_collective()init_nccl_reshard_comm_group()prepare_nccl_reshard_refit_info()nccl_reshard_refit()reset_prefix_cache()sleep()wake_up()shutdown()
VllmGenerationWorker
- Module Contents
nemo_rl.models.generation.vllm.vllm_generation- Module Contents
- Classes
- Data
- API
loggerVllmGenerationinit_cluster_placement_groups()_get_tied_worker_bundle_indices()_report_device_id()_report_dp_openai_server_base_urls()_collect_reserved_urls()load_and_start()_post_init()_get_raw_spec_counters()snapshot_step_metrics()get_step_metrics()init_collective()generate()generate_text()_async_generate_base()generate_text_async()generate_async()prepare_for_generation()finish_generation()shutdown()prepare_refit_info()update_weights_via_ipc_zmq()update_weights_from_collective()init_nccl_reshard_comm_group()prepare_nccl_reshard_refit_info()nccl_reshard_refit()start_gpu_profiling()stop_gpu_profiling()get_vllm_logger_metrics()clear_vllm_logger_metrics()clear_logger_metrics()get_logger_metrics()__del__()invalidate_kv_cache()requires_kv_scale_sync
- Module Contents
nemo_rl.models.generation.vllm.vllm_sparse_refit- Module Contents
- Classes
- Functions
- Data
- API
logger_warn_unauthenticated_refit_server()_StagedSparsePayload_stage_sparse_payload()VllmSparseRefitReceiverset_worker_hostnames()start_sync_server()shutdown()_enqueue_sparse_payload_apply()_submit_pending_sparse_payloads()_notify_refit_apply_waiters()_collect_refit_apply_results()_refit_collective_response()_refit_collective_rpc()update_weights_from_serialized_sparse_payloads()update_weights_from_staged_sparse_payloads()_flush_queued_sparse_payloads()_prepare_sparse_refit_info()_apply_s3_manifest_payload()_apply_zmq_payload()setup_api_server()report_refit_server_base_url()start_zmq_sparse_refit_relay()configure_zmq_sparse_refit_relay()stop_zmq_sparse_refit_relay()flush_zmq_sparse_refit_relay()_setup_vllm_refit_server()
- Module Contents
nemo_rl.models.generation.vllm.refit_layoutnemo_rl.models.generation.vllm.patches- Module Contents
- Functions
- API
_get_vllm_file()_locked_file_patch()_patch_vllm_init_workers_ray()_patch_vllm_llama_eagle3_own_lm_head()_patch_vllm_tool_parser_namespace_tool()_patch_vllm_ray_executor_v2_tcpstore_port()_patch_vllm_shm_broadcast_bind_retry()_patch_vllm_radio_layerscale_loader()ensure_vllm_source_compat()_apply_vllm_patches()
- Module Contents
nemo_rl.models.generation.vllm.utils- Module Contents
- Functions
- Data
- API
R3_MISSING_ROUTE_SENTINELG_ROUTED_EXPERTS_RANGE_CHECKED_as_routed_experts_tensor()format_prompt_for_vllm_generation()pad_and_align_routed_expert_indices()attach_routed_experts_to_chat_response_choices()model_dump_chat_response_with_routed_experts()aggregate_spec_decode_counters()compute_spec_decode_metrics()GENERATION_WORKER_OVERRIDESresolve_generation_worker_cls()
- Module Contents
nemo_rl.models.generation.vllm.collective_rpc
- Package Contents
- Submodules
- Submodules
nemo_rl.models.generation.interfaces- Module Contents
- Classes
- Functions
- Data
- API
ROUTED_EXPERTS_FALLBACK_DTYPEROUTED_EXPERTS_MISSING_ROUTE_SENTINEL_ROUTED_EXPERTS_DTYPE_NAMESget_num_routed_experts()resolve_routed_experts_dtype()resolve_routed_experts_dtype_name_for_model()verify_right_padding()ResourcesConfigOptionalResourcesConfigColocationConfigCheckpointEngineConfigGenerationConfigGenerationSamplingParamsGenerationDatumSpecGenerationOutputSpecGenerationInterfaceinit_collective()generate()prepare_for_generation()finish_generation()requires_kv_scale_syncprepare_refit_info()update_weights_via_ipc_zmq()update_weights_from_collective()prepare_nccl_reshard_refit_info()nccl_reshard_refit()invalidate_kv_cache()clear_logger_metrics()get_logger_metrics()
- Module Contents
nemo_rl.models.generation.openai_server_utilsnemo_rl.models.generation.constants
- Package Contents
- Subpackages
nemo_rl.models.dtensor- Submodules
nemo_rl.models.dtensor.parallelize- Module Contents
- Classes
- Functions
- Data
- API
- Module Contents
- Submodules
- Subpackages
nemo_rl.utils- Subpackages
nemo_rl.utils.checkpoint_engines- Submodules
nemo_rl.utils.checkpoint_engines.nixlnemo_rl.utils.checkpoint_engines.base
- Submodules
- Submodules
nemo_rl.utils.nvmlnemo_rl.utils.timernemo_rl.utils.flops_formulas- Module Contents
- Classes
- Functions
- API
FLOPSConfiggbsenc_seq_lenhslayersffn_hsattention_headshead_dimmoe_router_topkquery_groupsimg_seq_lenimg_himg_win_channelspatch_dimclass_token_lenprojector_typeinp_smodel_patternvocab_sizemodel_channelsvec_in_dimq_lora_rankkv_lora_rankqk_head_dimqk_pos_emb_head_dimv_head_dimmoe_layer_freqmoe_shared_expert_intermediate_sizemoe_ffn_hidden_sizemtp_num_layerscausal_self_attnis_hybrid_modelhybrid_override_patternmamba_state_dimmamba_head_dimmamba_num_groupsmamba_num_heads
gpt3()llama()nemotron()mixtral()qwen2()qwen3()bert()transformer()flux()deepseekv3()_mlp_layer_flops()_non_mla_attn_layer_flops()_mamba_layer_flops()_hybrid_model_flops()nemotronh()
- Module Contents
nemo_rl.utils.r3_trace- Module Contents
- Functions
- Data
- API
_TRACE_ENV_TRACE_STEPS_ENV_TRACE_SAMPLES_ENV_TRACE_DIR_ENV_TRACE_MICROBATCHES_ENV_TRACE_VERIFY_FORWARD_ENV_DEFAULT_TRACE_DIR_DEFAULT_TRACE_STEPS_DEFAULT_TRACE_SAMPLES_DEFAULT_TRACE_MICROBATCHES_write_lock_patch_lock_router_replay_patch_depth_original_get_replay_topk_event_counts_contextr3_trace_enabled()r3_trace_verify_forward_enabled()_env_int()_trace_steps()_trace_samples()_trace_microbatches()_next_count()_should_trace_step()_current_context()_torch_rank_info()_trace_path()_write_record()_tensor_sha256()_tensor_preview()_tensor_record()_shape()_valid_sample_record()_length_at()_tensors_equal()_expected_with_missing_route_fallback()_router_replay_action_name()_trace_router_replay_topk_use()_verify_router_replay_forward_context()trace_rollout_payload()trace_tq_fetch_payload()r3_trace_stage()maybe_r3_trace_stage()trace_cp_routed_experts()trace_router_replay_assignment()trace_router_replay_action()
- Module Contents
nemo_rl.utils.weight_transfer_sparse_codec- Module Contents
- Classes
- Functions
- Data
- API
NamedTensorTensorBatchSparseOperationSparseInfoTensorPayloadPreparedTensorPayloadSparseItem_INTEGER_DTYPE_BY_SIZE_TensorPayloadBuilderinteger_dtype_for_element_size()dtype_from_name()sparse_operation()integer_view()encode_sparse_infos()merge_sparse_payloads()sparse_locations_for_item()_encode_explicit_locations()DeltaCompressionTracker
- Module Contents
nemo_rl.utils.checkpoint- Module Contents
- Classes
- Functions
- Data
- API
PathLike_load_megatron_common_state_dict()PretrainedCheckpointConfigCheckpointingConfigCheckpointManagerget_resume_paths()init_tmp_checkpoint()_rename_checkpoint()finalize_checkpoint()begin_finalization()finalize_pending()shutdown()_warn_on_delete_failure()__enter__()__exit__()has_pending_finalizationremove_old_checkpoints()get_best_checkpoint_path()get_latest_checkpoint_path()load_training_info()
_load_checkpoint_history()
- Module Contents
nemo_rl.utils.confignemo_rl.utils.nsysnemo_rl.utils.memory_trackernemo_rl.utils.weight_transfer_zmqnemo_rl.utils.venvsnemo_rl.utils.native_checkpointnemo_rl.utils.prefetch_venvsnemo_rl.utils.weight_transfer_stream- Module Contents
- Classes
- Functions
- Data
- API
_STREAM_LOCAL_S3_PART_SIZE_S3_MEMORY_LIMITSparseRefitTransport_SparsePayloadBucket_s3_client()_S3ObjectStoresparse_payload_checksum()decode_sparse_payload()iter_sparse_weight_chunks()_get_manifest_s3_store()sparse_export_chunk_size()_executor()init_sparse_delta_baseline_from_iterator()stream_sparse_delta_payloads()stream_sparse_delta_payloads_via_s3_manifest()download_s3_refit_payload()zstd_compress()
- Module Contents
nemo_rl.utils.weight_transfer_httpnemo_rl.utils.logger- Module Contents
- Classes
- Functions
- Data
- API
_rich_logging_configuredWandbConfigSwanlabConfigTensorboardConfigMLflowConfigGPUMonitoringConfigLoggerConfigshould_log_nemo_gym_full_result_tables()LoggerInterfaceTensorboardLoggerWandbLoggerSwanlabLoggerGpuMetricSnapshotRayGpuMonitorLogger_merge_generation_logger_workers()_summarize_list()MLflowLoggerLoggerflatten_dict()configure_rich_logging()print_message_log_samples()get_next_experiment_dir()log_container_init_timing()
- Module Contents
nemo_rl.utils.grad_normnemo_rl.utils.flops_trackernemo_rl.utils.fastokensnemo_rl.utils.packed_tensornemo_rl.utils.routed_experts_codec
- Subpackages
nemo_rl.weight_sync- Submodules
nemo_rl.weight_sync.interfacesnemo_rl.weight_sync.nccl_reshard_utils- Module Contents
- Classes
- Functions
- Data
- API
MeshInfoRefitCtxLocalParamSpecHFToLocalParamMapRefitBuilderInterfaceCOLUMN_PARALLEL_SUFFIXESROW_PARALLEL_SUFFIXESget_tp_shard_dim()is_expert_param()FFN_PROJ_WEIGHT_SUFFIXESFFN_GROUPED_EXPERT_SUFFIXESis_nccl_reshard_param()_get_expert_tp_shard_dim()_STR_TO_DTYPE_restore_placement()restore_refit_info_placements()build_mesh_info()get_placements()_INDIVIDUAL_EXPERT_REgroup_expert_params_in_metadata()_LAYER_RE_MODEL_PREFIX_RE_extract_layer_prefix()_extract_layer_name()check_nccl_reshard_refit_support()build_nccl_reshard_refit_info()
- Module Contents
nemo_rl.weight_sync.collective_weight_synchronizernemo_rl.weight_sync.nccl_reshard_weight_synchronizernemo_rl.weight_sync.http_weight_synchronizernemo_rl.weight_sync.xferdtensor_python- Module Contents
- Functions
- Data
- API
_mesh_rank_tensor()_mesh_ranks()_mesh_signature()_mesh_coordinates()_normalize_shard_dim()_placement_signature()_validate_layout()_compute_shard_slices()_rank_regions()_intersect()_local_slices()_region_numel()_local_tensor()_tensor_metadata()_destination_groups()_build_exact_plan()_PLAN_CACHE_PLAN_CACHE_MAX_SIZE_plan_geometry()_SUBCOMM_CACHE_INACTIVE_SUBCOMM_CACHE_PROCESS_GROUP_COMM_IDS_PROCESS_GROUP_FINALIZERS_destroy_subcommunicator()_evict_communicators()_finalize_process_group()_parent_communicator_key()_active_replica_signature()_get_replica_subcommunicator()clear_xferdtensor_python_caches()_validate_local_inputs()_stage_rank_operations()_exchange_exact_overlaps()_broadcast_destination()_xferdtensor_python_impl_v1()_STRIPED_PLAN_CACHE_STRIPED_PLAN_CACHE_MAX_SIZE_ordered_replica_members()_build_striped_targets()_build_striped_transfers()_max_p2p_peer_degree()_region_view_is_contiguous()_remote_transfers_avoid_double_staging()_striped_geometry()_destination_buffer()_stage_striped_operations()_allgather_destination()xferdtensor_python_impl()__all__
- Module Contents
nemo_rl.weight_sync.xferdtensornemo_rl.weight_sync.factorynemo_rl.weight_sync.checkpoint_engine_weight_synchronizer- Module Contents
- Classes
- Functions
- Data
- API
_MEBIBYTE_flatten_metadata()_sort_ranked_metadata()_ordered_generation_metadata()CheckpointEngineWeightSynchronizer_policy_generation_checkpoint_engine_config_stale_checkpoint_engine_ready_bucket_size_bytesinit_communicator()is_stalemark_stale()_release_after_refit()_run_policy()_generation_rpc()_run_generation()_resolve_bucket_size_bytes()_ensure_checkpoint_engine_ready()sync_weights()shutdown()
- Module Contents
nemo_rl.weight_sync.checkpoint_engine_confignemo_rl.weight_sync.vllm_remote_sparse_weight_synchronizernemo_rl.weight_sync.ipc_weight_synchronizer
- Package Contents
- Submodules
nemo_rl.data_plane- Subpackages
nemo_rl.data_plane.adapters- Submodules
nemo_rl.data_plane.adapters.transfer_queuenemo_rl.data_plane.adapters.noop
- Submodules
- Submodules
nemo_rl.data_plane.schemanemo_rl.data_plane.interfacesnemo_rl.data_plane.column_ionemo_rl.data_plane.observabilitynemo_rl.data_plane.preshardnemo_rl.data_plane.factorynemo_rl.data_plane.codecnemo_rl.data_plane.worker_mixin- Module Contents
- Classes
- Functions
- Data
- API
FetchPolicy_broadcast_batched_data_dict()TQWorkerMixin_dp_clientsetup_data_plane()_require_dp_client()_get_replica_group()_pad_value_dict()_forward_pad_seqlen()_fetch()_apply_packing_prep()_attach_or_repack_pack_metadata()_local_coords()_is_replica_leader()_write_back()_write_back_result_field()train_presharded()get_logprobs_presharded()get_reference_policy_logprobs_presharded()begin_train_step_presharded()train_microbatch_presharded()finish_train_step_presharded()abort_train_step_presharded()
- Module Contents
- Package Contents
- Subpackages
nemo_rl.environments- Submodules
nemo_rl.environments.vlm_environmentnemo_rl.environments.interfacesnemo_rl.environments.nemo_gym- Module Contents
- Classes
- Functions
- Data
- API
_ROUTED_EXPERTS_DTYPESDEFAULT_INVALID_TOOL_CALL_PATTERNSDEFAULT_THINKING_TAGS_has_nan_generation_logprobs()get_nemo_gym_uv_cache_dir()get_nemo_gym_venv_dir()NemoGymConfig_detect_invalid_tool_call_and_malformed_thinking()_IMAGE_SRC_PREFIXES_looks_like_image_src()_extract_input_images_from_message()_index_per_turn_images()_attach_multimodal_data_to_user_message()NemoGymextract_reward_components()build_reward_component_columns()validate_reward_components_match_scalar()setup_nemo_gym_config()spinup_nemo_gym_actor()
- Module Contents
nemo_rl.environments.metricsnemo_rl.environments.reward_model_environmentnemo_rl.environments.code_environmentnemo_rl.environments.code_jaccard_environmentnemo_rl.environments.rewardsnemo_rl.environments.dapo_math_verifiernemo_rl.environments.math_environmentnemo_rl.environments.utils
- Submodules
nemo_rl.modelopt- Subpackages
nemo_rl.modelopt.models- Subpackages
nemo_rl.modelopt.models.policy- Subpackages
nemo_rl.modelopt.models.policy.workers- Submodules
nemo_rl.modelopt.models.policy.workers.megatron_quant_policy_worker- Module Contents
- Classes
- Functions
- API
_quant_checkpoint_cache_suffix()_find_other_quant_checkpoint_caches()_warn_if_other_quant_checkpoint_caches()_set_quantization_model_specs()MegatronQuantPolicyWorkermaybe_init_zmq()_quantize()_patch_validate_model_paths()_patch_setup_model_and_optimizer()_restore_modelopt_state_pre_load()hide_tensor_quantizers()enable_forward_pre_hook()disable_forward_pre_hook()disable_quantization()_hide_extra_state()use_reference_model()without_model_config()get_quantizer_stats()generate()save_checkpoint()_use_real_quant_refit()_get_real_quant_mode()_iter_real_quant_refit_params()_find_weight_quantizer()_iter_hf_input_amax_names()_get_enabled_input_amax()_iter_input_quantizer_amax_params()_iter_params_with_optional_kv_scales()
- Module Contents
nemo_rl.modelopt.models.policy.workers.dtensor_quant_policy_workernemo_rl.modelopt.models.policy.workers.dtensor_quant_policy_worker_v2nemo_rl.modelopt.models.policy.workers.utils
- Submodules
- Subpackages
nemo_rl.modelopt.models.generation- Submodules
nemo_rl.modelopt.models.generation.vllm_quant_patchnemo_rl.modelopt.models.generation.vllm_quant_workernemo_rl.modelopt.models.generation.vllm_quant_backend- Module Contents
- Classes
- Functions
- Data
- API
_FUSED_MODELOPT_MOE_SUFFIXES_match_fused_modelopt_moe_weight()_w13_num_shards_from_state_dict_info()_batch_fused_modelopt_moe_weights()_detach_pending_layerwise_weights()_iter_modelopt_quant_modules()_modelopt_layerwise_reload_roots()_require_complete_modelopt_layerwise_reload()VllmQuantInternalWorkerExtension_nrl_w13_num_shards_by_prefix_nrl_modelopt_reload_rootsmaybe_init_zmq()_is_real_quant_model()_get_modelopt_reload_roots()_weight_update_lifecycle()_weight_update_errors_are_fatal()_synchronize_before_ipc_data_ack()prepare_refit_info()_patch_named_parameters_to_include_buffers()_attach_input_quantizer_amax_loaders()_load_weights()get_weight_snapshot()get_quantizer_stats()
VllmQuantInternalWorkerExtensionWithCheckpointEngine
- Module Contents
nemo_rl.modelopt.models.generation.vllm_modelopt
- Submodules
- Subpackages
- Submodules
nemo_rl.modelopt.registrynemo_rl.modelopt.utils- Module Contents
- Functions
- Data
- API
MODELOPT_REAL_QUANT_ZMQ_TIMEOUT_MS_QUANT_IGNORE_NAME_SUFFIXESDEFAULT_NVFP4_IGNORENVFP4RealQuantMode_NVFP4_REAL_QUANT_MODES_iter_quant_ignore_suffix_variants()iter_quant_ignore_name_candidates()matches_quant_ignore_pattern()build_vllm_modelopt_nvfp4_config()_resolve_effective_quantizer_formats()_is_float_format()_validate_nvfp4_quantizer_format()resolve_nvfp4_real_quant_mode()resolve_quant_cfg()
- Module Contents
- Subpackages
nemo_rl.algorithms- Subpackages
nemo_rl.algorithms.single_controller_utils- Submodules
nemo_rl.algorithms.single_controller_utils.confignemo_rl.algorithms.single_controller_utils.setupnemo_rl.algorithms.single_controller_utils.utils
- Package Contents
- Submodules
nemo_rl.algorithms.x_token- Submodules
nemo_rl.algorithms.x_token.loss_utils- Module Contents
- Classes
- Functions
- Data
- API
alignment_from_flat_batch()Fp32SparseMMchunk_log_prob_sums()chunk_average_finalize()chunk_average_log_probs()slice_sparse_projection_rows()project_student_to_teacher_vocab()select_teacher_topk_indices()LocalizedAlignmentlocalize_alignment()student_next_token_ce()ce_label_mask()next_token_accuracy()collect_overlapping_teacher_shards()assemble_teacher_logits_from_shards()_try_zero_copy_teacher_logits()rebuild_teacher_full_logits_from_ipc()valid_chunk_mask()parse_projection_file()_SPARSE_PROJECTION_CACHE_TOPK_PROJECTION_CACHEget_sparse_projection_matrix()get_topk_projection()_EXACT_TOKEN_MAP_CACHEbuild_exact_token_map()prepare_xtoken_cross_tokenizer_loss_input()
- Module Contents
nemo_rl.algorithms.x_token.token_aligner- Module Contents
- Classes
- Functions
- Data
- API
- Module Contents
nemo_rl.algorithms.x_token.utils
- Package Contents
- Submodules
nemo_rl.algorithms.loss- Submodules
nemo_rl.algorithms.loss.interfacesnemo_rl.algorithms.loss.wrappernemo_rl.algorithms.loss.loss_functions- Module Contents
- Classes
- Data
- API
TensorDraftCrossEntropyLossConfigDraftCrossEntropyLossDataDictDraftCrossEntropyLossFnClippedPGLossConfigdisable_ppo_ratiotoken_level_losssequence_level_importance_ratiosratio_clip_minratio_clip_maxratio_clip_creference_policy_kl_penaltyreference_policy_kl_typekl_input_clamp_valuekl_output_clamp_valueuse_kl_in_rewarduse_importance_sampling_correctiontruncated_importance_sampling_typetruncated_importance_sampling_ratiotruncated_importance_sampling_ratio_minuse_on_policy_kl_approximationforce_on_policy_ratiouse_cispopositive_example_nll_weight
ClippedPGLossDataDictClippedPGLossFnNLLLossFnPreferenceLossDataDictPreferenceLossFnDPOLossConfigDPOLossDataDictDPOLossFnDistillationLossConfigDistillationLossDataDictDistillationLossFnMseValueLossConfigMseValueLossFnCrossTokenizerDistillationLossConfiggold_lossxtoken_losstemperaturevocab_topkuncommon_topkreverse_klexact_token_match_onlykl_loss_weightce_loss_scaledynamic_loss_scalingkd_loss_modenormalize_teacher_by_vocabalphasum_weights_metricstudent_vocab_sizeteacher_vocab_sizesprojection_matrix_pathsteacher_weightsteacher_gold_lossteacher_xtoken_loss
CrossTokenizerDistillationLossDataDictCrossTokenizerDistillationLossFnloss_typeinput_type_teacher_is_same_vocab()__call__()_resolve_gold_xtoken()_compute_teacher_kd()_compute_same_vocab_kl()_direct_topk_kl()_direct_full_vocab_kl()_same_vocab_masked_kl()_sum_kd()_averaged_logits_kd()_dp_global_masked_mean()_select_teacher_kd()_teacher_score_inputs()_compute_dynamic_weights()_teacher_weight_score()_compute_p_kl()_compute_gold()_compute_ce()
- Module Contents
nemo_rl.algorithms.loss.utils
- Package Contents
- Submodules
nemo_rl.algorithms.async_utils- Submodules
nemo_rl.algorithms.async_utils.interfacesnemo_rl.algorithms.async_utils.replay_buffer- Module Contents
- Classes
- API
ReplayBufferImpl_rollout_metrics_turn_count_for_diagnostics()add()get_debug_info()get_last_target_weight_already_generated()get_existing_target_weights()_remove_indices()sample()size()clear()state_dict()load_state_dict()_prepare_for_training_step()_is_valid_for_target()_remove_stale_trajectories()_count_for_target()_truncate_to_max_size()get_trajectories_needed()has_complete_batch()_remove_incomplete_target_steps()
ReplayBufferTQReplayBuffer
- Module Contents
nemo_rl.algorithms.async_utils.trajectory_collector- Module Contents
- Classes
- Data
- API
TokenizerType_MAX_NEMO_GYM_STREAM_RETRIES_NEMO_GYM_RETRY_DELAY_BASE_SECONDS_REPLAY_BUFFER_MAX_BACKOFF_SECONDSAsyncTrajectoryCollector_calculate_target_weights()_get_next_target_for_generation()set_weight_version()_should_pause_for_generation_limits()start_collection()is_data_exhausted()get_status()_collection_loop()_stamp_nemo_gym_task_indices()_process_batch()get_weight_version()pause()resume()prepare_for_refit()resume_after_refit()wait_for_pending_generations()get_dataloader_state()get_efficiency_metrics()get_rollouts_state()_cleanup_finished_threads()_release_target()_compute_teacher_logprobs()_iter_rollout_groups()_run_rollout_batch_worker()_build_task_index_map()_enqueue_rollout_group()_collect_rollout_batch()
- Module Contents
nemo_rl.algorithms.async_utils.staleness_sampler- Module Contents
- Classes
- Functions
- Data
- API
_GATE_POLL_SECONDSPromptGroupSamplerBaseSamplerWindowedSampler_gated_required_buffer_capacity()_GatedSamplerWeightFifoSamplerInOrderSamplerWindowedSamplerConfigWeightFifoSamplerConfigInOrderSamplerConfigCustomSamplerConfigSamplerConfigrequired_buffer_capacity_for_config()create_sampler()
- Module Contents
- Package Contents
- Submodules
- Submodules
nemo_rl.algorithms.logits_sampling_utilsnemo_rl.algorithms.metric_utils- Module Contents
- Classes
- Functions
- API
SetupTimingMetricsvllm_init_time_ssglang_init_time_strtllm_init_time_smegatron_generation_init_time_sgeneration_init_time_sgeneration_init_reserve_time_sgeneration_init_load_time_spolicy_init_time_snemo_gym_init_time_scollective_init_time_sparallel_wall_time_sparallel_init_enabledteacher_reservation_time_steacher_model_init_time_steacher_init_time_svllm_checkpoint_engine_init_time_stotal_setup_time_sworker_setup_time_sother_setup_time_sextrasto_metrics_dict()
print_setup_timing_summary()
- Module Contents
nemo_rl.algorithms.rmnemo_rl.algorithms.ppo- Module Contents
- Classes
- Functions
- Data
- API
TokenizerTypeAdvEstimatorConfigPPOConfignum_prompts_per_stepnum_generations_per_promptmax_num_epochsmax_num_stepsmax_rollout_turnsval_periodval_batch_sizeval_at_startval_at_endmax_val_samplesskip_reference_policy_logprobs_calculationseedoverlong_filteringuse_dynamic_samplingdynamic_sampling_max_gen_batchesbatch_multiplierppo_epochsreward_shapingreward_scalingcalculate_advantages_on_gpuadv_estimatorpolicy_training_start_stepseq_logprob_error_threshold
PPOSaveState_default_ppo_save_state()_apply_ppo_seq_logprob_error_masking()PPOLoggerConfigMasterConfigsetup()dynamic_sampling()_create_advantage_estimator()ppo_train()validate()
- Module Contents
nemo_rl.algorithms.opd- Module Contents
- Classes
- Functions
- API
TeacherResourceConfigNonColocatedTeachersConfigOnPolicyDistillationConfig_opd_cfg()is_opd_enabled()is_non_colocated_teachers_enabled()_skip_prev_logprobs()assert_prev_logprobs_available()resolve_reference_aliases()get_teacher_routing_metrics()teacher_seq_pad_multiple()_validate_default_teacher_alias()reserve_teacher_clusters()create_teacher_worker_groups()
- Module Contents
nemo_rl.algorithms.single_controllernemo_rl.algorithms.sftnemo_rl.algorithms.reward_functionsnemo_rl.algorithms.advantage_estimatornemo_rl.algorithms.grpo- Module Contents
- Classes
- Functions
- Data
- API
TokenizerType_get_next_nemo_gym_task_index()RewardScalingConfigAsyncGRPOConfigRewardPenaltyTokenIdsConfigRewardPenaltyConfig_REWARD_PENALTY_FLAGSGRPOConfignum_prompts_per_stepnum_generations_per_promptmax_num_epochsmax_num_stepsmax_rollout_turnsnormalize_rewardsadvantage_clip_lowadvantage_clip_highuse_leave_one_out_baselineval_periodval_start_atval_batch_sizeval_at_startval_at_endmax_val_samplesval_num_generations_per_promptstop_at_validation_metricstop_at_validation_thresholdskip_reference_policy_logprobs_calculationseedasync_grpooverlong_filteringuse_dynamic_samplingdynamic_sampling_max_gen_batchesbatch_multiplierreward_shapingreward_scalingcalculate_advantages_on_gpuseq_logprob_error_thresholdinvalid_tool_call_advantagemalformed_thinking_advantageadv_estimator
GRPOSaveState_initial_grpo_save_state()_get_grpo_save_state()GRPOLoggerConfigMasterConfigsetup()dynamic_sampling()scale_rewards()extract_initial_prompt_messages()add_grpo_token_loss_masks_and_generation_logprobs()_resolve_message_level_advantage_penalties()_raise_if_reward_penalties_enabled_without_nemo_gym()_apply_message_level_advantage_penalties()_apply_configured_message_level_advantage_penalties()_should_use_async_rollouts()_preserve_router_replay_routed_experts()_build_async_grpo_train_data()_apply_mask_sample_filter()_should_use_nemo_gym()_should_log_nemo_gym_responses()_write_latest_checkpoint_status()_get_effort_config()_pad_teacher_logprobs()_create_advantage_estimator()_clip_grpo_advantages()refit_policy_generation()_initial_policy_generation_stale()_log_mixed_rewards_and_advantages_information()_placeholder_seq_logprob_error_metrics()_validate_use_kl_in_reward_compat()_resolve_logprob_skip_flags()compute_and_apply_seq_logprob_error_masking()_validation_stop_value()_validation_early_stop_message()grpo_train()validate()aggregate_rollout_metrics()async_grpo_train()
- Module Contents
nemo_rl.algorithms.distillationnemo_rl.algorithms.grpo_syncnemo_rl.algorithms.xtoken_off_policy_distillationnemo_rl.algorithms.dponemo_rl.algorithms.utils- Module Contents
- Functions
- Data
- API
get_gdpo_reward_component_keys()calculate_kl()calculate_baseline_and_std_per_prompt()surpress_user_warnings()masked_mean()mask_out_neg_inf_logprobs()masked_var()set_seed()get_tokenizer()maybe_pad_last_batch()print_performance_metrics()log_generation_metrics_to_wandb()WALL_CLOCK_EFFICIENCY_CATEGORIESTHREAD_ACCUMULATED_EFFICIENCY_CATEGORIESEFFICIENCY_CATEGORIESprint_efficiency_summary()
- Module Contents
- Subpackages
nemo_rl.distributed- Submodules
nemo_rl.distributed.model_utils- Module Contents
- Classes
- Functions
- API
_compute_distributed_log_softmax_with_grad()_compute_distributed_log_softmax()_compute_distributed_softmax()DistributedLogprobDistributedCrossEntropyChunkedDistributedLogprobDistributedLogprobWithSamplingChunkedDistributedLogprobWithSamplingChunkedDistributedGatherLogprobdtensor_from_parallel_logits_to_logprobs()from_parallel_logits_to_logprobs()from_parallel_logits_to_logprobs_packed_sequences()_get_tokens_on_this_cp_rank()allgather_cp_sharded_tensor()_AllReduceSumgroup_all_reduce_sum_with_grad()group_all_reduce_sum()AllGatherCPTensorcp_load_balanced_to_contiguous()cp_shift_next()vocab_parallel_log_softmax()vocab_parallel_full_log_softmax()vocab_parallel_gather_columns()vocab_parallel_argmax()get_logprobs_from_vocab_parallel_logits()get_next_token_logprobs_from_logits()distributed_vocab_topk()gather_logits_at_global_indices()get_distillation_topk_logprobs_from_logits()ChunkedDistributedEntropyfrom_parallel_hidden_states_to_logprobs()ChunkedDistributedHiddenStatesToLogprobspatch_gpt_model_forward_for_linear_ce_fusion()_gpt_forward_with_linear_ce_fusion()all_to_all_vp2sq()all_to_all_sq2vp()
- Module Contents
nemo_rl.distributed.numa_utilsnemo_rl.distributed.virtual_cluster- Module Contents
- Classes
- Functions
- Data
- API
loggerClusterConfigdir_pathgit_rootPY_EXECUTABLESDEFAULT_GENERATION_PORT_RANGE_LOWDEFAULT_GENERATION_PORT_RANGE_HIGHDEFAULT_GYM_PORT_RANGE_LOWDEFAULT_GYM_PORT_RANGE_HIGHDEFAULT_VLLM_PORT_RANGE_LOWDEFAULT_VLLM_PORTS_PER_ENGINEDEFAULT_SGLANG_ROUTER_PORT_RANGE_LOWDEFAULT_SGLANG_ROUTER_PORT_RANGE_HIGHDEFAULT_SGLANG_PROMETHEUS_PORT_RANGE_LOWDEFAULT_SGLANG_PROMETHEUS_PORT_RANGE_HIGHDEFAULT_MASTER_PORT_RANGE_LOWDEFAULT_MASTER_PORT_RANGE_HIGHNVLINK_DOMAIN_PREFIXTOPO_RANK_KEYNVLINK_DOMAIN_UNKNOWNTOPO_RANK_UNKNOWN_get_node_ip_and_free_port()_get_node_ip_local()_bind_socket_in_range()_get_free_port_local()_get_free_consecutive_ports_local()init_ray()_get_gpu_id_info()get_reordered_bundle()ResourceInsufficientErrorget_ray_cluster_topology()select_segment_nodes()prepare_segment_topology()_sort_bundle_indices_by_topology()RayVirtualCluster
- Module Contents
nemo_rl.distributed.stateless_process_groupnemo_rl.distributed.collectivesnemo_rl.distributed.named_shardingnemo_rl.distributed.worker_groupsnemo_rl.distributed.ray_actor_environment_registrynemo_rl.distributed.worker_group_utilsnemo_rl.distributed.batched_data_dict- Module Contents
- Classes
- Data
- API
DictTSequencePackingArgsDynamicBatchingArgsBatchedDataDictADDITIONAL_OPTIONAL_KEY_TENSORSget_multimodal_dict()from_batches()all_gather()chunk()reorder_data()shard_by_batch_size()get_batch()slice()repeat_interleave()truncate_tensors()make_microbatch_iterator_with_dynamic_shapes()get_microbatch_iterator_dynamic_shapes_len()make_microbatch_iterator_for_packable_sequences()get_microbatch_iterator_for_packable_sequences_len()make_microbatch_iterator()sizeto()select_indices()get_dict()
SlicedDataDict
- Module Contents
- Submodules
nemo_rl.evalsnemo_rl.experience- Submodules
nemo_rl.experience.interfacesnemo_rl.experience.metric_utilsnemo_rl.experience.rollouts- Module Contents
- Classes
- Functions
- Data
- API
TokenizerType_add_r3_fallback_metrics()_extract_mask_sample_flags()_attach_routed_experts_to_message_log_prefix()_find_routed_experts_template()_dummy_routed_experts_for_tokens()backfill_missing_routed_experts()EffortLevelsConfig_EffortShapingMetrics_apply_effort_shaping()generate_responses()generate_responses_async()calculate_rewards()run_multi_turn_rollout()async_generate_response_for_sample_turn()run_sample_multi_turn_rollout()RolloutGroupResult_aggregate_multi_turn_rollout_metrics()_run_multi_turn_rollout_async()run_async_multi_turn_rollout()run_async_multi_turn_rollout_groups()_tensorize_by_key()NemoGymRolloutResult_CompletedNemoGymGroup_NemoGymStreamAccumulatorget_nemo_gym_thinking_tags()should_mask_flagged_samples()_get_reward_penalty_config_value()_get_reward_penalty_token_id()_get_required_reward_penalty_token_id()_get_reward_penalty_token_ids()_get_required_reward_penalty_token_ids()_infer_single_token_id()resolve_reward_penalty_config()apply_reward_penalties()_prepare_nemo_gym_rows()_tensorize_nemo_gym_result()run_async_nemo_gym_rollout()run_nemo_gym_rollout_sync()_postprocess_single_nemo_gym_group()
- Module Contents
nemo_rl.experience.rollout_managernemo_rl.experience.sync_rollout_actornemo_rl.experience.payload
- Submodules
nemo_rl.data- Subpackages
nemo_rl.data.datasets- Subpackages
nemo_rl.data.datasets.response_datasets- Submodules
nemo_rl.data.datasets.response_datasets.refcoconemo_rl.data.datasets.response_datasets.oai_format_datasetnemo_rl.data.datasets.response_datasets.helpsteer3nemo_rl.data.datasets.response_datasets.squadnemo_rl.data.datasets.response_datasets.avqanemo_rl.data.datasets.response_datasets.geometry3knemo_rl.data.datasets.response_datasets.mmpr_tinynemo_rl.data.datasets.response_datasets.tulu3nemo_rl.data.datasets.response_datasets.aimenemo_rl.data.datasets.response_datasets.audiomcqnemo_rl.data.datasets.response_datasets.numinamathnemo_rl.data.datasets.response_datasets.openr1_mathnemo_rl.data.datasets.response_datasets.oasstnemo_rl.data.datasets.response_datasets.response_datasetnemo_rl.data.datasets.response_datasets.openmathinstruct2nemo_rl.data.datasets.response_datasets.deepscalernemo_rl.data.datasets.response_datasets.daily_omninemo_rl.data.datasets.response_datasets.arrow_text_datasetnemo_rl.data.datasets.response_datasets.clevrnemo_rl.data.datasets.response_datasets.nemogym_datasetnemo_rl.data.datasets.response_datasets.nemotron_cascade2_sftnemo_rl.data.datasets.response_datasets.general_conversations_datasetnemo_rl.data.datasets.response_datasets.dapo_mathnemo_rl.data.datasets.response_datasets.gsm8knemo_rl.data.datasets.response_datasets.intent
- Package Contents
- Submodules
nemo_rl.data.datasets.eval_datasets- Submodules
nemo_rl.data.datasets.eval_datasets.mmlunemo_rl.data.datasets.eval_datasets.mathnemo_rl.data.datasets.eval_datasets.mmlu_pronemo_rl.data.datasets.eval_datasets.daily_omninemo_rl.data.datasets.eval_datasets.local_math_datasetnemo_rl.data.datasets.eval_datasets.gpqanemo_rl.data.datasets.eval_datasets.mmau
- Package Contents
- Submodules
nemo_rl.data.datasets.preference_datasets
- Submodules
nemo_rl.data.datasets.raw_datasetnemo_rl.data.datasets.processed_datasetnemo_rl.data.datasets.utils- Module Contents
- Functions
- Data
- API
TokenizerTypeload_audio_from_file()assert_no_double_bos()pil_to_base64()load_dataset_from_path()resolve_external_dataset_class()_BEHAVIORAL_DATASET_CONFIG_KEYSwarn_on_unsupported_dataset_config_keys()update_single_dataset_config()merge_datasets()extract_necessary_env_names()get_huggingface_cache_path()
- Module Contents
- Package Contents
- Subpackages
nemo_rl.data.packing
- Submodules
nemo_rl.data.interfacesnemo_rl.data.chat_templatesnemo_rl.data.processorsnemo_rl.data.collate_fnnemo_rl.data.cross_tokenizer_collatenemo_rl.data.llm_message_utils- Module Contents
- Functions
- Data
- API
TensorTokenizerTypemessage_log_to_flat_messages()get_keys_from_message_log()add_loss_mask_to_message_log()_pad_tensor()_validate_tensor_consistency()batched_message_log_to_flat_message()message_log_shape()get_first_index_that_differs()get_formatted_message_log()remap_dataset_keys()MESSAGE_LOG_BULK_FIELDSdecompose_message_log()attach_message_log_view()reconstruct_message_log()
- Module Contents
nemo_rl.data.dataloadernemo_rl.data.multimodal_utils- Module Contents
- Classes
- Functions
- Data
- API
MEDIA_TAGSMEDIA_TAGS_REVERSEDDEFAULT_MEDIA_EXTENSIONS_PLACEHOLDER_STYLE_PROCESSOR_NAMESMEDIA_TAGS_TO_ALLOWEDMEDIA_TAG_PATTERNloggeruses_image_placeholder()PackedTensorget_multimodal_keys_from_processor()get_multimodal_default_settings_from_processor()get_dim_to_pack_along()resolve_to_image()image_to_data_url()encode_images_in_examples()get_media_from_message()load_media_from_message()
- Module Contents
nemo_rl.data.utils
- Package Contents
- Subpackages
- Submodules
- Package Contents
- Subpackages