NeMo RL Documentation#
Welcome to the NeMo RL documentation. NeMo RL is an open-source post-training library developed by NVIDIA, designed to streamline and scale reinforcement learning methods for multimodal models (LLMs, VLMs, etc.).
This documentation provides comprehensive guides, examples, and references to help you get started with NeMo RL and build powerful post-training pipelines for your models.
Getting Started#
Learn about NeMo RL’s architecture, design philosophy, and key features that make it ideal for scalable reinforcement learning.
Get up and running quickly with examples for both DTensor and Megatron Core training backends.
Step-by-step instructions for installing NeMo RL, including prerequisites, system dependencies, and environment setup.
Explore the current features and upcoming enhancements in NeMo RL, including distributed training, advanced parallelism, and more.
Troubleshooting common issues including missing submodules and memory fragmentation.
Training and Generation#
Learn about DTensor and Megatron Core training backends, their capabilities, and how to choose the right one for your use case.
Discover supported algorithms including GRPO, PPO, SFT, DPO, RM, on-policy distillation, and multi-teacher on-policy distillation (MOPD) with detailed guides and examples.
Learn how to evaluate your models using built-in evaluation datasets and custom evaluation pipelines.
Configure and launch NeMo RL on multi-node Slurm or Kubernetes clusters for distributed computing.
Run a fixed Dynamo vLLM fleet with NCCL refit and W&B telemetry inside a Slurm Ray allocation.
Guides and Examples#
Reproduce DeepscaleR results with NeMo RL using GRPO on mathematical reasoning tasks.
Step-by-step guide for supervised fine-tuning on the OpenMathInstruct2 dataset.
Post-train Nemotron 3 Ultra with RLVR, teacher training, and MOPD stages on GB200 NVL72 hardware.
Create custom reward environments and integrate them with NeMo RL training pipelines.
Configure offline and online Eagle3 draft-model workflows to accelerate rollout generation with vLLM.
Train Qwen2.5-Omni-3B with GRPO on AVQA and evaluate on MMAU, following the R1-AQA approach.
Train Qwen2.5-Omni-7B with GRPO on PhilipC/IntentTrain (audio-visual intent recognition) and evaluate on Daily-Omni, following HumanOmniV2’s joint audio-visual setup.
Train Qwen3-30B-A3B-Thinking into a SWE agent with a pivot stage plus end-to-end agentic RL on SWE-bench.
Learn how to add support for new model architectures in NeMo RL.
Parameter-efficient fine-tuning with LoRA: backend support, DTensor vs Megatron schema comparison, config examples, and recipes.
Extend a model’s context window with YaRN RoPE scaling on the Megatron backend for SFT, GRPO, and other workflows.
Off-policy distillation across mismatched tokenizers — build a (student, teacher) projection matrix and run x-token KD via CUDA-IPC teacher logits.
Choose among colocated IPC, NCCL, sparse delta, and NIXL refit transports.
Use NIXL checkpoint-engine refit to update non-colocated vLLM generation workers from policy workers.
Run async GRPO or PPO via the SingleController path: TransferQueue data plane, pluggable staleness samplers, and streaming trainer.
Advanced Topics#
Deep dive into NeMo RL’s architecture, APIs, and design decisions for scalable RL.
Tools and techniques for debugging distributed Ray applications and RL training runs.
OpenTelemetry traces and rl.* metrics via nemo-lens: span groups, configuration, vLLM tracing, and an OTLP export stack.
Optimize large language models with FP8 quantization for faster training and inference.
Run quantization-aware GRPO and distillation using NVIDIA ModelOpt. Includes NVFP4 W4A4 and W4A16 real rollout.
Build and use Docker containers for reproducible NeMo RL environments.
API Reference#
Comprehensive reference for all NeMo RL modules, classes, functions, and methods. Browse the complete Python API with detailed docstrings and usage examples.
Full Documentation Index#
The complete table of contents below lists all pages, including guide, development, and design-doc pages that are not shown in the cards above.
About
Environment Start
E2E Examples
Guides
- Add New Models
- Model Diagnostics
- Supervised Fine-Tuning in NeMo RL
- Direct Preference Optimization in NeMo RL
- An in-depth Walkthrough of DAPO in NeMo RL
- LoRA (Low-Rank Adaptation)
- An in-depth Walkthrough of CISPO in NeMo RL
- An In-Depth Walkthrough of ProRLv2 in NeMo RL
- Quickstart: Launch a ProRLv2 Run
- DAPO: Dynamic Sampling
- Decoupled local/global advantage normalization
- Reward Shaping: “Stop properly” Penalty (Truncation Penalty)
- Loss: Decoupled (Asymmetric) Clipping
- Loss: Token-level Policy Gradient
- Importance Sampling Correction and MoE Stability
- Full Example Configs
- Practical Overrides
- What to Monitor
- References
- Two-Stage SWE RL for Qwen3-30B-A3B-Thinking
- An In-depth Walkthrough of GRPO in NeMo RL
- An In-Depth Walkthrough of PPO in NeMo RL
- GRPO on DeepScaler
- Solve a Sliding Puzzle Using GRPO
- Audio Post-training with NeMo RL
- Audio-Visual GRPO with Qwen2.5-Omni-7B
- Reward Model Training in NeMo RL
- Environments for GRPO Training
- Evaluation
- DeepSeek-V3
- Model Guides
- Model Quirks
- Train with Async GRPO
- Train with Single-Controller (Async GRPO and PPO)
- Configure the Single-Controller Path
- Checkpointing and Replay Recovery
- Async-RL Knobs and Sampler Modes
- Implementation Structure
- Core components
- 1.
SingleControllerActor(nemo_rl/algorithms/single_controller.py) - 2.
TQReplayBuffer(nemo_rl/algorithms/async_utils/replay_buffer.py) - 3.
RolloutManager.generate_and_push(nemo_rl/experience/rollout_manager.py) - 4. Samplers (
nemo_rl/algorithms/async_utils/staleness_sampler.py) - 5.
_rollout_pumpand_train_pump
- 1.
- Coordination Flow
- Core components
- Relation to Legacy Async GRPO
- Known Missing Features
- Quantization-Aware RL (QARL)
- Overview
- Verified Configurations
- Simulated KV-Cache Quantization
- ModelOpt Layer Spec Toggle
- Quantization-Aware GRPO (QA-GRPO)
- Real-Quant NVFP4 Rollout (W4A4 and W4A16)
- Quantization-Aware Distillation (On-Policy QAD)
- Quantization Parameters
- Megatron Checkpoint Directory
- Differences from FP8 Training
- Supported Quantization Formats
- Exporting Megatron Checkpoints
- Limitations
- Train with Eagle3 Speculative Decoding
- YaRN Long-Context Training
- Cross-Tokenizer (X-Token) Off-Policy Distillation
- Weight Refit: Choosing a Transport
- Checkpoint-Engine Refit
- Managed Dynamo generation on Slurm
- Router Replay
- Muon Optimizer
- DTensor Tensor Parallel Accuracy Issue
- Fault Tolerance Launcher Guide
Containers
Development
- CI/CD
- Test NeMo RL
- Documentation Development
- Debug NeMo RL Applications
- Profile GPU with Nsys
- FP8 Quantization in NeMo RL
- Experiment with Custom vLLM
Observability
- Observability
- What’s in this section
- Configuration
- Span Groups
- Metrics
- vLLM Tracing
- Exporting to an OTLP backend
- Extending Instrumentation
- Scope
- Install
- Quick start
- What gets instrumented
- What gets exported
- Related
- What’s in this section
Design Docs
- Design and Philosophy
- Padding in NeMo RL
- Logger
- uv in NeMo RL
- Dependency Management
- Data Format
- Generation Interface
- Managed Dynamo generation design
- Remote Sparse-Delta vLLM Refit
- Checkpoint Engine Design
- Exporting Checkpoints to Hugging Face Format
- Loss functions in NeMo RL
- FSDP2 Parallel Plan
- Training Backends
- Sequence Packing and Dynamic Batching
- Environment Variable Precedence in NeMo RL
- NeMo Gym Integration
- ModelOpt Real-Quant Refit Architecture
- NCCL Reshard Refit (Experimental)
- Training on text that contains
<image> - Automodel v0.6.0 and Context-Parallel Integration
API Reference
- API Reference
nemo_rl- Subpackages
nemo_rl.distributed- Submodules
nemo_rl.distributed.numa_utilsnemo_rl.distributed.worker_group_utilsnemo_rl.distributed.virtual_cluster- Module Contents
- Classes
- Functions
- Data
- API
loggerClusterConfigdir_pathgit_rootPY_EXECUTABLESDEFAULT_GENERATION_PORT_RANGE_LOWDEFAULT_GENERATION_PORT_RANGE_HIGHDEFAULT_DYNAMO_CONTROL_PORT_RANGE_LOWDEFAULT_DYNAMO_CONTROL_PORT_RANGE_HIGHDEFAULT_DYNAMO_HTTP_PORT_RANGE_LOWDEFAULT_DYNAMO_HTTP_PORT_RANGE_HIGHDEFAULT_DYNAMO_SYSTEM_PORT_RANGE_LOWDEFAULT_DYNAMO_SYSTEM_PORT_RANGE_HIGHDEFAULT_GYM_PORT_RANGE_LOWDEFAULT_GYM_PORT_RANGE_HIGHDEFAULT_VLLM_PORT_RANGE_LOWDEFAULT_VLLM_PORTS_PER_ENGINEDEFAULT_SGLANG_ROUTER_PORT_RANGE_LOWDEFAULT_SGLANG_ROUTER_PORT_RANGE_HIGHDEFAULT_SGLANG_PROMETHEUS_PORT_RANGE_LOWDEFAULT_SGLANG_PROMETHEUS_PORT_RANGE_HIGHDEFAULT_MASTER_PORT_RANGE_LOWDEFAULT_MASTER_PORT_RANGE_HIGHNVLINK_DOMAIN_PREFIXTOPO_RANK_KEYNVLINK_DOMAIN_UNKNOWNTOPO_RANK_UNKNOWN_get_node_ip_and_free_port()_get_node_ip_local()_bind_socket_in_range()_get_free_port_local()_get_free_consecutive_ports_local()init_ray()_get_gpu_id_info()get_reordered_bundle()ResourceInsufficientErrorget_ray_cluster_topology()select_segment_nodes()prepare_segment_topology()_sort_bundle_indices_by_topology()RayVirtualCluster
- Module Contents
nemo_rl.distributed.ray_actor_environment_registrynemo_rl.distributed.model_utils- Module Contents
- Classes
- Functions
- API
_compute_distributed_log_softmax_with_grad()_compute_distributed_log_softmax()_compute_distributed_softmax()DistributedLogprobDistributedCrossEntropyChunkedDistributedLogprobDistributedLogprobWithSamplingChunkedDistributedLogprobWithSamplingChunkedDistributedGatherLogprob_tp_target_logprobs()get_cp_sharded_next_token_logprobs()dtensor_from_parallel_logits_to_logprobs()from_parallel_logits_to_logprobs()from_parallel_logits_to_logprobs_packed_sequences()_get_tokens_on_this_cp_rank()allgather_cp_sharded_tensor()_AllReduceSumgroup_all_reduce_sum_with_grad()group_all_reduce_sum()AllGatherCPTensorcp_load_balanced_to_contiguous()cp_shift_next()vocab_parallel_log_softmax()vocab_parallel_full_log_softmax()vocab_parallel_gather_columns()vocab_parallel_argmax()get_logprobs_from_vocab_parallel_logits()get_next_token_logprobs_from_logits()distributed_vocab_topk()gather_logits_at_global_indices()get_distillation_topk_logprobs_from_logits()ChunkedDistributedEntropyfrom_parallel_hidden_states_to_logprobs()ChunkedDistributedHiddenStatesToLogprobspatch_gpt_model_forward_for_linear_ce_fusion()_gpt_forward_with_linear_ce_fusion()all_to_all_vp2sq()all_to_all_sq2vp()
- Module Contents
nemo_rl.distributed.stateless_process_groupnemo_rl.distributed.collectivesnemo_rl.distributed.named_shardingnemo_rl.distributed.refit_watchdog- Module Contents
- Classes
- Functions
- Data
- API
- Module Contents
nemo_rl.distributed.held_portnemo_rl.distributed.worker_groupsnemo_rl.distributed.batched_data_dict- Module Contents
- Classes
- Functions
- Data
- API
DictT_COUPLED_MULTIMODAL_KEYS_prepare_multimodal_sharing()SequencePackingArgsDynamicBatchingArgsBatchedDataDict_PIXEL_DTYPE_CAST_KEYSADDITIONAL_OPTIONAL_KEY_TENSORSget_multimodal_dict()from_batches()all_gather()chunk()reorder_data()shard_by_batch_size()get_batch()slice()repeat_interleave()truncate_tensors()make_microbatch_iterator_with_dynamic_shapes()get_microbatch_iterator_dynamic_shapes_len()make_microbatch_iterator_for_packable_sequences()get_microbatch_iterator_for_packable_sequences_len()make_microbatch_iterator()sizeto()select_indices()get_dict()
SlicedDataDict
- Module Contents
- Submodules
nemo_rl.environments- Submodules
nemo_rl.environments.code_jaccard_environmentnemo_rl.environments.vlm_environmentnemo_rl.environments.utilsnemo_rl.environments.rewardsnemo_rl.environments.reward_model_environmentnemo_rl.environments.nemo_gym_video- Module Contents
- Functions
- Data
- API
_VideoConfigValue_LOCAL_VIDEO_METADATA_KEYS_require_video_config_value()_get_content_part_url()_resolve_local_video_path()normalize_video_urls_in_examples()_extract_static_video_messages()_json_mapping()_metadata_extra_body()_chat_template_kwargs_for_processor()_deep_merge_dict()_inject_vllm_mm_processor_kwargs()_remove_vllm_mm_processor_kwargs()_replace_cached_video_frames_with_native_video()_strip_local_media_metadata()_compute_dynamic_prompt_length()_video_to_image_content()_make_overlength_filtered_video_example()nemo_gym_example_to_video_datum_spec()
- Module Contents
nemo_rl.environments.dapo_math_verifiernemo_rl.environments.interfacesnemo_rl.environments.math_environmentnemo_rl.environments.metricsnemo_rl.environments.nemotron_utils- Module Contents
- Functions
- Data
- API
NEMOTRON_VIDEO_PROCESSOR_NAMES_required_config_value()load_nemotron_video_model_config()_nemotron_video_target_resolution()_resize_and_normalize_nemotron_video_frame()_flatten_nemotron_video_frame_messages()_render_nemotron_video_prompt()_expand_nemotron_video_placeholders()process_nemotron_video_frames()
- Module Contents
nemo_rl.environments.nemo_gym- Module Contents
- Classes
- Functions
- Data
- API
_ROUTED_EXPERTS_DTYPESDEFAULT_INVALID_TOOL_CALL_PATTERNSDEFAULT_THINKING_TAGSNemoGymCompatibleConfigshould_use_nemo_gym()_has_nan_generation_logprobs()_typed_gym_failure()get_nemo_gym_uv_cache_dir()get_nemo_gym_venv_dir()NemoGymConfig_detect_invalid_tool_call_and_malformed_thinking()_IMAGE_SRC_PREFIXES_looks_like_image_src()get_pad_dynamic_image_shapes()_extract_input_images_from_message()_is_trainable_output_item()_index_per_turn_images()_image_sources_equal()_without_initial_image_sources()_attach_multimodal_data_to_user_message()NemoGymextract_reward_components()build_reward_component_columns()validate_reward_components_match_scalar()setup_nemo_gym_config()spinup_nemo_gym_actor()
- Module Contents
nemo_rl.environments.code_environment
- Submodules
nemo_rl.models- Subpackages
nemo_rl.models.generation- Subpackages
nemo_rl.models.generation.dynamo- Submodules
nemo_rl.models.generation.dynamo.worker_poolnemo_rl.models.generation.dynamo.dynamo_workernemo_rl.models.generation.dynamo.managed_runtimenemo_rl.models.generation.dynamo.dynamo_generation- Module Contents
- Classes
- Functions
- Data
- API
LOGGER_HTTP_MAX_ATTEMPTS_HTTP_RETRY_DELAY_S_RETRYABLE_HTTP_STATUS_CODES_is_retryable_http_response()_parse_dynamo_completion_response()DynamoGenerationprepare_for_generation()frontend_urlfinish_generation()get_logger_metrics()clear_logger_metrics()get_inference_world_size()get_collective_sender_spec()shutdown()__getstate__()__setstate__()_completion_url()_request_timeout_s()_merge_stop_strings()_prompt_token_ids()_build_completion_request()_allowed_new_tokens()_assert_response_within_context()_post_completion_request()_single_sample_output()generate()generate_async()init_collective()prepare_refit_info()update_weights_via_ipc_zmq()update_weights_from_collective()invalidate_kv_cache()
- Module Contents
nemo_rl.models.generation.dynamo.venvnemo_rl.models.generation.dynamo.validate_dynamo_vllm_argsnemo_rl.models.generation.dynamo.config- Module Contents
- Classes
- Functions
- Data
- API
VLLM_PACKED_BUFFER_SIZE_BYTESVLLM_PACKED_NUM_BUFFERSDYNAMO_VLLM_FLAGS_VLLM_CFG_STRUCTURAL_VLLM_CFG_MOVED_VLLM_CFG_UNSUPPORTED_VLLM_CFG_MANAGED_RUNTIME_VLLM_CFG_INAPPLICABLE_VLLM_SINGLE_RANK_ONLY_FIELDSDynamoWorkerArgsDynamoFrontendArgsDynamoCfgDynamoVllmConfig_require_nonempty_vllm_config()DynamoConfig
- Module Contents
nemo_rl.models.generation.dynamo.token_wrapper- Module Contents
- Classes
- Functions
- Data
- API
_GYM_TOKEN_METADATA_FIELDS_TOOL_ARGUMENT_MAPPING_ERROR_coerce_token_id_list()_coerce_logprob_list()_strip_gym_token_metadata()_chat_template_kwargs()_request_add_generation_prompt()_apply_chat_template()_render_prompt_token_ids()_render_prompt_token_ids_with_optional_prefix()_latest_tokenized_assistant_index()_derive_required_prefix_token_ids()_normalize_tool_arguments_for_template()_validate_engine_data()_inject_gym_token_metadata()prepare_dynamo_chat_completion_request()DynamoTokenWrapperServer
- Module Contents
nemo_rl.models.generation.dynamo.refitnemo_rl.models.generation.dynamo.metricsnemo_rl.models.generation.dynamo.argumentsnemo_rl.models.generation.dynamo.http_client
- Package Contents
- Submodules
nemo_rl.models.generation.trtllm- Submodules
nemo_rl.models.generation.trtllm.trtllm_http_servernemo_rl.models.generation.trtllm.trtllm_worker_async- Module Contents
- Classes
- API
TrtllmAsyncGenerationWorkerImplconfigure_worker()__repr__()is_alive()post_init_async()shutdown()start_http_server()stop_http_server()report_dp_openai_server_base_url()init_collective_async()prepare_refit_info_async()update_weights_from_collective_async()update_weights_via_ipc_zmq_async()report_device_id_async()_weights_tags()_all_sleep_tags()_resolve_wake_tags()sleep_async()wake_up_async()reset_prefix_cache_async()start_gpu_profiling_async()stop_gpu_profiling_async()generate_async()_build_sampling_params()
TrtllmAsyncGenerationWorker
- Module Contents
nemo_rl.models.generation.trtllm.config- Module Contents
- Classes
- API
TrtllmSpecificArgstensor_parallel_sizemodel_namegpu_memory_utilizationmax_model_lenprecisionmax_batch_sizemax_num_tokensexpose_http_serverasync_enginemoe_tensor_parallel_sizemoe_expert_parallel_sizein_flight_weight_updatesrecompute_kv_cache_after_weight_updatesdefault_chat_template_kwargstool_parserreasoning_parser
TrtllmConfig
- Module Contents
nemo_rl.models.generation.trtllm.trtllm_generation- Module Contents
- Classes
- API
TrtllmGenerationinit_cluster_placement_groups()_get_tied_worker_bundle_indices()_report_dp_openai_server_base_urls()_report_device_id()init_collective()generate()generate_async()prepare_for_generation()finish_generation()prepare_refit_info()start_gpu_profiling()stop_gpu_profiling()update_weights_from_collective()update_weights_via_ipc_zmq()invalidate_kv_cache()clear_logger_metrics()get_logger_metrics()shutdown()__del__()
- Module Contents
nemo_rl.models.generation.trtllm.trtllm_backend
- Submodules
nemo_rl.models.generation.megatron- Submodules
nemo_rl.models.generation.megatron.utilsnemo_rl.models.generation.megatron.megatron_generation- Module Contents
- Classes
- API
MegatronGenerationeffective_megatron_cfg()nvlink_domain_span()init_cluster_placement_groups()reserve_http_server_address()validate_settings()verify_served_address()worker_groupinit_collective()update_weights_from_collective()generate()generate_async()prepare_for_generation()finish_generation()blocks_training()wake_carries_weight_updates()invalidate_kv_cache()preinit_nvshmem_collective()suspend_for_refit()resume_after_refit()prepare_refit_info()start_gpu_profiling()stop_gpu_profiling()shutdown()__del__()
- Module Contents
nemo_rl.models.generation.megatron.megatron_worker- Module Contents
- Classes
- API
MegatronGenerationMixininference_model_colocated_reshard_plan_gen_model()_init_inference_engine_state()_setup_colocated_cuda_graph_managers()get_inference_cuda_graph_capture_count()_initialize_inference_engine()_start_inference_coordinator()_sleep()_sleep_engine()_wake()_wake_engine()_start_inference_loop_thread()_setup_openai_api_server()_run_async_coordinator_start()finish_generation()prepare_for_generation()report_dp_openai_server_base_url()_build_sampling_params()_merge_stop_strings()_prepare_data_for_generation()_parse_result_to_batched_data_dict()generate()generate_async()_generate_with_persistent_engine()
MegatronGenerationRefitMixin
- Module Contents
nemo_rl.models.generation.megatron.config- Module Contents
- Classes
- Functions
- API
MCoreGenerationSpecificArgsexpose_http_serverparsersbuffer_size_gbblock_size_tokensmax_tokensmax_model_lennum_cuda_graphsuse_cuda_graphs_for_non_decode_stepscuda_graph_implinference_cuda_graph_scopematerialize_only_last_token_logitsenable_chunked_prefillenable_prefix_cachingrefit_backendnum_speculative_tokensmamba_inference_ssm_states_dtypemamba_inference_conv_states_dtypekv_cache_management_modelogging_step_intervallogprobs_modefp8_cfg
MCoreGenerationConfigmerged_inference_megatron_cfg()dedicated_inference_megatron_cfg()
- Module Contents
- Package Contents
- Submodules
nemo_rl.models.generation.vllm- Submodules
nemo_rl.models.generation.vllm.video_utils- Module Contents
- Functions
- Data
- API
VideoSamplingStyle_TORCHCODEC_END_OF_STREAM_ERROR_CACHED_VIDEO_FRAME_MANIFEST_MAGIC_CACHED_VIDEO_FRAME_MANIFEST_MIME_round_video_frame_count()_timestamp_to_video_frame_index()_select_video_frame_count()_compute_video_timestamps()_build_video_metadata()_resolve_cached_video_media_path()build_cached_video_frame_metadata()build_cached_video_frame_data_url()_load_cached_video_frame_manifest()_is_torchcodec_end_of_stream_error()_torchcodec_sample_indices()_find_torchcodec_decodable_frame_count()_decode_torchcodec_video()_load_video_frames_torchcodec_with_metadata()register_torchcodec_vllm_video_loader()load_video_frames_with_metadata()
- Module Contents
nemo_rl.models.generation.vllm.utils- Module Contents
- Functions
- Data
- API
R3_MISSING_ROUTE_SENTINELVLLM_LOGPROB_FLOORG_ROUTED_EXPERTS_RANGE_CHECKED_as_routed_experts_tensor()format_prompt_for_vllm_generation()pad_and_align_routed_expert_indices()attach_routed_experts_to_chat_response_choices()attach_token_information_to_chat_response_choices()model_dump_chat_response_with_dynamic_message_fields()aggregate_spec_decode_counters()compute_spec_decode_metrics()GENERATION_WORKER_OVERRIDESresolve_generation_worker_cls()
- Module Contents
nemo_rl.models.generation.vllm.refit_layoutnemo_rl.models.generation.vllm.vllm_worker_async- Module Contents
- Classes
- Data
- API
LOGGERVllmAsyncGenerationWorkerImpl_return_routed_experts_enabled()_reserve_port()load_model()_create_engine()_install_engine_input_socket_lock()_start_vllm_metrics_logger()get_vllm_logger_metrics()clear_vllm_logger_metrics()post_init_async()get_reserved_url()report_dp_openai_server_base_url()_setup_vllm_openai_api_server()_setup_vllm_server()init_collective_async()generate_async()generate_text_async()report_device_id_async()prepare_refit_info_async()_reset_encoder_cache_after_weight_update()update_weights_via_ipc_zmq_async()update_weights_from_collective_async()init_nccl_reshard_comm_group_async()prepare_nccl_reshard_refit_info_async()nccl_reshard_refit_async()reset_prefix_cache_async()pause_generation_async()resume_generation_async()sleep_async()wake_up_async()shutdown()
VllmAsyncGenerationWorker
- Module Contents
nemo_rl.models.generation.vllm.vllm_sparse_refit- Module Contents
- Classes
- Functions
- Data
- API
logger_warn_unauthenticated_refit_server()_StagedSparsePayload_stage_sparse_payload()VllmSparseRefitReceiverset_worker_hostnames()start_sync_server()shutdown()_enqueue_sparse_payload_apply()_submit_pending_sparse_payloads()_notify_refit_apply_waiters()_collect_refit_apply_results()_refit_collective_response()_refit_collective_rpc()update_weights_from_serialized_sparse_payloads()update_weights_from_staged_sparse_payloads()_flush_queued_sparse_payloads()_prepare_sparse_refit_info()_apply_s3_manifest_payload()_apply_zmq_payload()setup_api_server()report_refit_server_base_url()start_zmq_sparse_refit_relay()configure_zmq_sparse_refit_relay()stop_zmq_sparse_refit_relay()flush_zmq_sparse_refit_relay()_setup_vllm_refit_server()
- Module Contents
nemo_rl.models.generation.vllm.vllm_sparse_deltanemo_rl.models.generation.vllm.config- Module Contents
- Classes
- Functions
- Data
- API
VllmRefitTransportNameVllmRefitSelectorVLLM_SPARSE_REFIT_TRANSPORTSVllmVideoConfigVllmSpecificArgstensor_parallel_sizepipeline_parallel_sizeexpert_parallel_sizegpu_memory_utilizationmax_model_lenskip_tokenizer_initasync_enginevideoload_formatprecisionlogprobs_modecap_max_tokens_to_contextis_mxquantization_ignored_layer_kwsquantization_ignore_patternskv_cache_dtypeenforce_eagerenable_return_routed_expertsuse_tqdmexpose_http_serverhttp_refit_api_key_env_varreset_encoder_cache_after_weight_updatehttp_refit_server_portzmq_refit_server_porthttp_server_serving_chat_kwargstool_parser_pluginenv_varsreasoning_parser_plugin
VllmDeltaCompressionConfigVllmRefitStorageConfigVllmRefitBaselineConfigVllmRefitTuningConfigVllmSparseRefitConfigVllmNixlRefitConfigVllmCheckpointEnginePluginConfigVllmRefitConfigVllmConfigresolve_vllm_video_config()materialize_vllm_video_config()normalize_vllm_refit_config()
- Module Contents
nemo_rl.models.generation.vllm.refit_loadernemo_rl.models.generation.vllm.collective_rpcnemo_rl.models.generation.vllm.worker_utilsnemo_rl.models.generation.vllm.vllm_backend- Module Contents
- Classes
- Functions
- Data
- API
loggerWeightUpdateTransportUnsupportedNativeRefitTransportWeightUpdateFinalizer_format_refit_key_error()IPCWeightManifestError_detach_pending_layerwise_weights()_refresh_hpc_modules_after_layerwise_reload()_model_uses_unquantized_flashinfer_trtllm()_IPCWeightManifestNixlVllmWorkerfix_gemma3_vision_weight_name()_read_mtp_layer_weights_from_checkpoint()VllmInternalWorkerExtensionpp_comm_groups_mtp_drafter_from_disk_sparse_delta_applier_nrl_named_parameters_nrl_layerwise_reload_active_nrl_layerwise_reload_failuremodel_update_group_get_named_parameters()_load_full_hf_weights()_load_hf_weights()bind_numa()init_collective()init_nccl_reshard_comm_group()report_device_id()report_node_hostname()get_zmq_address()maybe_init_zmq()prepare_refit_info()prepare_sparse_delta_refit_info()_uses_fp8_kv_cache()_maybe_process_fp8_kv_cache()_split_policy_and_draft_weights()_trim_vocab_padding()_get_drafter_model()_load_draft_weights()_mtp_drafter_refit_enabled()_maybe_refit_mtp_drafter()_maybe_process_mtp_drafter_after_loading()load_mtp_weights_from_disk()_load_weights()_get_sparse_delta_applier()_supports_unquantized_flashinfer_trtllm_refit()_uses_unquantized_flashinfer_trtllm()_uses_native_layerwise_refit()_validate_native_layerwise_refit()_reject_unsupported_native_refit()_weight_update_lifecycle()_weight_update_errors_are_fatal()_synchronize_before_ipc_data_ack()update_weights_via_ipc_zmq()update_weights_from_collective()_update_weights_from_collective()update_weights_from_decoded_sparse_payload()synchronize_device()finish_sparse_delta_refit()prepare_nccl_reshard_refit_info()build_hf_to_local_param_map()_build_hf_to_gen_backend_mapping()nccl_reshard_refit()_nccl_reshard_refit()_receive_and_load_misc_params()cleanup()start_gpu_profiling()stop_gpu_profiling()
VllmInternalWorkerExtensionWithCheckpointEngine
- Module Contents
nemo_rl.models.generation.vllm.vllm_generation- Module Contents
- Classes
- Functions
- Data
- API
logger_record_vllm_generation_metrics()VllmGenerationinit_cluster_placement_groups()_get_tied_worker_bundle_indices()_report_device_id()_report_dp_openai_server_base_urls()_collect_reserved_urls()load_and_start()_post_init()_get_raw_spec_counters()snapshot_step_metrics()get_step_metrics()init_collective()set_refit_membership()_refit_leader_workers()rebuild_collective()generate()generate_text()_async_generate_base()attach_fleet_health()_next_dp_shard_idx()_generate_on_shard()generate_text_async()generate_async()prepare_for_generation()finish_generation()shutdown()prepare_refit_info()update_weights_via_ipc_zmq()update_weights_from_collective()init_nccl_reshard_comm_group()prepare_nccl_reshard_refit_info()rebuild_nccl_reshard_comm_group()nccl_reshard_refit()start_gpu_profiling()stop_gpu_profiling()get_vllm_logger_metrics()clear_vllm_logger_metrics()clear_logger_metrics()get_logger_metrics()__del__()invalidate_kv_cache()pause_generation_for_refit()resume_generation_after_refit()requires_kv_scale_sync
- Module Contents
nemo_rl.models.generation.vllm.checkpoint_engine- Module Contents
- Classes
- Functions
- Data
- API
NIXL_VLLM_WORKER_NIXL_CONFIG_KEYconfigure_nixl_worker()preinit_nixl_from_vllm_config()resolve_rollout_rank()VllmCheckpointEngineMixincheckpoint_engine_validate_checkpoint_engine_weight_update()checkpoint_engine_total_memory_bytes()_load_hf_weights()init_checkpoint_engine()prepare_checkpoint_engine()init_checkpoint_engine_process_group()finalize_checkpoint_engine()_update_weights_from_checkpoint_engine_async()update_weights_from_checkpoint_engine()
VllmCheckpointEngineRpcMixinVllmAsyncCheckpointEngineRpcMixin
- Module Contents
nemo_rl.models.generation.vllm.patches- Module Contents
- Functions
- API
_get_vllm_file()_locked_file_patch()_patch_vllm_init_workers_ray()_patch_vllm_llama_eagle3_own_lm_head()_patch_vllm_tool_parser_namespace_tool()_patch_vllm_ray_executor_v2_tcpstore_port()_patch_vllm_shm_broadcast_bind_retry()_patch_vllm_radio_layerscale_loader()_patch_vllm_glm_decoder_sequence_parallel_moe()ensure_vllm_source_compat()_apply_vllm_patches()
- Module Contents
nemo_rl.models.generation.vllm.vllm_worker- Module Contents
- Classes
- Functions
- Data
- API
logger_context_capped_max_new_tokens()_maybe_enable_vllm_native_tracing()_resolve_enable_prefix_caching()_merge_fp8_kwargs()_log_effective_quantization_ignore_patterns()BaseVllmGenerationWorker__repr__()configure_worker()_init_config()_load_model()llm()is_alive()_merge_stop_strings()_build_sampling_params()start_gpu_profiling()stop_gpu_profiling()_spec_decode_max_tokens()_request_max_new_tokens()_patch_vllm_nsight_config()_get_raw_spec_counters()report_refit_server_base_url()start_zmq_sparse_refit_relay()configure_zmq_sparse_refit_relay()stop_zmq_sparse_refit_relay()
VllmGenerationWorkerImpl_create_engine()post_init()init_collective()generate()generate_text()report_device_id()prepare_refit_info()update_weights_via_ipc_zmq()update_weights_from_collective()init_nccl_reshard_comm_group()prepare_nccl_reshard_refit_info()nccl_reshard_refit()reset_prefix_cache()sleep()wake_up()shutdown()
VllmGenerationWorker
- Module Contents
- Package Contents
- Submodules
- Submodules
nemo_rl.models.generation.generation_routernemo_rl.models.generation.interfaces- Module Contents
- Classes
- Functions
- Data
- API
ROUTED_EXPERTS_FALLBACK_DTYPEROUTED_EXPERTS_MISSING_ROUTE_SENTINEL_ROUTED_EXPERTS_DTYPE_NAMES_warn_unsupported_in_flight_refit_pause_once()get_num_routed_experts()resolve_routed_experts_dtype()resolve_routed_experts_dtype_name_for_model()verify_right_padding()ResourcesConfigOptionalResourcesConfigColocationConfigCheckpointEngineConfigGenerationConfigshould_use_async_rollouts()GenerationSamplingParamsGenerationDatumSpecGenerationOutputSpecCollectiveSenderSpecreject_unenforceable_refit_deadline()GenerationInterfacevalidate_settings()init_collective()generate()prepare_for_generation()finish_generation()shutdown()pause_generation()continue_generation()requires_kv_scale_syncprepare_refit_info()update_weights_via_ipc_zmq()update_weights_from_collective()get_collective_sender_spec()get_inference_world_size()prepare_nccl_reshard_refit_info()nccl_reshard_refit()attach_fleet_health()invalidate_kv_cache()pause_generation_for_refit()resume_generation_after_refit()blocks_training()wake_carries_weight_updates()clear_logger_metrics()get_logger_metrics()
- Module Contents
nemo_rl.models.generation.constantsnemo_rl.models.generation.openai_server_utilsnemo_rl.models.generation.fleet_health- Module Contents
- Classes
- Data
- API
ShardState_SERVING_STATES_ABSENT_STATESShardHealthGenerationFleetExhaustedFleetHealthPolicyGenerationFleetHealthmembership_epochshard_countsnapshot()serving_shards()absent_shards()suspected_shards()state_of()serving_base_urls()counts_by_state()as_metrics()record_probe()record_actor_death()condemn_silent_participant()report_failure()report_success()shard_for_base_url()mark_restarting()mark_loaded()mark_weights_partial()report_refit()retire()raise_if_exhausted()_transition()_refresh_membership()
HealthyShardSelector
- Module Contents
- Package Contents
- Subpackages
nemo_rl.models.automodel- Submodules
nemo_rl.models.automodel.setupnemo_rl.models.automodel.confignemo_rl.models.automodel.datanemo_rl.models.automodel.checkpointnemo_rl.models.automodel.train- Module Contents
- Classes
- Functions
- Data
- API
PostProcessingFunctionPreparedModelForward_build_model_batch()prepare_model_forward()model_forward()extract_logits()apply_temperature_scaling()apply_top_k_top_p_filtering_for_local_logits()_cp_gather_logits()forward_with_post_processing_fn()automodel_forward_backward()LossPostProcessorLogprobsPostProcessorTopkLogitsPostProcessorFullLogitsPostProcessorScorePostProcessoraggregate_training_statistics()
- Module Contents
- Submodules
nemo_rl.models.megatron- Subpackages
nemo_rl.models.megatron.draft- Submodules
nemo_rl.models.megatron.draft.utils- Module Contents
- Classes
- Functions
- Data
- API
StateDictCheckpointLoader_CHECKPOINT_CANDIDATE_NAMES_HF_SNAPSHOT_ALLOW_PATTERNS_HF_SNAPSHOT_IGNORE_PATTERNS_MODEL_LAYER_QKV_KEY_PATTERN_CHECKPOINT_LAYER_KEY_PATTERN_EagleLayerLayout_resolve_optional_key()_EagleModelLayout_qkv_head_dims()_interleave_qkv()_deinterleave_qkv()_combine_or_shard_weight_parts()_PendingLayerWeights_get_num_aux_hidden_states()_all_gather_tp_shards()_gather_tp_qkv_weight()_gather_tp_gate_up_weight()_gather_tp_weight_if_needed()_extract_tensor_state_dict()_load_safetensors_file()_load_torch_file()_merge_checkpoint_shards()_load_index_checkpoint()_load_checkpoint_file()_load_checkpoint_from_directory()_load_checkpoint_state()_normalize_hf_key()_parse_layer_checkpoint_key()_get_tp_rank()_build_split_axis_by_parameter()_shard_to_local_tp()_assign_optional_layer_weight()_map_layer_hf_weight()_map_hf_state_to_eagle_state()load_hf_weights_to_eagle()_require_state_tensor()find_draft_owner_chunk()get_attached_draft_model()draft_model_detached()_export_layer_weights_to_hf()export_eagle_weights_to_hf()get_policy_lm_head_weight()_get_draft_output_layer()_get_draft_to_target_token_mapping()copy_policy_lm_head_to_draft()DRAFT_GRAD_NORM_GROUPregister_draft_grad_norm_group()build_draft_model()
- Module Contents
nemo_rl.models.megatron.draft.eaglenemo_rl.models.megatron.draft.hidden_capture
- Package Contents
- Submodules
- Submodules
nemo_rl.models.megatron.setup- Module Contents
- Classes
- Functions
- Data
- API
_HF_CONFIG_PATCHED_NEMOTRON_OMNI_EXPANDED_SEQUENCE_CONTRACT_patch_hf_config_double_instantiation()_force_sync_optimizer_fp32_from_model()TokenizerTypedestroy_parallel_state()configure_refit_environment()setup_distributed()validate_and_set_config()_canonicalize_hf_config_overrides()_get_hf_config_overrides_hash()_resolve_iter_dir_from_root()validate_model_paths()setup_model_config()_validate_model_override_conflicts()_merge_model_overrides()_merge_model_override_value()_apply_parallelism_config()_apply_moe_config()_apply_mtp_config()_apply_precision_config()_apply_performance_config()_validate_optimizer_config()_validate_chunking_config()_create_checkpoint_config()_validate_training_config()_validate_dtype_config()_create_megatron_config()_create_draft_pre_wrap_hook()_BRIDGE_SIGNAL_HANDLER_PATCHED_patch_bridge_signal_handler_for_worker_threads()build_inference_model()setup_model_and_optimizer()handle_model_import()setup_reference_model_state()finalize_megatron_setup()MoEFloat16Modulemake_policy_like_config()
- Module Contents
nemo_rl.models.megatron.pipeline_parallelnemo_rl.models.megatron.confignemo_rl.models.megatron.data- Module Contents
- Classes
- Functions
- API
ProcessedInputsProcessedMicrobatchmake_processed_microbatch_iterator()_get_fp8_token_alignment()_get_non_packed_sequence_pad_factor()_pad_sequence_aligned_tensors()get_microbatch_iterator()get_ltor_masks_and_position_ids()process_microbatch()_make_r3_trace_token_identity()_verify_r3_trace_cp_token_alignment()_fill_routed_experts_padding()process_global_batch()_prepare_vlm_batch_for_megatron()_pack_sequences_for_megatron()_shard_routed_experts_for_cp()_get_pack_sequence_parameters_for_megatron()_unpack_sequences_from_megatron()get_and_validate_seqlen()
- Module Contents
nemo_rl.models.megatron.memory_savernemo_rl.models.megatron.community_importnemo_rl.models.megatron.router_replay- Module Contents
- Functions
- Data
- API
_ROUTER_REPLAY_VALIDATE_ENV_MISSING_ROUTE_SENTINEL_MISSING_ROUTE_FALLBACK_PATCH_ATTRrouter_replay_enabled()configure_vllm_for_router_replay()validate_router_replay_config()_iter_model_modules()_unwrap_model_config()_global_moe_layer_numbers()_router_replay_instances_for_model()_local_layer_numbers_for_model()_normalize_routed_experts_for_mcore()_payload_indices_for_moe_layers()_router_replay_validation_enabled()_validate_replay_tensor()_install_missing_route_fallback_patch()_get_tensor_model_parallel_world_size()_get_tensor_model_parallel_rank()_split_for_sequence_parallel()build_router_replay_tensors()build_router_replay_assignments()set_router_replay_forward()set_router_replay_backward()clear_router_replay()clear_global_router_replay_instances()
- Module Contents
nemo_rl.models.megatron.commonnemo_rl.models.megatron.train- Module Contents
- Subpackages
nemo_rl.models.policy- Subpackages
nemo_rl.models.policy.workers- Submodules
nemo_rl.models.policy.workers.dtensor_policy_worker_v2- Module Contents
- Classes
- Functions
- API
_refit_tensor_dtype()dtensor_params_generator()_maybe_merge_lora_weight()_maybe_adapt_tensor_to_hf()DTensorPolicyWorkerV2Impl__repr__()_get_replica_group()_local_coords()_update_moe_gate_bias_if_supported()_autocast_context()set_rollout_num_gpus_per_engine()train()get_logprobs()score()get_topk_logits()get_full_logits_ipc()release_ipc_buffer()use_reference_model()_add_noise_to_weights()return_state_dict()return_model_config()prepare_refit_info()calibrate_qkv_fp8_scales()stream_weights_via_ipc_zmq()update_weights_to_sglang_colocated()_checkpoint_engine_params()broadcast_weights_for_collective()_broadcast_weights_for_collective()prepare_for_lp_inference()prepare_for_training()finish_inference()offload_before_refit()offload_after_refit()move_optimizer_to_device()move_to_device()move_buffer_to_device()move_to_cuda()move_to_cpu()save_checkpoint()finalize_async_save()load_checkpoint()_init_checkpoint_manager()
DTensorPolicyWorkerV2
- Module Contents
nemo_rl.models.policy.workers.megatron_policy_worker- Module Contents
- Classes
- Functions
- Data
- API
logTokenizerType_should_use_router_replay()_model_self_packs_for_cp()_model_self_packs_mtp_loss_mask()_model_slices_context_parallel_inputs()_unwrapped_chunks()_model_media_placeholder_token_id()_model_accepts_media_token_validity_mask()_estimate_refit_tensor_size_in_bytes()_collect_mtp_hf_layer_names()_meta_tensor_alloc_context()MegatronPolicyWorkerImpl_train_step_state_remote_sparse_refit_async_checkpoint_cuda_cache_active__repr__()_local_coords()_get_replica_group()configure_worker()enable_forward_pre_hook()disable_forward_pre_hook()_forward_pre_hook_enabled()_disable_forward_pre_hook_until_next_train_step()_copy_main_params_to_param_buffer()_uses_mxfp8_overlap_shared_param_buffer()_get_model_extra_state_dict()_restore_model_extra_state_dict()train()_compute_moe_grad_scale()_set_moe_grad_scale_func()get_reference_policy_logprobs()_split_step_state_init()_assert_step_open()_log_gpu_mem()_restore_saved_mcore_hooks()begin_train_step()train_microbatch()_train_microbatch_body()finish_train_step()_finish_train_step_body()abort_train_step()get_logprobs()_apply_state_dict_to_model()use_reference_model()get_topk_logits()prepare_refit_info()_collect_mtp_metrics()_set_mtp_grad_scale_func()_get_model_config()init_remote_sparse_delta_baseline()stream_remote_sparse_weights()_require_remote_sparse_refit()finish_remote_sparse_delta_sync()_is_fp8_export()_build_refit_conversion_tasks()_calculate_refit_param_info()_iter_params_with_optional_kv_scales()_iter_local_hf_param_shards()_iter_sglang_hf_weight_buckets()update_weights_to_sglang_colocated()connect_sglang_rollout_engines_distributed()update_weights_to_sglang_distributed()stream_weights_via_ipc_zmq()broadcast_weights_for_collective()_broadcast_weights_for_collective()_build_layer_to_pp_stage()prepare_nccl_reshard_refit_info()_build_expert_groups()_group_experts()build_hf_to_local_param_map()nccl_reshard_refit()_nccl_reshard_refit_guarded()_nccl_reshard_refit()_broadcast_misc_params_packed()prepare_for_lp_inference()_build_colocated_inference_model()prepare_for_training()finish_inference()_clear_fp8_caches()offload_before_refit()offload_after_refit()move_model()move_optimizer()save_checkpoint()_requires_nvrx_cuda_cache_release()finalize_async_save()load_checkpoint()check_tensor_parallel_attributes()calibrate_qkv_fp8_scales()
MegatronPolicyWorker
- Module Contents
nemo_rl.models.policy.workers.megatron_remote_sparse_refitnemo_rl.models.policy.workers.dtensor_policy_worker- Module Contents
- Classes
- Functions
- API
dtensor_params_generator()_attach_context_parallel_hooks()unshard_fsdp2_model()get_cpu_state_dict()DTensorPolicyWorkerImpl__repr__()_get_replica_group()_local_coords()create_context_parallel_ctx()_apply_temperature_scaling()_apply_top_k_top_p_filtering()train_context()train()get_logprobs()score()get_topk_logits()use_reference_model()_add_noise_to_weights()return_state_dict()return_model_config()prepare_refit_info()calibrate_qkv_fp8_scales()stream_weights_via_ipc_zmq()_checkpoint_engine_params()broadcast_weights_for_collective()_broadcast_weights_for_collective()prepare_for_lp_inference()prepare_for_training()offload_before_refit()offload_after_refit()move_optimizer_to_device()move_to_device()move_buffer_to_device()move_to_cuda()move_to_cpu()save_checkpoint()load_checkpoint()
DTensorPolicyWorker
- Module Contents
nemo_rl.models.policy.workers.base_policy_worker- Module Contents
- Classes
- API
AbstractPolicyWorkermodel_update_grouppp_comm_groupinit_collective()init_nccl_reshard_comm_group()prepare_nccl_reshard_refit_info()nccl_reshard_refit()_refit_transport_state()connect_sglang_rollout_engines()stand_down_refit_watchdog()is_alive()reset_peak_memory_stats()get_gpu_info()report_device_id()get_zmq_address()maybe_init_zmq()get_free_memory_bytes()shutdown()start_gpu_profiling()stop_gpu_profiling()report_node_ip_and_gpu_id()get_reference_policy_logprobs()finalize_async_save()finish_training()
- Module Contents
nemo_rl.models.policy.workers.checkpoint_enginenemo_rl.models.policy.workers.patches
- Submodules
- Submodules
nemo_rl.models.policy.tq_policy- Module Contents
- Classes
- Functions
- API
_aggregate_train_results()TQPolicyload_data_plane_checkpoint()shutdown()prepare_step()prepare_val_partition()discard_samples()finish_step()_logprob_dispatch()get_logprobs_from_meta()get_reference_policy_logprobs_from_meta()train_from_meta()begin_train_step()train_microbatches_from_meta()finish_train_step()abort_train_step()
- Module Contents
nemo_rl.models.policy.utils- Module Contents
- Classes
- Functions
- Data
- API
AUTOMODEL_FACTORYIPCProtocolPOLICY_WORKER_OVERRIDESresolve_policy_worker_cls()resolve_model_class()is_vllm_v1_engine_enabled()get_gpu_info()configure_dynamo_cache()get_runtime_env_for_policy_worker()get_megatron_checkpoint_dir()get_handle_from_tensor()ensure_teacher_ipc_buffer()aggregate_per_sample_handles()calculate_aligned_size()stream_weights_via_ipc_zmq_impl()rebuild_cuda_tensor_from_ipc()_derive_engine_gpu_offsets()connect_colocate_topology()_check_weight_sync_results()iter_named_tensor_buckets()send_hf_buckets_via_ipc_actor_impl()init_process_group()connect_rollout_engines_from_distributed()disconnect_rollout_engines_from_distributed()broadcast_hf_buckets_via_distributed_impl()
- Module Contents
nemo_rl.models.policy.teacher_worker_groupnemo_rl.models.policy.interfaces- Module Contents
- Classes
- API
LogprobOutputSpecReferenceLogprobOutputSpecScoreOutputSpecTopkLogitsOutputSpecPolicyInterfaceColocatablePolicyInterfaceinit_collective()offload_before_refit()offload_after_refit()offload_to_cpu()prepare_refit_info()stream_weights_via_ipc_zmq()connect_sglang_rollout_engines()update_weights_to_sglang_colocated()connect_sglang_rollout_engines_distributed()update_weights_to_sglang_distributed()broadcast_weights_for_collective()prepare_nccl_reshard_refit_info()nccl_reshard_refit()prepare_for_lp_inference()
- Module Contents
nemo_rl.models.policy.lm_policy- Module Contents
- Classes
- Functions
- Data
- API
PathLike_aggregate_megatron_flops_metrics()Policydata_parallel_sizerun_all_workers_single_data()run_all_workers_multiple_data()init_collective()init_collective_mcore_generation()preinit_nvshmem()swap_weights_via_reshard()_shard_for_logprob()_shard_for_train()_report_sharded_payload()get_logprobs()get_reference_policy_logprobs()get_topk_logits()get_full_logits_ipc()release_ipc_buffer()train()generate()score()prepare_for_generation()finish_generation()prepare_for_training()prepare_for_lp_inference()invalidate_kv_cache()prepare_refit_info()finish_inference()finish_training()calibrate_qkv_fp8_scales()get_free_memory_bytes()stream_weights_via_ipc_zmq()connect_sglang_rollout_engines()update_weights_to_sglang_colocated()connect_sglang_rollout_engines_distributed()update_weights_to_sglang_distributed()broadcast_weights_for_collective()init_nccl_reshard_comm_group()prepare_nccl_reshard_refit_info()nccl_reshard_refit()offload_before_refit()offload_after_refit()offload_to_cpu()save_checkpoint()finalize_async_save()shutdown()__del__()start_gpu_profiling()stop_gpu_profiling()print_node_ip_and_gpu_id()
- Module Contents
- Package Contents
- Classes
- Functions
- Data
- API
_patch_transformers_tokenizer_class_set()LoRAConfigDisabledLoRAConfigAutomodelBackendConfigAutomodelFreezeConfigAutomodelKwargsDTensorConfigDisabledMoEParallelizerOptionsDTensorConfigSequencePackingConfigDisabledSequencePackingConfigRewardModelConfigMegatronPeftConfigDisabledMegatronPeftConfigMegatronOptimizerConfigMegatronSchedulerConfigMegatronDDPConfigFp8ConfigMegatronConfigDisabledMegatronCheckpointConfigMegatronConfigenabledenv_varsmodel_overridesempty_unused_memory_levelactivation_checkpointingrecompute_granularityrecompute_modulestensor_model_parallel_sizepipeline_model_parallel_sizenum_layers_in_first_pipeline_stagenum_layers_in_last_pipeline_stagecontext_parallel_sizeradio_force_cpe_eval_modefreeze_vision_modelfreeze_vision_projectionfreeze_sound_encoderfreeze_sound_projectionpipeline_dtypesequence_parallelfreeze_moe_routerexpert_tensor_parallel_sizeexpert_model_parallel_sizedefer_fp32_logitsapply_rope_fusionbias_activation_fusionforce_reconvert_from_hfattention_backendmoe_per_layer_loggingmoe_enable_deepepmoe_token_dispatcher_typeinference_moe_token_dispatcher_typeinference_grouped_gemm_backendmoe_router_num_groupsmoe_router_group_topktransformer_implcuda_graph_implcuda_graph_modulescuda_graph_warmup_stepsmoe_pad_experts_for_cuda_graph_inferencemoe_shared_expert_overlapfine_grained_activation_offloadingoffload_modulesuse_gloo_process_groupsmoe_grouped_gemmmoe_flex_dispatcher_backendmoe_hybridep_num_smshybridep_num_ranks_per_nvlink_domainhybridep_use_mnnvlpeftoptimizerschedulerdistributed_data_parallel_configcheckpointgradient_accumulation_fusionuse_fused_weighted_squared_reluuse_fused_linear_logprobsfused_linear_logprobs_chunk_sizemtp_num_layersmtp_loss_scaling_factormtp_use_repeated_layermtp_detach_headsclear_memory_caches_before_refitfp8_cfgfreeze_config
DraftConfigDisabledDraftConfigTokenizerConfigPytorchOptimizerConfigSinglePytorchSchedulerConfigSinglePytorchMilestonesConfigSchedulerMilestonesDynamicBatchingConfigDisabledDynamicBatchingConfigRouterReplayConfigDisabledRouterReplayConfigPolicyConfigmodel_nametokenizertrain_global_batch_sizetrain_micro_batch_sizelogprob_batch_sizelogprob_chunk_sizegenerationgeneration_batch_sizeprecisionreward_model_cfgdtensor_cfgmegatron_cfgdraftpretrained_checkpointrouter_replayhf_config_overridesdynamic_batchingsequence_packingmake_sequence_length_divisible_bymax_total_sequence_lengthmax_grad_normrefit_buffer_size_gboptimizerschedulerquant_cfgquant_calib_dataquant_calib_sizequant_batch_sizequant_sequence_lengthdisable_modelopt_layer_specis_vlm
- Subpackages
nemo_rl.models.dtensor- Submodules
nemo_rl.models.dtensor.parallelize- Module Contents
- Classes
- Functions
- Data
- API
- Module Contents
- Submodules
nemo_rl.models.value- Subpackages
nemo_rl.models.value.workers- Submodules
nemo_rl.models.value.workers.dtensor_value_worker_v2nemo_rl.models.value.workers.megatron_value_worker
- Submodules
- Submodules
nemo_rl.models.value.tq_valuenemo_rl.models.value.config- Module Contents
- Classes
- API
ValueConfigmodel_nametokenizertrain_global_batch_sizetrain_micro_batch_sizelogprob_batch_sizeprecisionreward_model_cfgdtensor_cfgmegatron_cfghf_config_overridesdynamic_batchingsequence_packingmake_sequence_length_divisible_bymax_total_sequence_lengthmax_grad_normdequantize_base_checkpointoptimizerscheduler
- Module Contents
nemo_rl.models.value.lm_valuenemo_rl.models.value.interfaces
- Package Contents
- Subpackages
nemo_rl.models.huggingface
- Subpackages
nemo_rl.experience- Submodules
nemo_rl.experience.rollout_recovery- Module Contents
- Classes
- Functions
- Data
- API
ROLLOUT_RECOVERY_SCHEMA_VERSIONROLLOUT_RECOVERY_STATE_FILENAMEPromptGroupPhasePromptRefStatePromptGroupRecoveryStateRolloutRecoveryLedgerStateRolloutRecoveryStatePromptRefPromptGroupRecoveryRecordParsedRolloutRecoveryState_require_int()_prompt_task_name()_validate_prompt_identity()RolloutRecoveryLedger_validate_batch_shortfall()build_rollout_recovery_state()parse_rollout_recovery_state()
- Module Contents
nemo_rl.experience.interfacesnemo_rl.experience.rollout_managernemo_rl.experience.failures- Module Contents
- Classes
- Functions
- Data
- API
_AIOHTTP_INFRA_TYPES_CLIENT_RESPONSE_ERROR_MAX_CAUSE_DEPTH_RETRIABLE_HTTP_STATUSESRolloutFailureRolloutInfraFailureRolloutTimeoutGenerationUnavailableNoHealthyShardsGymTransportErrorRolloutDataFailureRolloutRedispatchExhaustedRolloutStallFailureClass_INFRA_TYPES_INFRA_TYPE_NAMEShttp_status_is_infra()_http_status()_is_infra()classify_rollout_failure()
- Module Contents
nemo_rl.experience.payloadnemo_rl.experience.sync_rollout_actornemo_rl.experience.metric_utilsnemo_rl.experience.rollouts- Module Contents
- Classes
- Functions
- Data
- API
TokenizerTypeattach_initial_nemo_gym_image_payloads()_add_multimodal_generation_payload()_reattach_original_multimodal_payloads()_reattach_static_multimodal_payloads_to_result()attach_static_multimodal_payload()_add_r3_fallback_metrics()_extract_mask_sample_flags()_attach_routed_experts_to_message_log_prefix()_find_routed_experts_template()_dummy_routed_experts_for_tokens()backfill_missing_routed_experts()EffortLevelsConfig_EffortShapingMetrics_apply_effort_shaping()_effort_shaping_metrics()generate_responses()generate_responses_async()calculate_rewards()run_multi_turn_rollout()async_generate_response_for_sample_turn()run_sample_multi_turn_rollout()RolloutGroupResult_aggregate_multi_turn_rollout_metrics()_run_multi_turn_rollout_async()run_async_multi_turn_rollout()run_async_multi_turn_rollout_groups()_tensorize_by_key()NemoGymRolloutResult_CompletedNemoGymGroup_NemoGymStreamAccumulatorget_nemo_gym_thinking_tags()should_mask_flagged_samples()_get_reward_penalty_config_value()_get_reward_penalty_token_id()_get_required_reward_penalty_token_id()_get_reward_penalty_token_ids()_get_required_reward_penalty_token_ids()_infer_single_token_id()resolve_reward_penalty_config()apply_reward_penalties()_prepare_nemo_gym_rows()_tensorize_nemo_gym_result()run_async_nemo_gym_rollout()run_nemo_gym_rollout_sync()_postprocess_single_nemo_gym_group()
- Module Contents
- Submodules
nemo_rl.modelopt- Subpackages
nemo_rl.modelopt.models- Subpackages
nemo_rl.modelopt.models.generation- Submodules
nemo_rl.modelopt.models.generation.vllm_modeloptnemo_rl.modelopt.models.generation.vllm_quant_patchnemo_rl.modelopt.models.generation.vllm_quant_backend- Module Contents
- Classes
- Functions
- Data
- API
_FUSED_MODELOPT_MOE_SUFFIXES_match_fused_modelopt_moe_weight()_w13_num_shards_from_state_dict_info()_batch_fused_modelopt_moe_weights()_detach_pending_layerwise_weights()_iter_modelopt_quant_modules()_modelopt_layerwise_reload_roots()_require_complete_modelopt_layerwise_reload()VllmQuantInternalWorkerExtension_QUANT_AMAX_SUFFIXES_nrl_w13_num_shards_by_prefix_nrl_modelopt_reload_roots_supports_unquantized_flashinfer_trtllm_refit()maybe_init_zmq()_is_real_quant_model()_get_modelopt_reload_roots()_weight_update_lifecycle()_weight_update_errors_are_fatal()_synchronize_before_ipc_data_ack()prepare_refit_info()_patch_named_parameters_to_include_buffers()_attach_input_quantizer_amax_loaders()_load_weights()get_weight_snapshot()get_quantizer_stats()
VllmQuantInternalWorkerExtensionWithCheckpointEngine
- Module Contents
nemo_rl.modelopt.models.generation.vllm_quant_worker
- Submodules
nemo_rl.modelopt.models.policy- Subpackages
nemo_rl.modelopt.models.policy.workers- Submodules
nemo_rl.modelopt.models.policy.workers.utilsnemo_rl.modelopt.models.policy.workers.dtensor_quant_policy_worker_v2nemo_rl.modelopt.models.policy.workers.megatron_quant_policy_worker- Module Contents
- Classes
- Functions
- API
_quant_checkpoint_cache_suffix()_find_other_quant_checkpoint_caches()_warn_if_other_quant_checkpoint_caches()_set_quantization_model_specs()MegatronQuantPolicyWorkermaybe_init_zmq()_quantize()_patch_validate_model_paths()_patch_setup_model_and_optimizer()_restore_modelopt_state_pre_load()hide_tensor_quantizers()enable_forward_pre_hook()disable_forward_pre_hook()disable_quantization()_hide_extra_state()use_reference_model()without_model_config()get_quantizer_stats()generate()save_checkpoint()_use_real_quant_refit()_get_real_quant_mode()_iter_real_quant_refit_params()_find_weight_quantizer()_iter_hf_input_amax_names()_get_enabled_input_amax()_iter_input_quantizer_amax_params()_iter_params_with_optional_kv_scales()
- Module Contents
nemo_rl.modelopt.models.policy.workers.dtensor_quant_policy_worker
- Submodules
- Subpackages
- Subpackages
- Submodules
nemo_rl.modelopt.utils- Module Contents
- Functions
- Data
- API
MODELOPT_REAL_QUANT_ZMQ_TIMEOUT_MS_QUANT_IGNORE_NAME_SUFFIXESDEFAULT_NVFP4_IGNORENVFP4RealQuantMode_NVFP4_REAL_QUANT_MODES_iter_quant_ignore_suffix_variants()iter_quant_ignore_name_candidates()matches_quant_ignore_pattern()build_vllm_modelopt_nvfp4_config()_resolve_effective_quantizer_formats()_is_float_format()_validate_nvfp4_quantizer_format()resolve_nvfp4_real_quant_mode()resolve_quant_cfg()
- Module Contents
nemo_rl.modelopt.registry
- Subpackages
nemo_rl.data- Subpackages
nemo_rl.data.datasets- Subpackages
nemo_rl.data.datasets.response_datasets- Submodules
nemo_rl.data.datasets.response_datasets.numinamathnemo_rl.data.datasets.response_datasets.tulu3nemo_rl.data.datasets.response_datasets.dapo_mathnemo_rl.data.datasets.response_datasets.daily_omninemo_rl.data.datasets.response_datasets.aimenemo_rl.data.datasets.response_datasets.avqanemo_rl.data.datasets.response_datasets.response_datasetnemo_rl.data.datasets.response_datasets.helpsteer3nemo_rl.data.datasets.response_datasets.gsm8knemo_rl.data.datasets.response_datasets.openr1_mathnemo_rl.data.datasets.response_datasets.geometry3knemo_rl.data.datasets.response_datasets.mmpr_tinynemo_rl.data.datasets.response_datasets.general_conversations_datasetnemo_rl.data.datasets.response_datasets.nemotron_cascade2_sftnemo_rl.data.datasets.response_datasets.nemogym_datasetnemo_rl.data.datasets.response_datasets.openmathinstruct2nemo_rl.data.datasets.response_datasets.oai_format_datasetnemo_rl.data.datasets.response_datasets.refcoconemo_rl.data.datasets.response_datasets.squadnemo_rl.data.datasets.response_datasets.audiomcqnemo_rl.data.datasets.response_datasets.intentnemo_rl.data.datasets.response_datasets.deepscalernemo_rl.data.datasets.response_datasets.oasstnemo_rl.data.datasets.response_datasets.clevrnemo_rl.data.datasets.response_datasets.arrow_text_dataset
- Package Contents
- Submodules
nemo_rl.data.datasets.eval_datasets- Submodules
nemo_rl.data.datasets.eval_datasets.gpqanemo_rl.data.datasets.eval_datasets.local_math_datasetnemo_rl.data.datasets.eval_datasets.daily_omninemo_rl.data.datasets.eval_datasets.mmaunemo_rl.data.datasets.eval_datasets.mathnemo_rl.data.datasets.eval_datasets.mmlunemo_rl.data.datasets.eval_datasets.mmlu_pro
- Package Contents
- Submodules
nemo_rl.data.datasets.preference_datasets
- Submodules
nemo_rl.data.datasets.utils- Module Contents
- Functions
- Data
- API
TokenizerTypeload_audio_from_file()assert_no_double_bos()pil_to_base64()load_dataset_from_path()resolve_external_dataset_class()_BEHAVIORAL_DATASET_CONFIG_KEYSwarn_on_unsupported_dataset_config_keys()update_single_dataset_config()merge_datasets()extract_necessary_env_names()get_huggingface_cache_path()
- Module Contents
nemo_rl.data.datasets.raw_datasetnemo_rl.data.datasets.processed_dataset
- Package Contents
- Subpackages
nemo_rl.data.packing
- Submodules
nemo_rl.data.utilsnemo_rl.data.multimodal_utils- Module Contents
- Classes
- Functions
- Data
- API
VLLM_MULTIMODAL_DATA_KEYSNATIVE_MULTIMODAL_KEYSIMAGE_CONTENT_TYPESVIDEO_CONTENT_TYPESAUDIO_CONTENT_TYPESMULTIMODAL_CONTENT_TYPESNEMO_GYM_IMAGE_ENCODE_MAX_WORKERSMEDIA_TAGSMEDIA_TAGS_REVERSEDDEFAULT_MEDIA_EXTENSIONS_PLACEHOLDER_STYLE_PROCESSOR_NAMESMEDIA_TAGS_TO_ALLOWEDMEDIA_TAG_PATTERNloggeruses_image_placeholder()PackedTensorget_multimodal_keys_from_processor()get_multimodal_default_settings_from_processor()get_dim_to_pack_along()get_pad_to_max_shape()extract_multimodal_model_inputs()resolve_to_image()image_to_data_url()_encode_single_image_source()extract_input_image_sources_from_responses_messages()extract_input_images_from_responses_messages()_materialize_ragged_pixel_values()_stack_ragged_pixel_values()_restore_tensors()attach_image_model_inputs_to_message()encode_images_in_examples()get_media_from_message()load_media_from_message()build_media_token_validity_mask()media_placeholder_token_id_from_chunks()chunks_accept_media_token_validity_mask()image_counts_by_row()attach_media_token_validity_mask()
- Module Contents
nemo_rl.data.cross_tokenizer_collatenemo_rl.data.chat_templatesnemo_rl.data.collate_fnnemo_rl.data.interfacesnemo_rl.data.dataloadernemo_rl.data.llm_message_utils- Module Contents
- Functions
- Data
- API
TensorTokenizerType_validated_packed_values()message_log_to_flat_messages()get_keys_from_message_log()add_loss_mask_to_message_log()_pad_tensor()_validate_tensor_consistency()batched_message_log_to_flat_message()message_log_shape()get_first_index_that_differs()get_formatted_message_log()remap_dataset_keys()MESSAGE_LOG_BULK_FIELDSdecompose_message_log()attach_message_log_view()reconstruct_message_log()
- Module Contents
nemo_rl.data.processors
- Package Contents
- Subpackages
nemo_rl.data_plane- Subpackages
nemo_rl.data_plane.adapters- Submodules
nemo_rl.data_plane.adapters.noopnemo_rl.data_plane.adapters.transfer_queue_envnemo_rl.data_plane.adapters.transfer_queue- Module Contents
- Classes
- Functions
- Data
- API
_get_local_node_ip()rdma_devices()_mooncake_transport_config()_STAGING_SLOT_TIMEOUT_S_memlock_limit()_register_checked()_StagingPool_StagingPoolRegistry_tq_shape_drift_error()_patch_mooncake_register_check()_patch_mooncake_staging_buffers()_connect_existing()_init_tq()_assert_no_key_loss()_promote_1d_leaves()_from_wire()TQDataPlaneClient
- Module Contents
- Submodules
- Submodules
nemo_rl.data_plane.schema- Module Contents
- Functions
- Data
- API
LayoutMICRO_BATCH_INDICESMICRO_BATCH_LENGTHSELEM_COUNTS_PER_GBGLOBAL_FORWARD_PAD_SEQLENINPUT_IDSINPUT_LENGTHSSAMPLE_MASKMETA_IDXDP_TRAIN_FIELDSSC_ROLLOUT_SCHEMA_FIELDSLP_SEED_FIELDSTEACHER_LP_FIELDSPPO_VALUE_FIELDSDP_VALUE_TRAIN_FIELDSVALUE_SEED_FIELDSDP_CALIB_INPUT_FIELDSROUTED_EXPERTS_FIELDPROMOTE_1D_FIELDSfields_with_optional_routed_experts()
- Module Contents
nemo_rl.data_plane.column_ionemo_rl.data_plane.observabilitynemo_rl.data_plane.worker_mixin- Module Contents
- Classes
- Functions
- Data
- API
FetchPolicy_broadcast_batched_data_dict()TQWorkerMixin_dp_clientsetup_data_plane()_require_dp_client()_get_replica_group()_pad_value_dict()_forward_pad_seqlen()_fetch()_apply_packing_prep()_attach_or_repack_pack_metadata()_local_coords()_is_replica_leader()_write_back()_write_back_result_field()train_presharded()get_logprobs_presharded()get_reference_policy_logprobs_presharded()get_teacher_logprobs_presharded()get_values_presharded()begin_train_step_presharded()train_microbatch_presharded()finish_train_step_presharded()abort_train_step_presharded()
- Module Contents
nemo_rl.data_plane.interfacesnemo_rl.data_plane.codecnemo_rl.data_plane.async_utilsnemo_rl.data_plane.factorynemo_rl.data_plane.driver_mixinnemo_rl.data_plane.preshard
- Package Contents
- Subpackages
nemo_rl.utils- Subpackages
nemo_rl.utils.checkpoint_engines- Submodules
nemo_rl.utils.checkpoint_engines.nixlnemo_rl.utils.checkpoint_engines.base
- Submodules
- Submodules
nemo_rl.utils.routed_experts_codecnemo_rl.utils.flops_formulas- Module Contents
- Classes
- Functions
- API
FLOPSConfiggbsenc_seq_lenhslayersffn_hsattention_headshead_dimmoe_router_topkquery_groupsimg_seq_lenimg_himg_win_channelspatch_dimclass_token_lenprojector_typeinp_smodel_patternvocab_sizemodel_channelsvec_in_dimq_lora_rankkv_lora_rankqk_head_dimqk_pos_emb_head_dimv_head_dimmoe_layer_freqmoe_shared_expert_intermediate_sizemoe_ffn_hidden_sizemtp_num_layerscausal_self_attnis_hybrid_modelhybrid_override_patternmamba_state_dimmamba_head_dimmamba_num_groupsmamba_num_headsdsa_indexer_n_headsdsa_indexer_head_dimdsa_indexer_topkdsa_indexer_compute_layers
gpt3()llama()nemotron()mixtral()qwen2()qwen3()bert()transformer()flux()_mla_projection_params()_moe_ffn_params()_mla_moe_linear_flops()_vocab_and_mtp_flops()deepseekv3()_causal_topk_pairs()glm_moe_dsa()_mlp_layer_flops()_non_mla_attn_layer_flops()_mamba_layer_flops()_hybrid_model_flops()nemotronh()
- Module Contents
nemo_rl.utils.prefetch_venvsnemo_rl.utils.weight_transfer_zmqnemo_rl.utils.packed_tensornemo_rl.utils.timernemo_rl.utils.confignemo_rl.utils.venvsnemo_rl.utils.native_checkpointnemo_rl.utils.flops_trackernemo_rl.utils.grad_normnemo_rl.utils.weight_transfer_sparse_codec- Module Contents
- Classes
- Functions
- Data
- API
NamedTensorTensorBatchSparseOperationSparseInfoTensorPayloadPreparedTensorPayloadSparseItem_INTEGER_DTYPE_BY_SIZE_TensorPayloadBuilderinteger_dtype_for_element_size()dtype_from_name()sparse_operation()integer_view()encode_sparse_infos()merge_sparse_payloads()sparse_locations_for_item()_encode_explicit_locations()DeltaCompressionTracker
- Module Contents
nemo_rl.utils.multimodal_payload_metrics- Module Contents
- Functions
- Data
- API
_PENDING_PAYLOAD_METRICS_PENDING_PAYLOAD_METRICS_LOCK_tensor_nbytes()_value_nbytes()_value_segment_count()_typed_content_media_nbytes()_typed_content_media_segment_count()protocol5_serialized_nbytes()collect_multimodal_payload_metrics()collect_sharded_multimodal_payload_metrics()merge_multimodal_payload_metrics()drain_multimodal_payload_metrics()print_multimodal_payload_metrics()
- Module Contents
nemo_rl.utils.memory_trackernemo_rl.utils.checkpoint- Module Contents
- Classes
- Functions
- Data
- API
PathLike_load_megatron_common_state_dict()validate_warm_start_checkpoint()PretrainedCheckpointConfigCheckpointingConfigCheckpointManagerget_resume_paths()init_tmp_checkpoint()_rename_checkpoint()finalize_checkpoint()begin_finalization()finalize_pending()shutdown()_warn_on_delete_failure()__enter__()__exit__()has_pending_finalizationremove_old_checkpoints()get_best_checkpoint_path()get_latest_checkpoint_path()load_training_info()
_load_checkpoint_history()
- Module Contents
nemo_rl.utils.r3_trace- Module Contents
- Functions
- Data
- API
_TRACE_ENV_TRACE_STEPS_ENV_TRACE_SAMPLES_ENV_TRACE_DIR_ENV_TRACE_MICROBATCHES_ENV_TRACE_VERIFY_FORWARD_ENV_DEFAULT_TRACE_DIR_DEFAULT_TRACE_STEPS_DEFAULT_TRACE_SAMPLES_DEFAULT_TRACE_MICROBATCHES_write_lock_patch_lock_router_replay_patch_depth_original_get_replay_topk_event_counts_contextr3_trace_enabled()r3_trace_verify_forward_enabled()_env_int()_trace_steps()_trace_samples()_trace_microbatches()_next_count()_should_trace_step()_current_context()_torch_rank_info()_trace_path()_write_record()_tensor_sha256()_tensor_preview()_tensor_record()_shape()_valid_sample_record()_length_at()_tensors_equal()_expected_with_missing_route_fallback()_router_replay_action_name()_trace_router_replay_topk_use()_verify_router_replay_forward_context()trace_rollout_payload()trace_tq_fetch_payload()r3_trace_stage()maybe_r3_trace_stage()trace_cp_routed_experts()trace_router_replay_assignment()trace_router_replay_action()
- Module Contents
nemo_rl.utils.fastokensnemo_rl.utils.weight_transfer_stream- Module Contents
- Classes
- Functions
- Data
- API
_STREAM_LOCAL_S3_PART_SIZE_S3_MEMORY_LIMITSparseRefitTransport_SparsePayloadBucket_s3_client()_S3ObjectStoresparse_payload_checksum()decode_sparse_payload()iter_sparse_weight_chunks()_get_manifest_s3_store()sparse_export_chunk_size()_executor()init_sparse_delta_baseline_from_iterator()stream_sparse_delta_payloads()stream_sparse_delta_payloads_via_s3_manifest()download_s3_refit_payload()zstd_compress()
- Module Contents
nemo_rl.utils.nsysnemo_rl.utils.nvmlnemo_rl.utils.logger- Module Contents
- Classes
- Functions
- Data
- API
_rich_logging_configuredWandbConfigSwanlabConfigTensorboardConfigMLflowConfigGPUMonitoringConfigLoggerConfigshould_log_nemo_gym_full_result_tables()LoggerInterfaceTensorboardLoggerWandbLoggerSwanlabLoggerGpuMetricSnapshotRayGpuMonitorLogger_merge_generation_logger_workers()_summarize_list()MLflowLoggerLoggerflatten_dict()configure_rich_logging()print_message_log_samples()get_next_experiment_dir()log_container_init_timing()
- Module Contents
nemo_rl.utils.weight_transfer_http
- Subpackages
nemo_rl.algorithms- Subpackages
nemo_rl.algorithms.loss- Submodules
nemo_rl.algorithms.loss.utilsnemo_rl.algorithms.loss.interfacesnemo_rl.algorithms.loss.wrappernemo_rl.algorithms.loss.loss_functions- Module Contents
- Classes
- Data
- API
TensorDraftCrossEntropyLossConfigDraftCrossEntropyLossDataDictDraftCrossEntropyLossFnClippedPGLossConfigdisable_ppo_ratiotoken_level_losssequence_level_importance_ratiosratio_clip_minratio_clip_maxratio_clip_creference_policy_kl_penaltyreference_policy_kl_typekl_input_clamp_valuekl_output_clamp_valueuse_kl_in_rewarduse_importance_sampling_correctiontruncated_importance_sampling_typetruncated_importance_sampling_ratiotruncated_importance_sampling_ratio_minuse_on_policy_kl_approximationforce_on_policy_ratiouse_cispopositive_example_nll_weight
ClippedPGLossDataDictClippedPGLossFnNLLLossFnPreferenceLossDataDictPreferenceLossFnDPOLossConfigDPOLossDataDictDPOLossFnDistillationLossConfigDistillationLossDataDictDistillationLossFnMseValueLossConfigMseValueLossFnCrossTokenizerDistillationLossConfiggold_lossxtoken_losstemperaturevocab_topkuncommon_topkreverse_klexact_token_match_onlykl_loss_weightce_loss_scaledynamic_loss_scalingkd_loss_modenormalize_teacher_by_vocabalphasum_weights_metricstudent_vocab_sizeteacher_vocab_sizesprojection_matrix_pathsteacher_weightsteacher_gold_lossteacher_xtoken_loss
CrossTokenizerDistillationLossDataDictCrossTokenizerDistillationLossFnloss_typeinput_type_teacher_is_same_vocab()__call__()_resolve_gold_xtoken()_compute_teacher_kd()_compute_same_vocab_kl()_direct_topk_kl()_direct_full_vocab_kl()_same_vocab_masked_kl()_sum_kd()_averaged_logits_kd()_dp_global_masked_mean()_select_teacher_kd()_teacher_score_inputs()_compute_dynamic_weights()_teacher_weight_score()_compute_p_kl()_compute_gold()_compute_ce()
- Module Contents
- Package Contents
- Submodules
nemo_rl.algorithms.x_token- Submodules
nemo_rl.algorithms.x_token.utilsnemo_rl.algorithms.x_token.token_aligner- Module Contents
- Classes
- Functions
- Data
- API
- Module Contents
nemo_rl.algorithms.x_token.loss_utils- Module Contents
- Classes
- Functions
- Data
- API
alignment_from_flat_batch()Fp32SparseMMchunk_log_prob_sums()chunk_average_finalize()chunk_average_log_probs()slice_sparse_projection_rows()slice_sparse_projection_cols()project_student_to_teacher_vocab()select_teacher_topk_indices()LocalizedAlignmentlocalize_alignment()student_next_token_ce()ce_label_mask()next_token_accuracy()collect_overlapping_teacher_shards()assemble_teacher_logits_from_shards()_try_zero_copy_teacher_logits()rebuild_teacher_full_logits_from_ipc()valid_chunk_mask()parse_projection_file()_SPARSE_PROJECTION_CACHE_TOPK_PROJECTION_CACHEget_sparse_projection_matrix()get_topk_projection()_EXACT_TOKEN_MAP_CACHEbuild_exact_token_map()prepare_xtoken_cross_tokenizer_loss_input()
- Module Contents
- Package Contents
- Submodules
nemo_rl.algorithms.single_controller_utils- Submodules
nemo_rl.algorithms.single_controller_utils.setup- Module Contents
- Classes
- Functions
- API
SingleControllerActorArgsgen_handletrainer_handleenv_handlestrain_clusterinference_clusterdp_clientdataloaderweight_synchronizeradvantage_estimatorloss_fnrollout_managertq_bufferpartition_idsave_statelast_checkpoint_pathdata_plane_checkpoint_metadatafleet_monitorgeneration_routerteacher_worker_groupsalias_to_group_aliasvalue_handlevalue_loss_fn
_maybe_restore_native_data_plane_checkpoint()_non_colocated_teacher_node_count()_build_clusters()_build_generation()_finish_deferred_generation()_build_trainer()_build_value()_spinup_gym()_generation_max_seq_len()_clamp_max_num_steps()_maybe_inject_megatron_train_iters()_maybe_attach_fleet_health()_shard_base_urls()_maybe_start_generation_router()_build_advantage_estimator()_build_retry_policy()setup_single_controller()
- Module Contents
nemo_rl.algorithms.single_controller_utils.utilsnemo_rl.algorithms.single_controller_utils.config- Module Contents
- Classes
- Functions
- Data
- API
NativeRolloutFTConfigNemoGymRolloutFTConfigRolloutFailureConfigFleetHealthConfig_GYM_RETRY_STATUSESGenerationRouterConfigWatchdogConfigAsyncRLConfigsamplerrollout_failurestall_watchdoggeneration_fleet_healthgeneration_routerrecompute_kv_cache_after_weight_updatesmin_groups_for_streaming_trainmax_inflight_promptsmax_buffered_rolloutsdiagnostics_reject_renamed_blocks()_check_router_deadline_fits_inside_the_rollout()_check_stall_watchdog_outlasts_rollouts()_reject_relocated_keys()
MasterConfigis_ppo_run()algo_config()validate_sampler_buffer_capacity()_validate_failure_settings()_validate_algo_settings()validate_single_controller_config()AdvantageConfig
- Module Contents
- Package Contents
- Submodules
nemo_rl.algorithms.async_utils- Submodules
nemo_rl.algorithms.async_utils.replay_buffer- Module Contents
- Classes
- Functions
- Data
- API
DATA_PLANE_CHECKPOINT_DIRREPLAY_BUFFER_METADATA_FILENAMELEGACY_REPLAY_BUFFER_FILENAMEREPLACEMENT_RESERVE_FILENAMEREPLAY_BUFFER_METADATA_SCHEMA_VERSIONREPLAY_BUFFER_METADATA_STORAGETQReplayGroupMetadataTQReplayMetadataStateDataPlaneCheckpointMetadatadata_plane_checkpoint_schema_versionsingle_controller_train_stepssingle_controller_trainer_versionsingle_controller_epochpartition_idsampler_namemodereplay_metadata_schema_versionreplay_manifest_digestreplay_group_countrollout_recovery_schema_versionrollout_recovery_payload_sha256rollout_recovery_group_count
_canonical_manifest_value()replay_manifest_digest()DataPlaneMutationCutDataPlaneCheckpointBarrierPostWriteEnrichmentErrorReplayBufferImpl_rollout_metrics_turn_count_for_diagnostics()add()get_debug_info()get_last_target_weight_already_generated()get_existing_target_weights()_remove_indices()sample()size()get_held_task_indices()clear()state_dict()save_to_path()load_from_path()load_state_dict()_prepare_for_training_step()_is_valid_for_target()_remove_stale_trajectories()_count_for_target()_truncate_to_max_size()get_trajectories_needed()has_complete_batch()_remove_incomplete_target_steps()
ReplayBufferTQReplayBuffer
- Module Contents
nemo_rl.algorithms.async_utils.staleness_sampler- Module Contents
- Classes
- Functions
- Data
- API
_GATE_POLL_SECONDSPromptGroupSamplerTransactionalAdmissionSamplerBaseSamplerWindowedSampler_gated_required_buffer_capacity()_GatedSamplerReadyFirstSamplerWeightFifoSamplerInOrderSamplerWindowedSamplerConfigReadyFirstSamplerConfigWeightFifoSamplerConfigInOrderSamplerConfigCustomSamplerConfigSamplerConfigrequired_buffer_capacity_for_config()_custom_sampler_class()_sampler_class_for_config()sampler_supports_buffer_checkpoint()create_sampler()
- Module Contents
nemo_rl.algorithms.async_utils.interfacesnemo_rl.algorithms.async_utils.trajectory_collector- Module Contents
- Classes
- Functions
- Data
- API
TokenizerType_MAX_NEMO_GYM_STREAM_RETRIES_NEMO_GYM_RETRY_DELAY_BASE_SECONDS_REPLAY_BUFFER_MAX_BACKOFF_SECONDS_WAKE_RETRY_INTERVAL_S_stamped_task_indices()_unanimous_task_index()AsyncTrajectoryCollector_calculate_target_weights()_get_next_target_for_generation()set_weight_version()set_generation_window()_should_pause_for_generation_limits()start_collection()is_data_exhausted()get_status()_mark_collection_failed()_collection_loop()_run_collection_loop()_stamp_task_indices()_capture_dataloader_state()_filter_covered_rows()get_checkpoint_dataloader_state()get_checkpoint_state()_process_batch()get_weight_version()check_health()pause()resume()prepare_for_refit()resume_after_refit()wait_for_pending_generations()get_dataloader_state()get_efficiency_metrics()flush_telemetry()_wake_waits()_drain_thread()_may_still_run()_join_until()drain_payload_metrics()_build_rollouts_state()get_rollouts_state()_cleanup_finished_threads()_release_target()_compute_teacher_logprobs()_iter_rollout_groups()_run_rollout_batch_worker()_build_task_index_map()_enqueue_rollout_group()_collect_rollout_batch()
- Module Contents
- Package Contents
- Submodules
- Submodules
nemo_rl.algorithms.rmnemo_rl.algorithms.utils- Module Contents
- Functions
- Data
- API
get_gdpo_reward_component_keys()calculate_kl()calculate_baseline_and_std_per_prompt()surpress_user_warnings()masked_mean()mask_out_neg_inf_logprobs()masked_var()set_seed()get_tokenizer()maybe_pad_last_batch()print_performance_metrics()log_generation_metrics()WALL_CLOCK_EFFICIENCY_CATEGORIESTHREAD_ACCUMULATED_EFFICIENCY_CATEGORIESEFFICIENCY_CATEGORIESRUN_WINDOW_WALL_CLOCK_CATEGORIESSTEP_WINDOW_WALL_CLOCK_CATEGORIESprint_efficiency_summary()
- Module Contents
nemo_rl.algorithms.distillationnemo_rl.algorithms.opd- Module Contents
- Classes
- Functions
- API
TeacherResourceConfigNonColocatedTeachersConfigOnPolicyDistillationConfig_opd_cfg()is_opd_enabled()is_non_colocated_teachers_enabled()_skip_prev_logprobs()assert_prev_logprobs_available()resolve_reference_aliases()get_teacher_routing_metrics()TQTeacherLogprobCoordinatorteacher_seq_pad_multiple()_validate_default_teacher_alias()reserve_teacher_clusters()create_teacher_worker_groups()
- Module Contents
nemo_rl.algorithms.xtoken_off_policy_distillationnemo_rl.algorithms.grpo- Module Contents
- Classes
- Functions
- Data
- API
TokenizerType_maybe_restore_async_replay_buffer_checkpoint()_save_async_replay_buffer_checkpoint()RewardScalingConfigAsyncGRPOConfigRewardPenaltyTokenIdsConfigRewardPenaltyConfig_REWARD_PENALTY_FLAGSGRPOConfignum_prompts_per_stepnum_generations_per_promptmax_num_epochsmax_num_stepsmax_rollout_turnsnormalize_rewardsadvantage_clip_lowadvantage_clip_highuse_leave_one_out_baselineval_periodval_start_atval_batch_sizeval_at_startval_at_endmax_val_samplesval_num_generations_per_promptstop_at_validation_metricstop_at_validation_thresholdskip_reference_policy_logprobs_calculationseedasync_grpooverlong_filteringuse_dynamic_samplingdynamic_sampling_max_gen_batchesbatch_multiplierreward_shapingreward_scalingcalculate_advantages_on_gpuseq_logprob_error_thresholdinvalid_tool_call_advantagemalformed_thinking_advantageadv_estimatordeduplicate_multimodal_datadebug_payload_metrics
GRPOSaveState_initial_grpo_save_state()_get_grpo_save_state()GRPOLoggerConfigMasterConfig_validate_multimodal_dedup_capability()_needs_hf_refit_handshake()shutdown_environments()setup()dynamic_sampling()scale_rewards()extract_initial_prompt_messages()add_grpo_token_loss_masks_and_generation_logprobs()_resolve_message_level_advantage_penalties()_raise_if_reward_penalties_enabled_without_nemo_gym()_apply_message_level_advantage_penalties()_apply_configured_message_level_advantage_penalties()_preserve_router_replay_routed_experts()_policy_dtype()_build_async_grpo_train_data()_apply_mask_sample_filter()_should_log_nemo_gym_responses()_write_latest_checkpoint_status()_get_effort_config()_pad_teacher_logprobs()_create_advantage_estimator()_clip_grpo_advantages()refit_policy_generation()_initial_policy_generation_stale()_log_mixed_rewards_and_advantages_information()_placeholder_seq_logprob_error_metrics()_validate_use_kl_in_reward_compat()_resolve_logprob_skip_flags()compute_and_apply_seq_logprob_error_masking()_validation_stop_value()_validation_early_stop_message()grpo_train()validate()aggregate_rollout_metrics()async_grpo_train()
- Module Contents
nemo_rl.algorithms.ppo- Module Contents
- Classes
- Functions
- Data
- API
TokenizerTypeAsyncPPOConfigPPOConfignum_prompts_per_stepnum_generations_per_promptmax_num_epochsmax_num_stepsmax_rollout_turnsval_periodval_batch_sizeval_at_startval_at_endmax_val_samplesskip_reference_policy_logprobs_calculationseedoverlong_filteringuse_dynamic_samplingdynamic_sampling_max_gen_batchesbatch_multiplierppo_epochsreward_shapingreward_scalingadv_estimatorpolicy_training_start_stepwarm_start_value_checkpointseq_logprob_error_thresholdasync_ppovalidate_async_warmup_settings()
PPOSaveState_default_ppo_save_state()_apply_ppo_seq_logprob_error_masking()PPOLoggerConfigMasterConfigsetup()dynamic_sampling()_create_advantage_estimator()_compute_critic_metrics()ppo_train()_async_ppo_generation_lead_steps()_async_ppo_buffer_max_age()async_ppo_train()validate()
- Module Contents
nemo_rl.algorithms.reward_functionsnemo_rl.algorithms.advantage_estimatornemo_rl.algorithms.metric_utils- Module Contents
- Classes
- Functions
- API
SetupTimingMetricsgeneration_init_time_sgeneration_init_reserve_time_sgeneration_init_load_time_spolicy_init_time_svalue_init_time_snemo_gym_init_time_scollective_init_time_sweight_sync_time_sparallel_wall_time_sparallel_init_enabledteacher_reservation_time_steacher_model_init_time_steacher_init_time_svllm_checkpoint_engine_init_time_stotal_setup_time_sworker_setup_time_sother_setup_time_sextrasto_metrics_dict()
print_setup_timing_summary()
- Module Contents
nemo_rl.algorithms.grpo_syncnemo_rl.algorithms.logits_sampling_utilsnemo_rl.algorithms.sftnemo_rl.algorithms.single_controller- Module Contents
- Classes
- Functions
- Data
- API
Generationlog_pooled_opd_metrics()SingleControllerActor_recovering_from_refitrun()ping()_maybe_restore_replay_buffer()_maybe_restore_rollout_recovery()_rehydrate_rollout_recovery_prompts()_admit_reserved_prompt_groups()_redispatch_restored_rollouts()_validate_replay_inventory()_maybe_restore_replacement_reserve()_ray_get()_call_dp()_clear_data_plane_samples()_save_data_plane_checkpoint()_rollout_pump()_divert_batch_to_reserve()_drain_reserve_into_steps()_take_replacement()_promote_into_step()_credit_shortfall()_target_groups_for_step()_train_pump()_stall_watchdog_pump()_gen_fleet_probe_pump()_probe_generation_fleet()_push_router_membership()_drain_router_failures()_stand_down_refit_deadline()_reconcile_refit_membership()_recovery_window()_recover_from_failed_refit()_promote_refit_shards()_check_env_health()_abort_stale_inflight()_save_checkpoint()_REFIT_UNWIND_GRACE_S_refit_await_budget_s()_sync_weights_within()_sync_weights()_value_stage()_value_train()_advantage_stage()_advantage_input_fields()_retune_lookahead_versions()
- Module Contents
nemo_rl.algorithms.dpo
- Subpackages
nemo_rl.telemetry- Submodules
nemo_rl.telemetry.setup- Module Contents
- Functions
- Data
- API
logger_TELEMETRY_HANDLE_TELEMETRY_INITIALISED_OTEL_PREFIX_OTEL_FALLBACK_PREFIX_RUN_ID_ENV_WORKER_GROUP_ENV_ENV_FIELD_MAP_SERVICE_NAME_ENV_is_env_truthy()telemetry_enabled_in_env()vllm_native_tracing_requested()_config_to_env()_dig()_build_resource_attributes()_always_export()_unrank()init_telemetry_driver()_worker_resource_attributes()init_telemetry_worker()get_telemetry_handle()shutdown_telemetry()
- Module Contents
nemo_rl.telemetry.span_groupsnemo_rl.telemetry.confignemo_rl.telemetry.instrumentation- Module Contents
- Classes
- Functions
- Data
- API
RL_BUCKET_ATTRRL_EFFICIENCY_CATEGORY_ATTR__all__BucketUMBRELLA_GROUPS_DEFAULT_GROUP_BUCKETEFFICIENCY_CATEGORY_BUCKETbucket_for_span_group()bucket_for_efficiency_category()COLLECTOR_LOOP_CATEGORIES_BUCKET_OVERRIDEbucket_scope()goodput_span_attributes()current_trace_carrier()remote_trace_context()managed_span()efficiency_span()trace_fn()
- Module Contents
nemo_rl.telemetry.metrics- Module Contents
- Functions
- Data
- API
logger_TRAIN_PREFIXES_scalar()RL_EFFICIENCY_SECONDS_METRICRL_EFFICIENCY_PCT_METRICRL_EFFICIENCY_MEASUREMENT_ATTRWALL_CLOCK_MEASUREMENTCOLLECTOR_WALL_CLOCK_MEASUREMENTTHREAD_SECONDS_MEASUREMENTRL_EFFICIENCY_WINDOW_ATTRSTEP_WINDOWRUN_WINDOW_RUN_WINDOW_WALL_CLOCK_CATEGORIES_EFFICIENCY_KEY_PREFIX_EFFICIENCY_SECONDS_SUFFIX_EFFICIENCY_PCT_KEY_EFFICIENCY_PCT_PER_STEP_KEY_EFFICIENCY_INSTRUMENTS_WARNEDwarn_once()efficiency_measurements()efficiency_window()map_efficiency_seconds()_get_efficiency_instruments()_tee_efficiency_metrics()tee_rl_metrics_to_otel()_tee_rl_metrics_to_otel()
- Module Contents
- Package Contents
- Submodules
nemo_rl.weight_sync- Submodules
nemo_rl.weight_sync.vllm_remote_sparse_weight_synchronizernemo_rl.weight_sync.ipc_weight_synchronizernemo_rl.weight_sync.sglang_weight_synchronizernemo_rl.weight_sync.collective_weight_synchronizernemo_rl.weight_sync.checkpoint_engine_confignemo_rl.weight_sync.xferdtensornemo_rl.weight_sync.interfacesnemo_rl.weight_sync.checkpoint_engine_weight_synchronizernemo_rl.weight_sync.nccl_reshard_weight_synchronizernemo_rl.weight_sync.nccl_reshard_utils- Module Contents
- Classes
- Functions
- Data
- API
MeshInfoRefitCtxLocalParamSpecHFToLocalParamMapRefitBuilderInterfaceCOLUMN_PARALLEL_SUFFIXESROW_PARALLEL_SUFFIXESget_tp_shard_dim()is_expert_param()FFN_PROJ_WEIGHT_SUFFIXESFFN_GROUPED_EXPERT_SUFFIXESis_nccl_reshard_param()_get_expert_tp_shard_dim()_STR_TO_DTYPE_restore_placement()make_nccl_reshard_refit_info_wire_safe()restore_refit_info_placements()build_mesh_info()get_placements()_INDIVIDUAL_EXPERT_REgroup_expert_params_in_metadata()_LAYER_RE_MODEL_PREFIX_RE_extract_layer_prefix()_extract_layer_name()check_nccl_reshard_refit_support()build_nccl_reshard_refit_info()
- Module Contents
nemo_rl.weight_sync.xferdtensor_python- Module Contents
- Functions
- Data
- API
_mesh_rank_tensor()_mesh_ranks()_mesh_signature()_mesh_coordinates()_normalize_shard_dim()_placement_signature()_validate_layout()_compute_shard_slices()_rank_regions()_intersect()_local_slices()_region_numel()_local_tensor()_tensor_metadata()_destination_groups()_build_exact_plan()_PLAN_CACHE_PLAN_CACHE_MAX_SIZE_plan_geometry()_SUBCOMM_CACHE_INACTIVE_SUBCOMM_CACHE_PROCESS_GROUP_COMM_IDS_PROCESS_GROUP_FINALIZERS_destroy_subcommunicator()_abort_subcommunicator()abort_xferdtensor_python_subcommunicators()_evict_communicators()_finalize_process_group()_parent_communicator_key()_active_replica_signature()_get_replica_subcommunicator()clear_xferdtensor_python_caches()_validate_local_inputs()_stage_rank_operations()_exchange_exact_overlaps()_broadcast_destination()_xferdtensor_python_impl_v1()_STRIPED_PLAN_CACHE_STRIPED_PLAN_CACHE_MAX_SIZE_ordered_replica_members()_build_striped_targets()_build_striped_transfers()_max_p2p_peer_degree()_region_view_is_contiguous()_remote_transfers_avoid_double_staging()_striped_geometry()_destination_buffer()_stage_striped_operations()_allgather_destination()xferdtensor_python_impl()__all__
- Module Contents
nemo_rl.weight_sync.megatron_weight_synchronizernemo_rl.weight_sync.factorynemo_rl.weight_sync.membership
- Package Contents
- Submodules
nemo_rl.evals
- Submodules
- Package Contents
- Subpackages