Index _ | A | B | C | D | E | F | G | H | I | J | K | L | M | N | O | P | Q | R | S | T | U | V | W | X | Y | Z _ __aenter__() (core.inference.apis.async_llm.MegatronAsyncLLM method) __aexit__() (core.inference.apis.async_llm.MegatronAsyncLLM method) __aiter__() (core.inference.async_stream.AsyncStream method) __all__ (in module core) (in module core.config_logger) (in module core.context_parallel) (in module core.distributed.fsdp.mcore_fsdp_adapter) (in module core.distributed.fsdp.src.megatron_fsdp) (in module core.distributed.fsdp.src.megatron_fsdp.experimental) (in module core.distributed.fsdp.src.megatron_fsdp.experimental.checkpoint) (in module core.distributed.fsdp.src.megatron_fsdp.experimental.placement) (in module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor) (in module core.fault_injector) (in module core.inference.apis) (in module core.inference.data_parallel_inference_coordinator) (in module core.inference.disaggregation.transfer_backends) (in module core.inference.sampling) (in module core.models.audio) (in module core.models.common.embeddings.relative_pos_embedding) (in module core.models.common.embeddings.rope_utils) (in module core.models.common.embeddings.rotary_pos_embedding) (in module core.models.mimo) (in module core.models.mimo.config) (in module core.models.mimo.model) (in module core.msc_utils) (in module core.resharding) (in module core.resharding.copy_services) (in module core.resharding.nvshmem_copy_service) (in module core.resharding.nvshmem_copy_service.core) (in module core.resharding.nvshmem_copy_service.memory) (in module core.resharding.nvshmem_copy_service.planning) (in module core.ssm.gated_delta_net) (in module core.ssm.ops) (in module core.ssm.ops.gdp) (in module core.tensor_parallel) (in module core.tensor_parallel.gtp_api) (in module core.tokenizers.text.libraries.tiktoken_tokenizer) (in module core.tokenizers.text.parsers) (in module core.transformer.custom_layers.batch_invariant_kernels) (in module core.transformer.mla_qk_norm_config) (in module core.transformer.moe.ops.paged_stash) __anext__() (core.inference.async_stream.AsyncStream method) __bool__() (core.inference.text_generation_controllers.text_generation_controller.DecodeOnly method) __call__() (core.distributed.distributed_data_parallel._BucketParamReadyCallback method) (core.full_cuda_graph.FullCudaGraphWrapper method) (core.full_cuda_graph.StaticBufferLoader method) (core.inference.headers._Headers method) (core.models.audio.audio_feature_config.NemoTransformerAudioTokenEstimator method) (core.models.gpt.gpt_model.GPTModel method) (core.models.hybrid.hybrid_model.HybridModel method) (core.optimizer.optimizer_config.ParamPredicate method) (core.optimizer.optimizer_config.ParamWithNamePredicate method) (core.optimizer.optimizer_cuda_graph.OptimizerCudaGraphWrapper method) (core.ssm.gated_delta_net.common.GatedDeltaRuleInterface method) (core.timers.Timers method) (core.transformer.attention.CoreAttentionBuilder method) (core.transformer.attention.LinearLayerBuilder method) (core.transformer.attention.LinearProjBuilder method) (core.transformer.attention.LinearQkvBuilder method) (core.transformer.cuda_graphs.CudaGraphManager method) (core.transformer.mlp.LinearFc1Builder method) (core.transformer.mlp.LinearFc2Builder method) (core.transformer.mlp.TEActivationFunctionBuilder method) (core.transformer.module.GraphableMegatronModule method) (core.transformer.moe.experts.GroupedLinearFc1Builder method) (core.transformer.moe.experts.GroupedLinearFc2Builder method) (core.transformer.moe.moe_layer.ExpertsBuilder method) (core.transformer.moe.moe_layer.RouterBuilder method) (core.transformer.moe.moe_layer.SharedExpertsBuilder method) (core.transformer.moe.paged_stash.PagedStashRunner method) (core.transformer.spec_utils.ModuleSpec method) (core.transformer.torch_norm.LayerNormBuilder method) (core.transformer.transformer_block.TransformerBlock method) (core.transformer.transformer_layer.HyperConnectionTransformerLayer method) (core.transformer.transformer_layer.MlpBuilder method) (core.utils._ValueWithRank method) (core.utils.StragglerDetector method) __config_logger_path_counts (in module core.config_logger) __contact_emails__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __contact_names__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __create_chunk_list__() (core.dist_checkpointing.strategies.checkpointable.CheckpointableShardedTensor method) (core.dist_checkpointing.strategies.checkpointable.LocalShardsContainer method) __create_write_items__() (core.dist_checkpointing.strategies.checkpointable.CheckpointableShardedTensor method) (core.dist_checkpointing.strategies.checkpointable.LocalShardsContainer method) __deepcopy__() (core.process_groups_config.ProcessGroupCollection method) __del__() (core.datasets.indexed_dataset._IndexReader method) (core.datasets.indexed_dataset._MMapBinReader method) (core.datasets.indexed_dataset._S3BinReader method) (core.datasets.indexed_dataset.IndexedDataset method) (core.models.common.utils.TransformerLayerNode method) (core.optimizer.optimizer_cuda_graph.OptimizerCudaGraphWrapper method) (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorPool method) __description__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __dir__() (core.msc_utils.MaybeMultiStorageClient method) __download_url__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __enter__() (core.datasets.indexed_dataset._IndexWriter method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.MultiGroupUBRAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ResetParametersContext method) (core.inference.apis.llm.MegatronLLM method) (core.nccl_allocator.MemPoolAllocatorWithoutRegistration method) (core.nccl_allocator.MultiGroupMemPoolAllocator method) (core.nccl_allocator.nccl_mem method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface method) (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) (core.transformer.moe.paged_stash.PagedStashContext method) (core.utils.StragglerDetector method) __eq__() (core.distributed.fsdp.src.megatron_fsdp.experimental.placement.BlockAtomic method) (core.distributed.fsdp.src.megatron_fsdp.experimental.placement.Flat method) (core.inference.batch_dimensions_utils.InferenceBatchDimensions method) (core.inference.contexts.static_context.StaticInferenceContext method) __exit__() (core.datasets.indexed_dataset._IndexWriter method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.MultiGroupUBRAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ResetParametersContext method) (core.inference.apis.llm.MegatronLLM method) (core.nccl_allocator.MemPoolAllocatorWithoutRegistration method) (core.nccl_allocator.MultiGroupMemPoolAllocator method) (core.nccl_allocator.nccl_mem method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface method) (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) (core.transformer.moe.paged_stash.PagedStashContext method) (core.utils.StragglerDetector method) __get_tensor_shard__() (core.dist_checkpointing.strategies.checkpointable.CheckpointableShardedTensor method) (core.dist_checkpointing.strategies.checkpointable.LocalShardsContainer method) __getattr__() (core.inference.headers._Headers method) (core.msc_utils.MaybeMultiStorageClient method) (core.process_groups_config.ProcessGroupCollection method) (in module core.models.bert.bert_layer_specs) __getitem__() (core.datasets.bert_dataset.BERTMaskedWordPieceDataset method) (core.datasets.blended_dataset.BlendedDataset method) (core.datasets.gpt_dataset.GPTDataset method) (core.datasets.gpt_dataset.MockGPTLowLevelDataset method) (core.datasets.indexed_dataset._IndexReader method) (core.datasets.indexed_dataset.IndexedDataset method) (core.datasets.megatron_dataset.MegatronDataset method) (core.datasets.multimodal_dataset.MockMultimodalDataset method) (core.datasets.t5_dataset.T5MaskedWordPieceDataset method) (core.inference.inference_request.DynamicInferenceRequestRecord method) (core.optimizer.optimizer.ProxyDict method) (core.parameter_names.CanonicalParameterNameMap method) (core.process_groups_config.MultiModuleProcessGroupCollection method) __getstate_() (core.rerun_state_machine.QuickStats method) __getstate__() (core.datasets.indexed_dataset.IndexedDataset method) (core.msc_utils._FeatureFlag method) __gt__() (core.utils._ValueWithRank method) __hash__() (core.inference.batch_dimensions_utils.InferenceBatchDimensions method) __homepage__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __iter__() (core.datasets.data_schedule.HybridCPDataLoaderWrapper method) (core.distributed.fsdp.src.megatron_fsdp.experimental.indexed_order.IndexedOrder method) (core.inference.headers._Headers method) (core.optimizer.optimizer.ProxyDict method) (core.parameter_names.CanonicalParameterNameMap method) (core.process_groups_config.MultiModuleProcessGroupCollection method) __keywords__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __len__() (core.datasets.blended_dataset.BlendedDataset method) (core.datasets.gpt_dataset.GPTDataset method) (core.datasets.gpt_dataset.MockGPTLowLevelDataset method) (core.datasets.indexed_dataset._IndexReader method) (core.datasets.indexed_dataset.IndexedDataset method) (core.datasets.masked_dataset.MaskedWordPieceDataset method) (core.datasets.megatron_dataset.MegatronDataset method) (core.optimizer.distrib_optimizer.Range method) (core.optimizer.optimizer.ProxyDict method) (core.parameter_names.CanonicalParameterNameMap method) (core.process_groups_config.MultiModuleProcessGroupCollection method) __license__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __LOGGER_NAME_STACK (in module core.dist_checkpointing.utils) __LOGGER_STACK (in module core.dist_checkpointing.utils) __lt__() (core.utils._ValueWithRank method) __new__() (core.dist_checkpointing.strategies.checkpointable.CheckpointableShardedTensor method) (core.dist_checkpointing.strategies.checkpointable.LocalShardsContainer method) (core.extensions.transformer_engine.TENorm method) (core.extensions.transformer_engine_spec_provider._TENormWithResidual method) (core.post_training.modelopt.layers.Norm method) (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) (core.transformer.torch_norm.WrappedTorchNorm method) (core.utils.StragglerDetector method) __next__() (core.datasets.data_schedule.HybridCPDataLoaderWrapper method) (core.inference.utils.Counter method) (core.rerun_state_machine.RerunDataIterator method) __package_name__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __post_init__() (core.context_parallel.layout.ContextParallelLayoutManager method) (core.datasets.bert_dataset.BERTMaskedWordPieceDatasetConfig method) (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig method) (core.datasets.gpt_dataset.GPTDatasetConfig method) (core.datasets.masked_dataset.MaskedWordPieceDatasetConfig method) (core.datasets.multimodal_dataset.MultimodalDatasetConfig method) (core.datasets.t5_dataset.T5MaskedWordPieceDatasetConfig method) (core.dist_checkpointing.mapping.ShardedObject method) (core.dist_checkpointing.mapping.ShardedTensor method) (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig method) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig method) (core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard.Placements method) (core.distributed.fsdp.src.megatron_fsdp.experimental.layout.GlobalLayout method) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout method) (core.distributed.fsdp.src.megatron_fsdp.experimental.schedule.SchedulePolicy method) (core.export.export_config.ExportConfig method) (core.inference.config.InferenceConfig method) (core.inference.config.MambaInferenceStateConfig method) (core.inference.disaggregation.kv_reshard.KVShardLayout method) (core.inference.disaggregation.ssm_reshard.SSMShardLayout method) (core.inference.inference_request.DynamicInferenceEvent method) (core.inference.inference_request.DynamicInferenceRequest method) (core.inference.inference_request.InferenceRequest method) (core.inference.sampling_params.SamplingParams method) (core.inference.shards_spec.InferenceShardSpec method) (core.model_parallel_config.ModelParallelConfig method) (core.models.mimo.config.base_configs.MimoModelConfig method) (core.optimizer.optimizer_config.OptimizerConfig method) (core.packed_seq_params.PackedSeqParams method) (core.process_groups_config.MultiModuleProcessGroupCollection method) (core.transformer.transformer_config.MLATransformerConfig method) (core.transformer.transformer_config.TransformerConfig method) __repository_url__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __repr__() (core.dist_checkpointing.strategies.checkpointable.CheckpointableShardedTensor method) (core.dist_checkpointing.strategies.checkpointable.LocalShardsContainer method) (core.distributed.fsdp.src.megatron_fsdp.experimental.placement.BlockAtomic method) (core.optimizer.distrib_optimizer.Range method) (core.process_groups_config.MultiModuleProcessGroupCollection method) (core.process_groups_config.ProcessGroupCollection method) (core.quantization.quant_config.GlobMatcher method) (core.quantization.quant_config.QuantizationConfig method) (core.quantization.quant_config.RecipeConfig method) (core.transformer.moe.paged_stash.PagedStashBuffer method) (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout method) __setattr__() (core.models.huggingface.module.HuggingFaceModule method) (core.process_groups_config.ProcessGroupHelperMeta method) __setitem__() (core.optimizer.optimizer.ProxyDict method) __setstate() (core.rerun_state_machine.QuickStats method) __setstate__() (core.datasets.indexed_dataset.IndexedDataset method) (core.msc_utils._FeatureFlag method) __shortversion__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) __str__() (core.dist_checkpointing.mapping.ShardedObject method) (core.inference.batch_dimensions_utils.InferenceBatchDimensions method) (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) (core.inference.contexts.static_context.StaticInferenceContext method) (core.inference.inference_request.DynamicInferenceEvent method) (core.inference.inference_request.DynamicInferenceRequest method) (core.optimizer.distrib_optimizer.Range method) (core.resharding.utils.ReshardPlan method) (core.transformer.cuda_graphs._CudaGraphRunner method) (core.utils._ValueWithRank method) __straggler__ (in module core.utils) __torch_dispatch__() (core.dist_checkpointing.strategies.checkpointable.CheckpointableShardedTensor class method) (core.dist_checkpointing.strategies.checkpointable.LocalShardsContainer class method) __torch_function__() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) __version__ (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) _ACTIVE_CAPTURE_COMM_STATE (in module core.tensor_parallel.gtp_cuda_graphs) _active_ddp_modules() (core.models.mimo.model.base.MimoModel method) _ACTIVE_OBSERVER (in module core.tensor_observation) _active_submodules() (core.models.mimo.model.base.MimoModel method) _adaptive_muon_config_to_kwargs() (in module core.optimizer.emerging_optimizers) _add_request() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _add_scales_to_converter() (core.export.trtllm.trtllm_helper.TRTLLMHelper method) _add_to_trtllm_model_weights() (core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter.DistributedTRTLLMModelWeightsConverter method) _adjust_key_value_for_inference() (core.transformer.attention.Attention method) _admit_pending_kv_imports() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _ag_stream_ids (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) _AG_STREAMS (in module core.tensor_parallel.generalized_tensor_parallelism) _aggregate() (core.transformer.moe.moe_logging.MoEMetricsTracker method) _align_temporal_token_counts_to_placeholders() (in module core.models.multimodal.llava_model) _all_gather() (core.tensor_parallel.inference_layers.InferenceColumnParallelLinear method) (core.tensor_parallel.inference_layers.InferenceLayerNormColumnParallelLinear method) _all_gather_along_batch_dim() (in module core.models.mimo.comm.colocated_communicator) _all_gather_backward_summary() (in module core.ssm.context_parallel.chunkwise) _all_gather_forward_summary() (in module core.ssm.context_parallel.chunkwise) _all_gather_param_group_metadata() (in module core.optimizer.layer_wise_optimizer) _all_gather_tensor() (core.optimizer.emerging_optimizers.TensorParallelMuon static method) (in module core.ssm.context_parallel.chunkwise) _all_gather_unpacked_summary() (in module core.ssm.context_parallel.chunkwise) _all_gather_unsharded_transpose_weights() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) _all_gather_weight() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _all_gather_weight_on_demand() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _all_grids_colocated() (core.models.mimo.config.role.RankRole static method) _ALL_LAYER_SCOPE_TAGS (in module core.tensor_parallel.generalized_tensor_parallelism) _ALL_STATES (in module core.inference.data_parallel_inference_coordinator.state) _all_to_all_cp2hp() (in module core.ssm.mamba_context_parallel) _all_to_all_hp2cp() (in module core.ssm.mamba_context_parallel) _AllGatherFromTensorParallelRegion (class in core.tensor_parallel.mappings) _alloc (in module core.inference.unified_memory) _alloc_storage() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _alloc_symmetric_wgrad_buffer() (in module core.tensor_parallel.generalized_tensor_parallelism) _allocate() (core.inference.symmetric_memory.SymmetricMemoryBuffer method) _allocate_buffer() (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightCache method) _allocate_mamba_cache() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _allocate_mamba_states() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _allocate_memory() (core.transformer.attention.Attention method) _allocate_memory_buffer() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _allocate_mtp_decode_blocks() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _allocate_recv_buffer() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) _allocator (in module core.allocator.vmm_symm_allocator) (in module core.nccl_allocator) _allreduce_conditional_embedding_grads() (in module core.distributed.finalize_model_grads) _allreduce_embedding_grad() (in module core.distributed.finalize_model_grads) _allreduce_layernorm_grads (in module core.distributed.finalize_model_grads) _allreduce_non_tensor_model_parallel_grads() (in module core.distributed.finalize_model_grads) _allreduce_position_embedding_grads() (in module core.distributed.finalize_model_grads) _allreduce_replicated_grads_over_gtp_remat_group() (in module core.distributed.finalize_model_grads) _allreduce_router_grads() (in module core.distributed.finalize_model_grads) _allreduce_word_embedding_grads() (in module core.distributed.finalize_model_grads) _AllToAll (class in core.tensor_parallel.mappings) _annotate_tensor_parallelism() (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV1 method) _append_kv_cache_kernel() (in module core.inference.contexts.fused_kv_append_kernel) _append_state_for_tool() (core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming.StreamingChatParser method) _apply_aux_loss() (core.transformer.moe.router.TopKRouter method) _apply_bias() (core.transformer.moe.experts.TEGroupedMLP static method) _apply_chat_template_sync() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _apply_chat_template_to_text() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _apply_colocated_comms() (core.models.mimo.model.base.MimoModel method) _apply_cudagraph_buffer_metadata() (in module core.transformer.cuda_graphs) _apply_expert_bias() (core.transformer.moe.router.TopKRouter method) _apply_fla_backward() (in module core.ssm.context_parallel.gdp) _apply_gated_norm() (core.ssm.gated_delta_net.common._GDNBase method) _apply_global_aux_loss() (core.transformer.moe.router.TopKRouter method) _apply_h_post() (core.transformer.hyper_connection.HyperConnectionModule method) _apply_image_tag() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _apply_linear() (in module core.tensor_parallel.inference_layers) _apply_mixer_bda() (core.ssm.mamba_layer.MambaLayer method) _apply_mlp_bda_step() (core.transformer.transformer_layer.HyperConnectionTransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) _apply_output_gate() (core.transformer.attention.Attention method) _apply_packed_bias() (core.transformer.moe.experts.TEGroupedMLP static method) _apply_prompt_preparation_error() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _apply_rotary_pos_emb_bshd() (in module core.models.common.embeddings.rope_utils) _apply_rotary_pos_emb_thd() (in module core.models.common.embeddings.rope_utils) _apply_scaling() (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) _apply_self_attn_bda_step() (core.transformer.transformer_layer.HyperConnectionTransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) _apply_seq_aux_loss() (core.transformer.moe.router.TopKRouter method) _apply_sink_softmax_correction_bshd() (core.transformer.attention.Attention static method) _apply_sink_softmax_correction_varlen() (core.transformer.attention.Attention static method) _apply_stop_word_finished_ids() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _apply_temporal_grouping() (core.models.vision.radio.RADIOViTModel method) _apply_tile_tagging() (core.models.multimodal.llava_model.LLaVAModel method) _arg_value_changed() (in module core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference) _as_parts() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer static method) _as_per_peer_tensors() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator static method) _assert_coordinator() (core.inference.apis._llm_base._MegatronLLMBase method) _assert_primary() (core.inference.apis._llm_base._MegatronLLMBase method) _assert_shard_index_matches_group() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _assign_iterations() (core.resharding.nvshmem_copy_service.planning.communication_scheduler.CommunicationScheduler method) _ASYNC_IO_LOOP (in module core.utils) _ASYNC_TASK_STATS (in module core.utils) _AsyncScheduleLogProbsGPUResult (class in core.inference.text_generation_controllers.text_generation_controller) _AsyncScheduleLogProbsTransfer (class in core.inference.text_generation_controllers.text_generation_controller) _AsyncScheduleRequestResult (class in core.inference.text_generation_controllers.text_generation_controller) _AsyncScheduleSampleResult (class in core.inference.text_generation_controllers.text_generation_controller) _attach_by_fqn() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor) _attach_dcp_hooks() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor) _attach_mixin() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) _attach_modality_split_sizes() (core.models.mimo.model.base.MimoModel method) _attention_pair_count() (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioModel method) _audio_clip_to_float32() (in module core.models.audio.audio_processor) _AUDIO_DURATION_MISMATCH_TOLERANCE_SECONDS (in module core.models.audio.audio_processor) _audio_num_sample_tolerance() (in module core.models.audio.audio_processor) _AUTO_TP_MODES (in module core.optimizer.emerging_optimizers) _autotune_warning_issued (in module core.ssm.ops.common.determinism) _await_notifs() (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) _axis_index() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) _AxisPlacements (class in core.distributed.fsdp.mcore_fsdp_adapter) _BACKEND_INFO_LOGGED (in module core.fusions.fused_mhc_kernels) _backend_uses_cutile() (in module core.fusions.fused_mhc_kernels) _backend_uses_triton() (in module core.fusions.fused_mhc_kernels) _backfill_gtp_sharded_param_map() (in module core.optimizer.optimizer) _backup_grads_before_capture() (in module core.transformer.cuda_graphs) _backward() (core.pipeline_parallel.utils.ScheduleNode method) _backward_in_proj() (core.ssm.gated_delta_net.common._GDNBase method) _backward_kv_proj() (core.transformer.multi_latent_attention.MLASelfAttention method) _backward_out_proj() (core.ssm.gated_delta_net.common._GDNBase method) _backward_output_proj() (core.transformer.attention.SelfAttention method) (core.transformer.multi_latent_attention.MLASelfAttention method) _backward_packed_tensor() (in module core.ssm.context_parallel.gdp_cutedsl) _backward_q_proj() (core.transformer.multi_latent_attention.MLASelfAttention method) _backward_qkv_proj() (core.transformer.attention.SelfAttention method) _BackwardDWWrapper (class in core.models.common.utils) _BackwardStreamWait (class in core.transformer.moe.shared_experts) _base_backend_name() (in module core.models.gpt.gpt_layer_specs) _BASE_VIEW_NAME (in module core.hyper_comm_grid) _BaseDataParallel (class in core.distributed.data_parallel_base) _batch_dim (core.pipeline_parallel.bridge_communicator.BridgeCommunicator property) _BATCH_INVARIANT_BACKEND (in module core.transformer.custom_layers.batch_invariant_kernels) _BATCH_INVARIANT_BACKENDS (in module core.transformer.custom_layers.batch_invariant_kernels) _BATCH_INVARIANT_COLLECTIVE (in module core.transformer.custom_layers.batch_invariant_kernels) _batch_invariant_LIB (in module core.transformer.custom_layers.batch_invariant_kernels) _batch_invariant_MODE (in module core.transformer.custom_layers.batch_invariant_kernels) _batch_invariant_mode_enabled() (in module core.inference.batch_dimensions_utils) _batch_invariant_te_grouped_dgrad() (in module core.transformer.custom_layers.batch_invariant_kernels) _batch_invariant_te_grouped_forward() (in module core.transformer.custom_layers.batch_invariant_kernels) _batch_invariant_te_grouped_wgrad() (in module core.transformer.custom_layers.batch_invariant_kernels) _batch_invariant_token_align() (in module core.inference.batch_dimensions_utils) _batched_p2p_ops() (in module core.pipeline_parallel.p2p_communication) _begin_transfer() (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend method) _bf16_grouped_gemm_aligned_contiguous() (in module core.transformer.custom_layers.batch_invariant_kernels) _bf16_grouped_gemm_contiguous() (in module core.transformer.custom_layers.batch_invariant_kernels) _bf16_grouped_gemm_wgrad_contiguous() (in module core.transformer.custom_layers.batch_invariant_kernels) _bf16_grouped_mm() (in module core.inference.moe.fused_moe) _BF16_TYPES (in module core.transformer.module) _bias_dropout_add_func() (in module core.fusions.fused_bias_dropout) _bind_reuseport_socket() (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) _BinReader (class in core.datasets.indexed_dataset) _block_atomic_to_flat() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) _block_hashes() (core.inference.inference_client.InferenceClient method) _block_scale_interleave() (in module core.inference.moe.flashinfer_mxfp8) _bmm_chunk_fwd() (in module core.ssm.ops.mamba2.ssd_bmm) _bmm_chunk_fwd_kernel() (in module core.ssm.ops.mamba2.ssd_bmm) _bridge_comm_dtype() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) _bridge_pg_cache (core.pipeline_parallel.bridge_communicator.BridgeCommunicator attribute) _broadcast_forward_tensor() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _broadcast_pg_cache (core.pipeline_parallel.bridge_communicator.BridgeCommunicator attribute) _broadcast_to_engines() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _broadcast_unique_id() (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) _BT_LIST (in module core.ssm.ops.gdp.common) _bucket_group_gradient_reduce() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.GradReducePipeline method) _bucket_is_managed_by_layer_wise_optimizer() (in module core.optimizer.layer_wise_optimizer) _BucketParamReadyCallback (class in core.distributed.distributed_data_parallel) _buf_bytes() (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightCache static method) _buffer (in module core.transformer.moe.fused_a2a) _buffer_distribution_for_strategy() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _buffer_link_table_row() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam class method) _buffers (core.inference.moe.vllm_fused_moe.VllmFusedMoeBuffers attribute) (core.inference.symmetric_memory.SymmetricMemoryManager attribute) _build_async_sched_request_state() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _build_async_sched_step_result() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _build_attention_mask_and_position_ids() (core.inference.model_inference_wrappers.gpt.gpt_inference_wrapper.GPTInferenceWrapper method) _build_b1ss_attention_mask() (core.datasets.t5_dataset.T5MaskedWordPieceDataset static method) _build_blended_dataset_splits() (core.datasets.blended_megatron_dataset_builder.BlendedMegatronDatasetBuilder method) _build_bridge_comms() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) _build_callable_nodes() (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan method) _build_chunk_metadata() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor) _build_colocated_communicators() (core.models.mimo.model.base.MimoModel method) _build_concatenated_mxfp8_weights() (core.transformer.moe.experts.InferenceGroupedMLP method) _build_concatenated_weights() (core.transformer.moe.experts.InferenceGroupedMLP method) _build_default_pg_collection() (in module core.pipeline_parallel.schedules) _build_descriptors_for_param() (in module core.resharding.planner) _build_document_index() (in module core.datasets.gpt_dataset) _build_document_sample_shuffle_indices() (core.datasets.gpt_dataset.GPTDataset method) _build_error (in module core.allocator.vmm_symm_allocator) _build_execution_batch_ids() (in module core.resharding.planner) _build_expert_mesh_and_placements() (in module core.distributed.fsdp.mcore_fsdp_adapter) _build_final_state_grad() (in module core.ssm.context_parallel.gdp) _build_fixed_max_pool() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.MaxPoolAllocator method) _build_fsdp_parameters() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) _build_gather_groups() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator static method) _build_gbuf_range_map() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _build_global_layer_prefixes() (in module core.parameter_names) _build_group_rank_by_logical_rank() (in module core.context_parallel.layout) _build_gtp_replica_fold() (in module core.optimizer.layer_wise_optimizer) _build_head_perm_for_split_sections() (in module core.ssm.gated_delta_net.common) _build_hybrid_dp_mesh() (in module core.distributed.fsdp.mcore_fsdp_adapter) _build_indices() (core.datasets.blended_dataset.BlendedDataset method) _build_initial_state() (in module core.ssm.context_parallel.gdp) _build_key_size_numel_dictionaries() (in module core.tensor_parallel.data) _build_layer_module_prefix_map() (in module core.resharding.utils) _build_layer_schedule_plan() (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan method) _build_layers() (core.transformer.multi_token_prediction.MultiTokenPredictionBlock method) (core.transformer.transformer_block.TransformerBlock method) _build_layout_redistribution_plan() (in module core.context_parallel.layout) _build_matchers() (core.quantization.quant_config.RecipeConfig static method) _build_megatron_dataset_splits() (core.datasets.blended_megatron_dataset_builder.BlendedMegatronDatasetBuilder method) _build_megatron_datasets_parallel() (core.datasets.blended_megatron_dataset_builder.BlendedMegatronDatasetBuilder method) _build_mhc_recompute_layer_plan() (core.models.hybrid.hybrid_block.HybridStack method) _build_model_and_main_param_groups() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _build_model_gbuf_param_range_map() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _build_model_gbuf_range() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _build_model_param_gbuf_map() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _build_model_param_to_state_dict_param_map() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _build_nccl_allocator() (in module core.nccl_allocator) _build_nemotron6_moe_native_tool_boundary_mask() (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _build_num_microbatches_calculator() (in module core.num_microbatches_calculator) _build_optimizer_group_ranges() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _build_or_get_plan() (in module core.resharding.refit) _build_packed_seq_params() (core.models.mimo.model.base.MimoModel method) (in module core.context_parallel.utils) _build_param_to_name() (core.parameter_names.CanonicalParameterNameMap static method) _build_plan_cache_key() (in module core.resharding.refit) _build_rank_mappings() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) _build_rank_module_info_map() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) _build_sample_index() (core.datasets.masked_dataset.MaskedWordPieceDataset method) _build_shard_distribution() (in module core.dist_checkpointing.exchange_utils) _build_shared_experts() (in module core.models.gpt.moe_module_specs) _build_shuffle_index() (in module core.datasets.gpt_dataset) _build_tables() (in module core.inference.headers) _build_tensor_reshard_specs() (in module core.resharding.planner) _build_thd_cp_a2a_perm() (in module core.ssm.gated_delta_net.common) _build_thd_cp_layout_plan_from_rank_order_indices() (in module core.context_parallel.layout) _build_thd_padding_mask() (in module core.datasets.data_schedule) _build_thd_zigzag_metadata() (in module core.context_parallel.layout) _build_vision_partition_units() (in module core.models.multimodal.context_parallel) _build_vlm_request() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _build_vmm_allocator() (in module core.allocator.vmm_symm_allocator) _build_zero_projection_anchor() (core.models.multimodal.llava_model.LLaVAModel method) _BYTES_PER_ELEMENT (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightCache attribute) _cache (core.transformer.moe.moe_utils.RandomSTEShared attribute) _cache_vision_embedding() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _cached_execution_batches (core.resharding.utils.ReshardPlan attribute) _calculate_cuda_graph_token_counts() (core.inference.batch_dimensions_utils.CUDAGraphBatchDimensionBuilder static method) _calculate_memory_size() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorPool static method) _calculate_num_segments() (core.resharding.nvshmem_copy_service.planning.task_segmenter.TaskSegmenter method) _calculate_token_counts_linear() (core.inference.batch_dimensions_utils.CUDAGraphBatchDimensionBuilder static method) _call_inner_layer() (core.models.hybrid.layers.hybrid_hyper_connection.HyperConnectionHybridLayer method) _call_inner_transformer_layer_without_local_bda() (core.models.hybrid.layers.hybrid_hyper_connection.HyperConnectionHybridLayer method) _can_allocate() (core.inference.symmetric_memory.SymmetricMemoryBuffer method) _can_manage_tensor_for_offload() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler static method) _can_schedule_chunked_prefill() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _can_schedule_non_chunked_prefill() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _canonical_parameter_name() (in module core.parameter_names) _canonical_pg_key_and_enum_view() (core.hyper_comm_grid.HyperCommGrid method) _capture_handoff_meta() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _cast_value() (core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter.SingleDeviceTRTLLMModelWeightsConverter method) _cat_rope() (in module core.models.vision.vit_model) _causal_conv1d_carry_states_kernel() (in module core.ssm.ops.common.causal_conv1d_varlen) _causal_conv1d_varlen_kernel() (in module core.ssm.ops.common.causal_conv1d_varlen) _causal_conv1d_varlen_simple() (in module core.ssm.ops.common.causal_conv1d_varlen) _causal_conv1d_version (in module core.utils) _causal_disallow_mask() (in module core.models.audio.nemo_transformer_encoder) _causal_window_size() (in module core.models.audio.nemo_transformer_encoder) _ceil_div() (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioModel static method) (in module core.inference.moe.activations) (in module core.inference.moe.permute) (in module core.inference.moe.vllm_fused_moe) (in module core.inference.quantization.mxfp8_quantize) (in module core.inference.quantization.mxfp8_tensor) _cg_admission_check() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _cg_admission_gating_active() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _CG_MEMPOOL (in module core.tensor_parallel.gtp_cuda_graphs) _CG_MEMPOOL_DEVICE (in module core.tensor_parallel.gtp_cuda_graphs) _chain_is_graphed() (in module core.tensor_parallel.generalized_tensor_parallelism) _chain_is_grouped() (in module core.tensor_parallel.generalized_tensor_parallelism) _chain_state (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam attribute) _check_and_set() (core.optimizer_param_scheduler.OptimizerParamScheduler method) _check_data_types() (in module core.tensor_parallel.data) _check_divisible() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) _check_mamba_sequence_packing_support() (in module core.ssm.mamba_mixer) _check_mesh_ranks_and_group_ranks_are_consistent() (in module core.distributed.fsdp.mcore_fsdp_adapter) _check_module_parameter_types() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _check_nan() (core.models.audio.nemo_transformer_encoder.TransformerEncoder method) _check_nan_in_grad() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _check_stop_words_for_request_post_append() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _check_supported_type() (in module core.transformer.cuda_graphs) _check_toggle() (core.utils.StragglerDetector method) _checkpointed_attention_forward() (core.transformer.attention.Attention method) _checkpointed_forward() (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) _chunk_cumsum_fwd() (in module core.ssm.ops.mamba2.ssd_chunk_state) _chunk_cumsum_fwd_kernel() (in module core.ssm.ops.mamba2.ssd_chunk_state) _chunk_scan_fwd() (in module core.ssm.ops.mamba2.ssd_chunk_scan) _chunk_scan_fwd_kernel() (in module core.ssm.ops.mamba2.ssd_chunk_scan) _chunk_state_fwd() (in module core.ssm.ops.mamba2.ssd_chunk_state) _chunk_state_fwd_kernel() (in module core.ssm.ops.mamba2.ssd_chunk_state) _chunk_state_varlen_kernel() (in module core.ssm.ops.mamba2.ssd_chunk_state) _chunkwise_packed_metadata() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _clamped_relu() (in module core.inference.moe.activations) _classify_param_chain() (in module core.tensor_parallel.generalized_tensor_parallelism) _clean_metadata_for_serialization() (in module core.dist_checkpointing.utils) _clear_input_id_padding() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _clear_intermediate_state() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) _clip_kv_proj_weight() (core.transformer.multi_latent_attention.MLASelfAttention method) _clip_linear_qkv() (core.transformer.attention.SelfAttention method) _CLIP_MEAN (in module core.models.vision.encoder_registry) _clip_q_proj_weight() (core.transformer.multi_latent_attention.MLASelfAttention method) _CLIP_STD (in module core.models.vision.encoder_registry) _clone_nested_tensors() (in module core.transformer.cuda_graphs) _coerce_arguments_mapping() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _coerce_to_token_id_list() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _collect_all_batches() (core.resharding.nvshmem_copy_service.planning.communication_scheduler.CommunicationScheduler method) _collect_backward_order() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module) _collect_commit_data() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) _collect_failed_requests() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _collect_finished_handoff_state() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _collect_fsdp_children() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module) _collect_main_grad_data_for_unscaling() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) _collect_original_tensor_info() (core.post_training.modelopt.layers.RealQuantTransformerLayer method) _collect_owned_parameters() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module) _collect_parameter_metadata() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup static method) _colocated() (core.models.mimo.config.role.RankRole class method) _ColocatedCommunicate (class in core.models.mimo.comm.colocated_communicator) _columnwise_scale_layout() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) _comm_records (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) _COMM_STREAM (in module core.pipeline_parallel.utils) _commit_mamba_intermediate_states() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _CommitSegments (class in core.inference.text_generation_controllers.mtp_controller_mixin) _communicate() (core.pipeline_parallel.p2p_communication.P2PCommunicator method) _communicate_shapes() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) (core.pipeline_parallel.p2p_communication.P2PCommunicator method) _COMP_STREAM (in module core.pipeline_parallel.utils) _compact_async_sched_logits() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _compare_floats() (in module core.rerun_state_machine) _compilation_error (in module core.inference.unified_memory) _compilation_state (in module core.inference.unified_memory) _compile_timeout() (in module core.inference.unified_memory) _compiled_topk_routing() (core.transformer.moe.router.InferenceTopKRouter static method) _complete_handoff_request_without_forward() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _complete_parameter() (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService static method) _complete_request() (core.inference.engines.dynamic_engine.DynamicInferenceEngine static method) _compute_backward_fragment_summary() (in module core.ssm.context_parallel.gdp) _compute_bias() (core.models.common.embeddings.relative_pos_embedding.RelativePositionEmbedding method) _compute_block_hashes() (core.inference.inference_request.DynamicInferenceRequest method) _compute_default_per_buffer_param_layout() (in module core.distributed.param_and_grad_buffer) _compute_file_hash() (in module core.dist_checkpointing.validation) _compute_fragment_summary() (in module core.ssm.context_parallel.gdp) _compute_gates() (core.ssm.gated_delta_net.common._GDNBase method) (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) (core.ssm.gated_delta_net.gdn2.GatedDeltaNet2 method) _compute_gating() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _compute_grad_norms_by_group() (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) _compute_h() (core.transformer.hyper_connection.HyperConnectionModule method) _compute_loss_scale() (in module core.pipeline_parallel.schedules) _compute_mhc_block_end_plan() (core.models.hybrid.hybrid_block.HybridStack method) _compute_mtp_acceptance_counts() (in module core.transformer.multi_token_prediction) _compute_num_frames_from_num_samples() (core.models.audio.audio_processor.NemoAudioProcessor method) _compute_nvfp4_packed_layout() (core.distributed.param_and_grad_buffer._ParamAndGradBuffer method) _compute_per_buffer_param_layout() (core.optimizer.distrib_optimizer.DistributedOptimizer static method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer static method) _compute_pid() (in module core.transformer.custom_layers.batch_invariant_kernels) _compute_prefix_match() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _compute_serial_mtp_and_sample() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _compute_serial_mtp_and_sample_impl() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _compute_shards_access() (in module core.dist_checkpointing.validation) _compute_token_balanced_split_points() (in module core.models.multimodal.context_parallel) _compute_tubelet_aware_split_points() (in module core.models.multimodal.context_parallel) _concat_embeddings() (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) _configure_global_num_microbatches_calculator() (in module core.num_microbatches_calculator) _configured (core.utils.StragglerDetector attribute) _connect_with_inference_coordinator() (core.inference.inference_client.InferenceClient method) _CONTAINING_PARAMETER_GROUP_ATTR (in module core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group) _CONTENT_METADATA_KEY (in module core.dist_checkpointing.serialization) _context (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _CONTEXT_PARALLEL_GLOBAL_RANKS (in module core.parallel_state) _CONTEXT_PARALLEL_GROUP (in module core.parallel_state) _controller() (core.utils.StragglerDetector method) _CONV_BANDS (in module core.inference.disaggregation.ssm_reshard) _convert_cp_layout() (core.context_parallel.layout.ContextParallelLayoutManager method) _convert_non_transformer_layer() (core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter.DistributedTRTLLMModelWeightsConverter method) (core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter.SingleDeviceTRTLLMModelWeightsConverter method) _convert_param_value() (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser method) _convert_to_moe_state_dict() (in module core.transformer.moe.upcycling_utils) _convert_transformer_layer() (core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter.DistributedTRTLLMModelWeightsConverter method) (core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter.SingleDeviceTRTLLMModelWeightsConverter method) _CoordinatorRuntime (class in core.inference.apis._llm_base) _copy_async_sched_accepted_counts_to_cpu() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _copy_async_sched_log_probs_to_cpu() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _copy_async_sched_sample_to_cpu() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _copy_back_extra_main_grads() (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) _copy_intermediate_to_cache() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) _copy_main_params_to_model_params() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) _copy_main_params_to_param_buffer() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _copy_model_grads_to_main_grads() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) _copy_model_params_to_main_params() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) _CopyToModelParallelRegion (class in core.tensor_parallel.mappings) _count_local_tokens_kernel() (in module core.inference.moe.permute) _count_local_tokens_kernel_persistent() (in module core.inference.moe.permute) _count_moe_layers() (core.transformer.moe.moe_logging.MoEMetricsTracker static method) _cpu_offloading_context (core.model_parallel_config.ModelParallelConfig attribute) _create_cudagraphs() (core.transformer.cuda_graphs._CudagraphGlobalRecord class method) _create_emerging_optimizer() (in module core.optimizer.emerging_optimizers) _create_hfsdp_helper_buffer() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _create_masked_lm_predictions() (core.datasets.masked_dataset.MaskedWordPieceDataset method) _create_mel_filterbank() (in module core.models.audio.nemo_audio_preprocessing) _create_or_validate_out() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) _create_pg_dist_cache() (in module core.dist_checkpointing.exchange_utils) _csa_compressor (in module core.models.hybrid.hybrid_layer_specs) _csa_indexer (in module core.models.hybrid.hybrid_layer_specs) _csa_qk_norm (in module core.models.hybrid.hybrid_layer_specs) _ctypes_lib (in module core.inference.unified_memory) _ctypes_lock (in module core.inference.unified_memory) _cuda_graph_mempool_bytes() (in module core.inference.engines.dynamic_engine) _CUDA_GRAPH_MODULES (in module core.tensor_parallel.generalized_tensor_parallelism) _CUDA_GRAPH_STREAM_NEXT_SLOT (in module core.transformer.cuda_graphs) _CUDA_GRAPH_STREAM_POOL_SIZE (in module core.transformer.cuda_graphs) _CUDA_GRAPH_STREAM_POOLS (in module core.transformer.cuda_graphs) _CUDA_RNG_STATE_TRACKER (in module core.tensor_parallel.random) _CUDA_RNG_STATE_TRACKER_INITIALIZED (in module core.tensor_parallel.random) _CUDA_UCX_TRANSPORTS (in module core.resharding.copy_services.nixl_copy_service) _CudagraphGlobalRecord (class in core.transformer.cuda_graphs) _CudagraphRecordNode (class in core.transformer.cuda_graphs) _CudagraphReplayNode (class in core.transformer.cuda_graphs) _CudaGraphRunner (class in core.transformer.cuda_graphs) _CUTILE_AVAILABLE (in module core.fusions.fused_mhc_kernels) _CUTILE_DEVICE_SUPPORT_CACHE (in module core.fusions.fused_mhc_kernels) _CUTILE_DEVICE_SUPPORT_ERROR (in module core.fusions.fused_mhc_kernels) _CUTILE_EXPERIMENTAL_AVAILABLE (in module core.fusions.fused_mhc_kernels) _cutile_supports_current_device() (in module core.fusions.fused_mhc_kernels) _DATA_PARALLEL_GLOBAL_RANKS (in module core.parallel_state) _DATA_PARALLEL_GLOBAL_RANKS_WITH_CP (in module core.parallel_state) _DATA_PARALLEL_GROUP (in module core.parallel_state) _DATA_PARALLEL_GROUP_GLOO (in module core.parallel_state) _DATA_PARALLEL_GROUP_WITH_CP (in module core.parallel_state) _DATA_PARALLEL_GROUP_WITH_CP_GLOO (in module core.parallel_state) _DATA_PARALLEL_GROUP_WITH_CP_WITH_GTP_REMAT (in module core.parallel_state) _DATA_PARALLEL_GROUP_WITH_GTP_REMAT (in module core.parallel_state) _DATA_PARALLEL_PLACEMENTS (in module core.distributed.fsdp.mcore_fsdp_adapter) _DATA_PARALLEL_RNG_TRACKER_NAME (in module core.tensor_parallel.random) _dbuffer_chunk_metadata() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor) _decode_avdecoder() (in module core.models.audio.audio_processor) _decode_conv() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _decode_kv_lookahead_tokens (core.inference.contexts.mtp_context_mixin.MTPContextMixin property) _decode_next() (core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer.HuggingFaceFastIncrementalDetokenizer method) _decode_sampled_video_frames() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) _DECODER_LAYER_KEY_RE (in module core.dist_checkpointing.gpt_checkpoint_interop) _DECODER_LAYER_RE (in module core.transformer.moe.router_trace) _decoder_sample_rate() (in module core.models.audio.audio_processor) _deepep_permute_pads_grouped_tensor_input() (in module core.transformer.moe.moe_utils) _DeepepManager (class in core.transformer.moe.token_dispatcher) _DEEPGEMM_M_ALIGNMENT (in module core.transformer.custom_layers.batch_invariant_kernels) _deepgemm_m_alignment() (in module core.transformer.custom_layers.batch_invariant_kernels) _default_adam_based_eopt_config_to_kwargs() (in module core.optimizer.emerging_optimizers) _default_if_trivial() (core.transformer.mla_qk_norm_config.QKNormConfigResolver class method) _DEFAULT_LOG_RANKS (in module core._rank_utils) _DEFAULT_MAX_GROUP_BYTES (in module core.resharding.copy_services.nccl_m2n_copy_service) _DEFAULT_MEDIA_CACHE_AFFINITY_MAX_ENTRIES (in module core.inference.data_parallel_inference_coordinator.coordinator) _default_param_overrides_factory() (in module core.optimizer.emerging_optimizers) _default_size_mb (core.inference.symmetric_memory.SymmetricMemoryManager attribute) _defer_loading_sharded_items() (in module core.dist_checkpointing.strategies.fully_parallel) _defer_loading_sharded_objects() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelLoadStrategyWrapper static method) _defer_loading_sharded_tensors() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelLoadStrategyWrapper static method) _delete_buffers() (core.inference.moe.vllm_fused_moe.VllmFusedMoeBuffers class method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher class method) _DEPRECATED_ATTENTION_VARIANT_ALIASES (in module core.models.gpt.experimental_attention_variant_module_specs) _deregister_blocks() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) _detect_expert_index_from_param_name() (in module core.resharding.utils) _detect_nixl_variant() (in module core.inference.disaggregation.transfer_backends.nixl) _detect_parallelism_type() (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV1 method) _detect_vlm_from_checkpoint() (in module core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference) _determine_missing_and_unexpected_keys() (in module core.dist_checkpointing.validation) _determine_source_ranks_for_dst_param() (in module core.resharding.planner) _deterministic_override (in module core.ssm.ops.common.determinism) _disable_deferred_mxfp8_param_sync() (core.optimizer.optimizer.ChainedOptimizer method) _disable_saved_tensors_observer() (core.transformer.cuda_graphs._CudagraphGlobalRecord class method) _disable_te_native_workspace_starvation() (in module core.transformer.custom_layers.batch_invariant_kernels) _DISALLOWED_CHAT_TEMPLATE_KWARGS (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _discard_outputs() (core.tensor_parallel.random.CheckpointWithoutOutput method) _discover_layers() (core.transformer.cuda_graphs.TECudaGraphHelper method) (core.transformer.cuda_graphs.VisionTECudaGraphHelper method) _DispatchManager (class in core.transformer.moe.token_dispatcher) _do_local_copies() (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) _double_buffer_parity() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _download() (core.tokenizers.text.libraries.megatron_hf_tokenizer.MegatronHFTokenizer method) _drain_deferred_kv_handoffs() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _drain_handoff_completion_notifications() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _drain_offload_pending() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) _dsa_linear_or_default() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _dtype_size() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _dynamic_patch_grid() (in module core.models.vision.vit_model) _dynamic_patch_grid_lists() (in module core.models.vision.vit_model) _dynamic_step_calculate_log_probs() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_calculate_log_probs_speculative() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_calculate_top_n_logprobs() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_calculate_top_n_logprobs_speculative() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_context_bookkeeping() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_context_init() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_forward_logits() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_log_probs_bookkeeping() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_sample_logits() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _dynamic_step_sample_logits_and_verify_tokens() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _EMBEDDING_GLOBAL_RANKS (in module core.parallel_state) _EMBEDDING_GROUP (in module core.parallel_state) _EMERGING_OPTIMIZERS (in module core.optimizer.emerging_optimizers) _emerging_optimizers_version (in module core.utils) _emit_kv_event() (core.inference.contexts.dynamic_context.DynamoHelper method) _emit_lcm_block_ops() (in module core.resharding.planner) _empty_encoder_output() (core.models.mimo.model.base.MimoModel method) _enable_deferred_mxfp8_param_sync() (core.optimizer.optimizer.ChainedOptimizer method) _enable_saved_tensors_observer() (core.transformer.cuda_graphs._CudagraphGlobalRecord class method) _enable_te_native_workspace_starvation() (in module core.transformer.custom_layers.batch_invariant_kernels) _encode_segment_id() (core.resharding.nvshmem_copy_service.planning.task_segmenter.TaskSegmenter method) _encode_with_markers() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _enforce_double_buffer_limit() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.GradReducePipeline method) _engine_reply_frames() (in module core.inference.engines.dynamic_engine) _enqueue_parameter() (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) _ensure_bootstrap() (core.transformer.moe.token_dispatcher._NCCLEPManager method) _ensure_buffer_allocated() (core.inference.contexts.routing_metadata.RoutingMetadata method) _ensure_cuda_ucx_transports() (in module core.resharding.copy_services.nixl_copy_service) _ensure_generator_state_is_cudagraph_safe() (in module core.transformer.cuda_graphs) _ensure_initialized() (core.resharding.copy_services.nvshmem_copy_service.NVSHMEMCopyService method) _ensure_main_grad() (core.transformer.moe.experts.TEGroupedMLP static method) _ensure_main_grad_for_fused_impl() (core.transformer.moe.experts.TEGroupedMLP method) _ensure_nccl_connected() (core.resharding.copy_services.nccl_copy_service.NCCLCopyService method) _ensure_no_shared_buffer_with() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _ensure_peer_registered() (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend method) _ensure_sendable() (in module core.resharding.transforms) _enter_decode() (core.inference.contexts.mtp_metadata.MTPMetadata method) _eopt_init_state_fn() (in module core.optimizer.emerging_optimizers) _ep_establish_consensus() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _ep_max_tokens() (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher class method) _ERROR_NAMES (core.rerun_state_machine.RerunErrorInjector attribute) _estimate_config_cost() (in module core.ssm.ops.common.determinism) _estimate_encoder_steps() (core.models.audio.audio_feature_config.NemoTransformerAudioTokenEstimator method) _EventLoopManager (class in core.inference.apis._llm_base) _evict_lru_slots_batch() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) _evictable_block_ids() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) _exchange_initial_states() (in module core.ssm.causal_conv1d) _exchange_workload_summaries() (core.resharding.nvshmem_copy_service.planning.communication_scheduler.CommunicationScheduler method) _execute_batch() (in module core.resharding.execution) _execute_pending_mamba_ops() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _expand_cu_seqlens() (in module core.ssm.context_parallel.gdp) _expand_quantized_param_shard_for_cast() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _EXPERT_DATA_PARALLEL_GROUP (in module core.parallel_state) _EXPERT_DATA_PARALLEL_GROUP_GLOO (in module core.parallel_state) _EXPERT_DATA_PARALLEL_GROUP_WITH_GTP_REMAT (in module core.parallel_state) _EXPERT_GTP_REMAT_RNG_TRACKER_NAME (in module core.tensor_parallel.random) _EXPERT_GTP_WEIGHT_REMAT_GLOBAL_RANKS (in module core.parallel_state) _EXPERT_GTP_WEIGHT_REMAT_GROUP (in module core.parallel_state) _EXPERT_MODEL_PARALLEL_GROUP (in module core.parallel_state) _EXPERT_MODEL_PARALLEL_RANKS (in module core.parallel_state) _EXPERT_PARALLEL_RNG_TRACKER_NAME (in module core.tensor_parallel.random) _EXPERT_PARAM_RE (in module core.resharding.utils) _EXPERT_PARAMETER_NAME_PATTERN (in module core.extensions.transformer_engine) _EXPERT_TENSOR_AND_MODEL_PARALLEL_GROUP (in module core.parallel_state) _EXPERT_TENSOR_MODEL_PIPELINE_PARALLEL_GROUP (in module core.parallel_state) _EXPERT_TENSOR_MODEL_PIPELINE_PARALLEL_GROUP_WITH_EGTP (in module core.parallel_state) _EXPERT_TENSOR_PARALLEL_GROUP (in module core.parallel_state) _EXPERT_WEIGHT_GROUPS (core.transformer.moe.experts.InferenceGroupedMLP attribute) _expert_weights_use_mxfp8() (core.transformer.moe.experts.InferenceGroupedMLP method) _expire_rank_hashes() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _extend_by_fsdp_units() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) _extend_by_prefetch_size() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) _extra_args_for_layer() (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan method) _extract_common_per_param_step() (core.optimizer.optimizer.MegatronOptimizer static method) _extract_declared_types() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _extract_from_cache() (core.datasets.indexed_dataset._S3BinReader method) _extract_grad_scaler() (in module core.models.mimo.optimizer) _extract_hidden_state() (core.transformer.moe.router_trace.RouterTracer method) _extract_media_url_bytes() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _extract_member() (in module core.models.audio.nemo_audio_checkpoint) _extract_module_metadata() (in module core.resharding.planner) _extract_multimodal_from_messages() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _extract_parallelism_info() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) _extract_param_groups() (in module core.models.mimo.optimizer) _extract_param_state_sharding_type() (in module core.models.mimo.optimizer) _extract_te_gemm_args() (in module core.transformer.custom_layers.batch_invariant_kernels) _extract_token_ids() (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer static method) _fa_version (in module core.utils) _fail_submission() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _failure_message() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) _FaultInjectorRNG (class in core.fault_injector) _FeatureFlag (class in core.msc_utils) _FileBinReader (class in core.datasets.indexed_dataset) _fill_expert_block_ids_kernel() (in module core.inference.moe.vllm_fused_moe) _fill_in_deferred_sharded_items() (in module core.dist_checkpointing.strategies.fully_parallel) _filter_and_reorder_param_groups() (core.optimizer.optimizer.MegatronOptimizer static method) _filter_by_ep_local_rank() (in module core.resharding.utils) _filter_configs_by_block_sizes() (in module core.ssm.ops.common.determinism) _filter_grads_for_norm() (core.optimizer.optimizer.MegatronOptimizer method) _finalize_and_validate() (in module core.inference.shards_spec) _finalize_dp_transfers() (in module core.resharding.planner) _finalize_kv_handoff_import() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _finalize_mhc_recompute_layer() (core.models.hybrid.hybrid_block.HybridStack static method) _find_cached_handoff_prefix() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _find_cg_chunk_size() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _find_kv_match_count() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _find_mamba_match_count() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _find_nemotron6_moe_assistant_indices() (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _find_source_metadata() (in module core.resharding.planner) _find_submodule() (in module core.transformer.moe.upcycling_utils) _fine_grained_recurse_module_types() (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV1 static method) _finish() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferHandle method) _finish_capturing() (core.transformer.cuda_graphs.TECudaGraphHelper method) (core.transformer.cuda_graphs.VisionTECudaGraphHelper method) _finish_init_quantization() (core.models.mimo.model.base.MimoModel method) _finish_param_sync_for_bucket_group() (core.distributed.distributed_data_parallel.DistributedDataParallel method) _finish_reason() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) _flash_attention_3_forward_wrapper() (core.transformer.attention.Attention method) _flash_attn_func() (in module core.models.audio.nemo_transformer_encoder) _flashinfer_forward() (core.transformer.moe.experts.InferenceGroupedMLP method) _flashinfer_version (in module core.utils) _FLOAT_TYPES (in module core.transformer.module) _flush_records_to_disk() (core.transformer.moe.router_trace.RouterTracer method) _fold_replica_id() (in module core.optimizer.layer_wise_optimizer) _fork_rng() (in module core.tensor_parallel.random) _format() (core.transformer.moe.moe_logging.MoEMetricsTracker static method) _forward() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) (core.pipeline_parallel.utils.ScheduleNode method) (core.transformer.moe.router.InferenceTopKRouter method) _forward_all_modules() (core.models.mimo.model.base.MimoModel method) _forward_attention() (core.transformer.transformer_layer.TransformerLayer method) _forward_encoders() (core.models.mimo.model.base.MimoModel method) _forward_impl() (core.tensor_parallel.layers.ColumnParallelLinear method) (core.tensor_parallel.layers.RowParallelLinear method) _forward_language_module() (core.models.mimo.model.base.MimoModel method) _forward_mlp() (core.transformer.transformer_layer.MoETransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) _forward_mlp_expert_compute() (core.transformer.transformer_layer.MoETransformerLayer method) _forward_mlp_output_with_bias() (core.transformer.transformer_layer.TransformerLayer method) _forward_mlp_postprocess() (core.transformer.transformer_layer.MoETransformerLayer method) _forward_mlp_router() (core.transformer.transformer_layer.MoETransformerLayer method) _forward_normal() (core.transformer.hyper_connection.HyperConnectionModule method) _forward_packed_tensor() (in module core.ssm.context_parallel.gdp_cutedsl) _forward_pre_mlp_layernorm() (core.transformer.transformer_layer.TransformerLayer method) _forward_self_attention_output_with_bias() (core.transformer.transformer_layer.TransformerLayer method) _forward_with_checkpoint() (core.transformer.hyper_connection.HyperConnectionModule method) _fp8_create_transpose_cache_fallback() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) _fp8_quantize_fallback() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) _free_storage() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _FRESH_INIT_SYMBOLS (in module core.dist_checkpointing.gpt_checkpoint_interop) _from_grid_map() (core.models.mimo.config.role.RankRole class method) _from_planes() (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer class method) _FSDP_CONTEXT (in module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) _fsdp_modules (core.models.huggingface.clip_model.SiglipHuggingFaceModel attribute) (core.models.huggingface.qwen_model.QwenHuggingFaceModel attribute) _FULL_ITERATION (in module core.tensor_parallel.generalized_tensor_parallelism) _function() (core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming.StreamingChatParser static method) _fused_forward() (core.transformer.moe.experts.TEGroupedMLP method) _fused_grouped_swiglu_forward() (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) _fused_grouped_swiglu_no_comm() (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) _fused_h_res_h_post_bda_native() (core.transformer.hyper_connection.HyperConnectionModule method) _fused_h_res_h_post_bda_with_checkpoint() (core.transformer.hyper_connection.HyperConnectionModule method) _fused_metadata_kernel() (in module core.inference.moe.metadata) _fused_moe_kernel() (in module core.inference.moe.vllm_fused_moe) _FusedMLARoPEInplace (class in core.fusions.fused_mla_yarn_rope_apply) _FusedMLARoPEKVSplit (class in core.fusions.fused_mla_yarn_rope_apply) _gated_norm_and_a2a() (core.ssm.gated_delta_net.common._GDNBase method) _gather_along_first_dim() (in module core.tensor_parallel.mappings) _gather_along_last_dim() (in module core.tensor_parallel.mappings) _gather_along_second_dim() (in module core.models.multimodal.context_parallel) _gather_buffer_identity() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _gather_shards_metadata() (in module core.dist_checkpointing.exchange_utils) _GatherFromModelParallelRegion (class in core.tensor_parallel.mappings) _GatherFromSequenceParallelRegion (class in core.tensor_parallel.mappings) _GDNBase (class in core.ssm.gated_delta_net.common) _gdp_chunk_forward() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _gelu_tanh() (in module core.models.vision.encoder_registry) _gen_rank_enum() (core.hyper_comm_grid.HyperCommGrid method) _gen_rank_enum_for() (core.hyper_comm_grid.HyperCommGrid method) _generate_impl() (core.inference.apis._llm_base._MegatronLLMBase method) _generate_tool_call_id() (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser method) _get() (core.distributed.param_and_grad_buffer._ParamAndGradBuffer method) _get_a2a_overlap_stream() (core.models.hybrid.shortcut_block.ShortcutMoEBlock class method) _get_activation_func() (in module core.inference.moe.fused_moe) _get_all_ranks_time_string() (core.timers.Timers method) _get_all_rng_states() (in module core.tensor_parallel.random) _get_amax_reduction_group() (core.transformer.cuda_graphs.TECudaGraphHelper method) _get_and_clear_stop_word_finished_ids() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _get_arguments_config() (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser method) _get_async_sched_rows_requiring_new_block() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _get_available_models_list() (core.tokenizers.text.libraries.megatron_hf_tokenizer.MegatronHFTokenizer method) _get_backend_spec_provider() (in module core.models.gpt.experimental_attention_variant_module_specs) _get_batch_invariant_decoder() (core.ssm.mamba_mixer.MambaMixer method) _get_batch_on_this_cp_rank_contiguous() (in module core.context_parallel.utils) _get_batch_on_this_cp_rank_padded_zigzag() (in module core.context_parallel.utils) _get_batch_on_this_cp_rank_per_document_balancing() (in module core.utils) _get_batch_on_this_cp_rank_per_sequence_balancing() (in module core.utils) _get_batch_size_and_seq_len() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) _get_batch_size_for_samples() (core.num_microbatches_calculator.StepBatchsizeNumMicroBatchesCalculator method) _get_block_submodules() (in module core.transformer.transformer_block) _get_buffers() (core.ssm.ops.mamba2.batch_invariant_decode.MambaBatchInvariantDecode method) _get_cache_key() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _get_cached_vision_embedding() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _get_cached_vision_entry() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _get_chain_state() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam class method) _get_config() (in module core.transformer.moe.upcycling_utils) _get_conv_checkpoint_split_layout() (in module core.ssm.gated_delta_product) _get_ctypes_lib() (in module core.inference.unified_memory) _get_cuda_graph_input_data() (core.transformer.cuda_graphs.TECudaGraphHelper method) _get_cuda_graph_stream() (in module core.transformer.cuda_graphs) _get_cuda_rng_state() (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.tensor_parallel.random) _get_custom_recipe() (in module core.fp8_utils) _get_decode_A_neg_exp() (core.ssm.mamba_mixer.MambaMixer method) _get_decode_only_log_state() (in module core.inference.engines.dynamic_engine) _get_default_config() (in module core.inference.moe.vllm_fused_moe) _get_dense_mlp_module_spec() (in module core.models.gpt.experimental_attention_variant_module_specs) _get_distribution() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict static method) _get_dp_buffer_shard_bucket_index() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _get_dp_tp_mesh() (in module core.distributed.fsdp.mcore_fsdp_adapter) _get_elapsed_time_all_ranks() (core.timers.Timers method) _get_embeddings() (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) _get_empty_tensor_for_exchange() (in module core.dist_checkpointing.exchange_utils) _get_energy() (core.energy_monitor.EnergyMonitor method) _get_execution_batches() (in module core.resharding.execution) _get_experimental_attention_variant_loss_scale_func() (in module core.pipeline_parallel.schedules) _get_extra_state_offsets() (in module core.transformer.utils) _get_extra_te_kwargs() (in module core.extensions.transformer_engine) _get_field() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _get_filesystem_reader() (in module core.dist_checkpointing.strategies.torch) _get_filesystem_writer() (in module core.dist_checkpointing.strategies.torch) _get_fp8_autocast_for_quant_params() (in module core.extensions.transformer_engine) _get_fp8_autocast_for_quant_recipe() (in module core.extensions.transformer_engine) _get_fp8_model_init_for_quant_params() (in module core.extensions.transformer_engine) _get_fp8_model_init_for_quant_recipe() (in module core.extensions.transformer_engine) _get_fp8_params_and_shard_fp32_from_fp8() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _get_fsdp_tensor_spec() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _get_function_calls() (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser method) _get_fused_grouped_swiglu_recipe() (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) _get_gated_delta_product_mamba_layer_spec() (in module core.models.hybrid.hybrid_layer_specs) _get_gbuf_name() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.FixedPoolAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.MaxPoolAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.RotaryBucketAllocator method) _get_global_min_max_time() (core.timers.Timers method) _get_global_min_max_time_string() (core.timers.Timers method) _get_global_seqlens_and_ids() (in module core.datasets.data_schedule_utils) _get_grad_norm_for_group() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) _get_group_rank_by_logical_rank() (in module core.context_parallel.layout) _get_grouped_quantized_members() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _get_grouped_quantized_recipe() (in module core.fp8_utils) _get_gtp_symm_pool() (in module core.tensor_parallel.gtp_symmetric_memory) _get_host_valid_tokens_estimate() (core.transformer.moe.token_dispatcher_inference.InferenceAllGatherDispatcherBase class method) _get_hsdp_tp_mesh() (in module core.distributed.fsdp.mcore_fsdp_adapter) _get_hybrid_stack_local_spec() (in module core.post_training.modelopt.hybrid.model_specs) _get_in_proj_checkpoint_split_layout() (in module core.ssm.gated_delta_product) _get_inference_softmax_offset() (core.transformer.attention.Attention method) _get_item_local_index() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) _get_item_local_shard_index() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) _get_item_slice_in_shard() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) _get_keys_endswith() (in module core.transformer.moe.upcycling_utils) _get_layer() (core.transformer.transformer_block.TransformerBlock method) _get_layer_offset() (core.transformer.transformer_layer.TransformerLayer static method) _get_layout_parallel_context() (in module core.context_parallel.layout) _get_local_expert_offset() (in module core.parameter_names) _get_ltor_masks_and_position_ids() (in module core.datasets.gpt_dataset) _get_main_grad_attr() (in module core.distributed.finalize_model_grads) _get_main_param_and_optimizer_states() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _get_megatron_emerging_optimizer() (in module core.optimizer) _get_megatron_optimizer_based_on_param_groups() (in module core.optimizer) _get_merges_file() (core.tokenizers.text.libraries.megatron_hf_tokenizer.MegatronHFTokenizer method) _get_metadata_path() (in module core.tokenizers.megatron_tokenizer) _get_mlp_module_spec() (in module core.models.gpt.gpt_layer_specs) (in module core.models.vision.vit_layer_specs) _get_model_and_main_params_data_float16() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) _get_model_param_range_map() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _get_moe_loss_scale() (in module core.pipeline_parallel.schedules) _get_moe_module_spec() (in module core.models.gpt.experimental_attention_variant_module_specs) _get_mtp_block_submodules() (in module core.transformer.multi_token_prediction) _get_mtp_loss_scale() (in module core.pipeline_parallel.schedules) _get_non_none() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _get_num_epochs() (core.datasets.gpt_dataset.GPTDataset method) _get_num_moe_experts() (in module core.parameter_names) _get_num_non_spatial_embeddings() (in module core.models.vision.clip_vit_model) _get_num_sms() (in module core.inference.moe.permute) _get_num_spatial_embeddings() (in module core.models.vision.clip_vit_model) _get_num_tokens_per_epoch() (core.datasets.gpt_dataset.GPTDataset method) _get_nvfp4_params_and_shard_fp32_from_nvfp4() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _get_offloading_interface() (in module core.models.hybrid.shortcut_block) (in module core.transformer.transformer_layer) _get_or_create_bridge_pg() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator class method) _get_or_create_broadcast_pg() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator class method) _get_owned_range() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) _get_parallel_config() (in module core.resharding.refit) _get_param_grad_norm_group() (in module core.optimizer.optimizer) _get_param_groups() (core.optimizer.optimizer.MegatronOptimizer method) (in module core.optimizer) _get_param_groups_and_buffers() (in module core.optimizer) _get_parameter_groups() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _get_paused_request_count_within_block_budget() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _get_pool_key() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorPool method) _get_pos_embeddings() (core.models.vision.radio.RADIOViTModel method) _get_position_embedding_weight() (in module core.distributed.finalize_model_grads) _get_pp_layer_offset_for_inference() (core.transformer.attention.Attention method) _get_precomputed_embeddings() (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) _get_prefetched_weight() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _get_qkv_split_shapes() (in module core.optimizer.emerging_optimizers) _get_quantized_accumulator() (in module core.resharding.execution) _get_rank_in_group() (in module core.resharding.utils) _get_recompute_chain_state() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam class method) _get_recompute_prefetched_weight() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _get_reduce_op() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer) _get_releasable_block_counts() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _get_remove_vocab_padding() (core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter.DistributedTRTLLMModelWeightsConverter method) _get_replica_id() (in module core.models.mimo.optimizer) _get_rng_state_dict() (in module core.distributed.fsdp.mcore_fsdp_adapter) _get_rsv_tensor() (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher class method) _get_sample_arguments() (core.transformer.cuda_graphs.TECudaGraphHelper method) (core.transformer.cuda_graphs.VisionTECudaGraphHelper method) _get_save_and_finalize_callbacks() (core.dist_checkpointing.strategies.torch.TorchDistSaveShardedStrategy method) _get_self_attention_module_spec() (in module core.models.gpt.experimental_attention_variant_module_specs) _get_share_storage() (in module core.tensor_parallel.random) _get_shared_word_embedding_weight() (in module core.distributed.finalize_model_grads) _get_should_context_be_quantized_params() (in module core.extensions.transformer_engine) _get_should_context_be_quantized_recipe() (in module core.extensions.transformer_engine) _get_size_per_split_per_dataset() (in module core.datasets.blended_megatron_dataset_builder) _get_state() (core.optimizer.optimizer.MegatronOptimizer method) _get_state_key_dtype() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _get_states_from_cache() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_mixer.MambaMixer method) _get_sub_optimizer_param_groups() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _get_submodules_under_cudagraphs() (core.transformer.module.GraphableMegatronModule method) (core.transformer.transformer_layer.HyperConnectionTransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) _get_te_cuda_graph_replay_args() (core.transformer.module.GraphableMegatronModule method) (core.transformer.transformer_layer.TransformerLayer method) _get_te_dot_product_attention() (in module core.models.audio.nemo_transformer_encoder) _get_te_native_grouped_workspace() (in module core.transformer.custom_layers.batch_invariant_kernels) _get_tensor_alias_chain() (in module core.transformer.cuda_graphs) _get_thd_freqs_on_this_cp_rank() (in module core.models.common.embeddings.rope_utils) _get_thd_token_idx() (in module core.fusions.fused_mla_yarn_rope_apply) _get_tileiras_path() (in module core.fusions.fused_mhc_kernels) _get_token_dispatcher_attrs() (core.transformer.transformer_layer.MoETransformerLayer method) _get_token_mask() (core.datasets.bert_dataset.BERTMaskedWordPieceDataset method) (core.datasets.masked_dataset.MaskedWordPieceDataset method) (core.datasets.t5_dataset.T5MaskedWordPieceDataset method) _get_tokenizer_model_class() (in module core.tokenizers.megatron_tokenizer) _get_tool_argument_schemas() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _get_topology() (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) _get_training_instruments() (in module core.telemetry.training_metrics) _get_triton_h_aggregate_fwd() (in module core.fusions.fused_mhc_kernels) _get_triton_h_post_bda_bwd() (in module core.fusions.fused_mhc_kernels) _get_triton_h_post_bda_fwd() (in module core.fusions.fused_mhc_kernels) _get_triton_sinkhorn() (in module core.fusions.fused_mhc_kernels) _get_trtllm_config() (core.export.trtllm.trtllm_helper.TRTLLMHelper method) _get_trtllm_pretrained_config_and_model_weights_in_distributed_setting() (core.export.trtllm.trtllm_helper.TRTLLMHelper method) _get_trtllm_pretrained_config_and_model_weights_list_on_single_device() (core.export.trtllm.trtllm_helper.TRTLLMHelper method) _get_validation_call_info() (core.rerun_state_machine.RerunStateMachine method) _get_vocab_file() (core.tokenizers.text.libraries.megatron_hf_tokenizer.MegatronHFTokenizer method) _gid_to_src_rank() (core.datasets.data_schedule.HybridCPDataLoaderWrapper method) _global_expert_parameter_name() (in module core.parameter_names) _GLOBAL_MEMORY_BUFFER (in module core.parallel_state) _GLOBAL_NUM_MICROBATCHES_CALCULATOR (in module core.num_microbatches_calculator) _global_process_group_list (in module core.parallel_state) _GLOBAL_RERUN_STATE_MACHINE (in module core.rerun_state_machine) _global_shape() (in module core.resharding.shard_planner) _global_shape_for_mesh() (in module core.resharding.planner) _GlobalMetadata (in module core.dist_checkpointing.validation) _GPT_FINAL_NORM_KEY_MAP (in module core.dist_checkpointing.gpt_checkpoint_interop) _GPT_OMITTED_LOCAL_KEYS (in module core.dist_checkpointing.gpt_checkpoint_interop) _GPT_SOURCED_SYMBOLS (in module core.dist_checkpointing.gpt_checkpoint_interop) _grad_accum_fusion_available (in module core.tensor_parallel.layers) _GRAPH_WGRAD_RINGS (in module core.tensor_parallel.gtp_cuda_graphs) _graphness_suffix() (in module core.tensor_parallel.generalized_tensor_parallelism) _GraphStatus (class in core.transformer.cuda_graphs) _group_buckets() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) _group_offload_output_with_bias() (core.transformer.transformer_layer.TransformerLayer static method) _group_parameters() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module) _group_temporal_token_counts_tensor() (in module core.models.multimodal.llava_model) _GROUPED_EXPERT_PATTERN (in module core.parameter_names) _gtp_attach_attrs() (in module core.tensor_parallel.generalized_tensor_parallelism) _gtp_attach_post_init() (in module core.extensions.transformer_engine) _GTP_CACHE (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_GROUPED_BUF_PARITY_COUNTER (in module core.tensor_parallel.generalized_tensor_parallelism) _gtp_native_fp8_subclass() (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_NATIVE_FP8_SUBCLASSES (in module core.tensor_parallel.generalized_tensor_parallelism) _gtp_pad_zero_count() (in module core.optimizer.clip_grads) _GTP_PARAMS (in module core.tensor_parallel.generalized_tensor_parallelism) _gtp_pre_init() (in module core.extensions.transformer_engine) _gtp_reclass_native_fp8_shard() (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_REMAT_GROUPED_FC1 (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_REMAT_GROUPED_FC2 (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_REMAT_GROUPED_PREFIX (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_REMAT_RNG_TRACKER_NAME (in module core.tensor_parallel.random) _gtp_restore_replicated_bias() (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_RUNNER_STREAMS (in module core.transformer.cuda_graphs) _gtp_shard_layout() (in module core.resharding.shard_planner) _gtp_slice_one_param() (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_SUBCLASS_SKIP (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_TE_MIN_VERSION (in module core.tensor_parallel.generalized_tensor_parallelism) _GTP_WEIGHT_REMAT_GLOBAL_RANKS (in module core.parallel_state) _GTP_WEIGHT_REMAT_GROUP (in module core.parallel_state) _gtp_wrap_bf16_shard() (in module core.tensor_parallel.generalized_tensor_parallelism) _GTPCompositeWorkHandle (class in core.tensor_parallel.generalized_tensor_parallelism) _GTPShardLayout (class in core.resharding.shard_planner) _HALF_MEAN (in module core.models.vision.encoder_registry) _HALF_STD (in module core.models.vision.encoder_registry) _HALF_TYPES (in module core.transformer.module) _handle_failed_request() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _handle_megatron_grad_accum() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam static method) _handle_rank_registration() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _handler() (core.utils.StragglerDetector method) _handoff_capacity_available() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _handshake() (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) _hardware_profile() (in module core.optimizer.emerging_optimizers) _harmonize_buffer_dtypes() (in module core.resharding.refit) _has_encoder_tokens() (core.models.mimo.model.base.MimoModel method) _has_mxfp8_storage() (in module core.inference.quantization.utils) _has_nccl_cuda_backend() (in module core.resharding.copy_services.nccl_m2n_copy_service) _has_nonempty_thinking_trace() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _has_previous_turn_tokens() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _has_sharded_grads() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) _HASH_ALGORITHM (in module core.dist_checkpointing.validation) _HASH_FIELDS_TO_REDACT (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _Headers (class in core.inference.headers) _HIDDEN_STATE_MIXING_RNG_SEED_OFFSET (in module core.transformer.multi_token_prediction) _HIDDEN_STATE_MIXING_RNG_TRACKER_NAME (in module core.transformer.multi_token_prediction) _HIERARCHICAL_CONTEXT_PARALLEL_GROUPS (in module core.parallel_state) _host_valid_tokens_estimate (core.transformer.moe.token_dispatcher_inference.InferenceAllGatherDispatcherBase attribute) _HYBRID_DP_CP_GROUPS (in module core.parallel_state) _hybrid_ep_buffer (in module core.transformer.moe.fused_a2a) _hybrid_logging_pg_kwargs() (in module core.models.hybrid.hybrid_model) _hybrid_mtp_block_spec (in module core.models.hybrid.hybrid_layer_specs) _HybridEPManager (class in core.transformer.moe.token_dispatcher) _hz_to_mel() (in module core.models.audio.nemo_audio_preprocessing) _image_part_text() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _import_class_from_path() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _import_module_if_available() (in module core.transformer.custom_layers.batch_invariant_kernels) _IN_MEAN (in module core.models.vision.encoder_registry) _in_proj_preprocess() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _IN_STD (in module core.models.vision.encoder_registry) _INDEX_FIELDS_TO_REDACT (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _INDEX_HEADER (in module core.datasets.indexed_dataset) _IndexReader (class in core.datasets.indexed_dataset) _IndexWriter (class in core.datasets.indexed_dataset) _indices_to_multihot() (core.transformer.moe.token_dispatcher._DeepepManager method) _indices_to_multihot_kernel() (in module core.fusions.fused_indices_converter) _infer_num_samples() (in module core.models.audio.audio_processor) _inflight_comm_params (in module core.tensor_parallel.generalized_tensor_parallelism) _init_dist_index() (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV1 method) _init_distributed_params() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) _init_dynamic_sampling_tensors() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _init_each_parameter_group_buffers() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) _init_fsdp_param_and_grad_buffer() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _init_gtp_remat_context() (in module core.extensions.transformer_engine) _init_gtp_runtime_attrs() (in module core.tensor_parallel.generalized_tensor_parallelism) _init_hfsdp_helper_and_dp_buffer_data() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _init_moe_expert_cache() (in module core.inference.utils) _init_mtp_sampling_tensors() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _init_optimizer_named_parameters() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) _init_optimizer_state() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.checkpoint) _init_optimizer_states_with_dummy_values() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _init_permutation_map_kernel() (in module core.inference.moe.permute) _init_sequence_parallel_cache() (in module core.transformer.utils) _init_sorted_ids_kernel() (in module core.inference.moe.vllm_fused_moe) _init_sub_optimizers() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _init_weights() (core.transformer.hyper_connection.HyperConnectionModule method) _initialize_affine_weight_cpu() (in module core.tensor_parallel.layers) _initialize_affine_weight_gpu() (in module core.tensor_parallel.layers) _initialize_buffers() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) _initialize_disaggregation_state() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _initialize_hidden_state_mixing_rng_tracker() (in module core.transformer.multi_token_prediction) _initialize_language_input_projections() (core.models.mimo.model.base.MimoModel method) _initialize_language_model() (core.models.mimo.model.base.MimoModel method) _initialize_metadata() (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) _initialize_submodules() (core.models.mimo.model.base.MimoModel method) _inject_gtp_remat_axis() (in module core.parallel_state) _insert_sharded_data() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict method) _INTER_PARTIAL_EXPERT_DATA_PARALLEL_GROUP (in module core.parallel_state) _interleave_last_update() (in module core.ssm.context_parallel.gdp) _intersect_segments() (in module core.resharding.shard_planner) _intersect_slice() (in module core.transformer.fsdp_dtensor_checkpoint) _intersection() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) _INTRA_DISTRIBUTED_OPTIMIZER_INSTANCE_GROUP (in module core.parallel_state) _INTRA_PARTIAL_DATA_PARALLEL_GROUP_WITH_CP (in module core.parallel_state) _INTRA_PARTIAL_DATA_PARALLEL_GROUP_WITH_CP_GLOO (in module core.parallel_state) _INTRA_PARTIAL_DATA_PARALLEL_GROUP_WITH_CP_WITH_GTP_REMAT (in module core.parallel_state) _INTRA_PARTIAL_EXPERT_DATA_PARALLEL_GROUP (in module core.parallel_state) _INTRA_PARTIAL_EXPERT_DATA_PARALLEL_GROUP_GLOO (in module core.parallel_state) _INTRA_PARTIAL_EXPERT_DATA_PARALLEL_GROUP_WITH_GTP_REMAT (in module core.parallel_state) _INVALID_PREFIX_ERROR (in module core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer) _invalidate_blocks_batch() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) _invalidate_vision_state() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _invoke_fused_moe_kernel() (in module core.inference.moe.vllm_fused_moe) _is_active (core.inference.utils.InferenceMode attribute) _is_base_pg_key() (core.hyper_comm_grid.HyperCommGrid method) _is_bf16_grouped_path() (in module core.transformer.custom_layers.batch_invariant_kernels) _is_cuda() (in module core.inference.communication_utils) _is_cuda_contiguous() (in module core.inference.communication_utils) _is_distopt_quantized_param() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _is_fp8_param_for_param_gather() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _is_fused_impl_supported() (core.transformer.moe.experts.TEGroupedMLP method) _is_fused_norm_linear() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _IS_GRAPH_CAPTURING (in module core.transformer.cuda_graphs) _IS_GRAPH_WARMUP (in module core.transformer.cuda_graphs) _is_grouped_nvfp4_param() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _is_grouped_quantized_tensor() (core.optimizer.distrib_optimizer.DistributedOptimizer static method) _is_hollow (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict attribute) _is_in_backward() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module) _is_in_embd_group() (core.models.common.language_module.language_module.LanguageModule method) _is_instance_or_param_data() (in module core.fp8_utils) _is_int_list_like() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _is_msc_path() (in module core.datasets.object_storage_utils) _is_muon_excluded() (in module core.optimizer.emerging_optimizers) _is_nonlinear_or_embedding() (in module core.optimizer.emerging_optimizers) _is_numeric_list_like() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _is_nvidia() (in module core.ssm.ops.gdp.common) _is_process_group_member() (in module core.hyper_comm_grid) _is_raisable() (core.inference.async_stream.AsyncStream static method) _is_root (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _is_s3_path() (in module core.datasets.object_storage_utils) _is_separate_grad_norm_group() (in module core.optimizer.optimizer) _is_sink_module() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) _is_source_module() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) _is_supported_dtype_for_bik() (in module core.transformer.custom_layers.batch_invariant_kernels) _is_trivial() (core.transformer.mla_qk_norm_config.QKNormConfigResolver static method) _is_two_bucket_group_equal() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.FixedPoolAllocator method) _iter_global_transfer_ops() (in module core.resharding.planner) _iter_optimizer_sub_dicts() (in module core.models.mimo.optimizer) _jsonable_arg_value() (in module core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference) _kernel_accepts_kwarg() (in module core.ssm.gated_delta_product) _kernel_make_viewless_tensor() (in module core.utils) _key_config_attributes() (core.datasets.bert_dataset.BERTMaskedWordPieceDataset static method) (core.datasets.masked_dataset.MaskedWordPieceDataset static method) (core.datasets.megatron_dataset.MegatronDataset static method) (core.datasets.t5_dataset.T5MaskedWordPieceDataset static method) _KNOWN_ENCODER_TARGETS (in module core.models.audio.nemo_audio_checkpoint) _KNOWN_PREPROC_TARGETS (in module core.models.audio.nemo_audio_checkpoint) _kv_block_view() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend method) _kv_layout_from_meta() (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend static method) (in module core.inference.disaggregation.transfer_backends.nccl) _kv_transfers() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend method) _kwargs_from_config() (in module core.optimizer.emerging_optimizers) _LANGUAGE_INPUT_PROJECTIONS_ATTR (in module core.models.mimo.model.base) _language_model_owns_mtp() (core.models.mimo.model.base.MimoModel method) _last_assistant_message() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _launch_combine() (core.models.hybrid.shortcut_block.ShortcutMoEBlock method) _launch_dispatch() (core.models.hybrid.shortcut_block.ShortcutMoEBlock method) _launch_outer_bucket_group() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) _launch_outer_prefetches() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) _launch_pack() (core.resharding.nvshmem_copy_service.core.pipeline_executor.PipelineExecutor method) _launch_unpack() (core.resharding.nvshmem_copy_service.core.pipeline_executor.PipelineExecutor method) _layer_is_graphable() (in module core.transformer.cuda_graphs) _LayerwiseAllGatherHandle (class in core.distributed.param_and_grad_buffer) _LayoutParallelContext (class in core.context_parallel.layout) _LayoutRedistributionPlan (class in core.context_parallel.layout) _legacy_common_state_exists() (in module core.dist_checkpointing.serialization) _level (core.resharding.nvshmem_copy_service.logger.PELogger attribute) _linear_forward() (in module core.tensor_parallel.layers) _link_tables_flushed (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam attribute) _load_args_from_ctx() (in module core.tensor_parallel.random) _load_extra_state_from_sharded_checkpoint() (in module core.post_training.modelopt.checkpointing) _load_frame_sequence_manifest() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) _load_from_state_dict() (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) (core.transformer.moe.router.TopKRouter method) (core.transformer.multi_latent_attention.FusedMLASelfAttention method) _load_json() (in module core.models.audio.nemo_audio_checkpoint) _load_omegaconf() (in module core.models.audio.nemo_audio_checkpoint) _load_pg_dist_cache() (in module core.dist_checkpointing.exchange_utils) _load_preprocessor_config() (in module core.models.audio.nemo_audio_checkpoint) _load_rng_state_dict() (in module core.distributed.fsdp.mcore_fsdp_adapter) _load_scaling_factors() (core.export.trtllm.trtllm_helper.TRTLLMHelper method) _load_state_dict_hook_ignore_extra_state() (in module core.models.multimodal.llava_model) _load_state_dict_hook_ignore_param_names() (in module core.models.multimodal.llava_model) _load_waveform_from_spec() (in module core.models.audio.audio_processor) _local (in module core.models.multimodal.llava_spec) (in module core.models.T5.t5_spec) (in module core.models.vision.vit_layer_specs) _local_backend (in module core.models.bert.bert_layer_specs) _local_segment_ids() (in module core.context_parallel.layout) _local_segments() (in module core.resharding.shard_planner) _local_tensor() (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService static method) _local_tokens_per_rank (core.transformer.moe.token_dispatcher_inference.NCCLAllGatherDispatcher attribute) _LocalMetadata (in module core.dist_checkpointing.validation) _LocalTransfer (class in core.resharding.copy_services.nccl_m2n_copy_service) _log_parameter_groups() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) _log_per_layer() (core.transformer.moe.moe_logging.MoEMetricsTracker method) _log_scalars() (core.transformer.moe.moe_logging.MoEMetricsTracker method) _log_softmax_batch_invariant() (in module core.transformer.custom_layers.batch_invariant_kernels) _log_softmax_kernel() (in module core.transformer.custom_layers.batch_invariant_kernels) _log_validation_error_to_file() (core.rerun_state_machine.RerunStateMachine method) _LOGGED_TOKEN_POLICIES (in module core.inference.moe.flashinfer_mxfp8) _logger (core.resharding.nvshmem_copy_service.logger.PELogger attribute) (in module core.telemetry.training_metrics) _LOGGER (in module core.transformer.custom_layers.batch_invariant_kernels) _M2NChannel (class in core.resharding.copy_services.nccl_m2n_copy_service) _M2NTopology (class in core.resharding.copy_services.nccl_m2n_copy_service) _m_splits_to_m_indices() (in module core.transformer.custom_layers.batch_invariant_kernels) _main_grad_is_stale (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) _maintain_float32_expert_bias() (core.transformer.moe.router.TopKRouter method) _make_backward_post_hook() (core.distributed.distributed_data_parallel.DistributedDataParallel method) _make_copy() (in module core.inference.disaggregation.transfer_backends.nccl) _make_forward_pre_hook() (core.distributed.distributed_data_parallel.DistributedDataParallel method) _make_fused_grouped_swiglu_ops() (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) _make_fused_impl_pre_forward_hook() (core.transformer.moe.experts.TEGroupedMLP method) _make_fused_ops() (core.transformer.moe.experts.TEGroupedMLP method) _make_index_record() (core.transformer.moe.router_trace.RouterTracer method) _make_kv_handoff_request() (core.inference.inference_client.InferenceClient method) _make_pipeline_output_viewless() (core.transformer.cuda_graphs._CudaGraphRunner method) _make_uniform_cutedsl_cu_seqlens() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _make_unshard_backward_hook() (in module core.models.common.combined_1f1b_mfsdp_scheduler) _make_unshard_forward_hook() (in module core.models.common.combined_1f1b_mfsdp_scheduler) _mamba_batch_invariant_prefill_chunk_length() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _mamba_chunk() (core.ssm.mamba_mixer.MambaMixer method) _mamba_chunk_scan_combined_fwd() (in module core.ssm.ops.mamba2.ssd_combined) _mamba_chunk_scan_decode_rows() (in module core.ssm.ops.mamba2.batch_invariant_decode) _mamba_ssm_version (in module core.utils) _mamba_state_selective_copy_kernel() (in module core.inference.text_generation_controllers.mtp_utils_triton) _mask_routing_padding_kernel() (in module core.transformer.moe.inference_routing_mask_kernel) _masked_update_rows() (in module core.ssm.ops.mamba2.batch_invariant_decode) _masked_update_rows_kernel() (in module core.ssm.ops.mamba2.batch_invariant_decode) _matches_cg_admission() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _materialize_async_sched_log_probs() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController static method) _materialize_meta_module() (in module core.distributed.fsdp.mcore_fsdp_adapter) _materialize_mtp_input_mask() (core.models.mimo.model.base.MimoModel static method) _materialize_owned_meta_modules() (in module core.distributed.fsdp.mcore_fsdp_adapter) _matmul_launch_metadata() (in module core.transformer.custom_layers.batch_invariant_kernels) _matmul_reduce_scatter() (core.tensor_parallel.inference_layers.InferenceRowParallelLinear method) _MAX_DATA_DIM (in module core.tensor_parallel.data) _MAX_GROUP_BYTES_ENV (in module core.resharding.copy_services.nccl_m2n_copy_service) _max_group_bytes_from_env() (in module core.resharding.copy_services.nccl_m2n_copy_service) _MAX_IMAGE_BYTES (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _MAX_INT64 (in module core.resharding.copy_services.nccl_m2n_copy_service) _MAX_RERUN_ATTEMPTS (in module core.transformer.moe.paged_stash) _MAX_VIDEO_BYTES (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _maybe_allocate_symmetric_buffer() (core.tensor_parallel.inference_layers.InferenceColumnParallelLinear method) (core.tensor_parallel.inference_layers.InferenceLayerNormColumnParallelLinear method) _maybe_dtoh_and_synchronize() (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) _maybe_filter_parallel_tool_calls() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _maybe_reflatten_from_moe() (core.transformer.transformer_layer.TransformerLayer method) _maybe_report_stats() (core.rerun_state_machine.RerunStateMachine method) _maybe_unflatten_for_moe() (core.transformer.transformer_layer.TransformerLayer method) _maybe_update_cuda_sync_point() (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) _mcore_fused_moe_forward() (core.transformer.moe.experts.InferenceGroupedMLP method) _MEDIA_FETCH_TIMEOUT_S (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _MEDIA_FETCH_USER_AGENT (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _media_tensor_keys() (in module core.inference.inference_request) _MEG_TE_GENERAL_GEMM_ORIG (in module core.transformer.custom_layers.batch_invariant_kernels) _MegatronLLMBase (class in core.inference.apis._llm_base) _mel_frequencies() (in module core.models.audio.nemo_audio_preprocessing) _mel_to_hz() (in module core.models.audio.nemo_audio_preprocessing) _mem_desc() (core.resharding.copy_services.nixl_copy_service.NixlCopyService static method) _MemDesc (in module core.resharding.copy_services.nixl_copy_service) _merge_affine_summaries() (in module core.ssm.context_parallel.gdp) _merge_backward_summaries() (in module core.ssm.context_parallel.gdp) _merge_cu_seqlens_across_micro_batch() (in module core.utils) _merge_forward_summaries() (in module core.ssm.context_parallel.gdp) _metadata_fn (in module core.dist_checkpointing.strategies.torch) _mhc_backend_selection() (in module core.fusions.fused_mhc_kernels) _mhc_backend_status() (in module core.fusions.fused_mhc_kernels) _MHC_COMPUTE_H_EPS (in module core.transformer.hyper_connection) _MHC_SINKHORN_EPS (in module core.transformer.hyper_connection) _MIN_FA4_VERSION (in module core.transformer.attention) _min_max() (core.utils.StragglerDetector method) _MINIMUM_NCCL_VERSION (in module core.resharding.copy_services.nccl_m2n_copy_service) _MISSING (in module core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference) _missing_cudnn_dsa_kernel_dependencies() (in module core.utils) _missing_tilelang_dsa_kernel_dependencies() (in module core.utils) _mix_hidden_state_history() (in module core.transformer.multi_token_prediction) _mla_fused_linear_or_default() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _mla_rope_bwd_inplace_kernel() (in module core.fusions.fused_mla_yarn_rope_apply) _mla_rope_bwd_kv_split_kernel() (in module core.fusions.fused_mla_yarn_rope_apply) _mla_rope_fwd_inplace_kernel() (in module core.fusions.fused_mla_yarn_rope_apply) _mla_rope_fwd_kv_split_kernel() (in module core.fusions.fused_mla_yarn_rope_apply) _mm_deepgemm() (in module core.transformer.custom_layers.batch_invariant_kernels) _MM_MARKER (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer attribute) _mm_mxfp8_flashinfer() (in module core.inference.quantization.utils) _mm_mxfp8_torch() (in module core.inference.quantization.utils) _MMapBinReader (class in core.datasets.indexed_dataset) _mod (in module core.inference.unified_memory) _model_dtype() (core.models.huggingface.fastconformer_model.ParakeetHuggingFaceModel method) _MODEL_PARALLEL_ATTRIBUTE_DEFAULTS (in module core.tensor_parallel.layers) _MODEL_PARALLEL_GLOBAL_RANKS (in module core.parallel_state) _MODEL_PARALLEL_GROUP (in module core.parallel_state) _MODEL_PARALLEL_RNG_TRACKER_NAME (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.tensor_parallel.random) _MODEL_SECTION_PATTERN (in module core.transformer.fsdp_dtensor_checkpoint) _model_weight_is_stale (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) _modify_logits_for_top_k_filtering() (core.inference.sampling.torch_sampling.TorchSampling static method) _modify_logits_for_top_p_filtering() (core.inference.sampling.torch_sampling.TorchSampling static method) _Module (class in core.typed_torch) _module_post_backward_hook() (in module core.models.common.combined_1f1b_mfsdp_scheduler) _MODULE_TYPE_REGISTRY (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV1 attribute) _moe_align_block_size_cuda_graphable() (in module core.inference.moe.vllm_fused_moe) _moe_metadata_sync_initialized (in module core.inference.utils) _MOE_METRICS_TRACKER (in module core.transformer.moe.moe_logging) _moe_router_preprocess() (core.models.hybrid.shortcut_block.ShortcutMoEBlock method) _MOE_ROUTER_TRACER (in module core.transformer.moe.router_trace) _MOE_SHARED_EXPERT_OVERLAP (in module core.tensor_parallel.generalized_tensor_parallelism) _moe_shared_experts() (core.models.hybrid.shortcut_block.ShortcutMoEBlock method) _moe_sum() (in module core.inference.moe.vllm_fused_moe) _moe_sum_kernel() (in module core.inference.moe.vllm_fused_moe) _move_book_keeping_tensors() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _move_new_state_to_right_device() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _MPU_DATA_PARALLEL_RANK (in module core.parallel_state) _MPU_DATA_PARALLEL_WORLD_SIZE (in module core.parallel_state) _MPU_EXPERT_MODEL_PARALLEL_RANK (in module core.parallel_state) _MPU_EXPERT_MODEL_PARALLEL_WORLD_SIZE (in module core.parallel_state) _MPU_EXPERT_TENSOR_PARALLEL_RANK (in module core.parallel_state) _MPU_EXPERT_TENSOR_PARALLEL_WORLD_SIZE (in module core.parallel_state) _MPU_PIPELINE_MODEL_PARALLEL_RANK (in module core.parallel_state) _MPU_PIPELINE_MODEL_PARALLEL_WORLD_SIZE (in module core.parallel_state) _MPU_TENSOR_MODEL_PARALLEL_RANK (in module core.parallel_state) _MPU_TENSOR_MODEL_PARALLEL_WORLD_SIZE (in module core.parallel_state) _mtp_activate_attn_metadata() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_allocate_buffers() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_begin_decode() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_commit_forward() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _mtp_commit_pass() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _mtp_decode_commit_segments() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _mtp_dummy_prefill_forward() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _mtp_forward_phase() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_initialize_kv_cache() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_initialize_metadata() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _MTP_LAYER_RE (in module core.transformer.moe.router_trace) _mtp_logits_are_vocab_sharded() (in module core.transformer.multi_token_prediction) _mtp_map_next_decode_tokens() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_next_decode_block_counts() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_prefill_commit_segments() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _mtp_prefill_reserve_blocks() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_setup_decode_step() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _mtp_setup_prefill_step() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _MTP_STACK_LAYER_RE (in module core.transformer.moe.router_trace) _mtp_trim_prefix_match() (core.inference.contexts.mtp_context_mixin.MTPContextMixin method) _multi_tensor_copy_this_to_that() (in module core.optimizer.optimizer) _multihot_to_indices_kernel() (in module core.fusions.fused_indices_converter) _MultiStorageClientBinReader (class in core.datasets.indexed_dataset) _muon_config_to_kwargs() (in module core.optimizer.emerging_optimizers) _MXFP8_BLOCK_SIZE (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) _MXFP8_DTYPE (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) _mxfp8_grouped_mm() (in module core.inference.moe.fused_moe) _mxfp8_quant_swizzle_kernel() (in module core.inference.quantization.mxfp8_quantize) _MXFP8_QUANTIZER (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) _MXFP8_SCALE_DTYPES (in module core.inference.quantization.mxfp8_tensor) _name (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _native_gtp_load_context() (in module core.resharding.execution) _native_parameter_parts() (in module core.resharding.planner) _NativeParameterPart (class in core.resharding.planner) _NCCLEPManager (class in core.transformer.moe.token_dispatcher) _needs_mxfp8_conversion() (in module core.resharding.refit) _NEMO_SOUND_MODEL_CACHE (in module core.models.huggingface.fastconformer_model) _NEMOTRON6_MOE_ASSISTANT_ROLE_TOKEN_IDS (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _NEMOTRON6_MOE_LINE_BREAK_TOKEN_ID (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _NEMOTRON6_MOE_MESSAGE_END_TOKEN_ID (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _NEMOTRON6_MOE_MESSAGE_START_TOKEN_ID (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _NEMOTRON6_MOE_TOKENIZER_CONTRACT (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _NEMOTRON6_MOE_TOOL_RESPONSE_TOKEN_ID (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _NEMOTRON6_MOE_USER_ROLE_TOKEN_ID (in module core.tokenizers.vision.libraries.multimodal_tokenizer) _new_bucket() (core.distributed.param_and_grad_buffer._ParamAndGradBuffer method) _new_decode_stream() (core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer.HuggingFaceFastIncrementalDetokenizer method) _next_decode_block_counts() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _NixlAgentContext (class in core.inference.disaggregation.transfer_backends.nixl) _no_redirect_opener (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _non_fused_or_default() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _NoRedirectHandler (class in core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _norm() (core.transformer.torch_norm.L2Norm method) _NORM_IMPL (in module core.models.vision.vit_model) _normalize_filterbank() (in module core.models.audio.nemo_audio_preprocessing) _normalize_filters() (core.inference.sampling_params.SamplingParams method) _normalize_left_context() (in module core.models.audio.nemo_transformer_encoder) _normalize_loss_scale() (in module core.pipeline_parallel.schedules) _normalize_model_chunks() (in module core.parameter_names) _normalize_mono_waveform() (in module core.models.audio.audio_processor) _normalize_multi_modal_data_list() (core.inference.apis._llm_base._MegatronLLMBase method) _normalize_prompts() (core.inference.apis._llm_base._MegatronLLMBase method) _normalize_raw_media_items() (in module core.inference.inference_request) _normalize_state_dict_for_grouped_params() (core.optimizer.distrib_optimizer.DistributedOptimizer static method) _normalize_structured_tool_arguments() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _normalize_tool_calls() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _notif() (core.resharding.copy_services.nixl_copy_service.NixlCopyService static method) _notify_cond_for_new_request() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _notify_observer() (in module core.tensor_observation) _NUM_SMS (in module core.inference.moe.permute) _num_trainable_parameters (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _NUMERIC_SERIES_FIELDS_TO_REDACT (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _nvtx_decorator_get_func_path() (in module core.utils) _nvtx_enabled (in module core.utils) _nvtx_label() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) _nvtx_range() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) _nvtx_range_get_func_path() (in module core.utils) _nvtx_range_messages (in module core.utils) _nvtx_range_msg_pool (in module core.utils) _OBSERVATION_SUSPENDED (in module core.tensor_observation) _offs_to_m_indices() (in module core.transformer.custom_layers.batch_invariant_kernels) _offset_slice() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) _optimizer_config_for_module() (in module core.models.mimo.optimizer) _OPTIMIZER_STATE_KEY (in module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor) _order_dims_for() (core.hyper_comm_grid.HyperCommGrid method) _order_dims_for_view() (core.hyper_comm_grid.HyperCommGrid method) _ordered_reduce_scatter_v_kernel() (in module core.inference.moe.batch_invariant) _OwnedRange (class in core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer) _owning_module (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) _p2p_ops() (in module core.pipeline_parallel.p2p_communication) _p_assert() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _pack_prompt() (core.inference.inference_client.InferenceClient static method) _pack_sequences() (in module core.datasets.data_schedule_utils) _pack_single_destination() (core.resharding.nvshmem_copy_service.planning.workload_packer.WorkloadPacker method) _pack_submit_frames() (core.inference.inference_client.InferenceClient method) _pack_tp_broadcast() (core.inference.engines.dynamic_engine.DynamicInferenceEngine static method) _packed_metadata() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _PACKED_NONE (in module core.inference.engines.dynamic_engine) _packed_seq_params_for_local_hsm_roll() (in module core.transformer.multi_token_prediction) _pad() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) _pad_columnwise_scale() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) _pad_for_m_grouped() (in module core.transformer.custom_layers.batch_invariant_kernels) _pad_routing_map() (core.transformer.moe.token_dispatcher._DeepepManager method) _pad_routing_map_kernel() (in module core.fusions.fused_pad_routing_map) _pad_rowwise_scale() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) _pad_tensor_for_quantization() (core.transformer.moe.experts.SequentialMLP method) _pad_to_multiple() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.layout) _PAD_TOKEN_ID (in module core.datasets.megatron_dataset) _parallel_stream (core.models.hybrid.shortcut_block.ShortcutMoEBlock attribute) _ParallelConfig (class in core.resharding.refit) _param2group_meta_to_param_groups() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _param_generator() (in module core.optimizer.cpu_offloading.hybrid_optimizer) _param_group_override_keys() (in module core.optimizer.optimizer) _param_groups_to_param2group_meta() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _param_ids (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) _param_ids_to_ensure_ready (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) _param_name() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _param_uses_quantized_storage() (in module core.distributed.param_and_grad_buffer) _ParamAndGradBucket (class in core.distributed.param_and_grad_buffer) _ParamAndGradBucketGroup (class in core.distributed.param_and_grad_buffer) _ParamAndGradBuffer (class in core.distributed.param_and_grad_buffer) _PARAMETER_ATTRIBUTES_TO_PRESERVE (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module_utils) _parameter_groups (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _parameter_groups() (in module core.resharding.copy_services.nccl_m2n_copy_service) _parameter_spec_key() (in module core.resharding.copy_services.nccl_m2n_copy_service) _parse_notif() (core.resharding.copy_services.nixl_copy_service.NixlCopyService static method) _parse_numeric_value() (core.num_microbatches_calculator.StepBatchsizeNumMicroBatchesCalculator static method) _parse_router_module_name() (in module core.transformer.moe.router_trace) _parse_schedule() (core.num_microbatches_calculator.StepBatchsizeNumMicroBatchesCalculator class method) _parse_xml_function_call() (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser method) _partition_contiguous_weights() (in module core.models.multimodal.context_parallel) _patch_cuda_core_experimental() (in module core.resharding.nvshmem_copy_service.compat) _pause_impl() (core.inference.apis._llm_base._MegatronLLMBase method) _pe_id (core.resharding.nvshmem_copy_service.logger.PELogger attribute) _pending_transfer_handles() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin static method) _PendingParameter (class in core.resharding.copy_services.nccl_m2n_copy_service) _per_rank_worst_case_token_count (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher attribute) _permute_quantize_mxfp8_kernel() (in module core.inference.moe.permute) _permute_tokens_kernel() (in module core.inference.moe.permute) _PG_DIST_CACHE (in module core.dist_checkpointing.exchange_utils) _pg_dist_cache_file_path() (in module core.dist_checkpointing.exchange_utils) _phase (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _pickle_patch_lock (in module core.safe_globals) _pin_mamba_autotuners() (in module core.transformer.custom_layers.batch_invariant_kernels) _PINNED_AUTOTUNERS (in module core.transformer.custom_layers.batch_invariant_kernels) _PINNED_MAMBA_CONFIGS (in module core.transformer.custom_layers.batch_invariant_kernels) _PIPELINE_GLOBAL_RANKS (in module core.parallel_state) _PIPELINE_MODEL_PARALLEL_GROUP (in module core.parallel_state) _pixel_shuffle_dynamic_resolution_chunks() (in module core.models.multimodal.llava_model) _placement() (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService static method) _plain_text() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer static method) _plan_cache (in module core.resharding.refit) _plan_kernel_args() (core.resharding.nvshmem_copy_service.planning.gpu_execution_planner.GPUExecutionPlanner method) _plan_tp() (in module core.resharding.planner) _plan_writes() (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) _PlanCacheKey (class in core.resharding.refit) _POLL_INTERVAL_S (in module core.inference.disaggregation.transfer_backends.nixl) _poll_pending_kv_imports() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _poll_pending_kv_pushes() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _POLL_TIMEOUT_S (in module core.inference.disaggregation.transfer_backends.nixl) _pools (in module core.tensor_parallel.gtp_symmetric_memory) _pop_forward_shapes() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _POSITION_EMBEDDING_GLOBAL_RANKS (in module core.parallel_state) _POSITION_EMBEDDING_GROUP (in module core.parallel_state) _post_backward_hook_registered (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext attribute) _post_deserialize() (core.inference.inference_request.DynamicInferenceRequest method) (core.inference.inference_request.InferenceRequest method) _post_param_sync() (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) _post_subsample_lengths() (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioModel method) _postprocess() (core.models.gpt.gpt_model.GPTModel method) (core.models.hybrid.shortcut_block.ShortcutMoEBlock method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) _pre_encode_forward_flops() (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioModel method) _pre_load_state_dict() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule static method) _pre_mlp_layernorm_and_residual() (core.transformer.transformer_layer.HyperConnectionTransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) _precalculate_loss_weights() (in module core.models.multimodal.llava_model) _prefetch_available() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _prefetch_parameter_groups() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) _prefix_depth_vector() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _prefix_sum_kernel() (in module core.inference.moe.permute) _prepare_channels() (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) _prepare_fla_forward() (in module core.ssm.context_parallel.gdp) _prepare_forward_data_iterator() (in module core.pipeline_parallel.schedules) _prepare_handoff_metadata_batch() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _prepare_inference_inputs() (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) _prepare_input_for_gated_delta_rule() (core.ssm.gated_delta_net.common._GDNBase method) _prepare_iter_schedules() (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) _prepare_mixer_input() (core.ssm.mamba_layer.MambaLayer method) _prepare_mla_core_attention_value() (in module core.transformer.multi_latent_attention) _prepare_mtp_inputs() (core.models.mimo.model.base.MimoModel method) _prepare_next_forward_pass_kernel() (in module core.inference.text_generation_controllers.mtp_utils_triton) _prepare_qkv() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _prepare_speculative_tokens_for_next_forward_pass() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _prepare_submit_request_message() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _prepare_tensor_for_comm() (in module core.pipeline_parallel.multimodule_communicator) _prepare_wgrad_reduce_scatter_inputs() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _PreparedHandoffMetadata (class in core.inference.disaggregation.inference_state_handoff) _PreparedMultimodalData (class in core.inference.inference_request) _prepend_gpt_layer_axis() (in module core.dist_checkpointing.gpt_checkpoint_interop) _preprocess() (core.models.gpt.gpt_model.GPTModel method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _preprocess_data() (core.models.multimodal.llava_model.LLaVAModel method) _prescale_wgrads_for_mean_rs() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _preserve_parameter_grads_during_backward_capture() (in module core.transformer.cuda_graphs) _PRESETS (core.telemetry.span_groups.MegatronSpanGroup attribute) _print_resolved_args() (in module core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference) _process_embedding_token_parallel() (core.models.multimodal.llava_model.LLaVAModel method) _processed_log_probs() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _PROFILES (in module core.optimizer.emerging_optimizers) _proj_and_transformer_layer() (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) _projection_and_get_norm() (core.transformer.hyper_connection.HyperConnectionModule method) _prompt_logprobs() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) _PROMPT_PREPARATION_ERROR_FIELD (in module core.inference.engines.dynamic_engine) _QKNormResolvedConfig (in module core.transformer.mla_qk_norm_config) _qkv_down_projection() (core.transformer.multi_latent_attention.FusedMLASelfAttention method) (core.transformer.multi_latent_attention.MLASelfAttention method) _QuantizeKVForFusedAttn (class in core.transformer.multi_latent_attention) _query_document_sample_shuffle_indices() (core.datasets.gpt_dataset.GPTDataset method) _Qwen3CoderToolParser (class in core.tokenizers.text.parsers.qwen3_coder_tool_parser) _R (in module core.tensor_parallel.random) _radio_h_spec() (in module core.models.vision.encoder_registry) _raise_kv_handoff_not_enabled() (core.inference.engines.dynamic_engine.DynamicInferenceEngine static method) _raise_unused_q_norm() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _rank_token_offset() (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher class method) _RankViewSpec (class in core.hyper_comm_grid) _READ_CHUNK_SIZE (in module core.dist_checkpointing.validation) _readiness_topic() (core.inference.engines.async_zmq_communicator.RankedPubSub method) _real_token_count_tensor (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher attribute) _recompute() (core.tensor_parallel.random.CheckpointWithoutOutput method) _recompute_chain_state (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam attribute) _recompute_link_table_row() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam class method) _recompute_link_tables_flushed (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam attribute) _recompute_prefetch_next() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _record() (core.inference.disaggregation.handoff_completion_tracker.HandoffCompletionTracker method) (core.transformer.moe.router_trace.RouterTracer method) _record_forward_shapes() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _record_graph_wgrad_ring_slots_ready() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _record_handoff_completion_notification() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _record_offload_transfer() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler static method) _RecordExpertDgradCompletion (class in core.transformer.moe.moe_layer) _rectangles_overlap() (in module core.resharding.shard_planner) _recv_forward_tensor() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _recv_task() (core.inference.inference_client.InferenceClient method) _redact_token_id_lists_for_logging() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _redistribute_layout() (in module core.context_parallel.layout) _redistribute_thd_layout() (in module core.context_parallel.layout) _redo_attention_load_balancing() (in module core.ssm.mamba_context_parallel) _reduce() (in module core.tensor_parallel.mappings) _reduce_any() (core.rerun_state_machine.RerunStateMachine method) _reduce_dest_cp_gradient() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _reduce_gradient_groups() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) _reduce_scatter() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _reduce_scatter_along_first_dim() (in module core.tensor_parallel.mappings) _reduce_scatter_along_last_dim() (in module core.tensor_parallel.mappings) _reduce_scatter_along_second_dim() (in module core.models.multimodal.context_parallel) _reduce_scatter_fp32_accum() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _ReduceFromModelParallelRegion (class in core.tensor_parallel.mappings) _reduces_grad_every_backward() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _ReduceScatterToSequenceParallelRegion (class in core.tensor_parallel.mappings) _ReduceScatterToTensorParallelRegion (class in core.tensor_parallel.mappings) _ReduceScatterWithFP32AccumulationWorkHandle (class in core.distributed.reduce_scatter_with_fp32_accumulation) _reestablish_shared_weights() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _REFIT_TENSOR_CACHE_ATTR (in module core.resharding.utils) _refresh_vlm_request_data() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _register() (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) _register_cg_wait() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _register_fsdp_hooks() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _register_hooks() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) _register_load_state_dict_hooks() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _register_param_copy_back_gpu_hook() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _register_rank_identity() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _RegisterDelayedWgradForExperts (class in core.transformer.moe.moe_layer) _registered (in module core.tensor_parallel.gtp_symmetric_memory) _reject_common_spec_conflicts() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _reject_disabled_norm() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _reject_explicit_norm_with_fused_linear() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _reject_residual_returning_norm() (core.transformer.transformer_layer.HyperConnectionTransformerLayer static method) _relative_position_bucket() (core.models.common.embeddings.relative_pos_embedding.RelativePositionEmbedding method) _release_pending_kv_import() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _release_pinned_handoff_blocks() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _release_pinned_handoff_ssm_slot() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _release_state() (core.pipeline_parallel.utils.ScheduleNode method) _release_tensor_storage() (in module core.pipeline_parallel.combined_1f1b) _release_wgrad_scratch() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _remove_engine() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _remove_glu_interleaving() (core.transformer.moe.experts.TEGroupedMLP static method) _remove_msc_prefix() (in module core.datasets.object_storage_utils) _remove_redundant_data() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict static method) _remove_s3_prefix() (in module core.datasets.object_storage_utils) _render_conversation() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _render_parts() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _replace_longest_prefix() (in module core.parameter_names) _replace_module_parameter() (in module core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp) _replace_param_with_distributed_if_needed() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _replace_param_with_raw_if_needed() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _replace_partial_prefill_sample_with_prompt_token() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _replace_prefix_tokens() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _replace_prefix_tokens_metadata() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _replace_sharded_keys_with_state_dict_keys() (in module core.dist_checkpointing.strategies.torch) _replace_state_dict_keys_with_sharded_keys() (in module core.dist_checkpointing.strategies.torch) _report_completed_kv_imports() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _REPORT_FORMAT (core.inference.disaggregation.handoff_completion_tracker.HandoffCompletionTracker attribute) _report_quantize_tensor_info() (core.post_training.modelopt.layers.RealQuantTransformerLayer method) _require_deepgemm_bf16() (in module core.transformer.custom_layers.batch_invariant_kernels) _require_linear() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _require_nvidia_resiliency_ext() (in module core.fault_injector) _require_rng() (in module core.fault_injector) _require_uniform_weight_format() (core.transformer.moe.experts.InferenceGroupedMLP static method) _requires_bf16_staging() (in module core.resharding.execution) _reserve_port() (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) _reserve_ssm_handoff_import() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _reset_activation_offload() (in module core.pipeline_parallel.schedules) _reset_after_capture() (core.transformer.cuda_graphs.TECudaGraphHelper method) (core.transformer.cuda_graphs.VisionTECudaGraphHelper method) _reset_dt_bias() (core.ssm.gated_delta_net.common._GDNBase method) (core.ssm.gated_delta_net.gdn2.GatedDeltaNet2 method) _reset_parameters() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) _reset_pending_kv_imports() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _reshard_if_dtensor() (in module core.distributed.finalize_model_grads) _reshard_parameter_groups() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) _resize_storage() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) _resolve_activation() (in module core.models.vision.encoder_registry) _resolve_attn_impl() (in module core.models.audio.nemo_transformer_encoder) _resolve_callable_from_python_import_path() (in module core.fp8_utils) _resolve_cu_seqlens() (core.ssm.gated_delta_net.common._GDNBase method) _resolve_disabled_qk_layernorm() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _resolve_dsa_qk_layernorm() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _resolve_flash_version() (core.transformer.attention.Attention method) _resolve_flashinfer_activation_type() (core.transformer.moe.experts.InferenceGroupedMLP method) _resolve_free_input() (core.models.common.utils.TransformerLayerNode static method) _resolve_global_layer_number_in_name() (in module core.resharding.utils) _resolve_group_grad_dtype() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) _resolve_is_first_microbatch() (in module core.extensions.transformer_engine) _resolve_lazy_media() (in module core.models.audio.audio_processor) _resolve_mcore_activation_type() (core.transformer.moe.experts.InferenceGroupedMLP method) _resolve_mla_qk_layernorm() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) _resolve_names() (core.transformer.moe.moe_logging.MoEMetricsTracker method) _resolve_pixel_stats() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) _resolve_qk_norm_config() (core.transformer.multi_latent_attention.MLASelfAttention method) _resolve_sample_rate() (in module core.models.audio.audio_processor) _resolve_token_dispatcher_attr() (core.transformer.transformer_layer.MoETransformerLayer method) _resolve_tp_mode() (core.optimizer.emerging_optimizers.TensorParallelMuon method) _resolve_view() (core.hyper_comm_grid.HyperCommGrid method) _restore_common_per_param_step() (core.optimizer.optimizer.MegatronOptimizer static method) _restore_dict_types() (in module core.dist_checkpointing.strategies.torch) _restore_grad_scaler() (in module core.models.mimo.optimizer) _restore_grads_after_capture() (in module core.transformer.cuda_graphs) _restore_model() (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) _restore_pad() (core.optimizer.emerging_optimizers.TensorParallelMuon static method) _restore_param_groups() (in module core.models.mimo.optimizer) _restore_param_state_sharding_type() (in module core.models.mimo.optimizer) _restore_saved_context() (in module core.ssm.context_parallel.gdp) (in module core.ssm.context_parallel.gdp_cutedsl) _restore_state() (core.rerun_state_machine.RerunStateMachine method) _restore_tensor_from_comm() (in module core.pipeline_parallel.multimodule_communicator) _restore_token_dispatcher_attrs() (core.transformer.transformer_layer.MoETransformerLayer method) _result() (core.transformer.mla_qk_norm_config.QKNormConfigResolver static method) _resume_impl() (core.inference.apis._llm_base._MegatronLLMBase method) _retarget_explicit_key_to_gpt_checkpoint() (in module core.dist_checkpointing.gpt_checkpoint_interop) _rewind_kv_cache() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _rewind_kv_cache_kernel() (in module core.inference.text_generation_controllers.mtp_utils_triton) _roll_tensor_packed_seq() (in module core.transformer.multi_token_prediction) _rotate_half() (in module core.models.common.embeddings.rope_utils) _round() (in module core.num_microbatches_calculator) _round_robin_dp() (in module core.resharding.utils) _round_up() (in module core.inference.moe.flashinfer_mxfp8) _router_record_bookkeeping() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _rowwise_scale_layout() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) _rs_stream_ids (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) _RS_STREAMS (in module core.tensor_parallel.generalized_tensor_parallelism) _run_async_sched_forward() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_forward_primer() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_log_probs() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_mtp_rewind() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_prepare() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_publish_bookkeeping() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_resolve() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_sample() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_sample_mtp() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_step_no_overlap() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_step_overlap() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_step_overlap_mtp() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_async_sched_update_requests() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_batched_payload_p2p() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _run_core_attention() (core.transformer.attention.Attention method) (core.transformer.multi_latent_attention.MultiLatentAttention method) _run_coroutine_sync() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _run_cross_attention() (core.transformer.transformer_layer.TransformerLayer method) _run_dummy_async_sched_base_step() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_dummy_async_sched_step() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_dummy_base_forward() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_dummy_legacy_step() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_dummy_serial_mtp_forward() (core.inference.text_generation_controllers.mtp_controller_mixin.MTPControllerMixin method) _run_gdp_kernel() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) _run_in_task_windows() (core.resharding.copy_services.nccl_copy_service.NCCLCopyService method) _run_input_layernorm() (core.transformer.transformer_layer.HyperConnectionTransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) _run_legacy_step() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _run_mlp() (core.transformer.transformer_layer.TransformerLayer method) _run_text_gen_server() (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) _s3_download_file() (in module core.datasets.object_storage_utils) _s3_object_exists() (in module core.datasets.object_storage_utils) _S3BinReader (class in core.datasets.indexed_dataset) _SAFE_CLASSES (core.safe_globals.SafeUnpickler attribute) _safe_content_prefix() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) _safe_pickle_load() (in module core.safe_globals) _sample_from_logits_2d() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _sampling_rate() (core.models.huggingface.fastconformer_model.ParakeetHuggingFaceModel method) _sanitize_chat_template_kwargs() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _sanitize_data_iterators() (core.rerun_state_machine.RerunStateMachine method) _sanitize_messages_for_template() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _sanitize_thd_padding_values() (in module core.datasets.data_schedule) _sanitize_tools_for_template() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _sanity_check_attention_and_get_attn_mask_dimension() (core.models.bert.bert_model.BertModel method) _save_args_to_ctx() (in module core.tensor_parallel.random) _save_state() (core.rerun_state_machine.RerunStateMachine method) _save_to_state_dict() (core.transformer.moe.router.TopKRouter method) _saved_tensors_observer (core.transformer.cuda_graphs._CudagraphGlobalRecord attribute) _scale_logits() (core.models.common.language_module.language_module.LanguageModule method) _scale_slice_from_data_slice() (in module core.resharding.transforms) _scatter_intermediate_conv_kernel() (in module core.ssm.ops.common.intermediate_extraction) _scatter_intermediate_ssm_kernel() (in module core.ssm.ops.common.intermediate_extraction) _scatter_token_indices_kernel() (in module core.inference.moe.vllm_fused_moe) _ScatterToModelParallelRegion (class in core.tensor_parallel.mappings) _ScatterToSequenceParallelRegion (class in core.tensor_parallel.mappings) _schedule_policy (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _Segment (class in core.resharding.shard_planner) _segment_owner() (in module core.context_parallel.layout) _segment_tasks() (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) _segmented_arange() (in module core.ssm.ops.gdp.common) _segments_per_rank() (in module core.context_parallel.layout) _select_tp_mode() (in module core.optimizer.emerging_optimizers) _select_triton_cutile_native() (in module core.fusions.fused_mhc_kernels) _selective_scan_update_kernel() (in module core.ssm.ops.mamba2.mamba_ssm) _send_requests_to_coordinator() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _send_signal_to_engines() (core.inference.inference_client.InferenceClient method) _send_to_engine() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _sequence_parallel_attr_cache (in module core.transformer.utils) _sequence_pointers() (core.datasets.indexed_dataset._IndexWriter method) _SEQUENTIAL_EXPERT_PATTERN (in module core.parameter_names) _serialize_finished_request() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _server_process_worker() (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) _SERVER_PROCESSES (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) _service_cache (in module core.resharding.refit) _set_all_rng_states() (in module core.tensor_parallel.random) _set_capture_end() (in module core.transformer.cuda_graphs) _set_capture_start() (in module core.transformer.cuda_graphs) _set_checkpointing() (in module core.tensor_parallel.random) _set_cos_sin_cache() (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) (core.models.common.embeddings.yarn_rotary_pos_embedding.YarnRotaryEmbedding method) _set_cuda_rng_state() (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.tensor_parallel.random) _set_duplicate_storage_info() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler static method) _set_expert_parameter_attributes() (in module core.extensions.transformer_engine) _set_fc2_next_layer_norm_weights() (core.transformer.transformer_layer.TransformerLayer method) _set_fc2_residual() (core.transformer.transformer_layer.TransformerLayer method) _set_global_memory_buffer() (in module core.parallel_state) _set_gtp_finalize_hook_plan() (core.transformer.cuda_graphs._CudaGraphRunner method) _set_main_param_and_optimizer_states() (core.optimizer.distrib_optimizer.DistributedOptimizer method) _set_module_parameter() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) _set_moe_paged_stash_all() (core.transformer.moe.paged_stash.PagedStashRunner method) _set_next_layer_norm_weights() (core.tensor_parallel.inference_layers.InferenceRowParallelLinear method) _set_offload_modules() (core.transformer.transformer_layer.TransformerLayer method) _set_padded_vocab_size() (in module core.tokenizers.utils.build_tokenizer) _set_param_groups() (core.optimizer.optimizer.MegatronOptimizer method) _set_proj_next_layer_norm_weights() (core.transformer.transformer_layer.TransformerLayer method) _set_proj_residual() (core.transformer.transformer_layer.TransformerLayer method) _set_rerun_state_machine() (in module core.rerun_state_machine) _set_residual() (core.tensor_parallel.inference_layers.InferenceRowParallelLinear method) _set_rs_state() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _set_skip_fp8_weight_update_tensor() (in module core.transformer.cuda_graphs) _set_state() (core.optimizer.optimizer.MegatronOptimizer method) (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _set_sub_optimizer_grads() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _set_warmup_end() (in module core.transformer.cuda_graphs) _set_warmup_start() (in module core.transformer.cuda_graphs) _setup_fused_tp_communication() (core.transformer.transformer_block.TransformerBlock method) _setup_handoff_completion_tracking() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _setup_inference_mode() (core.transformer.moe.moe_layer.MoELayer method) _setup_mtp_cuda_graphs() (core.models.common.language_module.language_module.LanguageModule method) _setup_mxfp8_transform_on_plan() (in module core.resharding.refit) _setup_variant_attrs() (core.ssm.gated_delta_net.common._GDNBase method) (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) (core.ssm.gated_delta_net.gdn2.GatedDeltaNet2 method) _shard_divisor() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer static method) _shard_language_inputs() (core.models.mimo.model.base.MimoModel method) _shard_params_from_layout() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) _shard_params_ping_pong() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) _shard_size() (in module core.dist_checkpointing.exchange_utils) _sharded_object_id() (in module core.dist_checkpointing.utils) _sharded_padded_shape (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam property) _sharded_tensor_shard_id() (in module core.dist_checkpointing.utils) _sharded_tensors (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict property) _ShardId (in module core.dist_checkpointing.utils) _SHARDING_STRATEGIES (in module core.distributed.distributed_data_parallel_config) _sharding_strategy_for_param() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) _share_storage_ext (in module core.tensor_parallel.random) _SHARE_STORAGE_SRC (in module core.tensor_parallel.random) _shared_capture_stream (in module core.full_cuda_graph) _shared_graph_pool (in module core.full_cuda_graph) _SHARED_MEM_BY_ARCH (in module core.ssm.ops.gdp.common) _shift_slice() (in module core.transformer.fsdp_dtensor_checkpoint) _should_call_local_cudagraph() (core.models.gpt.gpt_model.GPTModel method) (core.models.hybrid.hybrid_model.HybridModel method) (core.ssm.mamba_layer.MambaLayer method) (core.transformer.module.GraphableMegatronModule method) (core.transformer.transformer_block.TransformerBlock method) (core.transformer.transformer_layer.MoETransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) _should_call_te_cudagraph() (core.transformer.module.GraphableMegatronModule method) _should_defer_mxfp8_param_sync() (core.optimizer.optimizer.ChainedOptimizer method) _should_force_content() (core.tokenizers.text.parsers.nemotron_v3_reasoning_parser.NemotronV3ReasoningParser static method) _should_quantize_param() (in module core.inference.quantization.utils) _should_run_async_sched_overlap() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _should_window() (core.resharding.copy_services.nccl_copy_service.NCCLCopyService method) _shuffle_routed_scale() (in module core.inference.moe.flashinfer_mxfp8) _shutdown_impl() (core.inference.apis._llm_base._MegatronLLMBase method) _silu_mul_bounded_kernel() (in module core.inference.moe.activations) _SINGLE_GROUPED_EXPERT_PATTERN (in module core.parameter_names) _sinkhorn_iterations() (in module core.transformer.hyper_connection) _situ_glu_grads() (in module core.fusions.fused_bias_swiglu) _slice_backward_summary() (in module core.ssm.context_parallel.chunkwise) _slice_conv_param() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) _slice_forward_summary() (in module core.ssm.context_parallel.chunkwise) _slice_vector_param() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) _so_path (in module core.inference.unified_memory) _sort_ops_by_dst_offset() (in module core.resharding.planner) _source_shards() (in module core.resharding.shard_planner) _specialize_placements() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module) _split_along_first_dim() (in module core.tensor_parallel.mappings) _split_along_last_dim() (in module core.tensor_parallel.mappings) _split_audio_configs() (in module core.models.audio.nemo_audio_checkpoint) _split_num_frames() (in module core.models.multimodal.context_parallel) _split_projection() (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) _split_state_dict() (core.optimizer.optimizer.ChainedOptimizer method) _split_tensor_at_batch_dim() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _split_tensor_factory() (in module core.ssm.gated_delta_product) (in module core.ssm.utils) _squared_relu_back() (in module core.fusions.fused_weighted_squared_relu) _squared_relu_kernel() (in module core.inference.moe.activations) _squared_relu_quantize_kernel() (in module core.inference.moe.activations) _squared_relu_with_probs_kernel() (in module core.inference.moe.batch_invariant) _ssm_stage_transfer_meta() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin static method) _SSM_STATE_KINDS (in module core.inference.disaggregation.inference_state_handoff) _ssm_training() (core.ssm.mamba_mixer.MambaMixer method) _ssm_transfers() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend method) _stack_features() (core.models.audio.audio_projector.AudioProjection method) _stack_mxfp8_linear_weight() (core.transformer.moe.experts.InferenceGroupedMLP method) _stack_weights_for_deepgemm() (in module core.transformer.custom_layers.batch_invariant_kernels) _stage_layerwise_mxfp8_params() (core.distributed.param_and_grad_buffer._ParamAndGradBucket method) _stage_model_params_from_main_params() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.optimizer.optimizer.MixedPrecisionOptimizer method) _stage_pairs() (in module core.resharding.copy_services.nccl_m2n_copy_service) _StagePair (in module core.resharding.copy_services.nccl_m2n_copy_service) _start_bucket_group_param_sync() (core.distributed.distributed_data_parallel.DistributedDataParallel method) _start_capturing() (core.transformer.cuda_graphs.TECudaGraphHelper method) _start_deferred_mxfp8_param_sync() (core.optimizer.optimizer.ChainedOptimizer method) _start_ssm_handoff_import() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _stash_buffer_dtype() (in module core.transformer.moe.paged_stash) _STASH_NATIVE_DTYPES (in module core.transformer.moe.paged_stash) _state_dict_module_prefixes() (core.optimizer.distrib_optimizer.DistributedOptimizer static method) _state_dict_pre_hook_init_embedder() (core.models.vision.radio.RADIOViTModel method) _state_dict_pre_hook_init_video_embedder() (core.models.vision.radio.RADIOViTModel method) _STATE_EVENTS (core.inference.engines.dynamic_engine.DynamicInferenceEngine attribute) _state_passing_fwd() (in module core.ssm.ops.mamba2.ssd_state_passing) _state_passing_fwd_kernel() (in module core.ssm.ops.mamba2.ssd_state_passing) _state_shape() (in module core.ssm.context_parallel.gdp) _static_decode() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_mixer.MambaMixer method) _static_prefill() (core.ssm.mamba_mixer.MambaMixer method) _status_name() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) _step() (core.optimizer.optimizer.ChainedOptimizer method) _step_metadata (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher attribute) _step_with_deferred_mxfp8_param_sync() (core.optimizer.optimizer.ChainedOptimizer method) _stop_frontend_if_started() (core.inference.apis._llm_base._MegatronLLMBase method) _StragglerData (class in core.utils) _stream_key() (in module core.tensor_parallel.generalized_tensor_parallelism) _strip_module_prefix() (in module core.optimizer.optimizer) _strip_pad() (core.optimizer.emerging_optimizers.TensorParallelMuon static method) _strip_padding() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _strip_target() (in module core.models.audio.nemo_audio_checkpoint) _strip_wrapper_prefixes() (in module core.transformer.fsdp_dtensor_checkpoint) _submit_request() (core.inference.inference_client.InferenceClient method) _SUBMIT_REQUEST_FRAMES (in module core.inference.engines.dynamic_engine) _SUBMIT_REQUEST_METADATA_FIELDS (in module core.inference.engines.dynamic_engine) _submit_stream() (core.inference.inference_client.InferenceClient method) _suspend_impl() (core.inference.apis._llm_base._MegatronLLMBase method) _swap_book_keeping_tensors() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) _swiglu_kernel() (in module core.inference.moe.activations) _swiglu_with_probs_kernel() (in module core.inference.moe.batch_invariant) _switch_to_sharded_parameters() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) _switch_to_unsharded_parameters() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) _symm_agv_hidden (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher attribute) _symm_agv_probs (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher attribute) _symm_agv_routing (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher attribute) _symm_mem_pool (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) _symm_rsv (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher attribute) _symmetric_memory_context() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) _sync_hdo_param_groups_to_sub_optimizers() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _sync_hdo_state_to_sub_optimizers() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _sync_metrics() (core.transformer.moe.moe_logging.MoEMetricsTracker method) _sync_prompt_logprobs_fields() (core.inference.sampling_params.SamplingParams method) _sync_sub_optimizers_state_to_hdo() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _synchronize_async_sched_event() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController static method) _synchronize_router_host_outputs() (core.transformer.transformer_layer.MoETransformerLayer method) _synchronize_steps() (core.optimizer.optimizer.ChainedOptimizer method) _synchronized (core.tensor_parallel.generalized_tensor_parallelism.BatchedNVFP4AllGatherAsyncHandle attribute) _synthesize_fused_qkv_down_weight() (core.transformer.multi_latent_attention.FusedMLASelfAttention method) _synthesize_state_dict_params_for_model() (core.optimizer.distrib_optimizer.DistributedOptimizer static method) _synthetic_state_dict_key_suffixes() (core.transformer.multi_latent_attention.FusedMLASelfAttention method) _SYRK_MIN_EO_VERSION (in module core.optimizer.emerging_optimizers) _T (in module core.fault_injector) _tag_cudagraph_buffer_saved_for_backward() (in module core.transformer.cuda_graphs) _tanh_clamp_and_deriv() (in module core.fusions.fused_bias_swiglu) _tanh_relu_over_scale() (in module core.fusions.fused_weighted_squared_relu) _te() (in module core.models.multimodal.llava_spec) (in module core.models.T5.t5_spec) (in module core.models.vision.vit_layer_specs) _TE_APPLY_NORM_ORIGS (in module core.transformer.custom_layers.batch_invariant_kernels) _te_apply_normalization_patched() (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_BATCH_INVARIANT_COMMIT (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_BATCH_INVARIANT_MIN_VERSION (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_CONFIG_TYPE_KEY (in module core.extensions.transformer_engine) _te_cuda_graph_backward_dw_graph() (core.transformer.module.GraphableMegatronModule method) _te_cuda_graph_capture() (core.transformer.module.GraphableMegatronModule method) (core.transformer.transformer_layer.TransformerLayer method) _te_cuda_graph_replay() (core.ssm.mamba_layer.MambaLayer method) (core.transformer.module.GraphableMegatronModule method) (core.transformer.transformer_layer.TransformerLayer method) _te_cuda_graph_replay_impl() (core.transformer.transformer_layer.TransformerLayer method) _te_do_not_offload() (in module core.pipeline_parallel.fine_grained_activation_offload) _te_dpa_supports_softcap (in module core.extensions.transformer_engine) _TE_GEMM_FUNC_ORIGS (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_GENERAL_GEMM_ORIG (in module core.transformer.custom_layers.batch_invariant_kernels) _te_general_gemm_patched() (in module core.transformer.custom_layers.batch_invariant_kernels) _te_general_grouped_gemm_patched() (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_GROUPED_GEMM_FUNC_ORIGS (in module core.transformer.custom_layers.batch_invariant_kernels) _te_grouped_tensor_supports_sharded_weights() (in module core.transformer.moe.experts) _TE_GROUPED_WORKSPACE_FN_ORIG (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_NATIVE_ENV_ORIG (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_NATIVE_WORKSPACE_BYTES (in module core.transformer.custom_layers.batch_invariant_kernels) _te_patch_for_batch_invariant() (in module core.transformer.custom_layers.batch_invariant_kernels) _te_patch_general_grouped_gemm() (in module core.transformer.custom_layers.batch_invariant_kernels) _te_rms_norm_kernel() (in module core.tensor_parallel.inference_layers) _te_rmsnorm_forward_patched() (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_RMSNORM_FUNC_ORIGS (in module core.transformer.custom_layers.batch_invariant_kernels) _TE_RMSNORM_ORIG_FWD (in module core.transformer.custom_layers.batch_invariant_kernels) _te_unpatch_for_batch_invariant() (in module core.transformer.custom_layers.batch_invariant_kernels) _te_unpatch_general_grouped_gemm() (in module core.transformer.custom_layers.batch_invariant_kernels) _te_version (in module core.utils) _TE_WORKSPACE_SIZE_FN_ORIG (in module core.transformer.custom_layers.batch_invariant_kernels) _temporarily_bypass_shape_validation() (core.dist_checkpointing.strategies.torch.MCoreLoadPlanner method) _TENormWithResidual (class in core.extensions.transformer_engine_spec_provider) _TENSOR_AND_CONTEXT_PARALLEL_GROUP (in module core.parallel_state) _TENSOR_AND_DATA_PARALLEL_GROUP (in module core.parallel_state) _TENSOR_AND_DATA_PARALLEL_GROUP_WITH_CP (in module core.parallel_state) _tensor_mesh() (in module core.resharding.planner) _TENSOR_MODEL_PARALLEL_GLOBAL_RANKS (in module core.parallel_state) _TENSOR_MODEL_PARALLEL_GROUP (in module core.parallel_state) _tensor_nbytes() (core.inference.engines.dynamic_engine.DynamicInferenceEngine static method) _terminate() (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) _text_to_ids() (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) _text_to_ids_extra_space() (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) _THDZigzagMetadata (class in core.context_parallel.layout) _TicketSlot (class in core.tensor_parallel.generalized_tensor_parallelism) _to_bf16() (in module core.inference.quantization.utils) _TOKEN_ID_FIELDS_TO_REDACT (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _token_logprobs() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) _tokenize_prompts_and_batch() (in module core.inference.text_generation_server.dynamic_text_gen_server.tokenization) (in module core.inference.text_generation_server.tokenization) _tokenize_raw_conversation() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _tokenize_raw_conversation_slow() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _tokenize_text_with_offsets() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _tokenize_with_media_slots_sync() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _top_logprob_entries() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) _torch_h_aggregate_bwd() (in module core.fusions.fused_mhc_kernels) _torch_h_post_bda_bwd() (in module core.fusions.fused_mhc_kernels) _torch_load() (in module core.models.audio.nemo_audio_checkpoint) _torch_proj_rms_compute_h() (in module core.fusions.fused_mhc_kernels) _tp_block_layout() (in module core.resharding.planner) _tp_segments() (in module core.resharding.shard_planner) _trainable_parameter_countdown (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _TRAINING_INSTRUMENTS (in module core.telemetry.training_metrics) _transfer_samples_to_cpu() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _trim_mla_core_attention_output() (in module core.transformer.multi_latent_attention) _TRITON_AVAILABLE (in module core.fusions.fused_mhc_kernels) _TRITON_IMPLS (in module core.fusions.fused_mhc_kernels) _try_parse_jsonish() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) _try_send_streaming_partials() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _try_start_kv_handoff_import() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _Ts (in module core.tensor_parallel.random) _undo_attention_load_balancing() (in module core.ssm.mamba_context_parallel) _unified_recompute_hook() (core.tensor_parallel.random.CheckpointWithoutOutputManager method) _unpack_batch() (in module core.datasets.data_schedule_utils) _unpack_tp_broadcast() (core.inference.engines.dynamic_engine.DynamicInferenceEngine static method) _unpause_impl() (core.inference.apis._llm_base._MegatronLLMBase method) _unpermute_tokens_in_expert_order_kernel() (in module core.inference.moe.batch_invariant) _unpermute_tokens_kernel() (in module core.inference.moe.permute) _unpin_mamba_autotuners() (in module core.transformer.custom_layers.batch_invariant_kernels) _unscale_main_grads_and_check_for_nan() (core.optimizer.optimizer.MixedPrecisionOptimizer method) _unset_checkpointing() (in module core.tensor_parallel.random) _unshard_event (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule attribute) _unshard_if_dtensor() (in module core.distributed.finalize_model_grads) _unshard_parameter_groups() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) _unsharded_model_weight (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) _unsharded_shape (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam property) _unsharded_shape_padded (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam property) _unshuffle_cublas_scale() (in module core.inference.moe.flashinfer_mxfp8) _unwrap_model_cores() (in module core.resharding.refit) _unwrap_mxfp8_weight() (core.transformer.moe.experts.InferenceGroupedMLP static method) _unwrap_output() (in module core.inference.moe.flashinfer_mxfp8) _unwrap_parameter_data() (in module core.fp8_utils) _unwrap_pyt_sharded_tensor() (in module core.dist_checkpointing.strategies.torch) _update_fp32_params_by_new_state() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) _update_legacy_world_tensors() (core.optimizer.distrib_optimizer.DistributedOptimizer class method) _update_media_affinity() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _update_rank_hashes() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) _update_router_expert_bias() (in module core.distributed.finalize_model_grads) _update_router_qb_beta() (in module core.distributed.finalize_model_grads) _update_top_n_logprobs_dict() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _use_allgather_v (core.transformer.moe.token_dispatcher_inference.NCCLAllGatherDispatcher attribute) _use_bounded_mxfp8_rows (core.inference.utils.InferenceMode attribute) _use_causal_conv1d_deterministic_mode() (in module core.ssm.causal_conv1d) _USE_DYNAMIC_COMP_STREAM (in module core.pipeline_parallel.utils) _uses_decoupled_grad() (core.optimizer.optimizer.MegatronOptimizer method) _VALID_DSA_KERNEL_BACKENDS (in module core.utils) _VALID_MHC_BACKENDS (in module core.fusions.fused_mhc_kernels) _valid_tokens() (core.transformer.moe.token_dispatcher_inference.InferenceAllGatherDispatcherBase class method) _valid_tokens_tensor (core.transformer.moe.token_dispatcher_inference.InferenceAllGatherDispatcherBase attribute) _validate_archive() (in module core.models.audio.nemo_audio_checkpoint) _validate_async_sched_support_for_config() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _validate_async_sched_support_for_step() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _validate_common_state_dict() (in module core.dist_checkpointing.validation) _validate_config() (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV2 static method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer static method) _validate_cp_layouts() (core.transformer.transformer_config.TransformerConfig method) _validate_decode_ready_handoff() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) _validate_dp_axes() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) _validate_dsa_index_share_pipeline_split() (in module core.models.gpt.experimental_attention_variant_module_specs) _validate_dsa_kernel_backend_dependencies() (in module core.utils) _validate_encoder_cfg() (in module core.models.audio.nemo_audio_checkpoint) _validate_execution_batches() (in module core.resharding.execution) _validate_fused_grouped_swiglu() (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) _validate_global_shapes() (core.dist_checkpointing.strategies.torch.MCoreLoadPlanner method) _validate_grad_norm_group() (in module core.optimizer.optimizer) _validate_grids() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) _validate_mhc_backend() (in module core.fusions.fused_mhc_kernels) _validate_mxfp8_expert_precision_policy() (in module core.inference.quantization.utils) _validate_native_mesh_metadata() (in module core.resharding.planner) _validate_nccl_version() (in module core.resharding.copy_services.nccl_m2n_copy_service) _validate_nemotron6_moe_tokenizer_contract() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) _validate_nixl_cuda_support() (in module core.inference.disaggregation.transfer_backends.nixl) _validate_objects_for_key() (in module core.dist_checkpointing.validation) _validate_params() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict static method) _validate_pattern() (in module core.models.hybrid.hybrid_layer_allocation) _validate_peer() (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend method) _validate_placements() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer) _validate_precomputed_token_indices() (core.models.mimo.model.base.MimoModel static method) _validate_receiver_provided_shape() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _validate_role_roster() (in module core.resharding.copy_services.nccl_m2n_copy_service) _validate_sample_rate() (core.models.audio.audio_processor.NemoAudioProcessor method) _validate_schedule() (core.num_microbatches_calculator.StepBatchsizeNumMicroBatchesCalculator method) _validate_segmentation() (core.resharding.nvshmem_copy_service.planning.task_segmenter.TaskSegmenter method) _validate_send_dtype() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) _validate_sharding_for_key() (in module core.dist_checkpointing.validation) _validate_specs() (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) _validate_streaming_interval() (core.inference.sampling_params.SamplingParams method) _validate_summary_tensor() (in module core.ssm.context_parallel.chunkwise) _validate_ucx_transport_config() (in module core.inference.disaggregation.transfer_backends.nixl) _ValueWithRank (class in core.utils) _VERBOSE (in module core.datasets.blended_dataset) _verify_integrity_manifest_impl() (in module core.dist_checkpointing.validation) _verify_speculative_tokens() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) _verify_speculative_tokens_kernel() (in module core.inference.text_generation_controllers.mtp_utils_triton) _verify_te_to_mcore_mxfp8_conversion() (in module core.inference.quantization.utils) _version_no_greater_than() (in module core.ssm.triton_cache_manager) _video_sample_indices() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) _VIRTUAL_PIPELINE_MODEL_PARALLEL_RANK (in module core.parallel_state) _VIRTUAL_PIPELINE_MODEL_PARALLEL_WORLD_SIZE (in module core.parallel_state) _vision_cache_entry_nbytes() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _vision_cp_partition_loads() (in module core.models.multimodal.context_parallel) _vision_projection_dtype() (core.models.multimodal.llava_model.LLaVAModel method) _VisionCacheEntry (class in core.inference.engines.dynamic_engine) _vllm_forward() (core.transformer.moe.experts.InferenceGroupedMLP method) _vocab_parallel_argmax() (in module core.transformer.multi_token_prediction) _VocabParallelCrossEntropy (class in core.fusions.fused_cross_entropy) (class in core.tensor_parallel.cross_entropy) _wait_combine() (core.models.hybrid.shortcut_block.ShortcutMoEBlock method) _wait_dispatch() (core.models.hybrid.shortcut_block.ShortcutMoEBlock method) _wait_for_shutdown_impl() (core.inference.apis._llm_base._MegatronLLMBase method) _wait_for_transfer_handles() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin static method) _wait_param_gather() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _wait_recompute_param_gather() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _wait_reduce_scatter() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) _wait_side_streams() (core.transformer.cuda_graphs._CudaGraphRunner method) _weakref_forward_buffers() (core.transformer.cuda_graphs._CudaGraphRunner method) _weight_epoch (core.inference.engines.dynamic_engine.DynamicInferenceEngine attribute) _weight_scoped_salt() (in module core.inference.engines.dynamic_engine) _weighted_silu_mul_bounded_kernel() (in module core.inference.moe.batch_invariant) _weights (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam property) _wgrad_buf_pool (in module core.tensor_parallel.generalized_tensor_parallelism) _wgrad_gemm() (in module core.tensor_parallel.layers) _wgrad_pool_get() (in module core.tensor_parallel.generalized_tensor_parallelism) _wgrad_pool_put() (in module core.tensor_parallel.generalized_tensor_parallelism) _wgrad_ring_slot_params (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) _world_barrier() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) _wrap_graph_for_vision() (in module core.transformer.cuda_graphs) _Wrapped (in module core.utils) _wrapped_run_engine() (core.inference.engines.static_engine.StaticInferenceEngine method) _write_json() (in module core.models.audio.nemo_audio_checkpoint) _Writeback (class in core.resharding.execution) _yarn_find_correction_dim() (in module core.models.common.embeddings.yarn_rotary_pos_embedding) _yarn_find_correction_range() (in module core.models.common.embeddings.yarn_rotary_pos_embedding) _yarn_get_concentration_factor() (in module core.models.common.embeddings.yarn_rotary_pos_embedding) _yarn_get_concentration_factor_from_config() (in module core.models.common.embeddings.yarn_rotary_pos_embedding) _yarn_get_mscale() (in module core.models.common.embeddings.yarn_rotary_pos_embedding) _yarn_linear_ramp_mask() (in module core.models.common.embeddings.yarn_rotary_pos_embedding) _zc_bwd_token_buf (core.transformer.moe.token_dispatcher._NCCLEPManager attribute) _zc_fwd_token_buf (core.transformer.moe.token_dispatcher._NCCLEPManager attribute) _zc_recv_topk_weights_buf (core.transformer.moe.token_dispatcher._NCCLEPManager attribute) _zero_grad_group_helper() (in module core.optimizer.optimizer) _zero_output_rows_kernel() (in module core.inference.moe.permute) _zero_permutation_padding_kernel() (in module core.inference.moe.permute) A A (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) (core.ssm.context_parallel.gdp.GDPLocalContext attribute) a2a_cp_to_hp() (in module core.ssm.gated_delta_net.common) a2a_hp_to_cp() (in module core.ssm.gated_delta_net.common) A_log (core.ssm.gated_delta_net.common._GDNBase attribute) a_log_dim (core.ssm.gated_delta_net.common._GDNBase attribute) ABORT_REQUEST (core.inference.headers.Request attribute) abort_request() (core.inference.inference_client.InferenceClient method) (core.inference.scheduler.Scheduler method) abort_requests() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common) absorbed_input_layernorm_key() (in module core.transformer.fsdp_dtensor_checkpoint) AbstractEngine (class in core.inference.engines.abstract_engine) AbstractModelInferenceWrapper (class in core.inference.model_inference_wrappers.abstract_model_inference_wrapper) AbstractSchedulePlan (class in core.pipeline_parallel.utils) acceptance_step_lengths (core.inference.inference_request.DynamicInferenceRequest attribute) accepted_counts_cpu_ready_event (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) accepted_counts_cpu_view (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) accepted_counts_gpu (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) accepted_tokens_cpu (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) accepted_tokens_cpu_view (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) accepts_parameter() (in module core.utils) account_for_embedding_in_pipeline_split (core.transformer.transformer_config.TransformerConfig attribute) account_for_loss_in_pipeline_split (core.transformer.transformer_config.TransformerConfig attribute) aclose() (core.inference.async_stream.AsyncStream method) acquire() (core.inference.disaggregation.transfer_backends.nixl._NixlAgentContext method) activation_func (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.mlp.MLPSubmodules attribute) (core.transformer.moe.experts.GroupedMLPSubmodules attribute) (core.transformer.transformer_config.TransformerConfig attribute) activation_func() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) activation_func_clamp_value (core.transformer.transformer_config.TransformerConfig attribute) activation_func_fp8_input_store (core.transformer.transformer_config.TransformerConfig attribute) activation_func_tanh_clamp_scale (core.transformer.transformer_config.TransformerConfig attribute) activation_func_tanh_clamp_scale_linear (core.transformer.transformer_config.TransformerConfig attribute) ACTIVATION_OFFLOAD (core.telemetry.span_groups.MegatronSpanGroup attribute) activation_offload_fraction (core.transformer.transformer_config.TransformerConfig attribute) ActivationFunc (in module core.models.vision.encoder_registry) ActivationFuncName (in module core.transformer.moe.upcycling_utils) ActivationType (class in core.inference.moe.fused_moe) active() (core.inference.utils.InferenceMode class method) ACTIVE_AND_GENERATING_TOKENS (core.inference.inference_request.Status attribute) active_block_table (core.inference.contexts.mtp_metadata.MTPMetadata attribute) ACTIVE_BUT_NOT_GENERATING_TOKENS (core.inference.inference_request.Status attribute) active_offsets (core.inference.contexts.mtp_metadata.MTPMetadata attribute) active_request_count (core.inference.contexts.mtp_metadata.MTPMetadata attribute) active_request_ids (core.inference.engines.dynamic_engine.DynamicInferenceEngineStepResult attribute) (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) active_sampling_filter_flags() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) active_time() (core.timers.DummyTimer method) (core.timers.Timer method) ActiveRequestCountOverflowError ACTUAL_LOAD (core.transformer.moe.router_diagnostics.RouterDiagnosticChannel attribute) adam_beta1 (core.optimizer.optimizer_config.OptimizerConfig attribute) adam_beta2 (core.optimizer.optimizer_config.OptimizerConfig attribute) adam_eps (core.optimizer.optimizer_config.OptimizerConfig attribute) AdamOptimizerConfig (in module core.optimizer.optimizer_config) adaptive_muon_beta2 (core.optimizer.optimizer_config.OptimizerConfig attribute) adaptive_muon_eps (core.optimizer.optimizer_config.OptimizerConfig attribute) adaptive_muon_moment2_method (core.optimizer.optimizer_config.OptimizerConfig attribute) add() (core.extensions.transformer_engine.TECudaRNGStatesTracker method) (core.tensor_parallel.random.CudaRNGStatesTracker method) add_attributes() (core.inference.sampling_params.SamplingParams method) add_bias_linear (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) add_blocks_deregistered_observer() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) add_BOS (core.inference.sampling_params.SamplingParams attribute) add_checkpoint() (core.tensor_parallel.random.CheckpointWithoutOutputManager method) ADD_CONTEXT (core.inference.inference_request.DynamicInferenceEventType attribute) add_document() (core.datasets.indexed_dataset.IndexedDatasetBuilder method) add_documents() (core.datasets.indexed_dataset.IndexedDatasetBuilder method) add_dummy_requests_for_cudagraph_capture() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) add_dummy_requests_for_expert_parallel_step() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) add_dummy_requests_parallel() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) add_earliest_waiting_request_to_active_pool() (core.inference.scheduler.Scheduler method) ADD_ENGINE (core.inference.inference_request.DynamicInferenceEventType attribute) add_event() (core.inference.inference_request.DynamicInferenceRequest method) add_event_add_context() (core.inference.inference_request.DynamicInferenceRequest method) add_event_add_engine() (core.inference.inference_request.DynamicInferenceRequest method) add_event_error_nontransient() (core.inference.inference_request.DynamicInferenceRequest method) add_event_error_transient() (core.inference.inference_request.DynamicInferenceRequest method) add_event_evict() (core.inference.inference_request.DynamicInferenceRequest method) add_event_fail() (core.inference.inference_request.DynamicInferenceRequest method) add_event_finish() (core.inference.inference_request.DynamicInferenceRequest method) add_event_generated_token() (core.inference.inference_request.DynamicInferenceRequest method) add_event_pause() (core.inference.inference_request.DynamicInferenceRequest method) add_extra_token_to_sequence (core.datasets.gpt_dataset.GPTDatasetConfig attribute) add_index() (core.datasets.indexed_dataset.IndexedDatasetBuilder method) add_item() (core.datasets.indexed_dataset.IndexedDatasetBuilder method) add_kv_event_listener() (core.inference.contexts.dynamic_context.DynamoHelper method) add_paged_tensor_to_stash() (core.transformer.moe.paged_stash.PagedStashManager method) add_prefix_for_sharding() (in module core.dist_checkpointing.utils) add_qkv_bias (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) add_request() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) (core.inference.engines.static_engine.StaticInferenceEngine method) (core.inference.inference_client.InferenceClient method) (core.inference.scheduler.Scheduler method) add_request_streaming() (core.inference.inference_client.InferenceClient method) add_request_with_id() (core.inference.inference_client.InferenceClient method) add_request_with_kv_handoff() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) (core.inference.inference_client.InferenceClient method) add_request_with_kv_handoff_streaming() (core.inference.inference_client.InferenceClient method) add_special_tokens() (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract method) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) add_vlm_inference_args() (in module core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference) add_vlm_request_data() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) additional_decode_blocks() (in module core.inference.disaggregation.decode_admission) additional_special_tokens_ids (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer property) addmm_batch_invariant() (in module core.transformer.custom_layers.batch_invariant_kernels) adjust_batch_dims_for_expert_parallelism() (core.inference.batch_dimensions_utils.InferenceBatchDimensions static method) adjust_non_strict_load() (in module core.dist_checkpointing.validation) admit_prefilled_decode() (in module core.inference.disaggregation.decode_admission) advance() (core.rerun_state_machine.RerunDataIterator method) advance_decode_step() (core.inference.contexts.mtp_metadata.MTPMetadata method) advance_step() (core.transformer.moe.router_trace.RouterTracer method) advise_managed_module_parameters_preferred_location() (in module core.inference.unified_memory) advise_managed_tensor_accessed_by() (in module core.inference.unified_memory) advise_managed_tensor_preferred_location() (in module core.inference.unified_memory) AFFINITY (core.inference.config.MediaCacheCoordinatorPolicy attribute) aflops (core.utils._StragglerData attribute) ag_streams (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) agent (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle attribute) aggregate() (core.transformer.hyper_connection.HyperConnectionModule method) align_embeddings_by_token_positions() (core.models.mimo.model.base.MimoModel method) align_param_gather (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) all_gather_and_prefetch() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) all_gather_and_prefetch_bwd() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) all_gather_and_wait_parameters_ready() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) all_gather_last_dim_from_tensor_parallel_region() (in module core.tensor_parallel.mappings) all_gather_parameters() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) all_gather_params() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) ALL_GROUPS (core.telemetry.span_groups.MegatronSpanGroup attribute) all_passed (core.resharding.nvshmem_copy_service.validation.ValidationSummary property) all_ranks_for_shard (core.dist_checkpointing.exchange_utils.ShardDistribution attribute) all_reduce_gradients() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) all_reduce_max() (core.inference.engines.async_zmq_communicator.AsyncZMQCommunicator method) all_sharding_strategies_in() (in module core.distributed.fsdp.src.megatron_fsdp.utils) all_to_all() (in module core.tensor_parallel.mappings) all_to_all_hp2sp() (in module core.tensor_parallel.mappings) all_to_all_sp2hp() (in module core.tensor_parallel.mappings) allgather() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer method) allgather_params() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) allgather_stream (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext attribute) AllGatherPipeline (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) alloc() (core.tensor_parallel.gtp_symmetric_memory.RegisteredLIFOPool method) alloc_tensor_from_graph_mempool() (in module core.transformer.cuda_graphs) alloc_tile_workspace() (in module core.ssm.ops.common.determinism) allocate() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.FixedPoolAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.MaxPoolAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.RotaryBucketAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.StorageResizeBasedBucketAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.TemporaryBucketAllocator method) (core.inference.contexts.mtp_metadata.MTPMetadata method) (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorPool method) (core.resharding.nvshmem_copy_service.memory.double_buffer_manager.DoubleBufferManager method) (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers class method) allocate_bucket_storage() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) allocate_buffers() (core.inference.moe.vllm_fused_moe.VllmFusedMoeBuffers class method) (core.transformer.moe.token_dispatcher_inference.NCCLAllGatherDispatcher class method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher class method) allocate_graph_wgrad_rings() (in module core.tensor_parallel.gtp_cuda_graphs) allocate_inference_cache() (core.ssm.gated_delta_product.GatedDeltaProductMixer method) allocate_memory_blocks() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) allocate_partial_grad_buffer() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) allocate_slots_batch() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) allocate_stash_buffers() (core.transformer.moe.paged_stash.PagedStashManager method) allocate_valid_tokens_tensor() (core.transformer.moe.token_dispatcher_inference.InferenceAllGatherDispatcherBase class method) allow_ambiguous_pad_tokens (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) allow_shape_mismatch (core.dist_checkpointing.mapping.ShardedTensor attribute) allow_stale_multimodal_embeddings (core.inference.config.InferenceConfig attribute) allowed_from (core.inference.data_parallel_inference_coordinator.state.ControlTransition attribute) ALLOWED_INFERENCE_SCOPES (in module core.transformer.cuda_graph_config) allreduce() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) already_allocated_blocks (core.inference.contexts.dynamic_context.PrefixMatch attribute) annotate_first_last_layer() (in module core.transformer.cuda_graphs) any_sharding_strategy_in() (in module core.distributed.fsdp.src.megatron_fsdp.utils) append() (core.distributed.fsdp.src.megatron_fsdp.experimental.indexed_order.IndexedOrder method) append_key_value_cache() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) apply() (core.fusions.fused_bias_gelu.GeLUFunction class method) apply_biased_logits() (in module core.transformer.moe.moe_utils) apply_chat_template() (core.tokenizers.base_tokenizer.MegatronTokenizerBase method) (core.tokenizers.text.libraries.chat_template.MegatronTokenizerChatTemplate method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) apply_cudagraph_record_metadata() (core.transformer.cuda_graphs._CudaGraphRunner method) apply_factories() (in module core.dist_checkpointing.mapping) apply_factory_merges() (in module core.dist_checkpointing.mapping) apply_fused_qk_rotary_emb() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) apply_h_post() (core.transformer.hyper_connection.HyperConnectionModule method) apply_h_res() (core.transformer.hyper_connection.HyperConnectionModule method) apply_input_jitter() (core.transformer.moe.router.TopKRouter method) apply_loading_parallelization() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelLoadStrategyWrapper method) apply_module() (in module core.typed_torch) apply_pos_enc() (core.models.vision.radio.RADIOViTModel method) apply_prefix_mapping() (in module core.dist_checkpointing.utils) apply_query_key_layer_scaling (core.transformer.transformer_config.TransformerConfig attribute) apply_random_logits() (in module core.transformer.moe.moe_utils) apply_residual_connection_post_layernorm (core.transformer.transformer_config.TransformerConfig attribute) apply_rope() (in module core.models.audio.nemo_transformer_encoder) apply_rope_fusion (core.transformer.transformer_config.TransformerConfig attribute) apply_rotary_emb_key() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) apply_rotary_emb_query() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) apply_rotary_pos_emb() (in module core.models.common.embeddings.rope_utils) apply_rotary_pos_emb_with_cos_sin() (in module core.models.common.embeddings.rope_utils) apply_router_token_dropping() (in module core.transformer.moe.moe_utils) apply_saving_parallelization() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelSaveStrategyWrapper method) apply_swiglu_sharded_factory() (in module core.transformer.mlp) apply_to_config() (core.models.vision.encoder_registry.EncoderSpec method) apply_wd_to_qk_layernorm (core.optimizer.optimizer_config.OptimizerConfig attribute) apply_z_loss() (core.transformer.moe.router.TopKRouter method) arbitrary (core.transformer.enums.AttnMaskType attribute) ArgMetadata (class in core.transformer.cuda_graphs) arrival_time (core.inference.inference_request.InferenceRequest attribute) as_mlp_submodule() (core.transformer.mlp.MLP class method) assert_causal_conv1d_deterministic() (in module core.ssm.causal_conv1d) assert_te_supports_batch_invariant_attention() (in module core.transformer.custom_layers.batch_invariant_kernels) assert_viewless_tensor() (in module core.utils) assign_ep_resolved_name_inplace() (in module core.resharding.utils) assign_owner_work() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning) assign_resolved_name_inplace() (in module core.resharding.utils) assistant_prefix_len (core.tokenizers.text.libraries.sft_tokenizer.PromptConfig attribute) ASSUME_OK_UNEXPECTED (core.dist_checkpointing.validation.StrictHandling attribute) ASYNC (core.inference.config.AsyncScheduleMode attribute) async_bookkeep() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) async_bucket_gather() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) async_forward() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) async_generate_output_tokens_dynamic_batch() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) async_reduction (core.tensor_parallel.generalized_tensor_parallelism.GTPRematConfig attribute) async_save() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelSaveStrategyWrapper method) (core.dist_checkpointing.strategies.torch.TorchDistSaveShardedStrategy method) async_sched_mode (core.inference.config.InferenceConfig attribute) async_step() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) ASYNC_WAIT (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightState attribute) AsyncScheduleLogitsState (class in core.inference.text_generation_controllers.text_generation_controller) AsyncScheduleMode (class in core.inference.config) AsyncStream (class in core.inference.async_stream) AsyncZMQCommunicator (class in core.inference.engines.async_zmq_communicator) attach_and_log_load_balancing_loss() (core.transformer.moe.router.TopKRouter method) attach_grad_to_optimizer_state() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) attach_gtp_to_presharded_module() (in module core.tensor_parallel.generalized_tensor_parallelism) attach_stage_metadata() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common) attach_uneven_dtensor_metadata() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor) Attention (class in core.transformer.attention) ATTENTION (core.models.hybrid.layers.utils.Symbols attribute) attention_backend (core.transformer.transformer_config.TransformerConfig attribute) attention_bda_and_cross_attention() (core.transformer.transformer_layer.TransformerLayer method) attention_cp_layout (core.transformer.transformer_config.TransformerConfig attribute) attention_dense_bias (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) attention_dense_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) attention_dropout (core.transformer.transformer_config.TransformerConfig attribute) attention_latent_norm_epsilon (core.transformer.transformer_config.MLATransformerConfig attribute) attention_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) ATTENTION_LAYER_CONFIGS (core.models.hybrid.layers.utils.Symbols attribute) attention_linear_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) attention_mask_func() (in module core.transformer.utils) attention_output_gate (core.transformer.transformer_config.TransformerConfig attribute) attention_qkv_bias (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) attention_qkv_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) attention_softmax_in_fp32 (core.transformer.transformer_config.TransformerConfig attribute) attention_to_gpt (core.dist_checkpointing.gpt_checkpoint_interop.GPTCompatLayerMaps attribute) AttentionBlockSize (in module core.transformer.custom_layers.batch_invariant_kernels) AttentionLayerConfig (class in core.transformer.attention_layer_config) attn (core.transformer.enums.CudaGraphModule attribute) (core.transformer.enums.CudaGraphScope attribute) attn_impl (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) attn_logit_softcapping (core.transformer.transformer_config.TransformerConfig attribute) AttnBackend (class in core.transformer.enums) AttnMaskType (class in core.transformer.enums) AttnType (class in core.transformer.enums) attr (core.optimizer.optimizer_config.ParamKey attribute) AudioProjection (class in core.models.audio.audio_projector) AudioToMelSpectrogramPreprocessor (class in core.models.audio.nemo_audio_preprocessing) auto (core.transformer.enums.AttnBackend attribute) autocast_dtype (core.model_parallel_config.ModelParallelConfig attribute) autograd_function (core.ssm.context_parallel.gdp.FLAGatedDeltaProductCPBackend attribute) (core.ssm.context_parallel.gdp_common.GDPChunkwiseCPBackend attribute) (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGatedDeltaProductCPBackend attribute) AutogradFunctionImplementation (in module core.extensions.kitchen) AutoHuggingFaceModel (class in core.models.huggingface.module) autotune_configs() (in module core.ssm.ops.common.determinism) AUX_ACTUAL_OVERLAP (core.transformer.moe.router_diagnostics.RouterDiagnosticChannel attribute) AUX_LOAD (core.transformer.moe.router_diagnostics.RouterDiagnosticChannel attribute) average_in_collective (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) avg_group (core.transformer.moe.moe_logging.MetricEntry attribute) await_process_call() (in module core.inference.utils) axis_fragmentations (core.dist_checkpointing.mapping.ShardedTensor attribute) B B (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) backed_off_blocks (core.inference.contexts.dynamic_context.PrefixMatch attribute) backend (core.inference.quantization.mxfp8_tensor.MXFP8Tensor attribute) backend_slot() (in module core.models.backends) BackendSpecProvider (class in core.models.backends) BACKWARD (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule.Phase attribute) backward (core.ssm.context_parallel.gdp.FLAGDPChunkwiseContextParallel attribute) backward() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.RegisterFSDPBackwardFunction static method) (core.fusions.fused_bias_geglu.BiasGeGLUFunction static method) (core.fusions.fused_bias_geglu.GeGLUFunction static method) (core.fusions.fused_bias_geglu.WeightedBiasQuickGeGLUFunction static method) (core.fusions.fused_bias_geglu.WeightedQuickGeGLUFunction static method) (core.fusions.fused_bias_gelu.GeLUFunction static method) (core.fusions.fused_bias_swiglu.BiasSwiGLUFunction static method) (core.fusions.fused_bias_swiglu.SwiGLUFunction static method) (core.fusions.fused_bias_swiglu.WeightedSwiGLUFunction static method) (core.fusions.fused_cross_entropy._VocabParallelCrossEntropy static method) (core.fusions.fused_indices_converter.IndicesToMultihot static method) (core.fusions.fused_mhc_kernels.FusedHAggregate static method) (core.fusions.fused_mhc_kernels.FusedHPostBDA static method) (core.fusions.fused_mla_yarn_rope_apply._FusedMLARoPEInplace static method) (core.fusions.fused_mla_yarn_rope_apply._FusedMLARoPEKVSplit static method) (core.fusions.fused_softmax.ScaledMaskedSoftmax static method) (core.fusions.fused_softmax.ScaledSoftmax static method) (core.fusions.fused_softmax.ScaledUpperTriangMaskedSoftmax static method) (core.fusions.fused_weighted_squared_relu.WeightedSquaredReLUFunction static method) (core.models.common.utils.TransformerLayerNode method) (core.models.mimo.comm.colocated_communicator._ColocatedCommunicate static method) (core.models.multimodal.context_parallel.GatherFromContextParallelRanks static method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedOffloadingBackwardRecordFunction static method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedOffloadingGroupCommitFunction static method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedOffloadingGroupStartFunction static method) (core.pipeline_parallel.utils.NoopScheduleNode method) (core.pipeline_parallel.utils.ScheduleNode method) (core.pipeline_parallel.utils.StageDispatchBwdGrad static method) (core.ssm.context_parallel.gdp_common.GDPChunkwiseContextParallel static method) (core.tensor_parallel.cross_entropy._VocabParallelCrossEntropy static method) (core.tensor_parallel.generalized_tensor_parallelism.GTPEmbeddingWeight static method) (core.tensor_parallel.layers.LinearWithFrozenWeight static method) (core.tensor_parallel.layers.LinearWithGradAccumulationAndAsyncCommunication static method) (core.tensor_parallel.mappings._AllGatherFromTensorParallelRegion static method) (core.tensor_parallel.mappings._AllToAll static method) (core.tensor_parallel.mappings._CopyToModelParallelRegion static method) (core.tensor_parallel.mappings._GatherFromModelParallelRegion static method) (core.tensor_parallel.mappings._GatherFromSequenceParallelRegion static method) (core.tensor_parallel.mappings._ReduceFromModelParallelRegion static method) (core.tensor_parallel.mappings._ReduceScatterToSequenceParallelRegion static method) (core.tensor_parallel.mappings._ReduceScatterToTensorParallelRegion static method) (core.tensor_parallel.mappings._ScatterToModelParallelRegion static method) (core.tensor_parallel.mappings._ScatterToSequenceParallelRegion static method) (core.tensor_parallel.random.CheckpointFunction static method) (core.tensor_parallel.random.CheckpointWithoutOutputFunction static method) (core.transformer.cuda_graphs._CudagraphRecordNode static method) (core.transformer.cuda_graphs._CudagraphReplayNode static method) (core.transformer.custom_layers.batch_invariant_kernels.BatchInvariantRMSNormFn static method) (core.transformer.custom_layers.batch_invariant_kernels.BatchInvariantTEGemmFn static method) (core.transformer.hyper_connection.BroadcastTensorFused static method) (core.transformer.hyper_connection.SinkhornKnopp static method) (core.transformer.moe.fused_a2a.FusedCombine static method) (core.transformer.moe.fused_a2a.FusedDispatch static method) (core.transformer.moe.fused_a2a.HybridEPCombine static method) (core.transformer.moe.fused_a2a.HybridEPDispatch static method) (core.transformer.moe.moe_layer._RecordExpertDgradCompletion static method) (core.transformer.moe.moe_layer._RegisterDelayedWgradForExperts static method) (core.transformer.moe.moe_utils.MoEAuxLossAutoScaler static method) (core.transformer.moe.moe_utils.RandomSTE static method) (core.transformer.moe.moe_utils.RandomSTEShared static method) (core.transformer.moe.moe_utils.RouterGatingLinearFunction static method) (core.transformer.moe.paged_stash.PipelinePostScheduleFunction static method) (core.transformer.moe.paged_stash.PipelinePreScheduleFunction static method) (core.transformer.moe.shared_experts._BackwardStreamWait static method) (core.transformer.multi_latent_attention._QuantizeKVForFusedAttn static method) (core.transformer.multi_token_prediction.MTPLossAutoScaler static method) (core.utils.MakeViewlessTensor static method) backward_dw() (core.extensions.transformer_engine.TEColumnParallelLinear method) (core.extensions.transformer_engine.TELayerNormColumnParallelLinear method) (core.extensions.transformer_engine.TELinear method) (core.extensions.transformer_engine.TERowParallelLinear method) (core.models.common.utils._BackwardDWWrapper method) (core.models.common.utils.TransformerLayerNode method) (core.ssm.gated_delta_net.common._GDNBase method) (core.tensor_parallel.layers.ColumnParallelLinear method) (core.tensor_parallel.layers.RowParallelLinear method) (core.transformer.attention.LinearProjInterface method) (core.transformer.attention.LinearQkvInterface method) (core.transformer.attention.SelfAttention method) (core.transformer.mlp.LinearFc1Interface method) (core.transformer.mlp.LinearFc2Interface method) (core.transformer.mlp.MLP method) (core.transformer.moe.experts.GroupedLinearFc1Interface method) (core.transformer.moe.experts.GroupedLinearFc2Interface method) (core.transformer.moe.experts.SequentialMLP method) (core.transformer.moe.experts.TEGroupedMLP method) (core.transformer.moe.moe_layer.ExpertsInterface method) (core.transformer.moe.moe_layer.MoELayer method) (core.transformer.moe.moe_layer.SharedExpertsInterface method) (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) (core.transformer.moe.shared_experts.SharedExpertMLP method) (core.transformer.multi_latent_attention.FusedMLASelfAttention method) (core.transformer.multi_latent_attention.MLASelfAttention method) backward_impl() (core.models.common.utils.TransformerLayerNode method) backward_order (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext attribute) BACKWARD_PASS_ORDER (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.PrefetchOrder attribute) backward_prefetch_size (core.distributed.fsdp.src.megatron_fsdp.experimental.schedule.SchedulePolicy attribute) backward_record() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) backward_step() (in module core.pipeline_parallel.schedules) backward_step_multimodule() (in module core.pipeline_parallel.schedules) BackwardContextT (in module core.ssm.context_parallel.chunkwise) BalancedCPScheduler (class in core.pipeline_parallel.hybrid_cp_schedule) band (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) band() (core.inference.disaggregation.ssm_reshard.SSMShardLayout method) barrier_with_L1_time (core.model_parallel_config.ModelParallelConfig attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) BASE_OFFLOAD_MIN_COVERAGE (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler attribute) BaseInferenceContext (class in core.inference.contexts.base_context) BaseMoELayer (class in core.transformer.moe.moe_layer) BasePackingScheduler (class in core.datasets.data_schedule) BaseParser (class in core.tokenizers.text.parsers.base_parser) BaseTransformerLayer (class in core.transformer.transformer_layer) batch_id (core.resharding.utils.TransferOp attribute) batch_index (core.resharding.nvshmem_copy_service.nvshmem_types.ScheduledBatch attribute) (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) batch_invariant_backend (core.transformer.transformer_config.TransformerConfig attribute) batch_invariant_collective (core.transformer.transformer_config.TransformerConfig attribute) batch_invariant_decode_buffered_scan() (in module core.ssm.ops.mamba2.batch_invariant_decode) batch_invariant_mode (core.transformer.transformer_config.TransformerConfig attribute) batch_p2p_comm (core.model_parallel_config.ModelParallelConfig attribute) batch_p2p_sync (core.model_parallel_config.ModelParallelConfig attribute) batched_all_gather_and_prefetch() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) batched_all_gather_and_prefetch_bwd() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) batched_wgrad_reduce_scatter() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) BatchedNVFP4AllGatherAsyncHandle (class in core.tensor_parallel.generalized_tensor_parallelism) batches_by_layout (core.context_parallel.utils.ContextParallelBatch attribute) BatchInvariantDecodeBuffers (class in core.ssm.ops.mamba2.batch_invariant_decode) BatchInvariantRMSNormFn (class in core.transformer.custom_layers.batch_invariant_kernels) BatchInvariantTEGemmFn (class in core.transformer.custom_layers.batch_invariant_kernels) begin_decode() (core.inference.contexts.mtp_metadata.MTPMetadata method) begin_decode_for_capture() (core.inference.contexts.mtp_metadata.MTPMetadata method) begin_pull_blocks() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend method) (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend method) begin_push_blocks() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend method) bert_extended_attention_mask() (core.models.bert.bert_model.BertModel method) bert_layer_local_spec (in module core.models.bert.bert_layer_specs) bert_position_ids() (core.models.bert.bert_model.BertModel method) BertLMHead (class in core.models.bert.bert_lm_head) BERTMaskedWordPieceDataset (class in core.datasets.bert_dataset) BERTMaskedWordPieceDatasetConfig (class in core.datasets.bert_dataset) BertModel (class in core.models.bert.bert_model) beta (core.ssm.context_parallel.gdp.GDPSavedInputs attribute) (core.ssm.context_parallel.gdp_common.GDPInputs attribute) beta_fast (core.transformer.transformer_config.MLATransformerConfig attribute) beta_slow (core.transformer.transformer_config.MLATransformerConfig attribute) bf16 (core.model_parallel_config.ModelParallelConfig attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) bf16_peak_tflops (core.optimizer.emerging_optimizers.HardwareProfile attribute) bias_activation_fusion (core.transformer.transformer_config.TransformerConfig attribute) bias_clamped_swiglu() (in module core.fusions.fused_bias_swiglu) bias_clamped_swiglu_back() (in module core.fusions.fused_bias_swiglu) bias_dropout_add_fused_inference() (in module core.fusions.fused_bias_dropout) bias_dropout_add_fused_train() (in module core.fusions.fused_bias_dropout) bias_dropout_add_unfused() (in module core.fusions.fused_bias_dropout) bias_dropout_fusion (core.transformer.transformer_config.TransformerConfig attribute) bias_geglu() (in module core.fusions.fused_bias_geglu) bias_geglu_back() (in module core.fusions.fused_bias_geglu) bias_geglu_impl() (in module core.fusions.fused_bias_geglu) bias_gelu() (in module core.fusions.fused_bias_gelu) bias_gelu_back() (in module core.fusions.fused_bias_gelu) bias_gelu_impl (in module core.fusions.fused_bias_gelu) bias_situ_glu() (in module core.fusions.fused_bias_swiglu) bias_situ_glu_back() (in module core.fusions.fused_bias_swiglu) bias_swiglu() (in module core.fusions.fused_bias_swiglu) bias_swiglu_back() (in module core.fusions.fused_bias_swiglu) bias_swiglu_impl() (in module core.fusions.fused_bias_swiglu) BiasGeGLUFunction (class in core.fusions.fused_bias_geglu) BiasSwiGLUFunction (class in core.fusions.fused_bias_swiglu) bin_chunk_nbytes (core.datasets.object_storage_utils.ObjectStorageConfig attribute) BKV_LIST (in module core.ssm.ops.gdp.chunk_o) blend (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) blend_per_split (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) BlendedDataset (class in core.datasets.blended_dataset) BlendedMegatronDatasetBuilder (class in core.datasets.blended_megatron_dataset_builder) BlendedMegatronDatasetConfig (class in core.datasets.blended_megatron_dataset_config) block (core.transformer.enums.InferenceCudaGraphScope attribute) block_hash_salt (core.inference.inference_request.DynamicInferenceRequest attribute) block_size (core.distributed.fsdp.src.megatron_fsdp.experimental.layout.GlobalLayout attribute) block_size_tokens (core.inference.config.InferenceConfig attribute) (core.inference.contexts.mtp_metadata.MTPMetadata attribute) (core.inference.inference_request.DynamicInferenceRequest attribute) block_table (core.inference.contexts.mtp_metadata.MTPMetadata attribute) block_table_dtype (core.inference.contexts.mtp_metadata.MTPMetadata attribute) BlockAtomic (class in core.distributed.fsdp.src.megatron_fsdp.experimental.placement) BlockOverflowError blocks_axis (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) BlocksDeregisteredObserver (in module core.inference.contexts.kv_block_allocator) blockwise (core.enums.Fp8Recipe attribute) BlockwiseFP8WeightTransformerLayer (class in core.post_training.modelopt.layers) bos (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer property) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision property) bos_id (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract property) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer property) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) boundary_layout (core.context_parallel.layout.ContextParallelLayoutManager attribute) (core.context_parallel.utils.ContextParallelBatch attribute) bounded_silu_mul() (in module core.inference.moe.activations) bridge_comms_as_dest_module (core.pipeline_parallel.multimodule_communicator.RankModuleInfo attribute) bridge_comms_as_src_module (core.pipeline_parallel.multimodule_communicator.RankModuleInfo attribute) BridgeCommunicator (class in core.pipeline_parallel.bridge_communicator) BridgeDirection (class in core.models.mimo.comm.colocated_communicator) broadcast_data() (in module core.tensor_parallel.data) broadcast_float_list() (in module core.inference.communication_utils) broadcast_from_last_pipeline_stage() (in module core.inference.communication_utils) broadcast_int_list() (in module core.inference.communication_utils) broadcast_list() (in module core.inference.communication_utils) broadcast_params() (core.distributed.data_parallel_base._BaseDataParallel method) (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV2 method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) broadcast_scalars() (in module core.datasets.data_schedule_utils) broadcast_tensor() (in module core.datasets.data_schedule_utils) (in module core.inference.communication_utils) broadcast_to_pp_group() (in module core.datasets.data_schedule_utils) BroadcastTensorFused (class in core.transformer.hyper_connection) Bucket (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) bucket_end_divisor() (in module core.optimizer.param_layout) bucket_indices (core.optimizer.param_layout.PerBufferParamLayout attribute) bucket_size (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) BucketIndex (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) BucketingPolicy (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) BucketStatus (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) buf (core.tensor_parallel.generalized_tensor_parallelism._TicketSlot attribute) buf_ptr (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) buffer_dtypes (core.resharding.utils.ReshardPlan attribute) buffer_relative_offset (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer._OwnedRange attribute) buffer_size_gb (core.inference.config.InferenceConfig attribute) BufferDistribution (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) BufferGeometry (class in core.inference.disaggregation.transfer_backends.base) BufferKey (class in core.optimizer.param_layout) BufferType (class in core.distributed.param_and_grad_buffer) build() (core.datasets.blended_megatron_dataset_builder.BlendedMegatronDatasetBuilder method) (core.dist_checkpointing.mapping.ShardedTensorFactory method) (core.distributed.fsdp.src.megatron_fsdp.experimental.layout.GlobalLayout class method) (core.models.mimo.config.role.RankRole class method) build_active_slices() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) build_and_save_engine() (core.export.trtllm.engine_builder.trtllm_engine_builder.TRTLLMEngineBuilder static method) (core.export.trtllm.trtllm_helper.TRTLLMHelper method) build_centralized_reshard_plan() (in module core.resharding.planner) build_comm_map() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) build_cpu_optimizer_list() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer static method) build_data_parallel_buffer_index() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) build_fn (core.dist_checkpointing.mapping.ShardedTensorFactory attribute) build_forward_state() (core.context_parallel.layout.ContextParallelLayoutManager method) build_gdp_chunk_descriptors() (in module core.ssm.ops.gdp.metadata) build_generic_dataset() (core.datasets.blended_megatron_dataset_builder.BlendedMegatronDatasetBuilder static method) build_hf_model() (in module core.models.huggingface.module) build_inference_pg_collection() (in module core.inference.shards) build_inference_pg_collections_for_shards() (in module core.inference.shards) build_inverse_permutation_map() (in module core.transformer.moe.batch_invariant) build_layer_callables() (in module core.models.common.fine_grained_callables) build_local_reshard_plan() (in module core.resharding.planner) build_low_level_dataset() (core.datasets.gpt_dataset.GPTDataset static method) (core.datasets.gpt_dataset.MockGPTDataset static method) (core.datasets.masked_dataset.MaskedWordPieceDataset static method) (core.datasets.megatron_dataset.MegatronDataset static method) build_mhc_recompute_layer_plan() (in module core.transformer.hyper_connection) build_module() (in module core.transformer.spec_utils) build_mtp_layer_callables() (in module core.models.common.fine_grained_callables) build_packed_microbatches() (in module core.datasets.data_schedule_utils) build_packed_seq_idx() (in module core.ssm.packed_seq_helpers) build_packed_sequence_cp_metadata() (in module core.ssm.context_parallel.chunkwise) build_plan_from_rosters() (in module core.resharding.planner) build_preexpanded_media_token_mask() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) build_router_diagnostics() (in module core.transformer.moe.router_diagnostics) build_sample_idx() (in module core.datasets.helpers) build_schedule() (core.resharding.nvshmem_copy_service.planning.communication_scheduler.CommunicationScheduler method) build_schedule_plan() (core.models.gpt.gpt_model.GPTModel method) build_thd_cp_layout_plan() (in module core.context_parallel.layout) build_tokenizer() (in module core.tokenizers.utils.build_tokenizer) build_transformer_layer_callables() (in module core.models.gpt.fine_grained_callables) bulk_offload() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) bulk_offload_group() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) bulk_reload() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) bulk_reload_group() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) bw_inter_gbps (core.optimizer.emerging_optimizers.HardwareProfile attribute) bw_intra_gbps (core.optimizer.emerging_optimizers.HardwareProfile attribute) bwd_buffer_reuse_ref_count (in module core.transformer.cuda_graphs) bwd_cudagraph_buffer (core.transformer.cuda_graphs.CudagraphBufferMetadata attribute) BWD_READY (core.transformer.cuda_graphs._GraphStatus attribute) ByteLevelTokenizer (class in core.tokenizers.text.libraries.bytelevel_tokenizer) bytes_per_slice (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) C C (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) cache_index_file() (in module core.datasets.object_storage_utils) cache_mla_latents (core.transformer.transformer_config.MLATransformerConfig attribute) cached_prefix_block_count (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) calculate_cross_entropy_loss() (core.tensor_parallel.cross_entropy.VocabParallelCrossEntropy static method) (in module core.fusions.fused_cross_entropy) calculate_gradients() (core.tensor_parallel.cross_entropy.VocabParallelCrossEntropy static method) (in module core.fusions.fused_cross_entropy) calculate_log_probs() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) calculate_log_probs_tensors() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) calculate_logits_max() (core.tensor_parallel.cross_entropy.VocabParallelCrossEntropy static method) (in module core.fusions.fused_cross_entropy) calculate_per_token_loss (core.tensor_parallel.generalized_tensor_parallelism.GTPRematConfig attribute) (core.transformer.transformer_config.TransformerConfig attribute) calculate_predicted_logits() (core.tensor_parallel.cross_entropy.VocabParallelCrossEntropy static method) (in module core.fusions.fused_cross_entropy) Call (class in core.rerun_state_machine) call_ddp_preforward_hook() (core.transformer.cuda_graphs.CudaGraphManager method) Caller (class in core.rerun_state_machine) caller (core.rerun_state_machine.Call attribute) can_admit_prefilled_decode() (in module core.inference.disaggregation.decode_admission) can_prepare_requests() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) CanonicalParameterNameMap (class in core.parameter_names) capture_finished() (core.transformer.cuda_graphs.TECudaGraphHelper method) capture_reuse_count (core.transformer.cuda_graphs.CudagraphBufferMetadata attribute) capture_tensor_observations() (in module core.tensor_observation) carry_chunk_boundary() (core.inference.contexts.mtp_metadata.MTPMetadata method) cast() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) cat_with_oom_fallback() (in module core.transformer.utils) causal (core.transformer.enums.AttnMaskType attribute) causal_bottom_right (core.transformer.enums.AttnMaskType attribute) causal_conv1d_cp() (in module core.ssm.causal_conv1d) causal_conv1d_update() (in module core.ssm.ops.common.causal_conv1d_triton) causal_conv1d_update_kernel() (in module core.ssm.ops.common.causal_conv1d_triton) causal_conv1d_varlen_carry_states() (in module core.ssm.ops.common.causal_conv1d_varlen) causal_conv1d_varlen_fn() (in module core.ssm.ops.common.causal_conv1d_varlen) causal_mask (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) ceil_div() (in module core.models.audio.audio_feature_config) cg_wait_iters (core.inference.inference_request.DynamicInferenceRequest attribute) chain_id (core.tensor_parallel.generalized_tensor_parallelism._TicketSlot attribute) chained_optimizers (core.models.mimo.optimizer.MimoOptimizer property) ChainedOptimizer (class in core.optimizer.optimizer) changed_mesh_axis() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.placement) ChatCompletionRequest (in module core.tokenizers.text.parsers.qwen3_coder_tool_parser) ChatCompletionToolsParam (in module core.tokenizers.text.parsers.qwen3_coder_tool_parser) check_availability() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) check_config_overrides_consistency() (in module core.optimizer) check_first_val_step() (in module core.pipeline_parallel.schedules) check_fla_sequence_packing_support() (in module core.ssm.packed_seq_helpers) check_flashinfer_jit_cache_installed() (in module core.inference.utils) check_for_large_grads (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) check_for_nan_in_grad (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) check_gpu_memory() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) check_grads() (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) check_is_distributed_checkpoint() (in module core.dist_checkpointing.core) check_moe_overflow() (core.transformer.moe.paged_stash.PagedStashRunner method) check_over_budget() (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) check_paged_stash_host_spill() (in module core.transformer.moe.paged_stash) check_paged_stash_overflow() (in module core.transformer.moe.paged_stash) check_param_hashes_across_dp_replicas() (in module core.utils) check_param_states (core.tensor_parallel.generalized_tensor_parallelism.GTPRematConfig attribute) check_required_capacity() (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) check_shared_mem() (in module core.ssm.ops.gdp.common) checkpoint() (core.inference.inference_request.DynamicInferenceRequestRecord method) (core.tensor_parallel.random.CheckpointWithoutOutput method) (in module core.tensor_parallel.random) checkpoint_dir (core.models.vision.encoder_registry.EncoderSpec attribute) checkpoint_fully_reshardable_formats (core.optimizer.distrib_optimizer.DistributedOptimizer attribute) CHECKPOINT_NEMO_AUDIO_PREPROCESSOR_CONFIG_NAME (in module core.models.audio.nemo_audio_checkpoint) CHECKPOINT_NEMO_TRANSFORMER_AUDIO_CONFIG_NAME (in module core.models.audio.nemo_audio_checkpoint) CheckpointableShardedTensor (class in core.dist_checkpointing.strategies.checkpointable) checkpointed_forward() (in module core.recompute) CheckpointFunction (class in core.tensor_parallel.random) CheckpointingConfig (class in core.dist_checkpointing.core) CheckpointingException CheckpointWithoutOutput (class in core.tensor_parallel.random) CheckpointWithoutOutputFunction (class in core.tensor_parallel.random) CheckpointWithoutOutputManager (class in core.tensor_parallel.random) choices() (core.fault_injector._FaultInjectorRNG method) chunk_boundary_hidden (core.inference.contexts.mtp_metadata.MTPMetadata attribute) chunk_boundary_position (core.inference.contexts.mtp_metadata.MTPMetadata attribute) chunk_boundary_req_id (core.inference.contexts.mtp_metadata.MTPMetadata attribute) chunk_boundary_valid (core.inference.contexts.mtp_metadata.MTPMetadata attribute) chunk_flags (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) chunk_fwd_kernel_o() (in module core.ssm.ops.gdp.chunk_o) chunk_gated_delta_product_fwd_h() (in module core.ssm.ops.gdp.chunk_h) chunk_gated_delta_product_fwd_kernel_h_blockdim64() (in module core.ssm.ops.gdp.chunk_h) chunk_gated_delta_product_fwd_o() (in module core.ssm.ops.gdp.chunk_o) chunk_gated_delta_product_varlen() (in module core.ssm.ops.gdp.chunk) chunk_indices (core.ssm.context_parallel.gdp.GDPLocalContext attribute) chunk_indices_dp (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) (core.ssm.context_parallel.gdp.GDPLocalContext attribute) chunk_local_cumsum() (in module core.ssm.ops.gdp.cumsum) chunk_local_cumsum_scalar_kernel() (in module core.ssm.ops.gdp.cumsum) chunk_metadata_by_fqn() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor) chunk_scaled_dot_kkt_fwd() (in module core.ssm.ops.gdp.scaled_dot_kkt) chunk_scaled_dot_kkt_fwd_kernel() (in module core.ssm.ops.gdp.scaled_dot_kkt) chunk_size (core.ssm.ssm_inference.SSMChunking attribute) CHUNK_SIZE (in module core.ssm.ops.gdp.common) chunk_size_factor (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) chunk_state_varlen() (in module core.ssm.ops.mamba2.ssd_chunk_state) ChunkOffloadHandler (class in core.pipeline_parallel.fine_grained_activation_offload) chunkwise_cp_backward() (in module core.ssm.context_parallel.chunkwise) chunkwise_cp_forward() (in module core.ssm.context_parallel.chunkwise) CkptShardedMetadata (in module core.dist_checkpointing.serialization) clamped_squared_relu() (in module core.fusions.fused_weighted_squared_relu) clamped_squared_relu_back() (in module core.fusions.fused_weighted_squared_relu) clamped_swiglu() (in module core.fusions.fused_bias_swiglu) clamped_swiglu_back() (in module core.fusions.fused_bias_swiglu) clamped_weighted_swiglu() (in module core.fusions.fused_bias_swiglu) clamped_weighted_swiglu_back() (in module core.fusions.fused_bias_swiglu) class_token_len (core.models.vision.encoder_registry.EncoderSpec attribute) classification_head (core.datasets.bert_dataset.BERTMaskedWordPieceDatasetConfig attribute) classify_gtp_chains() (in module core.tensor_parallel.generalized_tensor_parallelism) classify_gtp_remat_chains() (in module core.tensor_parallel.generalized_tensor_parallelism) clean_metrics_in_tracker() (core.transformer.multi_token_prediction.MTPLossLoggingHelper static method) clear() (core.inference.text_generation_controllers.text_generation_controller.AsyncScheduleLogitsState method) (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorPool method) (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightCache method) (core.tensor_parallel.gtp_symmetric_memory.RegisteredLIFOPool method) (core.transformer.moe.moe_logging.MoEMetricsTracker method) (core.transformer.moe.moe_utils.MoECudaGraphTensorStore method) clear_all_caches() (in module core.resharding.refit) clear_aux_losses_tracker() (in module core.transformer.moe.moe_utils) clear_embedding_activation_buffer() (in module core.pipeline_parallel.schedules) clear_global_indices() (core.transformer.moe.router_replay.RouterReplay static method) clear_global_router_replay_action() (core.transformer.moe.router_replay.RouterReplay static method) clear_global_router_replay_instances() (core.transformer.moe.router_replay.RouterReplay static method) clear_global_static_buffers() (core.transformer.moe.router_replay.RouterReplay static method) clear_graph_wgrad_rings() (in module core.tensor_parallel.gtp_cuda_graphs) clear_indices() (core.transformer.moe.router_replay.RouterReplay method) clear_plan_cache() (in module core.resharding.refit) clear_requests() (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) clear_router_replay_action() (core.transformer.moe.router_replay.RouterReplay method) clear_service_cache() (in module core.resharding.refit) clear_static_buffer() (core.transformer.moe.router_replay.RouterReplay method) clear_vision_embedding_cache() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) client (core.inference.apis._llm_base._CoordinatorRuntime property) clip_grad (core.optimizer.optimizer_config.OptimizerConfig attribute) clip_grad_by_total_norm_fp32() (in module core.optimizer.clip_grads) clip_grad_norm() (core.optimizer.optimizer.MegatronOptimizer method) clip_qk() (core.transformer.attention.Attention method) (core.transformer.attention.SelfAttention method) (core.transformer.multi_latent_attention.MLASelfAttention method) (in module core.optimizer.qk_clip) CLIPViTModel (class in core.models.vision.clip_vit_model) clone_scatter_output_in_embedding (core.transformer.transformer_config.TransformerConfig attribute) clone_tensors_in_struct() (in module core.full_cuda_graph) close() (core.datasets.object_storage_utils.S3Client method) (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend method) (core.inference.engines.async_zmq_communicator.AsyncZMQCommunicator method) (core.resharding.copy_services.base.CopyService method) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) (core.resharding.copy_services.nvshmem_copy_service.NVSHMEMCopyService method) cls (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer property) cls_id (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract property) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) code_from_dtype() (core.datasets.indexed_dataset.DType class method) collect_mxfp8_param_metadata() (in module core.inference.quantization.utils) collect_stage_metadata() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common) COLOCATED (core.models.mimo.config.role.ModuleLayout attribute) ColocatedBridgeCommunicator (class in core.models.mimo.comm.colocated_communicator) ColoredFormatter (class in core.resharding.nvshmem_copy_service.logger) column_parallel_layer_norm_linear() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) column_parallel_linear() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) ColumnParallelLinear (class in core.tensor_parallel.layers) columnwise_data (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer attribute) columnwise_scale (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer attribute) combine() (core.rerun_state_machine.QuickStats method) (core.transformer.moe.moe_layer.MoELayer method) (core.transformer.moe.token_dispatcher._DeepepManager method) (core.transformer.moe.token_dispatcher._DispatchManager method) (core.transformer.moe.token_dispatcher._HybridEPManager method) (core.transformer.moe.token_dispatcher._NCCLEPManager method) combine_param_group_overrides() (in module core.optimizer_param_scheduler) combine_postprocess() (core.transformer.moe.token_dispatcher.MoEAllGatherTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoETokenDispatcher method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher method) combine_preprocess() (core.transformer.moe.token_dispatcher.MoEAllGatherTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoETokenDispatcher method) (core.transformer.moe.token_dispatcher_inference.NCCLAllGatherDispatcher method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher method) combined_1f1b_schedule_for_interleaved_pipelining() (in module core.pipeline_parallel.combined_1f1b) combined_1f1b_schedule_for_no_pipelining() (in module core.pipeline_parallel.combined_1f1b) combined_forward_backward_step() (in module core.pipeline_parallel.combined_1f1b) comm (core.resharding.copy_services.nccl_m2n_copy_service._M2NChannel attribute) COMMIT (core.inference.contexts.mtp_metadata.MTPForwardMode attribute) commit_intermediate_states() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) commit_sampled_tokens() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) commit_tensor() (core.dist_checkpointing.strategies.torch.MCoreLoadPlanner method) common (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict attribute) common_state_dict (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict property) COMMON_STATE_FNAME (in module core.dist_checkpointing.strategies.common) CommonStateDict (in module core.dist_checkpointing.mapping) CommRole (class in core.pipeline_parallel.bridge_communicator) communicate() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) COMMUNICATING (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BucketStatus attribute) COMMUNICATION (core.telemetry.span_groups.MegatronSpanGroup attribute) communication_group (core.context_parallel.layout._LayoutParallelContext attribute) CommunicationScheduler (class in core.resharding.nvshmem_copy_service.planning.communication_scheduler) compact_prompt_tokens (core.inference.inference_request.DynamicInferenceRequest attribute) COMPARISON_MATCH (in module core.rerun_state_machine) COMPARISON_MISMATCH (in module core.rerun_state_machine) CompilationState (class in core.inference.unified_memory) compile_allocator() (in module core.inference.unified_memory) compile_helpers() (in module core.datasets.utils) COMPLETED (core.inference.inference_request.Status attribute) compute_and_store_offsets() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) compute_block_hashes_batched() (in module core.inference.inference_request) compute_buffer_geometry() (in module core.inference.disaggregation.transfer_backends.base) compute_expert_offsets() (in module core.inference.moe.permute) compute_full_param_layout() (core.optimizer.distrib_optimizer.DistributedOptimizer static method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer static method) compute_language_model_loss() (core.models.common.language_module.language_module.LanguageModule method) compute_local_tokens_per_expert() (in module core.inference.moe.permute) compute_mappings() (core.transformer.hyper_connection.HyperConnectionModule method) compute_media_cache_key() (in module core.inference.inference_request) compute_mtp_single_step() (core.models.common.language_module.language_module.LanguageModule method) compute_normalized_router_scores() (in module core.transformer.moe.moe_utils) compute_num_embeddings() (core.models.audio.audio_processor.NemoAudioProcessor method) compute_num_frames() (core.models.audio.audio_processor.NemoAudioProcessor method) compute_request_hashes() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) compute_rope_params() (in module core.models.audio.nemo_transformer_encoder) compute_routing_scores_for_aux_loss() (in module core.transformer.moe.moe_utils) compute_total_pipeline_stages() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator static method) condition_init_method() (in module core.extensions.transformer_engine) config_attention_mask() (core.datasets.t5_dataset.T5MaskedWordPieceDataset static method) CONFIG_FNAME (in module core.dist_checkpointing.core) config_logger_dir (core.optimizer.optimizer_config.OptimizerConfig attribute) (core.transformer.transformer_config.TransformerConfig attribute) config_to_kwargs (core.optimizer.emerging_optimizers.EmergingOptimizerEntry attribute) configure() (core.utils.StragglerDetector method) configure_fused_tp_inference() (core.transformer.transformer_layer.TransformerLayer method) configure_gtp_remat_from_recipe() (in module core.tensor_parallel.generalized_tensor_parallelism) configure_nvtx_profiling() (in module core.utils) configured (core.utils.StragglerDetector property) CONNECT (core.inference.headers.Connection attribute) CONNECT_ACK (core.inference.headers.Connection attribute) Connection (class in core.inference.headers) CONSTANT (in module core.models.audio.nemo_audio_preprocessing) ConstantGradScaler (class in core.optimizer.grad_scaler) ConstantNumMicroBatchesCalculator (class in core.num_microbatches_calculator) construct_kv_transfer_backend_class() (in module core.inference.disaggregation.transfer_backends.base) consumed (core.inference.text_generation_controllers.text_generation_controller.DecodeOnly attribute) contains_submesh() (in module core.distributed.fsdp.src.megatron_fsdp.utils) context (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule property) (core.inference.apis._llm_base._MegatronLLMBase property) context_length (core.models.audio.nemo_transformer_encoder.GPTConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) context_parallel_size (core.datasets.gpt_dataset.GPTDatasetConfig attribute) (core.model_parallel_config.ModelParallelConfig attribute) ContextErrorFactory (class in core.inference.contexts.dynamic_context) ContextGPUView (class in core.inference.contexts.gpu_view) ContextOverflowError ContextParallelBatch (class in core.context_parallel.utils) ContextParallelLayoutManager (class in core.context_parallel.layout) ContextParallelLayoutState (class in core.context_parallel.layout) contexts (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle attribute) contiguous_local_token_count (core.context_parallel.layout.THDCPLayoutPlan attribute) contiguous_packed_seq_params (core.context_parallel.layout.ContextParallelLayoutState attribute) contiguous_to_zigzag() (in module core.context_parallel.layout) continuation_blocks (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) Control (class in core.inference.headers) CONTROL_TRANSITIONS (in module core.inference.data_parallel_inference_coordinator.state) controller (core.inference.apis._llm_base._MegatronLLMBase property) ControlTransition (class in core.inference.data_parallel_inference_coordinator.state) conv1d() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) conv1d_channels() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) conv_dim_local (core.inference.disaggregation.ssm_reshard.SSMShardLayout property) conv_merging (core.models.vision.encoder_registry.EncoderSpec attribute) conv_states_dtype (core.inference.config.MambaInferenceStateConfig attribute) conv_states_shape (core.inference.config.MambaInferenceStateConfig attribute) conversion_helper() (in module core.transformer.module) convert() (core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter.DistributedTRTLLMModelWeightsConverter method) (core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter.SingleDeviceTRTLLMModelWeightsConverter method) convert_cp_layout() (in module core.context_parallel.layout) convert_cuda_rng_state() (in module core.tensor_parallel.random) convert_module_to_dtype_except_fp32_marked() (in module core.transformer.module) convert_schedule_table_to_order() (in module core.transformer.cuda_graphs) convert_split_vector_to_split_matrix() (in module core.datasets.blended_megatron_dataset_config) convert_tokens_to_ids() (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) ConvSubsampling (class in core.models.audio.nemo_transformer_encoder) coord_addr (core.inference.apis._llm_base._CoordinatorRuntime property) CoordinatorState (class in core.inference.data_parallel_inference_coordinator.state) (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator attribute) copy_() (core.inference.quantization.mxfp8_tensor.MXFP8Tensor method) copy_async_sched_sample_to_forward() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) copy_gradients_to_partial_buffer() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) copy_gtp_attributes() (in module core.tensor_parallel.layers) copy_main_weights_to_model_weights() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) copy_optimizer_param_metadata() (in module core.optimizer.optimizer) copy_parameter_attributes() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module_utils) copy_parameter_metadata() (in module core.utils) copy_signature() (in module core.typed_torch) copy_tensor_model_parallel_attributes() (in module core.tensor_parallel.layers) copy_tensor_to_quantized_param() (in module core.fp8_utils) copy_tensors_in_struct() (in module core.full_cuda_graph) copy_tensors_to_cpu() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict method) copy_tensors_to_quantized_params() (in module core.fp8_utils) copy_to_tensor_model_parallel_region() (in module core.tensor_parallel.mappings) CopyService (class in core.resharding.copy_services.base) core module core._rank_utils module core._slurm_utils module core.activations module core.allocator module core.allocator.vmm_symm_allocator module core.config module core.config_logger module core.context_parallel module core.context_parallel.layout module core.context_parallel.utils module core.datasets module core.datasets.bert_dataset module core.datasets.blended_dataset module core.datasets.blended_megatron_dataset_builder module core.datasets.blended_megatron_dataset_config module core.datasets.data_schedule module core.datasets.data_schedule_utils module core.datasets.gpt_dataset module core.datasets.helpers module core.datasets.indexed_dataset module core.datasets.masked_dataset module core.datasets.megatron_dataset module core.datasets.multimodal_dataset module core.datasets.object_storage_utils module core.datasets.t5_dataset module core.datasets.utils module core.datasets.utils_s3 module core.dist_checkpointing module core.dist_checkpointing.core module core.dist_checkpointing.dict_utils module core.dist_checkpointing.exchange_utils module core.dist_checkpointing.gpt_checkpoint_interop module core.dist_checkpointing.mapping module core.dist_checkpointing.optimizer module core.dist_checkpointing.serialization module core.dist_checkpointing.state_dict_utils module core.dist_checkpointing.strategies module core.dist_checkpointing.strategies.checkpointable module core.dist_checkpointing.strategies.common module core.dist_checkpointing.strategies.fully_parallel module core.dist_checkpointing.strategies.nvrx module core.dist_checkpointing.strategies.torch module core.dist_checkpointing.tensor_aware_state_dict module core.dist_checkpointing.utils module core.dist_checkpointing.validation module core.distributed module core.distributed.data_parallel_base module core.distributed.distributed_data_parallel module core.distributed.distributed_data_parallel_config module core.distributed.finalize_model_grads module core.distributed.fsdp module core.distributed.fsdp.mcore_fsdp_adapter module core.distributed.fsdp.src module core.distributed.fsdp.src.megatron_fsdp module core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config module core.distributed.fsdp.src.megatron_fsdp.experimental module core.distributed.fsdp.src.megatron_fsdp.experimental.checkpoint module core.distributed.fsdp.src.megatron_fsdp.experimental.countdown module core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard module core.distributed.fsdp.src.megatron_fsdp.experimental.indexed_order module core.distributed.fsdp.src.megatron_fsdp.experimental.layout module core.distributed.fsdp.src.megatron_fsdp.experimental.module module core.distributed.fsdp.src.megatron_fsdp.experimental.module_utils module core.distributed.fsdp.src.megatron_fsdp.experimental.optimizer module core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning module core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group module core.distributed.fsdp.src.megatron_fsdp.experimental.placement module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer module core.distributed.fsdp.src.megatron_fsdp.experimental.schedule module core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor module core.distributed.fsdp.src.megatron_fsdp.fully_shard module core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp module core.distributed.fsdp.src.megatron_fsdp.mixed_precision module core.distributed.fsdp.src.megatron_fsdp.package_info module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor module core.distributed.fsdp.src.megatron_fsdp.utils module core.distributed.param_and_grad_buffer module core.distributed.reduce_scatter_with_fp32_accumulation module core.distributed.torch_fully_sharded_data_parallel module core.distributed.torch_fully_sharded_data_parallel_config module core.energy_monitor module core.enums module core.export module core.export.data_type module core.export.export_config module core.export.model_type module core.export.trtllm module core.export.trtllm.engine_builder module core.export.trtllm.engine_builder.trtllm_engine_builder module core.export.trtllm.model_to_trllm_mapping module core.export.trtllm.model_to_trllm_mapping.default_conversion_dict module core.export.trtllm.trt_model_config module core.export.trtllm.trt_model_type module core.export.trtllm.trtllm_helper module core.export.trtllm.trtllm_layers module core.export.trtllm.trtllm_weights_converter module core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter module core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter module core.export.trtllm.trtllm_weights_converter.utils module core.extensions module core.extensions.kitchen module core.extensions.transformer_engine module core.extensions.transformer_engine_spec_provider module core.fault_injector module core.fp4_utils module core.fp8_utils module core.full_cuda_graph module core.fusions module core.fusions.fused_bias_dropout module core.fusions.fused_bias_geglu module core.fusions.fused_bias_gelu module core.fusions.fused_bias_swiglu module core.fusions.fused_cross_entropy module core.fusions.fused_indices_converter module core.fusions.fused_layer_norm module core.fusions.fused_mhc_kernels module core.fusions.fused_mla_yarn_rope_apply module core.fusions.fused_pad_routing_map module core.fusions.fused_softmax module core.fusions.fused_weighted_squared_relu module core.hyper_comm_grid module core.inference module core.inference.apis module core.inference.apis._llm_base module core.inference.apis.async_llm module core.inference.apis.llm module core.inference.apis.serve_config module core.inference.async_stream module core.inference.batch_dimensions_utils module core.inference.common_inference_params module core.inference.communication_utils module core.inference.config module core.inference.contexts module core.inference.contexts.base_context module core.inference.contexts.dynamic_context module core.inference.contexts.fused_kv_append_kernel module core.inference.contexts.gpu_view module core.inference.contexts.kv_block_allocator module core.inference.contexts.mamba_slot_allocator module core.inference.contexts.mtp_context_mixin module core.inference.contexts.mtp_metadata module core.inference.contexts.routing_metadata module core.inference.contexts.static_context module core.inference.data_parallel_inference_coordinator module core.inference.data_parallel_inference_coordinator.coordinator module core.inference.data_parallel_inference_coordinator.handlers module core.inference.data_parallel_inference_coordinator.state module core.inference.disaggregation module core.inference.disaggregation.decode_admission module core.inference.disaggregation.engine module core.inference.disaggregation.handoff_completion_tracker module core.inference.disaggregation.inference_state_handoff module core.inference.disaggregation.kv_reshard module core.inference.disaggregation.pending_handoff_imports module core.inference.disaggregation.ssm_reshard module core.inference.disaggregation.transfer_backends module core.inference.disaggregation.transfer_backends.base module core.inference.disaggregation.transfer_backends.nccl module core.inference.disaggregation.transfer_backends.nixl module core.inference.disaggregation.utils module core.inference.engines module core.inference.engines.abstract_engine module core.inference.engines.async_zmq_communicator module core.inference.engines.dynamic_engine module core.inference.engines.mcore_engine module core.inference.engines.static_engine module core.inference.headers module core.inference.inference_client module core.inference.inference_request module core.inference.model_inference_wrappers module core.inference.model_inference_wrappers.abstract_model_inference_wrapper module core.inference.model_inference_wrappers.gpt module core.inference.model_inference_wrappers.gpt.gpt_inference_wrapper module core.inference.model_inference_wrappers.t5 module core.inference.model_inference_wrappers.t5.t5_inference_wrapper module core.inference.moe module core.inference.moe.activations module core.inference.moe.batch_invariant module core.inference.moe.flashinfer_mxfp8 module core.inference.moe.fused_moe module core.inference.moe.metadata module core.inference.moe.permute module core.inference.moe.vllm_fused_moe module core.inference.quantization module core.inference.quantization.mxfp8_quantize module core.inference.quantization.mxfp8_tensor module core.inference.quantization.utils module core.inference.sampling module core.inference.sampling.base module core.inference.sampling.flashinfer_sampling module core.inference.sampling.torch_sampling module core.inference.sampling_params module core.inference.scheduler module core.inference.shards module core.inference.shards_spec module core.inference.symmetric_memory module core.inference.text_generation_controllers module core.inference.text_generation_controllers.encoder_decoder_text_generation_controller module core.inference.text_generation_controllers.mtp_controller_mixin module core.inference.text_generation_controllers.mtp_utils_pytorch module core.inference.text_generation_controllers.mtp_utils_triton module core.inference.text_generation_controllers.text_generation_controller module core.inference.text_generation_controllers.vlm_text_generation_controller module core.inference.text_generation_server module core.inference.text_generation_server.dynamic_text_gen_server module core.inference.text_generation_server.dynamic_text_gen_server.endpoints module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.completions module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.health module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.profile module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing module core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server module core.inference.text_generation_server.dynamic_text_gen_server.tokenization module core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference module core.inference.text_generation_server.run_mcore_engine module core.inference.text_generation_server.text_generation_server module core.inference.text_generation_server.tokenization module core.inference.unified_memory module core.inference.utils module core.inference_params module core.jit module core.model_parallel_config module core.models module core.models.audio module core.models.audio.audio_feature_config module core.models.audio.audio_processor module core.models.audio.audio_projector module core.models.audio.nemo_audio_checkpoint module core.models.audio.nemo_audio_preprocessing module core.models.audio.nemo_transformer_audio_model module core.models.audio.nemo_transformer_encoder module core.models.audio.packed_audio module core.models.backends module core.models.bert module core.models.bert.bert_layer_specs module core.models.bert.bert_lm_head module core.models.bert.bert_model module core.models.bert.pooler module core.models.common module core.models.common.combined_1f1b_mfsdp_scheduler module core.models.common.embeddings module core.models.common.embeddings.language_model_embedding module core.models.common.embeddings.relative_pos_embedding module core.models.common.embeddings.rope_utils module core.models.common.embeddings.rotary_pos_embedding module core.models.common.embeddings.yarn_rotary_pos_embedding module core.models.common.fine_grained_callables module core.models.common.language_module module core.models.common.language_module.language_module module core.models.common.model_chunk_schedule_plan module core.models.common.utils module core.models.common.vision_module module core.models.common.vision_module.vision_module module core.models.gpt module core.models.gpt.experimental_attention_variant_module_specs module core.models.gpt.fine_grained_callables module core.models.gpt.gpt_layer_specs module core.models.gpt.gpt_model module core.models.gpt.moe_module_specs module core.models.huggingface module core.models.huggingface.clip_model module core.models.huggingface.fastconformer_model module core.models.huggingface.module module core.models.huggingface.qwen_model module core.models.hybrid module core.models.hybrid.hybrid_block module core.models.hybrid.hybrid_layer_allocation module core.models.hybrid.hybrid_layer_specs module core.models.hybrid.hybrid_model module core.models.hybrid.layers module core.models.hybrid.layers.hybrid_hyper_connection module core.models.hybrid.layers.utils module core.models.hybrid.shortcut_block module core.models.mamba module core.models.mamba.mamba_layer_specs module core.models.mamba.mamba_model module core.models.mimo module core.models.mimo.comm module core.models.mimo.comm.colocated_communicator module core.models.mimo.config module core.models.mimo.config.base_configs module core.models.mimo.config.role module core.models.mimo.model module core.models.mimo.model.base module core.models.mimo.optimizer module core.models.multimodal module core.models.multimodal.context_parallel module core.models.multimodal.llava_model module core.models.multimodal.llava_spec module core.models.multimodal.utils module core.models.T5 module core.models.T5.t5_model module core.models.T5.t5_spec module core.models.vision module core.models.vision.clip_vit_model module core.models.vision.encoder_registry module core.models.vision.multimodal_projector module core.models.vision.radio module core.models.vision.vit_layer_specs module core.models.vision.vit_model module core.msc_utils module core.nccl_allocator module core.num_microbatches_calculator module core.optimizer module core.optimizer.clip_grads module core.optimizer.cpu_offloading module core.optimizer.cpu_offloading.hybrid_optimizer module core.optimizer.distrib_optimizer module core.optimizer.emerging_optimizers module core.optimizer.fully_sharded_optimizer module core.optimizer.grad_scaler module core.optimizer.layer_wise_optimizer module core.optimizer.muon module core.optimizer.optimizer module core.optimizer.optimizer_config module core.optimizer.optimizer_cuda_graph module core.optimizer.param_layout module core.optimizer.qk_clip module core.optimizer_param_scheduler module core.package_info module core.packed_seq_params module core.parallel_state module core.parameter_names module core.pipeline_parallel module core.pipeline_parallel.bridge_communicator module core.pipeline_parallel.combined_1f1b module core.pipeline_parallel.fine_grained_activation_offload module core.pipeline_parallel.hybrid_cp_schedule module core.pipeline_parallel.multimodule_communicator module core.pipeline_parallel.p2p_communication module core.pipeline_parallel.schedules module core.pipeline_parallel.utils module core.post_training module core.post_training.modelopt module core.post_training.modelopt.checkpointing module core.post_training.modelopt.gpt module core.post_training.modelopt.gpt.model_specs module core.post_training.modelopt.gpt.state_dict_hooks module core.post_training.modelopt.hybrid module core.post_training.modelopt.hybrid.model_specs module core.post_training.modelopt.layers module core.post_training.modelopt.mamba module core.post_training.modelopt.mamba.model_specs module core.process_groups_config module core.quantization module core.quantization.quant_config module core.quantization.utils module core.recompute module core.rerun_state_machine module core.resharding module core.resharding.copy_services module core.resharding.copy_services.base module core.resharding.copy_services.gloo_copy_service module core.resharding.copy_services.nccl_copy_service module core.resharding.copy_services.nccl_m2n_copy_service module core.resharding.copy_services.nixl_copy_service module core.resharding.copy_services.nvshmem_copy_service module core.resharding.execution module core.resharding.nvshmem_copy_service module core.resharding.nvshmem_copy_service.compat module core.resharding.nvshmem_copy_service.core module core.resharding.nvshmem_copy_service.core.gpu_resource_manager module core.resharding.nvshmem_copy_service.core.kernel_launcher module core.resharding.nvshmem_copy_service.core.pipeline_executor module core.resharding.nvshmem_copy_service.logger module core.resharding.nvshmem_copy_service.memory module core.resharding.nvshmem_copy_service.memory.double_buffer_manager module core.resharding.nvshmem_copy_service.memory.tensor_pointer_utils module core.resharding.nvshmem_copy_service.nvshmem_types module core.resharding.nvshmem_copy_service.planning module core.resharding.nvshmem_copy_service.planning.communication_scheduler module core.resharding.nvshmem_copy_service.planning.gpu_execution_planner module core.resharding.nvshmem_copy_service.planning.task_segmenter module core.resharding.nvshmem_copy_service.planning.workload_packer module core.resharding.nvshmem_copy_service.service module core.resharding.nvshmem_copy_service.validation module core.resharding.planner module core.resharding.refit module core.resharding.shard_planner module core.resharding.transforms module core.resharding.utils module core.safe_globals module core.ssm module core.ssm.causal_conv1d module core.ssm.context_parallel module core.ssm.context_parallel.chunkwise module core.ssm.context_parallel.gdp module core.ssm.context_parallel.gdp_common module core.ssm.context_parallel.gdp_cutedsl module core.ssm.gated_delta_net module core.ssm.gated_delta_net.common module core.ssm.gated_delta_net.gdn module core.ssm.gated_delta_net.gdn2 module core.ssm.gated_delta_product module core.ssm.gdn_layer_config module core.ssm.gdp_context_parallel module core.ssm.mamba_block module core.ssm.mamba_context_parallel module core.ssm.mamba_hybrid_layer_allocation module core.ssm.mamba_layer module core.ssm.mamba_layer_config module core.ssm.mamba_mixer module core.ssm.mlp_layer module core.ssm.mlp_layer_config module core.ssm.ops module core.ssm.ops.common module core.ssm.ops.common.causal_conv1d_triton module core.ssm.ops.common.causal_conv1d_varlen module core.ssm.ops.common.determinism module core.ssm.ops.common.intermediate_extraction module core.ssm.ops.gdp module core.ssm.ops.gdp.chunk module core.ssm.ops.gdp.chunk_h module core.ssm.ops.gdp.chunk_o module core.ssm.ops.gdp.common module core.ssm.ops.gdp.cumsum module core.ssm.ops.gdp.decode_prepare module core.ssm.ops.gdp.fused_recurrent module core.ssm.ops.gdp.metadata module core.ssm.ops.gdp.scaled_dot_kkt module core.ssm.ops.gdp.solve_tril module core.ssm.ops.gdp.wy_fast module core.ssm.ops.mamba2 module core.ssm.ops.mamba2.batch_invariant_decode module core.ssm.ops.mamba2.mamba_ssm module core.ssm.ops.mamba2.ssd_bmm module core.ssm.ops.mamba2.ssd_chunk_scan module core.ssm.ops.mamba2.ssd_chunk_state module core.ssm.ops.mamba2.ssd_combined module core.ssm.ops.mamba2.ssd_state_passing module core.ssm.packed_seq_helpers module core.ssm.ssm_inference module core.ssm.triton_cache_manager module core.ssm.utils module core.telemetry module core.telemetry.fallbacks module core.telemetry.span_groups module core.telemetry.training_metrics module core.tensor_observation module core.tensor_parallel module core.tensor_parallel.cross_entropy module core.tensor_parallel.data module core.tensor_parallel.generalized_tensor_parallelism module core.tensor_parallel.gtp_api module core.tensor_parallel.gtp_cuda_graphs module core.tensor_parallel.gtp_symmetric_memory module core.tensor_parallel.inference_layers module core.tensor_parallel.layers module core.tensor_parallel.mappings module core.tensor_parallel.random module core.tensor_parallel.utils module core.timers module core.tokenizers module core.tokenizers.base_tokenizer module core.tokenizers.megatron_tokenizer module core.tokenizers.text module core.tokenizers.text.libraries module core.tokenizers.text.libraries.abstract_tokenizer module core.tokenizers.text.libraries.bytelevel_tokenizer module core.tokenizers.text.libraries.chat_template module core.tokenizers.text.libraries.huggingface_tokenizer module core.tokenizers.text.libraries.megatron_hf_tokenizer module core.tokenizers.text.libraries.null_tokenizer module core.tokenizers.text.libraries.sentencepiece_tokenizer module core.tokenizers.text.libraries.sft_tokenizer module core.tokenizers.text.libraries.tiktoken_tokenizer module core.tokenizers.text.parsers module core.tokenizers.text.parsers.base_parser module core.tokenizers.text.parsers.deepseek_r1_reasoning_parser module core.tokenizers.text.parsers.nemotron_v3_reasoning_parser module core.tokenizers.text.parsers.qwen3_coder_tool_parser module core.tokenizers.text.text_tokenizer module core.tokenizers.utils module core.tokenizers.utils.build_tokenizer module core.tokenizers.utils.utils module core.tokenizers.vision module core.tokenizers.vision.libraries module core.tokenizers.vision.libraries.multimodal_tokenizer module core.tokenizers.vision.libraries.null_multimodal_tokenizer module core.tokenizers.vision.vision_tokenizer module core.transformer module core.transformer.attention module core.transformer.attention_layer_config module core.transformer.cuda_graph_config module core.transformer.cuda_graphs module core.transformer.custom_layers module core.transformer.custom_layers.batch_invariant_kernels module core.transformer.dot_product_attention module core.transformer.enums module core.transformer.fsdp_dtensor_checkpoint module core.transformer.hyper_connection module core.transformer.identity_op module core.transformer.mla_layer_config module core.transformer.mla_qk_norm_config module core.transformer.mlp module core.transformer.module module core.transformer.moe module core.transformer.moe.batch_invariant module core.transformer.moe.experts module core.transformer.moe.fused_a2a module core.transformer.moe.inference_routing_mask_kernel module core.transformer.moe.moe_layer module core.transformer.moe.moe_layer_config module core.transformer.moe.moe_logging module core.transformer.moe.moe_utils module core.transformer.moe.ops module core.transformer.moe.ops.paged_stash module core.transformer.moe.paged_stash module core.transformer.moe.router module core.transformer.moe.router_diagnostics module core.transformer.moe.router_replay module core.transformer.moe.router_trace module core.transformer.moe.shared_experts module core.transformer.moe.token_dispatcher module core.transformer.moe.token_dispatcher_inference module core.transformer.moe.upcycling_utils module core.transformer.multi_latent_attention module core.transformer.multi_token_prediction module core.transformer.pipeline_parallel_layer_layout module core.transformer.spec_utils module core.transformer.torch_layer_norm module core.transformer.torch_norm module core.transformer.transformer_block module core.transformer.transformer_config module core.transformer.transformer_layer module core.transformer.utils module core.typed_torch module core.utils module core_attention (core.transformer.attention.CrossAttentionSubmodules attribute) (core.transformer.attention.SelfAttentionSubmodules attribute) (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) core_attention() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) CoreAttentionBuilder (class in core.transformer.attention) CoreAttentionInterface (class in core.transformer.attention) correct_amax_history_if_needed() (in module core.fp8_utils) CORRECT_RESULT (core.rerun_state_machine.RerunDiagnostic attribute) count_replication() (in module core.optimizer.fully_sharded_optimizer) count_zeros() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) count_zeros_fp32() (in module core.optimizer.clip_grads) Countdown (class in core.distributed.fsdp.src.megatron_fsdp.experimental.countdown) Counter (class in core.inference.utils) counts (core.inference.text_generation_controllers.mtp_controller_mixin._CommitSegments attribute) cp (core.inference.shards_spec.InferenceShardSpec attribute) (core.process_groups_config.ProcessGroupCollection attribute) cp_backward_apply() (core.ssm.context_parallel.chunkwise.LinearAttentionCPBackend method) (core.ssm.context_parallel.gdp.FLAGatedDeltaProductCPBackend method) (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGatedDeltaProductCPBackend method) cp_backward_prepare() (core.ssm.context_parallel.chunkwise.LinearAttentionCPBackend method) (core.ssm.context_parallel.gdp.FLAGatedDeltaProductCPBackend method) (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGatedDeltaProductCPBackend method) cp_comm_type (core.transformer.transformer_config.TransformerConfig attribute) cp_forward_apply() (core.ssm.context_parallel.chunkwise.LinearAttentionCPBackend method) (core.ssm.context_parallel.gdp.FLAGatedDeltaProductCPBackend method) (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGatedDeltaProductCPBackend method) cp_forward_prepare() (core.ssm.context_parallel.chunkwise.LinearAttentionCPBackend method) (core.ssm.context_parallel.gdp.FLAGatedDeltaProductCPBackend method) (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGatedDeltaProductCPBackend method) cp_group (core.context_parallel.layout.ContextParallelLayoutManager attribute) (core.packed_seq_params.PackedSeqParams attribute) cp_rank (core.context_parallel.layout._LayoutParallelContext attribute) cp_scatter_cache (core.packed_seq_params.PackedSeqParams attribute) cp_size (core.context_parallel.layout._LayoutParallelContext attribute) cp_stream (core.extensions.transformer_engine.TEDotProductAttention attribute) CPBackwardPackedSummary (class in core.ssm.context_parallel.chunkwise) CPBackwardSummary (in module core.ssm.context_parallel.chunkwise) CPBackwardUnpackedSummary (class in core.ssm.context_parallel.chunkwise) CPForwardPackedSummary (class in core.ssm.context_parallel.chunkwise) CPForwardResult (class in core.ssm.context_parallel.chunkwise) CPForwardSummary (in module core.ssm.context_parallel.chunkwise) CPForwardUnpackedSummary (class in core.ssm.context_parallel.chunkwise) CPGradientsT (in module core.ssm.context_parallel.chunkwise) CPInputT (in module core.ssm.context_parallel.chunkwise) CPLayout (in module core.context_parallel.layout) CPSavedContext (class in core.ssm.context_parallel.chunkwise) cpu_offloading (core.model_parallel_config.ModelParallelConfig attribute) cpu_offloading_activations (core.model_parallel_config.ModelParallelConfig attribute) cpu_offloading_double_buffering (core.model_parallel_config.ModelParallelConfig attribute) cpu_offloading_num_layers (core.model_parallel_config.ModelParallelConfig attribute) cpu_offloading_retain_pinned_cpu_buffers (core.model_parallel_config.ModelParallelConfig attribute) cpu_offloading_weights (core.model_parallel_config.ModelParallelConfig attribute) cpu_ready_event (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) cpu_tensor_pool (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager property) create_all_gather_groups() (in module core.parallel_state) create_attention_mask (core.datasets.gpt_dataset.GPTDatasetConfig attribute) create_bwd_graph() (core.transformer.cuda_graphs._CudaGraphRunner method) create_cuda_graphs() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) create_cudagraphs() (core.transformer.cuda_graphs._CudagraphGlobalRecord class method) (core.transformer.cuda_graphs.TECudaGraphHelper method) (in module core.transformer.cuda_graphs) create_data_iterator() (in module core.datasets.data_schedule_utils) create_decentralized_global_plan() (core.dist_checkpointing.strategies.torch.MCoreSavePlanner method) create_events() (core.resharding.nvshmem_copy_service.core.gpu_resource_manager.GPUResourceManager method) create_fwd_graph() (core.transformer.cuda_graphs._CudaGraphRunner method) create_gpu_plans() (core.resharding.nvshmem_copy_service.planning.gpu_execution_planner.GPUExecutionPlanner method) create_group() (in module core.parallel_state) create_hierarchical_groups() (in module core.parallel_state) create_hybrid_dp_cp_groups() (in module core.parallel_state) create_layer_config() (in module core.models.hybrid.layers.utils) create_local_plan() (core.dist_checkpointing.strategies.torch.MCoreLoadPlanner method) (core.dist_checkpointing.strategies.torch.MCoreSavePlanner method) create_mcore_cudagraph_manager() (core.models.gpt.gpt_model.GPTModel method) (core.models.hybrid.hybrid_model.HybridModel method) (core.ssm.mamba_layer.MambaLayer method) (core.transformer.transformer_layer.HyperConnectionTransformerLayer method) (core.transformer.transformer_layer.MoETransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) create_nccl_mem_pool() (in module core.nccl_allocator) create_pg() (core.hyper_comm_grid.HyperCommGrid method) create_publisher() (core.inference.engines.async_zmq_communicator.RankedPubSub static method) create_strong_ref() (in module core.transformer.cuda_graphs) create_subscriber() (core.inference.engines.async_zmq_communicator.RankedPubSub method) create_unified_mempool() (in module core.inference.unified_memory) create_updated_function_signature() (in module core.distributed.fsdp.src.megatron_fsdp.utils) create_vmm_mem_pool() (in module core.allocator.vmm_symm_allocator) critical() (core.resharding.nvshmem_copy_service.logger.PELogger class method) cross_attention (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) cross_attention_hyper_connection (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) cross_attn (core.transformer.enums.AttnType attribute) cross_attn_bda (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) cross_entropy_fusion_impl (core.model_parallel_config.ModelParallelConfig attribute) cross_entropy_loss_fusion (core.model_parallel_config.ModelParallelConfig attribute) CrossAttention (class in core.transformer.attention) CrossAttentionSubmodules (class in core.transformer.attention) CrossEntropyTarget (in module core.models.backends) CSA (core.models.hybrid.layers.utils.Symbols attribute) csa_compress_ratios (core.transformer.transformer_config.TransformerConfig attribute) csa_compress_rotary_base (core.transformer.transformer_config.TransformerConfig attribute) csa_dense_mode (core.transformer.transformer_config.TransformerConfig attribute) csa_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) csa_qk_layernorm_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) csa_window_size (core.transformer.transformer_config.TransformerConfig attribute) cu_kv_lengths() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) cu_query_lengths() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) cu_seqlens (core.models.audio.packed_audio.PackedAudioEmbeddings property) (core.ssm.context_parallel.gdp_common.GDPInputs attribute) cu_seqlens_dp (core.ssm.context_parallel.gdp.GDPLocalContext attribute) (core.ssm.context_parallel.gdp.GDPSavedInputs attribute) cu_seqlens_kv (core.packed_seq_params.PackedSeqParams attribute) cu_seqlens_kv_padded (core.packed_seq_params.PackedSeqParams attribute) cu_seqlens_padded (core.context_parallel.layout._THDZigzagMetadata attribute) cu_seqlens_q (core.packed_seq_params.PackedSeqParams attribute) cu_seqlens_q_padded (core.packed_seq_params.PackedSeqParams attribute) cuda_dtoh_stream (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher attribute) cuda_graph (core.full_cuda_graph.FullCudaGraphWrapper attribute) (core.optimizer.optimizer_cuda_graph.OptimizerCudaGraphWrapper attribute) cuda_graph_all_prefills (core.inference.config.InferenceConfig attribute) cuda_graph_attr_cache (in module core.transformer.utils) cuda_graph_event (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager property) cuda_graph_event() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) cuda_graph_impl (core.transformer.transformer_config.TransformerConfig attribute) cuda_graph_max_tokens (core.inference.config.InferenceConfig attribute) cuda_graph_mixed_prefill_count (core.inference.config.InferenceConfig attribute) cuda_graph_modules (core.transformer.transformer_config.TransformerConfig attribute) CUDA_GRAPH_MODULES_DEPRECATIONS (in module core.transformer.cuda_graph_config) cuda_graph_pool_allocation() (in module core.tensor_parallel.gtp_cuda_graphs) cuda_graph_request_count (core.inference.engines.dynamic_engine.DynamicInferenceEngineStepResult attribute) (core.inference.text_generation_controllers.text_generation_controller.AsyncScheduleLogitsState attribute) cuda_graph_retain_backward_graph (core.transformer.transformer_config.TransformerConfig attribute) CUDA_GRAPH_ROUNDER (core.inference.batch_dimensions_utils.CUDAGraphBatchDimensionBuilder attribute) cuda_graph_scope (core.transformer.transformer_config.TransformerConfig attribute) cuda_graph_set_manual_hooks() (core.transformer.cuda_graphs.TECudaGraphHelper method) (core.transformer.cuda_graphs.VisionTECudaGraphHelper method) cuda_graph_sizing_distribution (core.inference.config.InferenceConfig attribute) cuda_graph_stream (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager property) cuda_graph_stream() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) cuda_graph_use_single_mempool (core.transformer.transformer_config.TransformerConfig attribute) cuda_graph_warmup_steps (core.transformer.transformer_config.TransformerConfig attribute) cudagraph_created (core.transformer.cuda_graphs._CudagraphGlobalRecord attribute) cudagraph_inference_record (core.transformer.cuda_graphs._CudagraphGlobalRecord attribute) cudagraph_record (core.transformer.cuda_graphs._CudagraphGlobalRecord attribute) cudagraph_reuse_ref_count (core.transformer.cuda_graphs.CudagraphBufferMetadata attribute) CUDAGraphBatchDimensionBuilder (class in core.inference.batch_dimensions_utils) CudagraphBufferMetadata (class in core.transformer.cuda_graphs) CudaGraphManager (class in core.transformer.cuda_graphs) CudaGraphModule (class in core.transformer.enums) CudaGraphScope (class in core.transformer.enums) CudaGraphSizingDistribution (class in core.inference.config) CudaRNGStatesTracker (class in core.tensor_parallel.random) cur_backward_chunk() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) cur_forward_chunk() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) curr_iter() (core.full_cuda_graph.FullCudaGraphWrapper method) (core.optimizer.optimizer_cuda_graph.OptimizerCudaGraphWrapper method) curr_iteration (core.full_cuda_graph.FullCudaGraphWrapper attribute) (core.optimizer.optimizer_cuda_graph.OptimizerCudaGraphWrapper attribute) current_image_embeddings() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) current_image_token_mask() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) current_input_and_position_ids() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) current_stage (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator property) (core.pipeline_parallel.p2p_communication.P2PCommunicator property) current_stream() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext method) custom (core.enums.Fp4Recipe attribute) (core.enums.Fp8Recipe attribute) custom_backward() (in module core.pipeline_parallel.schedules) custom_chat_template (core.tokenizers.text.libraries.sft_tokenizer.PromptConfig attribute) custom_recipe_factory (core.extensions.transformer_engine.TEQuantizationRecipe attribute) CuTeDSLGatedDeltaProductCPBackend (class in core.ssm.context_parallel.gdp_cutedsl) CuTeDSLGDPSavedMetadata (class in core.ssm.context_parallel.gdp_cutedsl) D d2h_stream (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager property) d_conv (core.inference.disaggregation.ssm_reshard.SSMStateDims attribute) d_inner (core.inference.disaggregation.ssm_reshard.SSMShardLayout property) d_inner_local (core.inference.disaggregation.ssm_reshard.SSMShardLayout property) d_model (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) d_state (core.inference.disaggregation.ssm_reshard.SSMStateDims attribute) data (core.dist_checkpointing.mapping.ShardedBase attribute) (core.dist_checkpointing.mapping.ShardedObject attribute) (core.dist_checkpointing.mapping.ShardedTensor attribute) (core.dist_checkpointing.mapping.ShardedTensorFactory attribute) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.Bucket attribute) (core.inference.moe.flashinfer_mxfp8.FlashInferRoutedMXFP8Weight attribute) (core.inference.quantization.mxfp8_tensor.MXFP8Tensor attribute) DATA_LOADING (core.telemetry.span_groups.MegatronSpanGroup attribute) data_parallel_group_ranks (core.resharding.utils.ParameterMetadata attribute) data_parallel_sharding_strategy (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BucketingPolicy attribute) data_parallel_size (core.datasets.gpt_dataset.GPTDatasetConfig attribute) data_read() (core.full_cuda_graph.FullCudaGraphWrapper method) (core.transformer.moe.paged_stash.PagedStashRunner method) DATA_READY (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightState attribute) DATA_READY_SYNC (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightState attribute) DataIteratorArgType (in module core.rerun_state_machine) DataParallelBuffer (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) DataParallelInferenceCoordinator (class in core.inference.data_parallel_inference_coordinator.coordinator) dataset_exists() (in module core.datasets.object_storage_utils) DataType (in module core.export.data_type) DBuffer (class in core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer) deallocate() (core.inference.contexts.mtp_metadata.MTPMetadata method) deallocate_inference_state_buffers() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) deallocate_output_tensor() (in module core.pipeline_parallel.schedules) deallocate_pipeline_outputs (core.model_parallel_config.ModelParallelConfig attribute) DEBUG (in module core.pipeline_parallel.fine_grained_activation_offload) debug() (core.resharding.nvshmem_copy_service.logger.PELogger class method) DEBUG_RANK (in module core.pipeline_parallel.fine_grained_activation_offload) debug_rank() (in module core.pipeline_parallel.fine_grained_activation_offload) debug_time() (in module core.dist_checkpointing.utils) decode_header() (in module core.inference.headers) decode_only (core.inference.text_generation_controllers.text_generation_controller.DynamicBatchControllerStepResult attribute) decode_req_count (core.inference.batch_dimensions_utils.InferenceBatchDimensions attribute) DecodeOnly (class in core.inference.text_generation_controllers.text_generation_controller) decoder (core.models.multimodal.llava_model.LLaVAModel property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.transformer.enums.LayerType attribute) decoder_input (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) decoder_model_with_local_default_spec() (in module core.models.multimodal.llava_spec) decoder_model_with_local_spec() (in module core.models.T5.t5_spec) decoder_model_with_transformer_engine_default_spec() (in module core.models.multimodal.llava_spec) (in module core.models.T5.t5_spec) decoder_seq_length (core.inference.inference_request.VLMInferenceRequest attribute) decoupled_lr (core.optimizer.optimizer_config.OptimizerConfig attribute) decoupled_min_lr (core.optimizer.optimizer_config.OptimizerConfig attribute) decoupled_weight_decay (core.optimizer.optimizer_config.OptimizerConfig attribute) decrement() (core.distributed.fsdp.src.megatron_fsdp.experimental.countdown.Countdown method) DeepSeekR1ReasoningParser (class in core.tokenizers.text.parsers.deepseek_r1_reasoning_parser) default() (core.config_logger.JSONEncoderWithMcoreTypes method) default_backward_func() (core.pipeline_parallel.utils.ScheduleNode method) default_cache_dir() (in module core.ssm.triton_cache_manager) DEFAULT_CONVERSION_DICT (in module core.export.trtllm.model_to_trllm_mapping.default_conversion_dict) default_embedding_ranks() (in module core.parallel_state) DEFAULT_IMAGE_TOKEN_INDEX (in module core.models.multimodal.llava_model) default_img_h (core.models.vision.encoder_registry.EncoderSpec attribute) default_img_w (core.models.vision.encoder_registry.EncoderSpec attribute) DEFAULT_MAX_PARAMS_PER_BATCH (in module core.resharding.planner) DEFAULT_MAX_TOKENS (core.inference.contexts.dynamic_context.DynamicInferenceContext attribute) default_param_overrides (core.optimizer.emerging_optimizers.EmergingOptimizerEntry attribute) default_position_embedding_ranks() (in module core.parallel_state) DEFAULT_SOUND_TOKEN_INDEX (in module core.models.multimodal.llava_model) default_temperature (core.inference.apis.serve_config.ServeConfig attribute) DEFAULT_TIKTOKEN_MAX_VOCAB (in module core.tokenizers.text.libraries.tiktoken_tokenizer) default_top_k (core.inference.apis.serve_config.ServeConfig attribute) default_top_p (core.inference.apis.serve_config.ServeConfig attribute) defer_embedding_wgrad_compute (core.model_parallel_config.ModelParallelConfig attribute) defer_npy_index_mmap (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) DeferredKvHandoff (class in core.inference.disaggregation.pending_handoff_imports) delay_offload_until_cuda_graph (core.transformer.transformer_config.TransformerConfig attribute) delay_wgrad_compute (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.model_parallel_config.ModelParallelConfig attribute) delayed (core.enums.Fp8Recipe attribute) delete_cuda_graphs() (core.transformer.cuda_graphs.TECudaGraphHelper method) (in module core.transformer.cuda_graphs) delta_offload_bytes_across_pp_ranks (core.transformer.transformer_config.TransformerConfig attribute) deprecate_args() (in module core.utils) deprecate_inference_params() (in module core.utils) deprecated() (in module core.utils) DEPRECATED_ARGS (in module core.inference.contexts.dynamic_context) (in module core.inference.engines.dynamic_engine) (in module core.inference.model_inference_wrappers.abstract_model_inference_wrapper) (in module core.inference.model_inference_wrappers.gpt.gpt_inference_wrapper) DepthwiseConvSubsampling (class in core.models.audio.nemo_transformer_encoder) dequantize_fp4_tensor() (in module core.fp4_utils) dequantize_fp8_tensor() (in module core.fp8_utils) dequantize_gtp_native_fp8() (in module core.tensor_parallel.generalized_tensor_parallelism) deregister_and_clear_gtp_symm_pools() (in module core.tensor_parallel.gtp_symmetric_memory) deregister_mem_pool() (in module core.allocator.vmm_symm_allocator) (in module core.nccl_allocator) deserialize() (core.inference.contexts.dynamic_context.ContextErrorFactory class method) (core.inference.inference_request.DynamicInferenceEvent class method) (core.inference.inference_request.InferenceRequest class method) (core.inference.sampling_params.SamplingParams class method) deserialize_ndarray() (in module core.inference.inference_request) deserialize_tensor() (in module core.inference.inference_request) dest_pe (core.resharding.nvshmem_copy_service.nvshmem_types.ScheduledBatch attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.SendRequest attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.WorkloadGroup attribute) dest_pos (core.resharding.nvshmem_copy_service.nvshmem_types.ReceiveRequest attribute) dest_rank (core.resharding.copy_services.base.SendOp attribute) dest_tensor (core.resharding.nvshmem_copy_service.nvshmem_types.ReceiveRequest attribute) destinations_safe (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) destroy() (core.hyper_comm_grid.HyperCommGrid method) (core.inference.symmetric_memory.SymmetricMemoryManager class method) (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) (core.models.mimo.model.base.MimoModel method) destroy_bridge_pgs() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator class method) destroy_broadcast_pgs() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator class method) destroy_global_memory_buffer() (in module core.parallel_state) destroy_model_parallel() (in module core.parallel_state) destroy_moe_metrics_tracker() (in module core.transformer.moe.moe_logging) destroy_num_microbatches_calculator() (in module core.num_microbatches_calculator) destroy_rerun_state_machine() (in module core.rerun_state_machine) detach() (core.models.common.utils.TransformerLayerNode method) determine_global_metadata() (in module core.dist_checkpointing.validation) determine_main_replica_uniform_distribution() (in module core.dist_checkpointing.exchange_utils) deterministic_mode (core.model_parallel_config.ModelParallelConfig attribute) detokenize() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController static method) (core.tokenizers.base_tokenizer.MegatronTokenizerBase method) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) detokenize_generations (core.inference.sampling_params.SamplingParams attribute) detokenize_generations() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) detokenize_stop_sequence (core.inference.sampling_params.SamplingParams attribute) detokenize_tokens() (in module core.inference.utils) device (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer property) (core.inference.quantization.mxfp8_tensor.MXFP8Tensor property) (core.resharding.nvshmem_copy_service.service.RemoteCopyService property) device_id (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) device_memory_summary() (in module core.inference.utils) dict_list_map_inplace() (in module core.dist_checkpointing.dict_utils) dict_list_map_outplace() (in module core.dist_checkpointing.dict_utils) diff() (in module core.dist_checkpointing.dict_utils) dim (core.resharding.utils.ShardingDescriptor attribute) dim_names (core.hyper_comm_grid._RankViewSpec attribute) dims (core.inference.disaggregation.ssm_reshard.SSMShardLayout attribute) disable() (core.msc_utils._FeatureFlag method) disable_batch_invariant_mode() (in module core.transformer.custom_layers.batch_invariant_kernels) disable_bf16_reduced_precision_matmul (core.transformer.transformer_config.TransformerConfig attribute) disable_ep_consensus (core.inference.config.InferenceConfig attribute) disable_forward_pre_hook() (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.models.mimo.model.base.MimoModel method) disable_jit_fuser() (in module core.jit) disable_offload() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) disable_parameter_transpose_cache (core.transformer.transformer_config.TransformerConfig attribute) disable_static_buffer_recording() (core.inference.contexts.routing_metadata.RoutingMetadata method) disable_symmetric_registration (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) DISABLED (core.rerun_state_machine.RerunMode attribute) DisaggDynamicInferenceEngine (class in core.inference.disaggregation.engine) disaggregated_params (core.inference.inference_request.DynamicInferenceRequest attribute) discard_all_outputs_and_register_unified_recompute() (core.tensor_parallel.random.CheckpointWithoutOutputManager method) discard_output_and_register_recompute() (core.tensor_parallel.random.CheckpointWithoutOutput method) discard_pending_kv_stored_events() (core.inference.contexts.dynamic_context.DynamoHelper method) DISCONNECT (core.inference.headers.Lifecycle attribute) dispatch() (core.transformer.moe.moe_layer.MoELayer method) (core.transformer.moe.token_dispatcher._DeepepManager method) (core.transformer.moe.token_dispatcher._DispatchManager method) (core.transformer.moe.token_dispatcher._HybridEPManager method) (core.transformer.moe.token_dispatcher._NCCLEPManager method) dispatch_postprocess() (core.transformer.moe.token_dispatcher.MoEAllGatherTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoETokenDispatcher method) (core.transformer.moe.token_dispatcher_inference.NCCLAllGatherDispatcher method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher method) dispatch_preprocess() (core.transformer.moe.token_dispatcher.MoEAllGatherTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoETokenDispatcher method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher method) distribute_main_replicas_with_precomputed_distribution() (in module core.dist_checkpointing.strategies.fully_parallel) distribute_saved_activations (core.transformer.transformer_config.TransformerConfig attribute) distribute_shards_to_ranks() (in module core.dist_checkpointing.exchange_utils) distribute_tensors() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer class method) DistributedDataParallel (class in core.distributed.distributed_data_parallel) DistributedDataParallelConfig (class in core.distributed.distributed_data_parallel_config) (class in core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config) DistributedDataset (in module core.datasets.blended_megatron_dataset_builder) DistributedOptimizer (class in core.optimizer.distrib_optimizer) DistributedTRTLLMModelWeightsConverter (class in core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter) dither (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) divide() (in module core.utils) do_kv_handoff (core.inference.sampling_params.SamplingParams attribute) document_indices (core.datasets.indexed_dataset.IndexedDataset property) done (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle attribute) DOT_PRECISION_AUTOTUNE_LIST (in module core.ssm.ops.gdp.solve_tril) DotProductAttention (class in core.transformer.dot_product_attention) DoubleBufferManager (class in core.resharding.nvshmem_copy_service.memory.double_buffer_manager) download_file() (core.datasets.object_storage_utils.S3Client method) dp (core.inference.shards_spec.InferenceShardSpec attribute) (core.process_groups_config.ProcessGroupCollection attribute) dp_axes (core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard.Placements attribute) DP_BALANCED (core.datasets.data_schedule.PackingSchedulerEnum attribute) dp_cp (core.process_groups_config.ProcessGroupCollection attribute) dp_cp_ag (core.process_groups_config.ProcessGroupCollection attribute) dp_cp_gtp_remat (core.process_groups_config.ProcessGroupCollection attribute) dp_gtp_remat (core.process_groups_config.ProcessGroupCollection attribute) dp_size (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout property) (core.resharding.refit._ParallelConfig attribute) DpBalancedScheduler (class in core.datasets.data_schedule) DRAFT (core.inference.contexts.mtp_metadata.MTPForwardMode attribute) drain_completed() (core.inference.disaggregation.handoff_completion_tracker.HandoffCompletionTracker method) drain_embedding_wgrad_compute() (in module core.utils) drop_last_partial_validation_sequence (core.datasets.gpt_dataset.GPTDatasetConfig attribute) drop_rate (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.GPTConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) drop_transfer_prefix_blocks() (in module core.inference.disaggregation.utils) DS_ATTENTION (core.models.hybrid.layers.utils.Symbols attribute) dsa_indexer_head_dim (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_k_norm_epsilon (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_k_norm_fp32 (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_loss_coeff (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_n_heads (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_rope_interleaved (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_rotate_activation (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_scoring_relu (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_skip_topk_offset (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_topk (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_topk_freq (core.transformer.transformer_config.TransformerConfig attribute) dsa_indexer_use_sparse_loss (core.transformer.transformer_config.TransformerConfig attribute) dsa_kernel_backend (core.transformer.transformer_config.TransformerConfig attribute) dsa_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) dst (core.resharding.copy_services.nccl_m2n_copy_service._LocalTransfer attribute) dst_config (core.resharding.refit._PlanCacheKey attribute) dst_dim_ranks (core.resharding.utils.ShardingDescriptor attribute) dst_head_slice() (core.inference.disaggregation.kv_reshard.KVReshardTransfer method) dst_hi (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) dst_layer (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) dst_layer_slice() (core.inference.disaggregation.kv_reshard.KVReshardTransfer method) dst_lo (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) dst_local_shape (core.resharding.planner._NativeParameterPart attribute) (core.resharding.utils.TensorReshardSpec attribute) dst_mesh (core.resharding.copy_services.nccl_m2n_copy_service._M2NChannel attribute) dst_param (core.resharding.execution._Writeback attribute) dst_param_name (core.resharding.utils.TensorReshardSpec attribute) dst_param_shape (core.resharding.utils.TensorReshardSpec attribute) dst_rank (core.inference.disaggregation.kv_reshard.KVReshardTransfer attribute) (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) dst_rank_offset (core.resharding.refit._PlanCacheKey attribute) dst_ranks (core.resharding.copy_services.nccl_m2n_copy_service._M2NTopology attribute) (core.resharding.utils.TensorReshardSpec attribute) dst_shard_dim (core.resharding.utils.TensorReshardSpec attribute) dst_slice (core.resharding.execution._Writeback attribute) (core.resharding.planner._NativeParameterPart attribute) (core.resharding.utils.TensorReshardSpec attribute) dst_stride (core.resharding.utils.ShardingDescriptor attribute) dst_view (core.resharding.copy_services.nccl_m2n_copy_service._LocalTransfer attribute) DSV4_COMPRESS_RATIO_MAP (core.models.hybrid.layers.utils.Symbols attribute) dt (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) dt_bias (core.ssm.gated_delta_net.common._GDNBase attribute) dt_bias_dim (core.ssm.gated_delta_net.common._GDNBase attribute) DType (class in core.datasets.indexed_dataset) dtype (core.dist_checkpointing.mapping.ShardedTensor attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer property) (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) (core.inference.quantization.mxfp8_tensor.MXFP8Tensor attribute) (core.resharding.utils.ParameterMetadata attribute) (core.resharding.utils.TensorReshardSpec attribute) (core.tensor_parallel.generalized_tensor_parallelism._TicketSlot attribute) dtype_from_code() (core.datasets.indexed_dataset.DType class method) dummy_block_idx (core.inference.contexts.mtp_metadata.MTPMetadata attribute) dummy_forward() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) dummy_step() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) DummyTimer (class in core.timers) dv (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) dynamic_res_preprocess() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) dynamic_resolution (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) dynamic_resolution_max_patches (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) dynamic_resolution_max_side (core.models.vision.encoder_registry.EncoderSpec attribute) dynamic_resolution_min_patches (core.inference.config.ImageProcessingConfig attribute) DynamicBatchControllerStepResult (class in core.inference.text_generation_controllers.text_generation_controller) DynamicGradScaler (class in core.optimizer.grad_scaler) DynamicInferenceContext (class in core.inference.contexts.dynamic_context) DynamicInferenceEngine (class in core.inference.engines.dynamic_engine) DynamicInferenceEngineStepResult (class in core.inference.engines.dynamic_engine) DynamicInferenceEvent (class in core.inference.inference_request) DynamicInferenceEventType (class in core.inference.inference_request) DynamicInferenceRequest (class in core.inference.inference_request) DynamicInferenceRequestRecord (class in core.inference.inference_request) DynamicVLMInferenceRequest (class in core.inference.inference_request) DynamoHelper (class in core.inference.contexts.dynamic_context) E e_proj (core.transformer.multi_token_prediction.MultiTokenPredictionLayerSubmodules attribute) effective_dtype() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) effective_prefill_chunk_length (core.inference.contexts.dynamic_context.PrefixMatch attribute) eh_proj (core.transformer.multi_token_prediction.MultiTokenPredictionLayerSubmodules attribute) elapsed() (core.timers.DummyTimer method) (core.timers.Timer method) (core.timers.TimerBase method) (core.utils.StragglerDetector method) element_size (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) (core.resharding.utils.ParameterMetadata attribute) emb_dim (core.models.audio.nemo_transformer_encoder.GPTConfig attribute) embd (core.process_groups_config.ProcessGroupCollection attribute) embedding (core.inference.engines.dynamic_engine._VisionCacheEntry attribute) (core.transformer.enums.LayerType attribute) embedding() (core.models.huggingface.qwen_model.QwenHuggingFaceModel method) embedding_init_method (core.transformer.transformer_config.TransformerConfig attribute) embedding_init_method_std (core.transformer.transformer_config.TransformerConfig attribute) embeddings (core.models.audio.packed_audio.PackedAudioEmbeddings attribute) EmergingOptimizerEntry (class in core.optimizer.emerging_optimizers) EMPTY (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BucketStatus attribute) empty() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer class method) empty_from_unique_key() (core.dist_checkpointing.mapping.ShardedObject class method) enable() (core.msc_utils._FeatureFlag method) enable_autocast (core.model_parallel_config.ModelParallelConfig attribute) enable_batch_invariant_mode() (in module core.transformer.custom_layers.batch_invariant_kernels) enable_chunked_prefill (core.inference.config.InferenceConfig attribute) enable_cuda_graph (core.transformer.transformer_config.TransformerConfig attribute) enable_decode_mode() (core.inference.contexts.static_context.StaticInferenceContext method) ENABLE_EXPERIMENTAL (in module core.config) enable_forward_pre_hook() (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.models.mimo.model.base.MimoModel method) enable_jit_fuser() (in module core.jit) enable_mhc_connections (core.transformer.transformer_config.TransformerConfig attribute) enable_offload() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) enable_prefill_mode() (core.inference.contexts.static_context.StaticInferenceContext method) enable_prefix_caching (core.inference.config.InferenceConfig attribute) (core.inference.inference_request.DynamicInferenceRequest attribute) enable_static_buffer_recording() (core.inference.contexts.routing_metadata.RoutingMetadata method) enabled (core.inference.contexts.mtp_metadata.MTPMetadata attribute) (core.utils.StragglerDetector property) enabled() (in module core.inference.moe.batch_invariant) encode_files() (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) encoder (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.transformer.enums.LayerType attribute) encoder_model_with_local_spec() (in module core.models.T5.t5_spec) encoder_model_with_transformer_engine_default_spec() (in module core.models.T5.t5_spec) encoder_or_decoder (core.enums.ModelType attribute) (core.transformer.enums.ModelType attribute) encoder_prompt (core.inference.inference_request.InferenceRequest attribute) encoder_time_stride (core.models.audio.audio_feature_config.NemoTransformerAudioTokenEstimator attribute) (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig property) encoder_tokens() (core.models.vision.vit_model.QwenPatchMerger method) EncoderDecoderTextGenerationController (class in core.inference.text_generation_controllers.encoder_decoder_text_generation_controller) EncoderSpec (class in core.models.vision.encoder_registry) end_document() (core.datasets.indexed_dataset.IndexedDatasetBuilder method) end_forward() (core.inference.contexts.mtp_metadata.MTPMetadata method) end_wd (core.optimizer_param_scheduler.ParamGroupOverride attribute) EnergyMonitor (class in core.energy_monitor) engine (core.inference.apis._llm_base._MegatronLLMBase property) ENGINE_REPLY (core.inference.headers.Request attribute) ENGINE_REPLY_PARTIAL (core.inference.headers.Request attribute) EngineState (class in core.inference.engines.dynamic_engine) EngineSuspendedError enorm (core.transformer.multi_token_prediction.MultiTokenPredictionLayerSubmodules attribute) ensure_divisibility() (in module core.utils) ensure_finalized() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext method) ensure_initialized() (core.transformer.moe.moe_logging.MoEMetricsTracker method) ensure_metadata_has_dp_cp_group() (in module core.transformer.utils) ensure_mxfp8_scale_dtype() (in module core.inference.quantization.mxfp8_tensor) ensure_nccl_ep_bootstrapped() (in module core.transformer.moe.fused_a2a) ensure_nvshmem_compat() (in module core.resharding.nvshmem_copy_service.compat) ensure_params_ready() (in module core.utils) enter_replay() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) entrypoint() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator class method) eod (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract property) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer property) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer property) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer property) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision property) eod_mask_loss (core.datasets.gpt_dataset.GPTDatasetConfig attribute) eos (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) eos_id (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract property) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer property) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) ep (core.inference.shards_spec.InferenceShardSpec attribute) (core.process_groups_config.ProcessGroupCollection attribute) ep_consensus_interval (core.inference.config.InferenceConfig attribute) ep_overlap_early_attn_memory_release (core.model_parallel_config.ModelParallelConfig attribute) ep_rank (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) ep_size (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) (core.resharding.refit._ParallelConfig attribute) EQUAL (core.models.mimo.comm.colocated_communicator.BridgeDirection attribute) erf_gelu() (in module core.transformer.utils) error (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle attribute) error() (core.resharding.nvshmem_copy_service.logger.PELogger class method) ERROR_NONTRANSIENT (core.inference.inference_request.DynamicInferenceEventType attribute) ERROR_TRANSIENT (core.inference.inference_request.DynamicInferenceEventType attribute) estimate() (core.models.audio.audio_feature_config.NemoTransformerAudioTokenEstimator method) estimate_flops() (core.models.audio.audio_projector.AudioProjection method) (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioModel method) estimate_from_num_frames() (core.models.audio.audio_feature_config.NemoTransformerAudioTokenEstimator method) etp_rank (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) etp_size (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) eval_mode (core.inference.apis.serve_config.ServeConfig attribute) evaluation_recipe (core.extensions.transformer_engine.TEQuantizationParams attribute) event (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan property) event_add_engine (core.inference.inference_request.DynamicInferenceRequest attribute) events (core.inference.inference_request.DynamicInferenceRequest attribute) EVICT (core.inference.inference_request.DynamicInferenceEventType attribute) evict_lru_blocks() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) evict_overflow_paused_requests() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) evict_request_ids (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) exact_pad (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) exchange_by_distribution() (in module core.dist_checkpointing.exchange_utils) exchange_loaded_objects_gather_object() (in module core.dist_checkpointing.exchange_utils) exchange_loaded_tensors_broadcast() (in module core.dist_checkpointing.exchange_utils) exchange_loaded_tensors_gather_object() (in module core.dist_checkpointing.exchange_utils) exchange_loaded_tensors_gather_rounds() (in module core.dist_checkpointing.exchange_utils) execute_pipeline() (core.resharding.nvshmem_copy_service.core.pipeline_executor.PipelineExecutor method) execute_plan() (core.resharding.copy_services.base.CopyService method) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) execute_reshard_plan() (in module core.resharding.execution) execution_batch_bytes (core.resharding.refit._PlanCacheKey attribute) (core.resharding.utils.ReshardPlan attribute) exists() (core.datasets.indexed_dataset.IndexedDataset static method) EXIT_CODE_FAILED_ON_RESULT_VALIDATION (in module core.rerun_state_machine) EXIT_CODE_RESUME_TO_DISAMBIGUATE (in module core.rerun_state_machine) exit_replay() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) exp() (in module core.ssm.ops.gdp.common) exp2() (in module core.ssm.ops.gdp.common) exp_avg_dtype (core.optimizer.optimizer_config.OptimizerConfig attribute) exp_avg_sq_dtype (core.optimizer.optimizer_config.OptimizerConfig attribute) experimental_api() (in module core.distributed.fsdp.src.megatron_fsdp.fully_shard) (in module core.utils) experimental_attention_variant (core.transformer.transformer_config.TransformerConfig attribute) experimental_attention_variant_loss_scale_func (core.transformer.transformer_config.TransformerConfig attribute) experimental_cls() (in module core.utils) experimental_fn() (in module core.utils) ExperimentalNotEnabledError EXPERT_BIAS (core.transformer.moe.router_diagnostics.RouterDiagnosticChannel attribute) expert_data_parallel_sharding_strategy (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BucketingPolicy attribute) expert_gtp_remat_size (core.resharding.refit._ParallelConfig attribute) expert_gtp_weight_remat_size (core.model_parallel_config.ModelParallelConfig attribute) expert_model_parallel_size (core.model_parallel_config.ModelParallelConfig attribute) expert_outer_dp_sharding_strategy (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) expert_parallel_group_ranks (core.resharding.utils.ParameterMetadata attribute) expert_param_local_key() (in module core.transformer.fsdp_dtensor_checkpoint) expert_tensor_parallel_num_weight_shards (core.model_parallel_config.ModelParallelConfig attribute) expert_tensor_parallel_size (core.model_parallel_config.ModelParallelConfig attribute) expert_tp_size (core.resharding.refit._ParallelConfig attribute) experts (core.transformer.moe.moe_layer.MoESubmodules attribute) ExpertsBuilder (class in core.transformer.moe.moe_layer) ExpertsInterface (class in core.transformer.moe.moe_layer) ExpertsType (in module core.transformer.moe.upcycling_utils) EXPONENTIAL (core.inference.config.CudaGraphSizingDistribution attribute) export_geometry_meta() (in module core.inference.disaggregation.transfer_backends.base) export_meta() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend method) (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend method) ExportConfig (class in core.export.export_config) expt_dp (core.process_groups_config.ProcessGroupCollection attribute) expt_dp_ag (core.process_groups_config.ProcessGroupCollection attribute) expt_dp_gtp_remat (core.process_groups_config.ProcessGroupCollection attribute) expt_gtp_remat (core.process_groups_config.ProcessGroupCollection attribute) expt_outer_fsdp_group (core.distributed.fsdp.src.megatron_fsdp.utils.FSDPDistributedIndex attribute) expt_tp (core.inference.shards_spec.InferenceShardSpec attribute) (core.process_groups_config.ProcessGroupCollection attribute) ExtendedRMSNorm (class in core.ssm.gated_delta_product) (class in core.ssm.mamba_mixer) external_cuda_graph (core.transformer.transformer_config.TransformerConfig attribute) extra_repr() (core.extensions.transformer_engine.TEColumnParallelLinear method) (core.extensions.transformer_engine.TELayerNormColumnParallelLinear method) (core.extensions.transformer_engine.TERowParallelLinear method) (core.tensor_parallel.layers.ColumnParallelLinear method) (core.tensor_parallel.layers.RowParallelLinear method) extract_matching_values() (in module core.dist_checkpointing.dict_utils) extract_nemo_archive() (in module core.models.audio.nemo_audio_checkpoint) extract_nonpersistent() (in module core.dist_checkpointing.utils) extract_param_metadata() (in module core.resharding.utils) extract_sharded_base() (in module core.dist_checkpointing.utils) extract_sharded_tensors() (in module core.dist_checkpointing.utils) extract_sharded_tensors_and_factories() (in module core.dist_checkpointing.utils) extract_tool_calls() (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser method) ExtractedToolCallInformation (in module core.tokenizers.text.parsers.qwen3_coder_tool_parser) F FactoryBuildFn (in module core.dist_checkpointing.mapping) FactoryMergeFn (in module core.dist_checkpointing.mapping) FAIL (core.inference.inference_request.DynamicInferenceEventType attribute) FAILED (core.inference.inference_request.Status attribute) failed() (core.inference.inference_request.DynamicInferenceRequest method) failed_tasks (core.resharding.nvshmem_copy_service.validation.ValidationSummary attribute) FAILURE (core.inference.unified_memory.CompilationState attribute) fallback_logger (in module core.dist_checkpointing.utils) FAN_IN (core.models.mimo.comm.colocated_communicator.BridgeDirection attribute) FAN_OUT (core.models.mimo.comm.colocated_communicator.BridgeDirection attribute) fast_cache_load (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) fast_exp() (in module core.ssm.ops.mamba2.mamba_ssm) fast_gelu() (in module core.activations) fault_injector_delay_start_iteration (core.fault_injector.FaultInjectorConfig attribute) fault_injector_fault_delay (core.fault_injector.FaultInjectorConfig attribute) fault_injector_fault_probabilities (core.fault_injector.FaultInjectorConfig attribute) fault_injector_fault_types (core.fault_injector.FaultInjectorConfig attribute) fault_injector_mtti_seconds (core.fault_injector.FaultInjectorConfig attribute) fault_injector_num_ranks (core.fault_injector.FaultInjectorConfig attribute) fault_injector_offset_seconds (core.fault_injector.FaultInjectorConfig attribute) fault_injector_ranks (core.fault_injector.FaultInjectorConfig attribute) fault_injector_seed (core.fault_injector.FaultInjectorConfig attribute) FaultInjectorConfig (class in core.fault_injector) FC1_FORWARD_DONE (core.transformer.moe.shared_experts.SharedExpertState attribute) FC2_FORWARD_DONE (core.transformer.moe.shared_experts.SharedExpertState attribute) features (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) FeedForward (class in core.models.audio.nemo_transformer_encoder) fetch_bucket() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) ffn_fc_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) ffn_hidden_size (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) ffn_linear_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) ffn_projection_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) fill_in_deferred_sharded_objects() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelLoadStrategyWrapper static method) fill_in_deferred_sharded_tensors() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelLoadStrategyWrapper static method) filter_banks (core.models.audio.nemo_audio_preprocessing.AudioToMelSpectrogramPreprocessor property) filter_logits() (core.inference.sampling.torch_sampling.TorchSampling static method) filter_out_empty_flatten_tensor() (in module core.dist_checkpointing.state_dict_utils) filter_unflattened_state_dict() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) final_layernorm_bias (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) final_layernorm_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) finalize() (core.datasets.indexed_dataset.IndexedDatasetBuilder method) (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext method) (core.resharding.nvshmem_copy_service.core.gpu_resource_manager.GPUResourceManager method) (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) finalize_group_grads() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) finalize_layer() (core.context_parallel.layout.ContextParallelLayoutState method) finalize_layer_output() (core.context_parallel.layout.ContextParallelLayoutManager method) finalize_mhc_recompute_layer() (in module core.transformer.hyper_connection) finalize_model_grads() (in module core.distributed.finalize_model_grads) finalize_model_grads_func (core.model_parallel_config.ModelParallelConfig attribute) finalize_recv() (core.resharding.transforms.MXFP8ReshardTransform method) (core.resharding.transforms.ReshardTransform method) finalize_text() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) (core.inference.inference_request.DynamicInferenceRequest method) finalize_tile_workspace() (in module core.ssm.ops.common.determinism) finalized_params (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) find_class() (core.safe_globals.SafeUnpickler method) find_group_with_name() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) find_megatron_fsdp() (in module core.distributed.fsdp.src.megatron_fsdp.utils) find_next_group() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) fine_grained_activation_offloading (core.transformer.transformer_config.TransformerConfig attribute) fine_grained_offloading_disable_offload() (in module core.pipeline_parallel.fine_grained_activation_offload) fine_grained_offloading_enable_offload() (in module core.pipeline_parallel.fine_grained_activation_offload) fine_grained_offloading_group_flush_delayed_groups() (in module core.pipeline_parallel.fine_grained_activation_offload) fine_grained_offloading_group_offload() (in module core.pipeline_parallel.fine_grained_activation_offload) fine_grained_offloading_group_start() (in module core.pipeline_parallel.fine_grained_activation_offload) fine_grained_offloading_max_inflight_offloads (core.transformer.transformer_config.TransformerConfig attribute) FineGrainedActivationOffloadingInterface (class in core.pipeline_parallel.fine_grained_activation_offload) FineGrainedOffloadingBackwardRecordFunction (class in core.pipeline_parallel.fine_grained_activation_offload) FineGrainedOffloadingGroupCommitFunction (class in core.pipeline_parallel.fine_grained_activation_offload) FineGrainedOffloadingGroupStartFunction (class in core.pipeline_parallel.fine_grained_activation_offload) FINISH (core.inference.inference_request.DynamicInferenceEventType attribute) finish() (core.inference.async_stream.AsyncStream method) finish_all_groups() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) finish_embedding_wgrad_compute() (in module core.pipeline_parallel.schedules) finish_grad_sync() (core.distributed.data_parallel_base._BaseDataParallel method) (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV2 method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) (core.distributed.torch_fully_sharded_data_parallel.TorchFullyShardedDataParallel method) finish_init() (core.extensions.transformer_engine.TELayerNormColumnParallelLinear method) (core.extensions.transformer_engine.TELinear method) finish_param_sync() (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) finish_reason() (core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming.StreamingChatParser method) finished (core.inference.async_stream.AsyncStream property) finished_chunk_token_count (core.inference.inference_request.DynamicInferenceRequest attribute) finished_handoff_block_ids (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) finished_handoff_decode_tokens (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) finished_handoff_ssm_slots (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) finished_request_ids (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) finished_requests (core.inference.engines.dynamic_engine.DynamicInferenceEngineStepResult attribute) FinishedRequestRecord (class in core.inference.inference_request) First_dst (in module core.typed_torch) FIRST_ITERATION (core.telemetry.span_groups.MegatronSpanGroup attribute) first_last_layers_bf16 (core.transformer.transformer_config.TransformerConfig attribute) first_mismatch_actual (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) first_mismatch_expected (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) first_mismatch_idx (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) FIRST_PREFIX_BLOCK (core.inference.config.PrefixCachingCoordinatorPolicy attribute) FIRST_RERUN_NOT_REPRODUCIBLE (core.rerun_state_machine.RerunValidationStatus attribute) FIRST_RERUN_REPRODUCIBLE (core.rerun_state_machine.RerunValidationStatus attribute) FixedPoolAllocator (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) FLA_TRIL_PRECISION (in module core.ssm.ops.gdp.solve_tril) FLAGatedDeltaProductCPBackend (class in core.ssm.context_parallel.gdp) FLAGDPChunkwiseContextParallel (class in core.ssm.context_parallel.gdp) flash (core.transformer.enums.AttnBackend attribute) flash_attention_version (core.transformer.transformer_config.TransformerConfig attribute) flash_attn4_varlen_func (in module core.transformer.attention) flash_decode (core.transformer.transformer_config.TransformerConfig attribute) flash_decode() (core.transformer.attention.Attention method) flash_decode_and_prefill() (core.transformer.attention.Attention method) FLASHINFER (core.inference.moe.InferenceGroupedGemmBackend attribute) flashinfer_routed_mxfp8_moe() (in module core.inference.moe.flashinfer_mxfp8) flashinfer_routed_mxfp8_moe_prequantized() (in module core.inference.moe.flashinfer_mxfp8) FlashInferRoutedMXFP8Weight (class in core.inference.moe.flashinfer_mxfp8) FlashInferSampling (class in core.inference.sampling.flashinfer_sampling) Flat (class in core.distributed.fsdp.src.megatron_fsdp.experimental.placement) flat_counts (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout attribute) flatten_batch_for_packed_sequences() (in module core.utils) flatten_state_dict() (in module core.dist_checkpointing.strategies.torch) (in module core.transformer.fsdp_dtensor_checkpoint) flattened_range (core.dist_checkpointing.mapping.ShardedTensor attribute) (core.dist_checkpointing.mapping.ShardedTensorFactory attribute) float16_to_fp32() (in module core.transformer.module) Float16Module (class in core.transformer.module) Float16OptimizerWithFloat16Params (class in core.optimizer.optimizer) float32 (core.datasets.indexed_dataset.DType attribute) float64 (core.datasets.indexed_dataset.DType attribute) flush() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) (core.transformer.moe.router_trace.RouterTracer method) flush_delayed_groups() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) flush_link_tables() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam class method) flush_recompute_link_tables() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam class method) fn (core.optimizer.optimizer_config.ParamPredicate attribute) (core.optimizer.optimizer_config.ParamWithNamePredicate attribute) following_rank_stop (core.ssm.context_parallel.chunkwise.PackedSequenceCPMetadata attribute) force_all_tensors_to_non_fp8() (in module core.dist_checkpointing.utils) force_system_message (core.tokenizers.text.libraries.sft_tokenizer.PromptConfig attribute) fork() (core.tensor_parallel.random.CudaRNGStatesTracker method) format() (core.resharding.nvshmem_copy_service.logger.ColoredFormatter method) format_mem_bytes() (in module core.inference.engines.dynamic_engine) formatTime() (core.resharding.nvshmem_copy_service.logger.ColoredFormatter method) FORWARD (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule.Phase attribute) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.TrainingState attribute) forward (core.ssm.context_parallel.gdp.FLAGDPChunkwiseContextParallel attribute) forward() (core.distributed.data_parallel_base._BaseDataParallel method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.RegisterFSDPBackwardFunction static method) (core.extensions.transformer_engine.TEDotProductAttention method) (core.extensions.transformer_engine.TELayerNormColumnParallelLinear method) (core.extensions.transformer_engine.TELinear method) (core.extensions.transformer_engine.TELMHeadColumnParallelLinear method) (core.fusions.fused_bias_geglu.BiasGeGLUFunction static method) (core.fusions.fused_bias_geglu.GeGLUFunction static method) (core.fusions.fused_bias_geglu.WeightedBiasQuickGeGLUFunction static method) (core.fusions.fused_bias_geglu.WeightedQuickGeGLUFunction static method) (core.fusions.fused_bias_gelu.GeLUFunction static method) (core.fusions.fused_bias_swiglu.BiasSwiGLUFunction static method) (core.fusions.fused_bias_swiglu.SwiGLUFunction static method) (core.fusions.fused_bias_swiglu.WeightedSwiGLUFunction static method) (core.fusions.fused_cross_entropy._VocabParallelCrossEntropy static method) (core.fusions.fused_indices_converter.IndicesToMultihot static method) (core.fusions.fused_layer_norm.FusedLayerNorm method) (core.fusions.fused_mhc_kernels.FusedHAggregate static method) (core.fusions.fused_mhc_kernels.FusedHPostBDA static method) (core.fusions.fused_mla_yarn_rope_apply._FusedMLARoPEInplace static method) (core.fusions.fused_mla_yarn_rope_apply._FusedMLARoPEKVSplit static method) (core.fusions.fused_softmax.FusedScaleMaskSoftmax method) (core.fusions.fused_softmax.ScaledMaskedSoftmax static method) (core.fusions.fused_softmax.ScaledSoftmax static method) (core.fusions.fused_softmax.ScaledUpperTriangMaskedSoftmax static method) (core.fusions.fused_softmax.SoftmaxOne method) (core.fusions.fused_weighted_squared_relu.WeightedSquaredReLUFunction static method) (core.models.audio.audio_projector.AudioProjection method) (core.models.audio.nemo_audio_preprocessing.AudioToMelSpectrogramPreprocessor method) (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioModel method) (core.models.audio.nemo_transformer_encoder.ConvSubsampling method) (core.models.audio.nemo_transformer_encoder.DepthwiseConvSubsampling method) (core.models.audio.nemo_transformer_encoder.FeedForward method) (core.models.audio.nemo_transformer_encoder.GELU method) (core.models.audio.nemo_transformer_encoder.LayerNorm method) (core.models.audio.nemo_transformer_encoder.MultiHeadAttention method) (core.models.audio.nemo_transformer_encoder.MultiHeadAttentionWithFA method) (core.models.audio.nemo_transformer_encoder.MultiHeadAttentionWithSDPA method) (core.models.audio.nemo_transformer_encoder.MultiHeadAttentionWithTE method) (core.models.audio.nemo_transformer_encoder.NGPTStackingSubsampling method) (core.models.audio.nemo_transformer_encoder.TransformerBlock method) (core.models.audio.nemo_transformer_encoder.TransformerEncoder method) (core.models.bert.bert_lm_head.BertLMHead method) (core.models.bert.bert_model.BertModel method) (core.models.bert.pooler.Pooler method) (core.models.common.embeddings.language_model_embedding.LanguageModelEmbedding method) (core.models.common.embeddings.relative_pos_embedding.RelativePositionEmbedding method) (core.models.common.embeddings.rotary_pos_embedding.MultimodalRotaryEmbedding method) (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) (core.models.common.embeddings.yarn_rotary_pos_embedding.YarnRotaryEmbedding method) (core.models.common.utils.TransformerLayerNode method) (core.models.gpt.gpt_model.GPTModel method) (core.models.huggingface.clip_model.SiglipHuggingFaceModel method) (core.models.huggingface.fastconformer_model.ParakeetHuggingFaceModel method) (core.models.huggingface.module.AutoHuggingFaceModel method) (core.models.huggingface.qwen_model.QwenHuggingFaceModel method) (core.models.hybrid.hybrid_block.HybridStack method) (core.models.hybrid.hybrid_model.HybridModel method) (core.models.hybrid.layers.hybrid_hyper_connection.HyperConnectionHybridLayer method) (core.models.hybrid.shortcut_block.ShortcutMoEBlock method) (core.models.mimo.comm.colocated_communicator._ColocatedCommunicate static method) (core.models.mimo.model.base.MimoModel method) (core.models.multimodal.context_parallel.GatherFromContextParallelRanks static method) (core.models.multimodal.llava_model.LLaVAModel method) (core.models.T5.t5_model.T5LMHead method) (core.models.T5.t5_model.T5Model method) (core.models.vision.clip_vit_model.CLIPViTModel method) (core.models.vision.multimodal_projector.MultimodalProjector method) (core.models.vision.radio.RADIOViTModel method) (core.models.vision.vit_model.Kimi2DRotaryEmbedding method) (core.models.vision.vit_model.KimiLearned2DPosEmbed method) (core.models.vision.vit_model.KimiPatchMerger method) (core.models.vision.vit_model.KimiViTModel method) (core.models.vision.vit_model.PatchEmbedding method) (core.models.vision.vit_model.Pixtral2DRotaryEmbedding method) (core.models.vision.vit_model.PixtralLargePatchMerger method) (core.models.vision.vit_model.QwenLearnedPosEmbed method) (core.models.vision.vit_model.QwenPatchEmbedding method) (core.models.vision.vit_model.QwenPatchMerger method) (core.models.vision.vit_model.QwenVL2DRotaryEmbedding method) (core.models.vision.vit_model.QwenVLViTModel method) (core.models.vision.vit_model.ViTModel method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedOffloadingBackwardRecordFunction static method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedOffloadingGroupCommitFunction static method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedOffloadingGroupStartFunction static method) (core.pipeline_parallel.utils.NoopScheduleNode method) (core.pipeline_parallel.utils.ScheduleNode method) (core.pipeline_parallel.utils.StageDispatchBwdGrad static method) (core.post_training.modelopt.layers.Linear method) (core.ssm.context_parallel.gdp_common.GDPChunkwiseContextParallel static method) (core.ssm.gated_delta_net.common._GDNBase method) (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_layer.MambaLayer method) (core.ssm.mamba_mixer.MambaMixer method) (core.tensor_parallel.cross_entropy._VocabParallelCrossEntropy static method) (core.tensor_parallel.generalized_tensor_parallelism.GTPEmbeddingWeight static method) (core.tensor_parallel.inference_layers.InferenceColumnParallelLinear method) (core.tensor_parallel.inference_layers.InferenceLayerNormColumnParallelLinear method) (core.tensor_parallel.inference_layers.InferenceLinear method) (core.tensor_parallel.inference_layers.InferenceRowParallelLinear method) (core.tensor_parallel.layers.ColumnParallelLinear method) (core.tensor_parallel.layers.LinearWithFrozenWeight static method) (core.tensor_parallel.layers.LinearWithGradAccumulationAndAsyncCommunication static method) (core.tensor_parallel.layers.RowParallelLinear method) (core.tensor_parallel.layers.VocabParallelEmbedding method) (core.tensor_parallel.mappings._AllGatherFromTensorParallelRegion static method) (core.tensor_parallel.mappings._AllToAll static method) (core.tensor_parallel.mappings._CopyToModelParallelRegion static method) (core.tensor_parallel.mappings._GatherFromModelParallelRegion static method) (core.tensor_parallel.mappings._GatherFromSequenceParallelRegion static method) (core.tensor_parallel.mappings._ReduceFromModelParallelRegion static method) (core.tensor_parallel.mappings._ReduceScatterToSequenceParallelRegion static method) (core.tensor_parallel.mappings._ReduceScatterToTensorParallelRegion static method) (core.tensor_parallel.mappings._ScatterToModelParallelRegion static method) (core.tensor_parallel.mappings._ScatterToSequenceParallelRegion static method) (core.tensor_parallel.random.CheckpointFunction static method) (core.tensor_parallel.random.CheckpointWithoutOutputFunction static method) (core.transformer.attention.Attention method) (core.transformer.attention.CoreAttentionInterface method) (core.transformer.attention.LinearInterface method) (core.transformer.attention.LinearProjInterface method) (core.transformer.attention.LinearQkvInterface method) (core.transformer.cuda_graphs._CudagraphRecordNode static method) (core.transformer.cuda_graphs._CudagraphReplayNode static method) (core.transformer.custom_layers.batch_invariant_kernels.BatchInvariantRMSNormFn static method) (core.transformer.custom_layers.batch_invariant_kernels.BatchInvariantTEGemmFn static method) (core.transformer.dot_product_attention.DotProductAttention method) (core.transformer.hyper_connection.BroadcastTensorFused static method) (core.transformer.hyper_connection.HyperConnectionModule method) (core.transformer.hyper_connection.SinkhornKnopp static method) (core.transformer.identity_op.IdentityFuncOp method) (core.transformer.identity_op.IdentityOp method) (core.transformer.mlp.LinearFc1Interface method) (core.transformer.mlp.LinearFc2Interface method) (core.transformer.mlp.MLP method) (core.transformer.mlp.TEActivationFunctionInterface method) (core.transformer.module.Float16Module method) (core.transformer.moe.experts.GroupedLinearFc1Interface method) (core.transformer.moe.experts.GroupedLinearFc2Interface method) (core.transformer.moe.experts.InferenceGroupedMLP method) (core.transformer.moe.experts.SequentialMLP method) (core.transformer.moe.experts.TEGroupedMLP method) (core.transformer.moe.fused_a2a.FusedCombine static method) (core.transformer.moe.fused_a2a.FusedDispatch static method) (core.transformer.moe.fused_a2a.HybridEPCombine static method) (core.transformer.moe.fused_a2a.HybridEPDispatch static method) (core.transformer.moe.moe_layer._RecordExpertDgradCompletion static method) (core.transformer.moe.moe_layer._RegisterDelayedWgradForExperts static method) (core.transformer.moe.moe_layer.BaseMoELayer method) (core.transformer.moe.moe_layer.ExpertsInterface method) (core.transformer.moe.moe_layer.MoELayer method) (core.transformer.moe.moe_layer.RouterInterface method) (core.transformer.moe.moe_layer.SharedExpertsInterface method) (core.transformer.moe.moe_utils.MoEAuxLossAutoScaler static method) (core.transformer.moe.moe_utils.RandomSTE static method) (core.transformer.moe.moe_utils.RandomSTEShared static method) (core.transformer.moe.moe_utils.RouterGatingLinearFunction static method) (core.transformer.moe.paged_stash.PipelinePostScheduleFunction static method) (core.transformer.moe.paged_stash.PipelinePreScheduleFunction static method) (core.transformer.moe.router.InferenceTopKRouter method) (core.transformer.moe.router.Router method) (core.transformer.moe.router.TopKRouter method) (core.transformer.moe.shared_experts._BackwardStreamWait static method) (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) (core.transformer.moe.shared_experts.SharedExpertMLP method) (core.transformer.multi_latent_attention._QuantizeKVForFusedAttn static method) (core.transformer.multi_latent_attention.MultiLatentAttention method) (core.transformer.multi_token_prediction.MTPLossAutoScaler static method) (core.transformer.multi_token_prediction.MultiTokenPredictionBlock method) (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) (core.transformer.torch_norm.L2Norm method) (core.transformer.torch_norm.LayerNormInterface method) (core.transformer.transformer_block.TransformerBlock method) (core.transformer.transformer_layer.MlpInterface method) (core.transformer.transformer_layer.TransformerLayer method) (core.typed_torch._Module method) (core.utils.MakeViewlessTensor static method) forward_active (core.inference.contexts.mtp_metadata.MTPMetadata property) forward_backward_no_pipelining() (in module core.pipeline_parallel.schedules) forward_backward_pipelining_with_interleaving() (in module core.pipeline_parallel.schedules) forward_backward_pipelining_without_interleaving() (in module core.pipeline_parallel.schedules) forward_fused_softmax() (core.fusions.fused_softmax.FusedScaleMaskSoftmax method) forward_impl() (core.models.common.utils.PostProcessNode method) (core.models.common.utils.PreProcessNode method) (core.models.common.utils.TransformerLayerNode method) forward_input_split_sizes (core.context_parallel.layout.THDCPLayoutPlan attribute) forward_lm_only() (core.models.multimodal.llava_model.LLaVAModel method) forward_mode (core.inference.contexts.mtp_metadata.MTPMetadata attribute) forward_order (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext attribute) forward_output_split_sizes (core.context_parallel.layout.THDCPLayoutPlan attribute) forward_packed() (core.models.audio.audio_projector.AudioProjection method) (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioModel method) FORWARD_PASS_ORDER (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.PrefetchOrder attribute) forward_pass_with_pipeline_parallel() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) forward_pass_without_pipeline_parallel() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) (core.inference.model_inference_wrappers.t5.t5_inference_wrapper.T5InferenceWrapper method) forward_patches() (core.models.vision.vit_model.PatchEmbedding method) (core.models.vision.vit_model.QwenPatchEmbedding method) forward_post_core_attn() (core.ssm.gated_delta_net.common._GDNBase method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_layer.MambaLayer method) (core.ssm.mamba_mixer.MambaMixer method) (core.transformer.attention.Attention method) (core.transformer.module.TwoStageAttentionLayer method) (core.transformer.transformer_layer.TransformerLayer method) forward_pre_attn_and_core_attn() (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) (core.ssm.gated_delta_net.gdn2.GatedDeltaNet2 method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_layer.MambaLayer method) (core.ssm.mamba_mixer.MambaMixer method) (core.transformer.attention.Attention method) (core.transformer.module.TwoStageAttentionLayer method) (core.transformer.transformer_layer.TransformerLayer method) forward_prefetch_size (core.distributed.fsdp.src.megatron_fsdp.experimental.schedule.SchedulePolicy attribute) forward_receive_positions (core.context_parallel.layout.THDCPLayoutPlan attribute) forward_record() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) forward_send_indices (core.context_parallel.layout.THDCPLayoutPlan attribute) forward_single_position() (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) forward_step() (in module core.pipeline_parallel.schedules) forward_step_calc_loss() (in module core.pipeline_parallel.schedules) forward_torch_softmax() (core.fusions.fused_softmax.FusedScaleMaskSoftmax method) fp16 (core.model_parallel_config.ModelParallelConfig attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) fp32_residual_connection (core.transformer.transformer_config.TransformerConfig attribute) fp32_to_float16() (in module core.transformer.module) FP32Optimizer (class in core.optimizer.optimizer) fp4 (core.transformer.transformer_config.TransformerConfig attribute) fp4_param (core.extensions.transformer_engine.TEQuantizationRecipe attribute) (core.transformer.transformer_config.TransformerConfig attribute) fp4_param_gather (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) fp4_quantization_recipe (core.extensions.transformer_engine.TEQuantizationRecipe attribute) fp4_quantizer_factory (core.transformer.transformer_config.TransformerConfig attribute) fp4_recipe (core.transformer.transformer_config.TransformerConfig attribute) Fp4Recipe (class in core.enums) fp8 (core.transformer.transformer_config.TransformerConfig attribute) FP8_2D_BLOCKWISE_REAL_QUANT_CFG (in module core.post_training.modelopt.layers) fp8_amax_compute_algo (core.transformer.transformer_config.TransformerConfig attribute) fp8_amax_history_len (core.transformer.transformer_config.TransformerConfig attribute) fp8_create_transpose_cache() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) fp8_dequantize() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) fp8_discard_transpose_cache() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) fp8_dot_product_attention (core.transformer.transformer_config.TransformerConfig attribute) fp8_format (core.extensions.transformer_engine.TEQuantizationRecipe attribute) fp8_get_raw_data() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) fp8_interval (core.transformer.transformer_config.TransformerConfig attribute) fp8_margin (core.transformer.transformer_config.TransformerConfig attribute) fp8_multi_head_attention (core.transformer.transformer_config.TransformerConfig attribute) fp8_need_transpose_data() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) fp8_need_transpose_data_for_meta_device_init() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) fp8_output_proj (core.transformer.transformer_config.TransformerConfig attribute) fp8_pad_hook() (in module core.models.vision.radio) fp8_param (core.extensions.transformer_engine.TEQuantizationRecipe attribute) (core.transformer.transformer_config.TransformerConfig attribute) fp8_param_gather (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) FP8_PER_TENSOR_REAL_QUANT_CFG (in module core.post_training.modelopt.layers) fp8_quantization_recipe (core.extensions.transformer_engine.TEQuantizationRecipe attribute) fp8_quantize() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) fp8_quantizer_factory (core.transformer.transformer_config.TransformerConfig attribute) fp8_recipe (core.optimizer.optimizer_config.OptimizerConfig attribute) (core.transformer.transformer_config.TransformerConfig attribute) fp8_set_raw_data() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) fp8_wgrad (core.transformer.transformer_config.TransformerConfig attribute) Fp8Recipe (class in core.enums) FP8WeightTransformerLayer (class in core.post_training.modelopt.layers) fqns (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameter attribute) frame_manifest_magic (core.inference.config.VideoProcessingConfig attribute) frame_splicing (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) free() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.FixedPoolAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.MaxPoolAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.RotaryBucketAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.StorageResizeBasedBucketAllocator method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.TemporaryBucketAllocator method) (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorPool method) (core.resharding.nvshmem_copy_service.memory.double_buffer_manager.DoubleBufferManager method) (core.tensor_parallel.gtp_symmetric_memory.RegisteredLIFOPool method) free_bucket_storage() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) free_overlap_buffers() (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) (core.models.mimo.model.base.MimoModel method) freeze() (core.models.audio.nemo_transformer_encoder.TransformerEncoder method) (core.models.multimodal.llava_model.LLaVAModel method) freeze_base_model_for_mtp (core.transformer.transformer_config.TransformerConfig attribute) FREEZE_GC (in module core.transformer.cuda_graphs) fresh_init (core.dist_checkpointing.gpt_checkpoint_interop.GPTCompatLayerMaps attribute) from_bf16() (core.inference.quantization.mxfp8_tensor.MXFP8Tensor class method) from_config() (core.inference.moe.InferenceGroupedGemmBackend class method) (core.transformer.transformer_config.TransformerConfig class method) from_config_dict() (core.quantization.quant_config.RecipeConfig static method) from_dict() (core.inference.config.MultimodalPromptConfig class method) (core.models.audio.audio_feature_config.NemoAudioFeatureConfig class method) (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig class method) from_group() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.GroupOwnerLayout class method) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout class method) from_local() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer class method) from_model() (core.inference.config.MambaInferenceStateConfig class method) from_pretrained() (core.tokenizers.megatron_tokenizer.MegatronTokenizer method) from_rank_offsets() (core.dist_checkpointing.mapping.ShardedTensor class method) from_request() (core.inference.inference_request.DynamicInferenceRequestRecord class method) (core.inference.inference_request.FinishedRequestRecord class method) (core.inference.inference_request.OffloadedRequestPayload class method) from_sh_ten() (core.dist_checkpointing.strategies.checkpointable.CheckpointableShardedTensor class method) from_single_layout() (core.context_parallel.utils.ContextParallelBatch class method) from_state_dict() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict class method) from_str() (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout static method) from_yaml_file() (core.quantization.quant_config.RecipeConfig static method) front_backward_chunk() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) frontend_replicas (core.inference.apis.serve_config.ServeConfig attribute) fsdp_all_gather_in_start_param_sync (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) fsdp_db_use_persist_buf_on_alloc_fail (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) fsdp_double_buffer (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) fsdp_manual_registration (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) fsdp_parameters (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) fsdp_unit_id (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) fsdp_unit_modules (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BucketingPolicy attribute) FsdpContext (class in core.distributed.fsdp.src.megatron_fsdp.experimental.module) FSDPDistributedIndex (class in core.distributed.fsdp.src.megatron_fsdp.utils) FsdpModule (class in core.distributed.fsdp.src.megatron_fsdp.experimental.module) FsdpModule.Phase (class in core.distributed.fsdp.src.megatron_fsdp.experimental.module) FsdpParameter (class in core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group) FsdpParameterGroup (class in core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group) full_iteration (core.transformer.enums.CudaGraphScope attribute) full_iteration_inference (core.transformer.enums.CudaGraphScope attribute) full_numel() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout method) full_shape (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout attribute) full_validation (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) FullCudaGraphWrapper (class in core.full_cuda_graph) FullParamLayout (class in core.optimizer.param_layout) fully_shard() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) (in module core.distributed.fsdp.src.megatron_fsdp.fully_shard) fully_shard_context() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) fully_shard_model() (in module core.distributed.fsdp.src.megatron_fsdp.fully_shard) fully_shard_optimizer() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.optimizer) (in module core.distributed.fsdp.src.megatron_fsdp.fully_shard) FullyParallelLoadStrategyWrapper (class in core.dist_checkpointing.strategies.fully_parallel) FullyParallelSaveStrategyWrapper (class in core.dist_checkpointing.strategies.fully_parallel) FullyShardedDataParallel() (in module core.distributed.fsdp.mcore_fsdp_adapter) FullyShardedDataParallelV1 (class in core.distributed.fsdp.mcore_fsdp_adapter) FullyShardedDataParallelV2 (class in core.distributed.fsdp.mcore_fsdp_adapter) FullyShardedOptimizer (class in core.optimizer.fully_sharded_optimizer) FunctionCall (in module core.tokenizers.text.parsers.qwen3_coder_tool_parser) fuse_layernorm_and_linear() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) fused (core.transformer.enums.AttnBackend attribute) fused_add_3() (in module core.fusions.fused_mhc_kernels) fused_apply_mla_rope_for_kv() (in module core.fusions.fused_mla_yarn_rope_apply) fused_apply_mla_rope_for_q() (in module core.fusions.fused_mla_yarn_rope_apply) fused_h_aggregate() (in module core.fusions.fused_mhc_kernels) fused_h_post_bda() (in module core.fusions.fused_mhc_kernels) fused_h_res_h_post_bda() (core.transformer.hyper_connection.HyperConnectionModule method) fused_indices_to_multihot() (in module core.fusions.fused_indices_converter) fused_metadata_update() (in module core.inference.moe.metadata) fused_mla_rope_inplace() (in module core.fusions.fused_mla_yarn_rope_apply) fused_mla_rope_kv_split() (in module core.fusions.fused_mla_yarn_rope_apply) fused_mla_rope_out_of_place() (in module core.fusions.fused_mla_yarn_rope_apply) fused_pad_routing_map() (in module core.fusions.fused_pad_routing_map) fused_proj_rms_compute_h() (in module core.fusions.fused_mhc_kernels) fused_recurrent_gated_delta_rule_fwd_kernel() (in module core.ssm.ops.gdp.fused_recurrent) fused_recurrent_gated_delta_rule_update() (in module core.ssm.ops.gdp.fused_recurrent) fused_residual_rmsnorm (core.transformer.transformer_config.TransformerConfig attribute) fused_single_qkv_rope (core.transformer.transformer_config.TransformerConfig attribute) fused_sinkhorn() (in module core.fusions.fused_mhc_kernels) fused_vocab_parallel_cross_entropy() (in module core.fusions.fused_cross_entropy) FusedCombine (class in core.transformer.moe.fused_a2a) FusedDispatch (class in core.transformer.moe.fused_a2a) FusedHAggregate (class in core.fusions.fused_mhc_kernels) FusedHPostBDA (class in core.fusions.fused_mhc_kernels) FusedLayerNorm (class in core.fusions.fused_layer_norm) FusedMLASelfAttention (class in core.transformer.multi_latent_attention) FusedScaleMaskSoftmax (class in core.fusions.fused_softmax) FusedSharedExpertMLP (class in core.transformer.moe.shared_experts) future (core.inference.disaggregation.pending_handoff_imports.DeferredKvHandoff attribute) (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) (core.inference.engines.dynamic_engine.RequestEntry attribute) fwd (core.tensor_parallel.generalized_tensor_parallelism._TicketSlot attribute) fwd_buffer_reuse_ref_count (in module core.transformer.cuda_graphs) fwd_cudagraph_buffer (core.transformer.cuda_graphs.CudagraphBufferMetadata attribute) FWD_READY (core.transformer.cuda_graphs._GraphStatus attribute) G g (core.ssm.context_parallel.gdp_common.GDPInputs attribute) g_cumsum (core.ssm.context_parallel.gdp.GDPLocalContext attribute) g_dtype (core.ssm.context_parallel.gdp.GDPSavedInputs attribute) (core.ssm.context_parallel.gdp.GDPSavedMetadata attribute) g_interleaved (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) (core.ssm.context_parallel.gdp.GDPLocalContext attribute) GATED_ACTIVATION (in module core.export.trtllm.trtllm_weights_converter.utils) gated_delta_product_inference_stack_spec (in module core.models.hybrid.hybrid_layer_specs) gated_delta_product_stack_spec (in module core.models.hybrid.hybrid_layer_specs) gated_delta_rule (core.ssm.gated_delta_net.common._GDNBase attribute) gated_linear_unit (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) GatedDeltaNet (class in core.ssm.gated_delta_net.gdn) GatedDeltaNet2 (class in core.ssm.gated_delta_net.gdn2) GatedDeltaNetSubmodules (class in core.ssm.gated_delta_net.common) GatedDeltaProductMixer (class in core.ssm.gated_delta_product) GatedDeltaProductMixerSubmodules (class in core.ssm.gated_delta_product) GatedDeltaRuleInterface (class in core.ssm.gated_delta_net.common) gather_and_compute_chunk_metadata() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) gather_from_context_parallel_ranks() (in module core.models.multimodal.context_parallel) gather_from_context_parallel_ranks_dynamic_res() (in module core.models.multimodal.context_parallel) gather_from_sequence_parallel_region() (in module core.tensor_parallel.mappings) gather_from_tensor_model_parallel_region() (in module core.tensor_parallel.mappings) gather_split_1d_tensor() (in module core.tensor_parallel.utils) gather_uneven_dtensor_to_full_tensor() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) GatherFromContextParallelRanks (class in core.models.multimodal.context_parallel) gating() (core.transformer.moe.router.Router method) GDN (core.models.hybrid.layers.utils.Symbols attribute) gdn2_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) GDN_ATTENTION_VARIANTS (in module core.models.gpt.experimental_attention_variant_module_specs) gdn_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) GDNLayerConfig (class in core.ssm.gdn_layer_config) gdp_chunkwise_context_parallel() (in module core.ssm.context_parallel.gdp_common) gdp_cutedsl_kernel (core.transformer.transformer_config.TransformerConfig attribute) gdp_decode_prepare() (in module core.ssm.ops.gdp.decode_prepare) gdp_decode_prepare_kernel() (in module core.ssm.ops.gdp.decode_prepare) gdp_inference_stack_spec (in module core.models.hybrid.hybrid_layer_specs) gdp_num_chunk_states_to_recompute (core.transformer.transformer_config.TransformerConfig attribute) gdp_num_householder (core.inference.config.MambaInferenceStateConfig attribute) (core.transformer.transformer_config.TransformerConfig attribute) gdp_stack_spec (in module core.models.hybrid.hybrid_layer_specs) GDPBackwardContext (class in core.ssm.context_parallel.gdp) GDPChunkwiseContextParallel (class in core.ssm.context_parallel.gdp_common) GDPChunkwiseCPBackend (class in core.ssm.context_parallel.gdp_common) GDPContextParallel (class in core.ssm.gdp_context_parallel) GDPInputGradients (in module core.ssm.context_parallel.gdp_common) GDPInputs (class in core.ssm.context_parallel.gdp_common) GDPLocalContext (class in core.ssm.context_parallel.gdp) GDPSavedInputs (class in core.ssm.context_parallel.gdp) GDPSavedMetadata (class in core.ssm.context_parallel.gdp) geglu() (in module core.fusions.fused_bias_geglu) geglu_back() (in module core.fusions.fused_bias_geglu) GeGLUFunction (class in core.fusions.fused_bias_geglu) GELU (class in core.models.audio.nemo_transformer_encoder) gelu_impl() (in module core.transformer.utils) GeLUFunction (class in core.fusions.fused_bias_gelu) generate() (core.inference.apis.async_llm.MegatronAsyncLLM method) (core.inference.apis.llm.MegatronLLM method) (core.inference.engines.abstract_engine.AbstractEngine static method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) (core.inference.engines.static_engine.StaticInferenceEngine method) generate_all_output_tokens_static_batch() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) generate_cuda_graph_batch_dimensions_list() (core.inference.batch_dimensions_utils.CUDAGraphBatchDimensionBuilder static method) generate_deterministic_data() (in module core.resharding.nvshmem_copy_service.validation) generate_masked_orthogonal_rank_groups() (in module core.parallel_state) GENERATE_NUM (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common) generate_output_tokens_dynamic_batch() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) generate_using_dynamic_engine() (core.inference.engines.static_engine.StaticInferenceEngine method) generate_using_legacy_static_engine() (core.inference.engines.static_engine.StaticInferenceEngine method) generated_length (core.inference.inference_request.InferenceRequest attribute) generated_log_probs (core.inference.inference_request.InferenceRequest attribute) (core.inference.inference_request.OffloadedRequestPayload attribute) generated_segments (core.inference.inference_request.InferenceRequest attribute) generated_sequence_lengths (core.inference.inference_request.InferenceRequest attribute) generated_text (core.inference.inference_request.InferenceRequest attribute) GENERATED_TOKEN (core.inference.inference_request.DynamicInferenceEventType attribute) generated_token_ids (core.inference.inference_request.OffloadedRequestPayload attribute) generated_tokens (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.InferenceRequest attribute) generated_top_n_logprobs (core.inference.inference_request.InferenceRequest attribute) generator() (core.inference.async_stream.AsyncStream method) get() (core.datasets.gpt_dataset.MockGPTLowLevelDataset method) (core.datasets.indexed_dataset.IndexedDataset method) (core.inference.moe.vllm_fused_moe.VllmFusedMoeBuffers class method) (core.num_microbatches_calculator.NumMicroBatchesCalculator method) (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightCache method) get_A_log() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) get_active_request_count() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) get_active_sequence_lengths() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) get_active_used() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) get_ag_stream() (in module core.tensor_parallel.generalized_tensor_parallelism) get_align_size_for_quantization() (in module core.transformer.moe.moe_utils) get_all_ranks() (in module core.parallel_state) get_all_rng_states() (in module core.tensor_parallel.random) get_all_timers_string() (core.timers.Timers method) get_allocatable_count() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) get_amax_reduction_group() (in module core.parallel_state) get_arg_metas() (core.transformer.cuda_graphs._CudaGraphRunner method) get_asyncio_loop() (in module core.utils) get_attention_mask() (in module core.inference.utils) get_attr_wrapped_model() (in module core.utils) get_aux_loss_coeff() (core.transformer.moe.router.TopKRouter method) get_backend() (in module core.models.backends) get_backend_from_config() (in module core.models.backends) get_batch() (core.context_parallel.utils.ContextParallelBatch method) get_batch_and_global_seqlens() (in module core.datasets.data_schedule_utils) get_batch_for_context_window() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) (core.inference.model_inference_wrappers.gpt.gpt_inference_wrapper.GPTInferenceWrapper method) (core.inference.model_inference_wrappers.t5.t5_inference_wrapper.T5InferenceWrapper method) get_batch_invariant_attention_block_size() (in module core.transformer.custom_layers.batch_invariant_kernels) get_batch_invariant_backend() (in module core.transformer.custom_layers.batch_invariant_kernels) get_batch_invariant_collective() (in module core.transformer.custom_layers.batch_invariant_kernels) get_batch_on_this_cp_rank() (in module core.utils) get_batch_on_this_rank_for_sequence_packing() (in module core.datasets.data_schedule) get_batch_on_this_tp_rank() (in module core.utils) get_batch_per_block() (core.fusions.fused_softmax.FusedScaleMaskSoftmax static method) get_batches_on_this_cp_rank() (in module core.context_parallel.utils) get_bert_layer_with_transformer_engine_spec() (in module core.models.bert.bert_layer_specs) get_bert_layer_with_transformer_engine_submodules() (in module core.models.bert.bert_layer_specs) get_best_data_parallel_rank() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) get_bias_dropout_add() (in module core.fusions.fused_bias_dropout) get_bin_path() (in module core.datasets.indexed_dataset) get_blend_from_list() (in module core.datasets.utils) get_block_routing() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) get_boundary_pp_stage_ranks() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) get_bucket_key() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) get_buffer() (core.inference.symmetric_memory.SymmetricMemoryManager class method) (in module core.transformer.moe.fused_a2a) get_cached_cos_sin() (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) (core.models.common.embeddings.yarn_rotary_pos_embedding.YarnRotaryEmbedding method) get_canonical_lr_for_logging() (in module core.optimizer_param_scheduler) get_capacity() (in module core.transformer.moe.moe_utils) get_causal_conv1d_version() (in module core.utils) get_comm_stream() (in module core.pipeline_parallel.utils) get_committed_kv_block_counts() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) get_comms_for_chain() (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState method) get_comp_stream() (in module core.pipeline_parallel.utils) get_compute_units() (in module core.transformer.custom_layers.batch_invariant_kernels) get_config_keys() (core.extensions.transformer_engine.TEQuantizationRecipe class method) get_config_logger_path() (in module core.config_logger) get_connected_params() (core.transformer.cuda_graphs._CudaGraphRunner method) get_containing_parameter_group() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group) get_context() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) get_context_parallel_global_ranks() (in module core.parallel_state) get_context_parallel_group() (in module core.parallel_state) get_context_parallel_rank() (in module core.parallel_state) get_context_parallel_world_size() (in module core.parallel_state) get_conv1d_bias() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) get_conv1d_weight() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) get_cos_sin() (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) get_cpu_offload_context (in module core.transformer.transformer_block) get_cu_seqlens() (in module core.ssm.packed_seq_helpers) get_cuda_core_device_class() (in module core.resharding.nvshmem_copy_service.compat) get_cuda_rng_tracker() (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.tensor_parallel.random) get_cudagraph_runner() (core.transformer.cuda_graphs.CudaGraphManager method) get_current_global_batch_size() (core.num_microbatches_calculator.NumMicroBatchesCalculator method) (in module core.num_microbatches_calculator) get_current_running_global_batch_size() (core.num_microbatches_calculator.NumMicroBatchesCalculator method) (in module core.num_microbatches_calculator) get_D() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) get_data_parallel_group() (in module core.parallel_state) get_data_parallel_group_gloo() (in module core.parallel_state) get_data_parallel_group_if_dtensor() (in module core.utils) get_data_parallel_rank() (in module core.parallel_state) get_data_parallel_rng_tracker_name() (in module core.tensor_parallel.random) get_data_parallel_src_rank() (in module core.parallel_state) get_data_parallel_world_size() (in module core.parallel_state) get_data_tensors() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) get_default_causal_mask() (in module core.transformer.utils) get_default_load_sharded_strategy() (in module core.dist_checkpointing.serialization) get_default_log_ranks() (in module core._rank_utils) get_default_pg_collection() (in module core.transformer.moe.moe_utils) get_default_save_sharded_strategy() (in module core.dist_checkpointing.serialization) get_deprecated_cuda_graph_modules_migration() (in module core.transformer.cuda_graph_config) get_distributed_index() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) get_document_indices() (core.datasets.indexed_dataset.IndexedDataset method) get_dp_group() (core.distributed.fsdp.src.megatron_fsdp.utils.FSDPDistributedIndex method) get_dsa_module_spec_for_backend() (in module core.models.gpt.experimental_attention_variant_module_specs) get_dt_bias() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) get_dtensor() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) get_early_return_outputs() (core.transformer.moe.moe_utils.MoECudaGraphPartialCaptureSignal method) get_emb() (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) (core.models.common.embeddings.yarn_rotary_pos_embedding.YarnRotaryEmbedding method) get_embedding_group() (in module core.parallel_state) get_emerging_optimizers_version() (in module core.utils) get_ep_layer_offset() (in module core.transformer.fsdp_dtensor_checkpoint) get_evictable_block_count() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) get_experimental_attention_variant_module_spec() (in module core.models.gpt.experimental_attention_variant_module_specs) get_expert_data_parallel_group() (in module core.parallel_state) get_expert_data_parallel_group_gloo() (in module core.parallel_state) get_expert_data_parallel_rank() (in module core.parallel_state) get_expert_data_parallel_world_size() (in module core.parallel_state) get_expert_gtp_weight_remat_global_ranks() (in module core.parallel_state) get_expert_gtp_weight_remat_group() (in module core.parallel_state) get_expert_gtp_weight_remat_rank() (in module core.parallel_state) get_expert_gtp_weight_remat_world_size() (in module core.parallel_state) get_expert_index_from_key() (in module core.transformer.fsdp_dtensor_checkpoint) get_expert_model_parallel_group() (in module core.parallel_state) get_expert_model_parallel_rank() (in module core.parallel_state) get_expert_model_parallel_src_rank() (in module core.parallel_state) get_expert_model_parallel_world_size() (in module core.parallel_state) get_expert_parallel_rng_tracker_name() (in module core.tensor_parallel.random) get_expert_tensor_and_model_parallel_group() (in module core.parallel_state) get_expert_tensor_and_model_parallel_rank() (in module core.parallel_state) get_expert_tensor_and_model_parallel_world_size() (in module core.parallel_state) get_expert_tensor_model_pipeline_parallel_group() (in module core.parallel_state) get_expert_tensor_parallel_group() (in module core.parallel_state) get_expert_tensor_parallel_rank() (in module core.parallel_state) get_expert_tensor_parallel_world_size() (in module core.parallel_state) get_expert_zero_copy_buffers() (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoETokenDispatcher method) get_extra_state() (core.extensions.transformer_engine.TELMHeadColumnParallelLinear method) (core.tensor_parallel.layers.ColumnParallelLinear method) (core.tensor_parallel.layers.RowParallelLinear method) get_fa_version() (in module core.utils) get_fault() (in module core.fault_injector) get_fault_delay() (in module core.fault_injector) get_fault_ranks() (in module core.fault_injector) get_features() (core.models.audio.nemo_audio_preprocessing.AudioToMelSpectrogramPreprocessor method) get_flashinfer_version() (in module core.utils) get_forward_backward_func() (in module core.pipeline_parallel.schedules) get_fp4_align_size() (in module core.fp4_utils) get_fp8_align_size() (in module core.fp8_utils) get_freqs_non_repeated() (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) get_fsdp_buffer() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.GradReducePipeline method) get_fsdp_group() (core.distributed.fsdp.src.megatron_fsdp.utils.FSDPDistributedIndex method) get_full_tensor_if_necessary() (in module core.utils) get_func_args() (in module core.nccl_allocator) get_gated_delta_net_module_spec() (in module core.models.gpt.experimental_attention_variant_module_specs) get_global_GTP_cache() (in module core.tensor_parallel.generalized_tensor_parallelism) get_global_id_seqlens() (core.datasets.data_schedule.HybridCPDataLoaderWrapper method) get_global_memory_buffer() (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.parallel_state) get_global_seqlens() (core.datasets.data_schedule.HybridCPDataLoaderWrapper method) get_global_unique_param_name() (in module core.transformer.fsdp_dtensor_checkpoint) get_gpt_decoder_block_spec() (in module core.models.gpt.gpt_layer_specs) get_gpt_decoder_layer_specs() (in module core.models.gpt.gpt_layer_specs) get_gpt_layer_local_spec() (in module core.models.gpt.gpt_layer_specs) get_gpt_layer_local_submodules() (in module core.models.gpt.gpt_layer_specs) get_gpt_layer_with_inference_spec() (in module core.models.gpt.gpt_layer_specs) get_gpt_layer_with_inference_submodules() (in module core.models.gpt.gpt_layer_specs) get_gpt_layer_with_transformer_engine_spec() (in module core.models.gpt.gpt_layer_specs) get_gpt_layer_with_transformer_engine_submodules() (in module core.models.gpt.gpt_layer_specs) get_gpt_modelopt_spec() (in module core.post_training.modelopt.gpt.model_specs) get_gpt_mtp_block_spec() (in module core.models.gpt.gpt_layer_specs) get_gpt_mtp_block_spec_for_backend() (in module core.models.gpt.gpt_layer_specs) get_grad() (core.pipeline_parallel.utils.ScheduleNode method) get_grad_norm() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) get_grad_norm_fp32() (in module core.optimizer.clip_grads) get_grad_stats_parallel_group() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) get_grads_for_grad_norm() (core.optimizer.optimizer.MegatronOptimizer method) get_graph_pool() (in module core.full_cuda_graph) get_grouped_quantized_members() (in module core.fp8_utils) get_grouped_tensor_members() (in module core.fp8_utils) get_groups_and_subsamples() (core.datasets.data_schedule.BasePackingScheduler method) (core.datasets.data_schedule.DpBalancedScheduler method) (core.pipeline_parallel.hybrid_cp_schedule.BalancedCPScheduler method) get_gtp_ranks() (core.parallel_state.RankGenerator method) get_gtp_remat_rng_tracker_name() (in module core.tensor_parallel.random) get_gtp_runner_streams() (in module core.transformer.cuda_graphs) get_gtp_weight_remat_global_ranks() (in module core.parallel_state) get_gtp_weight_remat_group() (in module core.parallel_state) get_gtp_weight_remat_rank() (in module core.parallel_state) get_gtp_weight_remat_world_size() (in module core.parallel_state) get_hf_model_type() (in module core.models.huggingface.module) get_hidden_bytes() (in module core.transformer.moe.fused_a2a) get_hierarchical_context_parallel_groups() (in module core.parallel_state) get_hybrid_data_context_parallel_groups() (in module core.parallel_state) get_hybrid_layer_counts() (in module core.models.hybrid.hybrid_layer_allocation) get_hybrid_stack_modelopt_spec() (in module core.post_training.modelopt.hybrid.model_specs) get_hybrid_total_layer_count() (in module core.models.hybrid.hybrid_layer_allocation) get_hybrid_total_pipeline_segment_count() (in module core.models.hybrid.hybrid_layer_allocation) get_idx_path() (in module core.datasets.indexed_dataset) get_index_cache_path() (in module core.datasets.object_storage_utils) get_index_of_chunked_prefill_request() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) get_inference_optimized_moe_spec() (in module core.models.gpt.moe_module_specs) get_inner_quantization_context() (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) (core.transformer.transformer_layer.TransformerLayer method) get_instance() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager class method) (core.transformer.moe.paged_stash.PagedStashManager class method) get_inter_distributed_optimizer_instance_group() (in module core.parallel_state) get_intermediate_cpu_data() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) get_intra_distributed_optimizer_instance_group() (in module core.parallel_state) get_item() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) get_item_from_bucket() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) get_kvcache_utilization_stats() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) get_language_model_collection() (core.process_groups_config.MultiModuleProcessGroupCollection method) get_language_model_cp_size() (core.process_groups_config.MultiModuleProcessGroupCollection method) get_layer() (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan method) get_layer_id_list() (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout method) get_layer_maps_from_layer_type_list() (in module core.models.hybrid.hybrid_layer_allocation) get_layer_moe_metadata() (in module core.models.common.fine_grained_callables) get_layer_name_without_prefix() (in module core.export.trtllm.trtllm_layers) get_layer_norm_weights() (core.transformer.transformer_layer.TransformerLayer method) get_layer_offset() (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout method) get_layer_static_inputs() (core.transformer.module.GraphableMegatronModule method) (core.transformer.transformer_layer.HyperConnectionTransformerLayer method) (core.transformer.transformer_layer.TransformerLayer method) get_layer_symbol_from_config() (in module core.models.hybrid.layers.utils) get_layer_type_list_from_layer_config_list() (in module core.models.hybrid.hybrid_layer_allocation) get_leader_rank() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) get_least_loaded_data_parallel_rank() (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) get_linear_attention_pattern() (in module core.models.gpt.experimental_attention_variant_module_specs) get_linear_layer() (in module core.transformer.utils) get_local_model_weights_per_gpu() (core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter.SingleDeviceTRTLLMModelWeightsConverter method) get_local_range() (core.distributed.fsdp.src.megatron_fsdp.experimental.layout.GlobalLayout method) get_logical_hybrid_fsdp_rank() (core.distributed.fsdp.src.megatron_fsdp.utils.FSDPDistributedIndex method) get_loss_scale() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.optimizer.optimizer.MixedPrecisionOptimizer method) get_low_precision_context() (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan method) get_lr() (core.optimizer_param_scheduler.OptimizerParamScheduler method) get_mamba_stack_modelopt_spec (in module core.post_training.modelopt.hybrid.model_specs) get_mamba_version() (in module core.utils) get_mask() (core.parallel_state.RankGenerator method) get_max_deduplicated_groups() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) get_max_sequence_lengths() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) get_mcore_tensor_parallel_partition_dim() (in module core.distributed.fsdp.src.megatron_fsdp.utils) get_megatron_muon_optimizer() (in module core.optimizer.muon) get_megatron_optimizer() (in module core.optimizer) get_mem_alloc_context() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) get_mem_size_str() (in module core.inference.contexts.dynamic_context) get_mesh_names() (in module core.distributed.fsdp.src.megatron_fsdp.utils) get_metadata_types() (core.inference.inference_request.DynamicInferenceRequest static method) get_micro_batch_size() (core.num_microbatches_calculator.NumMicroBatchesCalculator method) (in module core.num_microbatches_calculator) get_mimo_optimizer() (in module core.models.mimo.optimizer) get_mismatch_errors() (core.transformer.cuda_graphs._CudaGraphRunner method) get_mla_fused_down_proj_splits() (in module core.transformer.fsdp_dtensor_checkpoint) get_mlp_layer_norm_weights() (core.transformer.transformer_layer.TransformerLayer method) get_mlp_module_spec() (in module core.models.gpt.gpt_layer_specs) get_mlp_module_spec_for_backend() (in module core.models.gpt.gpt_layer_specs) get_mode() (core.rerun_state_machine.RerunStateMachine method) get_model() (in module core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference) get_model_config() (in module core.utils) get_model_parallel_group() (in module core.parallel_state) get_model_parallel_src_rank() (in module core.parallel_state) get_model_type() (in module core.utils) get_model_xattn() (in module core.utils) get_module() (in module core.transformer.spec_utils) get_module_collection() (core.process_groups_config.MultiModuleProcessGroupCollection method) get_moe_layer_pattern() (in module core.models.gpt.experimental_attention_variant_module_specs) get_moe_layer_wise_logging_tracker() (in module core.transformer.moe.moe_utils) get_moe_metrics_tracker() (in module core.transformer.moe.moe_logging) get_moe_module_spec() (in module core.models.gpt.moe_module_specs) get_moe_module_spec_for_backend() (in module core.models.gpt.moe_module_specs) get_moe_router_tracer() (in module core.transformer.moe.router_trace) get_mtp_inner_layer_paths() (in module core.transformer.fsdp_dtensor_checkpoint) get_mtp_layer_offset() (in module core.transformer.multi_token_prediction) get_mtp_layer_spec() (in module core.transformer.multi_token_prediction) get_mtp_layer_spec_for_backend() (in module core.transformer.multi_token_prediction) get_mtp_num_layers_to_build() (in module core.transformer.multi_token_prediction) get_mtp_ranks() (in module core.transformer.multi_token_prediction) get_mup_config_overrides() (in module core.optimizer) get_nccl_options() (in module core.parallel_state) get_nemo_sound_model() (in module core.models.huggingface.fastconformer_model) get_new_request_id() (core.inference.engines.static_engine.StaticInferenceEngine method) (core.inference.scheduler.Scheduler method) get_num_image_embeddings() (in module core.models.vision.clip_vit_model) get_num_layers_to_build() (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout method) (in module core.transformer.transformer_block) get_num_microbatches() (in module core.num_microbatches_calculator) get_num_stages_from_str() (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout static method) get_num_video_embeddings() (in module core.models.vision.clip_vit_model) get_number_of_tokens_per_expert() (core.transformer.moe.token_dispatcher._DeepepManager method) (core.transformer.moe.token_dispatcher._HybridEPManager method) (core.transformer.moe.token_dispatcher._NCCLEPManager method) get_nvfp4_rowwise_packed_shape() (in module core.fp4_utils) get_object() (core.datasets.object_storage_utils.S3Client method) get_object_storage_access() (in module core.datasets.object_storage_utils) get_optim_param_to_id_map() (in module core.dist_checkpointing.optimizer) get_or_create_service() (in module core.resharding.refit) get_outer_fsdp_group() (core.distributed.fsdp.src.megatron_fsdp.utils.FSDPDistributedIndex method) get_output() (core.pipeline_parallel.utils.ScheduleNode method) (core.transformer.moe.shared_experts.SharedExpertMLP method) get_overlap_moe_expert_parallel_comm_order() (in module core.transformer.cuda_graphs) get_packed_seq_params() (core.context_parallel.utils.ContextParallelBatch method) (in module core.models.multimodal.context_parallel) get_padded_shard() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) get_padded_vocab_size() (core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter.SingleDeviceTRTLLMModelWeightsConverter method) get_padding() (in module core.models.multimodal.context_parallel) get_paged_stash_context() (in module core.transformer.moe.paged_stash) get_param_id_to_sharded_param_map() (in module core.dist_checkpointing.optimizer) get_parameter_local_cp() (in module core.ssm.gated_delta_net.common) get_parameter_owner() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.module_utils) get_parameter_state_dp_reshardable() (core.optimizer.distrib_optimizer.DistributedOptimizer method) get_parameter_state_dp_zero() (core.optimizer.distrib_optimizer.DistributedOptimizer method) get_parameters() (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) get_path_count() (in module core.config_logger) get_path_with_count() (in module core.config_logger) get_paused_used() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) get_permuted_hidden_states_by_experts() (core.transformer.moe.token_dispatcher._DeepepManager method) (core.transformer.moe.token_dispatcher._DispatchManager method) (core.transformer.moe.token_dispatcher._HybridEPManager method) (core.transformer.moe.token_dispatcher._NCCLEPManager method) get_pg() (core.hyper_comm_grid.HyperCommGrid method) get_pg_rank() (in module core.utils) get_pg_size() (in module core.utils) get_pg_src_rank() (in module core.utils) get_pipeline_model_parallel_first_rank() (in module core.parallel_state) get_pipeline_model_parallel_group() (in module core.parallel_state) get_pipeline_model_parallel_last_rank() (in module core.parallel_state) get_pipeline_model_parallel_next_rank() (in module core.parallel_state) get_pipeline_model_parallel_prev_rank() (in module core.parallel_state) get_pipeline_model_parallel_rank() (in module core.parallel_state) get_pipeline_model_parallel_world_size() (in module core.parallel_state) get_pointer() (core.resharding.nvshmem_copy_service.memory.tensor_pointer_utils.TensorPointerExtractor static method) get_pool_status() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorPool method) get_pos_emb_on_this_cp_rank() (in module core.models.common.embeddings.rope_utils) get_pos_enc() (core.models.vision.radio.RADIOViTModel method) get_position_embedding_group() (in module core.parallel_state) get_pp_first_rank() (in module core.pipeline_parallel.utils) get_pp_last_rank() (in module core.pipeline_parallel.utils) get_pp_next_rank() (in module core.pipeline_parallel.utils) get_pp_prev_rank() (in module core.pipeline_parallel.utils) get_pp_rank_microbatches() (in module core.pipeline_parallel.schedules) get_preexpanded_media_token_id() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) get_prefix_coordination_metrics() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) get_qattention_params_from_predefined (in module core.extensions.kitchen) get_qfa_params_from_recipe_name (in module core.extensions.kitchen) get_qkv_layer_norm_weights() (core.transformer.transformer_layer.TransformerLayer method) get_qlinear_params_from_predefined (in module core.extensions.kitchen) get_qlinear_params_from_qat_params (in module core.extensions.kitchen) get_quant_config_or_none() (in module core.quantization.utils) get_quantization_context() (core.transformer.cuda_graphs._CudaGraphRunner method) get_quantized_model_init_context_cls() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) get_query_key_value_tensors() (core.transformer.attention.Attention method) (core.transformer.attention.CrossAttention method) (core.transformer.attention.SelfAttention method) (core.transformer.multi_latent_attention.MLASelfAttention method) get_rank_enum() (core.hyper_comm_grid.HyperCommGrid method) get_ranks() (core.parallel_state.RankGenerator method) get_ready_bucket_group_for_reduction() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.GradReducePipeline method) get_recorded_data() (core.transformer.moe.router_replay.RouterReplay static method) get_recorded_indices() (core.transformer.moe.router_replay.RouterReplay method) get_recv_slot() (core.resharding.nvshmem_copy_service.memory.double_buffer_manager.DoubleBufferManager method) get_refit_tensor_dict() (in module core.resharding.utils) get_relative_seq_len() (core.models.common.embeddings.relative_pos_embedding.RelativePositionEmbedding static method) get_replay_topk() (core.transformer.moe.router_replay.RouterReplay method) get_request() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) get_required_sample_keys() (core.datasets.data_schedule.BasePackingScheduler method) (core.datasets.data_schedule.DpBalancedScheduler method) get_rerun_state_machine() (in module core.rerun_state_machine) get_restored_hidden_states_by_experts() (core.transformer.moe.token_dispatcher._DeepepManager method) (core.transformer.moe.token_dispatcher._DispatchManager method) (core.transformer.moe.token_dispatcher._HybridEPManager method) (core.transformer.moe.token_dispatcher._NCCLEPManager method) get_root_mesh() (core.distributed.fsdp.src.megatron_fsdp.utils.FSDPDistributedIndex method) get_rotary_seq_len() (core.models.common.embeddings.rotary_pos_embedding.RotaryEmbedding method) get_routing_indices() (core.inference.contexts.routing_metadata.RoutingMetadata method) get_rs_stream() (in module core.tensor_parallel.generalized_tensor_parallelism) get_schedule_layer() (core.transformer.moe.paged_stash.PagedStashManager method) get_schedule_table() (in module core.pipeline_parallel.schedules) get_send_slot() (core.resharding.nvshmem_copy_service.memory.double_buffer_manager.DoubleBufferManager method) get_seq_len() (core.models.audio.nemo_audio_preprocessing.AudioToMelSpectrogramPreprocessor method) get_shard_from_bucket() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) get_shard_from_local_buffer() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) get_sharding_strategies_in_use() (in module core.distributed.fsdp.src.megatron_fsdp.utils) get_sharding_strategy() (in module core.distributed.fsdp.src.megatron_fsdp.utils) get_shared_capture_stream() (in module core.full_cuda_graph) get_shared_graph_pool() (in module core.full_cuda_graph) get_skipped_iterations_from_tracker_file() (core.rerun_state_machine.RerunStateMachine class method) get_slice_info() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) get_sliding_window_causal_mask() (in module core.transformer.utils) get_slot() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) get_spec() (core.inference.config.MultimodalPromptConfig method) (in module core.models.vision.encoder_registry) get_special_tokens() (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) get_standard_config_overrides() (in module core.optimizer) get_states() (core.tensor_parallel.random.CudaRNGStatesTracker method) get_stream() (core.resharding.nvshmem_copy_service.core.gpu_resource_manager.GPUResourceManager method) get_stream_generator() (core.inference.engines.static_engine.StaticInferenceEngine method) get_submesh() (core.distributed.fsdp.src.megatron_fsdp.utils.FSDPDistributedIndex method) get_submodules() (in module core.transformer.spec_utils) get_supported_coefficient_types() (in module core.optimizer.emerging_optimizers) get_t5_decoder_with_local_block_spec() (in module core.models.T5.t5_spec) get_t5_decoder_with_transformer_engine_block_spec() (in module core.models.T5.t5_spec) get_t5_encoder_with_local_block_spec() (in module core.models.T5.t5_spec) get_t5_encoder_with_transformer_engine_block_spec() (in module core.models.T5.t5_spec) get_te_version() (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.utils) get_tensor() (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer method) (core.distributed.fsdp.src.megatron_fsdp.utils.GlobalMemoryBuffer method) (core.utils.GlobalMemoryBuffer method) get_tensor_and_context_parallel_group() (in module core.parallel_state) get_tensor_and_context_parallel_rank() (in module core.parallel_state) get_tensor_and_context_parallel_world_size() (in module core.parallel_state) get_tensor_and_data_parallel_group() (in module core.parallel_state) get_tensor_device() (in module core.pipeline_parallel.schedules) get_tensor_model_parallel_group() (in module core.parallel_state) get_tensor_model_parallel_group_if_none() (in module core.utils) get_tensor_model_parallel_rank() (in module core.parallel_state) get_tensor_model_parallel_src_rank() (in module core.parallel_state) get_tensor_model_parallel_world_size() (in module core.parallel_state) get_tensor_shapes() (in module core.pipeline_parallel.schedules) get_tensor_view() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer method) get_tensors() (core.transformer.cuda_graphs._CudaGraphRunner method) get_text_embeddings() (core.models.mimo.model.base.MimoModel method) get_tokens_per_expert_and_token_count() (in module core.transformer.moe.moe_utils) get_torch_stream() (core.resharding.nvshmem_copy_service.core.gpu_resource_manager.GPUResourceManager method) get_torch_version() (in module core.utils) get_total() (core.energy_monitor.EnergyMonitor method) get_total_num_experts() (in module core.transformer.fsdp_dtensor_checkpoint) get_total_used() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) get_total_workload() (core.pipeline_parallel.hybrid_cp_schedule.BalancedCPScheduler method) get_transformer_block_with_experimental_attention_variant_spec() (in module core.models.gpt.experimental_attention_variant_module_specs) get_transformer_layer_offset() (in module core.transformer.transformer_layer) get_transformer_layer_with_experimental_attention_variant_spec() (in module core.models.gpt.experimental_attention_variant_module_specs) get_trtllm_pretrained_config_and_model_weights() (core.export.trtllm.trtllm_helper.TRTLLMHelper method) get_unexpected_model_keys() (in module core.transformer.fsdp_dtensor_checkpoint) get_unflattened_state_dict() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) get_updated_expert_bias() (in module core.transformer.moe.moe_utils) get_virtual_pipeline_model_parallel_rank() (in module core.parallel_state) get_virtual_pipeline_model_parallel_world_size() (in module core.parallel_state) get_vision_cuda_graph_seq_length() (in module core.transformer.cuda_graphs) get_vit_layer_with_local_spec() (in module core.models.vision.vit_layer_specs) get_vit_layer_with_transformer_engine_spec() (in module core.models.vision.vit_layer_specs) get_wd() (core.optimizer_param_scheduler.OptimizerParamScheduler method) get_wgrad_tensor() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) GLOBAL_BLOCK_SIZE (in module core.transformer.moe.ops.paged_stash) global_expert_index (core.resharding.utils.ParameterMetadata attribute) global_head_hi (core.inference.disaggregation.kv_reshard.KVReshardTransfer attribute) global_head_lo (core.inference.disaggregation.kv_reshard.KVReshardTransfer attribute) global_layer (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) global_layer_hi (core.inference.disaggregation.kv_reshard.KVReshardTransfer attribute) global_layer_lo (core.inference.disaggregation.kv_reshard.KVReshardTransfer attribute) global_mempool (core.transformer.cuda_graphs.CudaGraphManager attribute) global_offset (core.dist_checkpointing.mapping.ShardedObject attribute) (core.dist_checkpointing.mapping.ShardedTensor attribute) global_rank (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) (core.inference.disaggregation.ssm_reshard.SSMShardLayout attribute) global_router_replay_instances (core.transformer.moe.router_replay.RouterReplay attribute) global_shape (core.dist_checkpointing.mapping.ShardedObject attribute) (core.dist_checkpointing.mapping.ShardedTensor attribute) (core.resharding.planner._NativeParameterPart attribute) (core.resharding.utils.TensorReshardSpec attribute) global_start (core.resharding.shard_planner._Segment attribute) GlobalLayout (class in core.distributed.fsdp.src.megatron_fsdp.experimental.layout) GlobalMemoryBuffer (class in core.distributed.fsdp.src.megatron_fsdp.utils) (class in core.utils) GlobMatcher (class in core.quantization.quant_config) GlooCopyService (class in core.resharding.copy_services.gloo_copy_service) glu_linear_offset (core.transformer.transformer_config.TransformerConfig attribute) gpt_compatible_layer_maps() (in module core.dist_checkpointing.gpt_checkpoint_interop) GPTCompatLayerMaps (class in core.dist_checkpointing.gpt_checkpoint_interop) GPTConfig (class in core.models.audio.nemo_transformer_encoder) GPTDataset (class in core.datasets.gpt_dataset) GPTDatasetConfig (class in core.datasets.gpt_dataset) GPTInferenceWrapper (class in core.inference.model_inference_wrappers.gpt.gpt_inference_wrapper) GPTModel (class in core.models.gpt.gpt_model) gpu_plan (core.resharding.nvshmem_copy_service.nvshmem_types.ScheduledBatch attribute) gpu_ready_event (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsGPUResult attribute) gpu_result (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) GPUExecutionPlanner (class in core.resharding.nvshmem_copy_service.planning.gpu_execution_planner) GPUResourceManager (class in core.resharding.nvshmem_copy_service.core.gpu_resource_manager) gpus_needed() (core.pipeline_parallel.hybrid_cp_schedule.BalancedCPScheduler method) grad (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BufferDistribution attribute) GRAD (core.distributed.param_and_grad_buffer.BufferType attribute) grad_buffer() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) grad_comm_dtype (core.distributed.fsdp.src.megatron_fsdp.mixed_precision.MixedPrecisionPolicy attribute) grad_divisor (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) grad_dtype (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) (core.optimizer.param_layout.BufferKey attribute) GRAD_NORM_GROUP_ATTR (in module core.optimizer.optimizer) grad_norm_skip_threshold (core.optimizer.optimizer_config.OptimizerConfig attribute) grad_reduce_in_fp32 (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) grad_scale_func (core.model_parallel_config.ModelParallelConfig attribute) grad_sync_func (core.model_parallel_config.ModelParallelConfig attribute) gradient (core.distributed.fsdp.mcore_fsdp_adapter._AxisPlacements attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard.Placements attribute) gradient_accumulation_fusion (core.model_parallel_config.ModelParallelConfig attribute) gradient_reduce_div_fusion (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) gradient_reduce_preprocessing() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) GradReducePipeline (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) grads_states_parallel_group_is_shared() (core.optimizer.optimizer.ChainedOptimizer method) grant_shape_mismatch_for_gtp_padding() (in module core.utils) graph_wgrad_ring_size (core.tensor_parallel.generalized_tensor_parallelism.GTPRematConfig attribute) GraphableMegatronModule (class in core.transformer.module) graphed (core.inference.contexts.mtp_metadata.MTPMetadata attribute) GRAPHED (core.tensor_parallel.generalized_tensor_parallelism.GTPChain attribute) graphs_created() (core.transformer.cuda_graphs.TECudaGraphHelper method) GraphWgradRingSlot (class in core.tensor_parallel.gtp_cuda_graphs) grid (core.models.mimo.optimizer.ModuleOptimizerInfo attribute) group (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.GroupOwnerLayout attribute) group_layers_into_shortcut_blocks() (in module core.models.hybrid.shortcut_block) group_limited_topk() (in module core.transformer.moe.moe_utils) group_offload() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface method) group_params_for_buffers() (in module core.distributed.param_and_grad_buffer) group_rank_by_logical_rank (core.context_parallel.layout._LayoutParallelContext attribute) group_size (core.context_parallel.layout._LayoutParallelContext property) grouped_gather_along_first_dim() (in module core.tensor_parallel.generalized_tensor_parallelism) grouped_gemm_batch_invariant() (in module core.transformer.custom_layers.batch_invariant_kernels) grouped_gemm_batch_invariant_alignment() (in module core.transformer.custom_layers.batch_invariant_kernels) grouped_mlp_modules() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) grouped_mm() (in module core.inference.moe.batch_invariant) grouped_mm_alignment() (in module core.inference.moe.batch_invariant) GroupedLinearFc1Builder (class in core.transformer.moe.experts) GroupedLinearFc1Interface (class in core.transformer.moe.experts) GroupedLinearFc2Builder (class in core.transformer.moe.experts) GroupedLinearFc2Interface (class in core.transformer.moe.experts) GroupedMLPSubmodules (class in core.transformer.moe.experts) GroupOwnerLayout (class in core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning) grow_ep_recv_capacity() (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) grow_recv_capacity() (core.transformer.moe.token_dispatcher._NCCLEPManager method) GTP_CONFIG (in module core.tensor_parallel.generalized_tensor_parallelism) gtp_local_pad_zero_count() (in module core.tensor_parallel.layers) gtp_native_fp8_load_context() (in module core.tensor_parallel.generalized_tensor_parallelism) gtp_pad_length (core.resharding.utils.ParameterMetadata attribute) gtp_remat (core.process_groups_config.ProcessGroupCollection attribute) gtp_remat_group_ranks (core.resharding.utils.ParameterMetadata attribute) gtp_remat_opt_in_modules (core.transformer.transformer_config.TransformerConfig attribute) gtp_remat_shard_dim0() (in module core.tensor_parallel.generalized_tensor_parallelism) gtp_remat_size (core.resharding.refit._ParallelConfig attribute) gtp_remat_slice_rows() (in module core.tensor_parallel.generalized_tensor_parallelism) gtp_replica_rank() (in module core.tensor_parallel.generalized_tensor_parallelism) gtp_symm_pool_ctx() (in module core.tensor_parallel.gtp_symmetric_memory) gtp_weight_remat_size (core.model_parallel_config.ModelParallelConfig attribute) GTPCaptureCommState (class in core.tensor_parallel.gtp_cuda_graphs) GTPChain (class in core.tensor_parallel.generalized_tensor_parallelism) GTPEmbeddingWeight (class in core.tensor_parallel.generalized_tensor_parallelism) GTPRematConfig (class in core.tensor_parallel.generalized_tensor_parallelism) GTPShardedParam (class in core.tensor_parallel.generalized_tensor_parallelism) GTPShardHandle (class in core.tensor_parallel.generalized_tensor_parallelism) GTPWeightCache (class in core.tensor_parallel.generalized_tensor_parallelism) GTPWeightState (class in core.tensor_parallel.generalized_tensor_parallelism) H h (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) h2d_stream (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager property) h_proj (core.transformer.multi_token_prediction.MultiTokenPredictionLayerSubmodules attribute) handle (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) handle_abort_request() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_connect() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_control_signal() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_cuda_profiler_signal() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_disconnect() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_engine_reply() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_engine_reply_partial() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_experts_in_state_dict() (in module core.transformer.fsdp_dtensor_checkpoint) handle_fp8_extra_state_case() (in module core.transformer.fsdp_dtensor_checkpoint) handle_gdn_in_state_dict() (in module core.transformer.fsdp_dtensor_checkpoint) handle_mla_down_proj_in_state_dict() (in module core.transformer.fsdp_dtensor_checkpoint) handle_mtp_in_state_dict() (in module core.transformer.fsdp_dtensor_checkpoint) handle_release_kv() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_shutdown() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_submit_request() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_submit_request_with_kv() (in module core.inference.data_parallel_inference_coordinator.handlers) handle_swiglu_in_state_dict() (in module core.transformer.fsdp_dtensor_checkpoint) HANDLERS (in module core.inference.data_parallel_inference_coordinator.handlers) handles (core.inference.disaggregation.pending_handoff_imports.PendingSSMImport attribute) HandoffCompletionTracker (class in core.inference.disaggregation.handoff_completion_tracker) HardwareProfile (class in core.optimizer.emerging_optimizers) has_admittable_kv_import (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin property) (core.inference.engines.dynamic_engine.DynamicInferenceEngine property) has_bos (core.tokenizers.text.libraries.sft_tokenizer.PromptConfig attribute) has_config_logger_enabled() (in module core.config_logger) has_cu_seqlens (core.ssm.context_parallel.gdp.GDPSavedMetadata attribute) has_final_layernorm_in_this_stage() (core.transformer.transformer_block.TransformerBlock method) has_gigatoken_support() (in module core.tokenizers.utils.utils) has_grad_norm_group() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) has_initial_states (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGDPSavedMetadata attribute) has_kv_event_listeners (core.inference.contexts.dynamic_context.DynamoHelper property) has_language_model() (core.process_groups_config.MultiModuleProcessGroupCollection method) has_language_module (core.models.mimo.config.role.RankRole property) has_modality_modules (core.models.mimo.config.role.RankRole property) has_native_spatial_merge (core.models.vision.encoder_registry.EncoderSpec attribute) has_nemo_audio_configs_in_checkpoint_dir() (in module core.models.audio.nemo_audio_checkpoint) has_nvrx_async_support() (in module core.dist_checkpointing.strategies.nvrx) has_receiver_derived_bridge_shapes (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator property) has_regular_grid (core.dist_checkpointing.mapping.ShardedTensor property) has_sharded_model_weights() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup method) has_state() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) has_system_role (core.tokenizers.text.libraries.sft_tokenizer.PromptConfig attribute) has_unfinished_requests() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) has_vlm_data (core.inference.contexts.dynamic_context.DynamicInferenceContext property) hashes (core.inference.disaggregation.pending_handoff_imports.DeferredKvHandoff attribute) (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) HAVE_APEX_OR_TE (in module core.optimizer.distrib_optimizer) HAVE_EMERGING_OPTIMIZERS (in module core.optimizer) HAVE_KITCHEN (in module core.extensions.kitchen) HAVE_NVRX (in module core.dist_checkpointing.strategies.torch) have_requests_pending() (core.inference.scheduler.Scheduler method) HAVE_TE (in module core.fp4_utils) (in module core.fp8_utils) HAVE_TE_FP4_TENSOR_CLASS (in module core.fp4_utils) HAVE_TE_FP8_TENSOR_CLASS (in module core.fp8_utils) HCA (core.models.hybrid.layers.utils.Symbols attribute) hcp (core.process_groups_config.ProcessGroupCollection attribute) head_dim (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) head_object() (core.datasets.object_storage_utils.S3Client method) head_range() (core.inference.disaggregation.kv_reshard.KVShardLayout method) headdim (core.inference.disaggregation.ssm_reshard.SSMStateDims attribute) HEADER_ENUMS (in module core.inference.headers) Headers (in module core.inference.headers) heads_per_partition (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) hetereogenous_dist_checkpoint (core.transformer.transformer_config.TransformerConfig attribute) heterogeneous_block_specs (core.transformer.transformer_config.TransformerConfig attribute) hfsdp_helper_gbuf (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) hfsdp_helper_wbuf (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) hfsdp_helper_wtbuf (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) hfsdp_param_gather_overlap (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) hidden (core.inference.text_generation_controllers.mtp_controller_mixin._CommitSegments attribute) hidden_dropout (core.transformer.transformer_config.TransformerConfig attribute) hidden_dtype (core.inference.contexts.mtp_metadata.MTPMetadata attribute) hidden_size (core.inference.contexts.mtp_metadata.MTPMetadata attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) hidden_states (core.transformer.moe.moe_utils.MoECudaGraphTensorStore attribute) (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) hierarchical_context_parallel_sizes (core.model_parallel_config.ModelParallelConfig attribute) high_priority_a2a_comm_stream (core.transformer.transformer_config.TransformerConfig attribute) highfreq (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) hnorm (core.transformer.multi_token_prediction.MultiTokenPredictionLayerSubmodules attribute) host (core.inference.apis.serve_config.ServeConfig attribute) hsdp_comm_gbuf (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) http_error_301() (core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions._NoRedirectHandler method) http_error_302 (core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions._NoRedirectHandler attribute) http_error_303 (core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions._NoRedirectHandler attribute) http_error_307 (core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions._NoRedirectHandler attribute) http_error_308 (core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions._NoRedirectHandler attribute) HuggingFaceFastIncrementalDetokenizer (class in core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer) HuggingFaceModule (class in core.models.huggingface.module) HuggingFaceTokenizer (class in core.tokenizers.text.libraries.huggingface_tokenizer) HYBRID (core.inference.config.CudaGraphSizingDistribution attribute) hybrid_context_parallel (core.datasets.gpt_dataset.GPTDatasetConfig attribute) (core.model_parallel_config.ModelParallelConfig attribute) hybrid_context_parallel_forward_backward() (in module core.pipeline_parallel.hybrid_cp_schedule) hybrid_dsv4_stack_spec (in module core.models.hybrid.hybrid_layer_specs) hybrid_inference_stack_spec (in module core.models.hybrid.hybrid_layer_specs) hybrid_stack_spec (in module core.models.hybrid.hybrid_layer_specs) hybrid_stack_spec_no_moe_grouped_gemm (in module core.post_training.modelopt.hybrid.model_specs) HybridCPDataLoaderWrapper (class in core.datasets.data_schedule) HybridDeviceOptimizer (class in core.optimizer.cpu_offloading.hybrid_optimizer) HYBRIDEP_TOKEN_ALIGNMENT (in module core.transformer.moe.fused_a2a) HybridEPCombine (class in core.transformer.moe.fused_a2a) HybridEPDispatch (class in core.transformer.moe.fused_a2a) HybridModel (class in core.models.hybrid.hybrid_model) HybridStack (class in core.models.hybrid.hybrid_block) HybridStackSubmodules (class in core.models.hybrid.hybrid_block) HyperCommGrid (class in core.hyper_comm_grid) HyperConnectionHybridLayer (class in core.models.hybrid.layers.hybrid_hyper_connection) HyperConnectionModule (class in core.transformer.hyper_connection) HyperConnectionTransformerLayer (class in core.transformer.transformer_layer) hysteresis (core.optimizer.optimizer_config.OptimizerConfig attribute) I id_to_token() (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) idempotent_in (core.inference.data_parallel_inference_coordinator.state.ControlTransition attribute) identity_template (in module core.tokenizers.text.libraries.sft_tokenizer) IdentityFuncOp (class in core.transformer.identity_op) IdentityOp (class in core.transformer.identity_op) IDLE (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.TrainingState attribute) (core.transformer.moe.shared_experts.SharedExpertState attribute) ids_to_text() (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract method) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) ids_to_tokens() (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract method) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) IGNORE_ALL (core.dist_checkpointing.validation.StrictHandling attribute) IGNORE_INDEX (in module core.models.multimodal.llava_model) (in module core.tokenizers.text.libraries.sft_tokenizer) image_config (core.inference.config.VideoProcessingConfig attribute) image_embeddings (core.inference.inference_request.DynamicVLMInferenceRequest attribute) image_h (core.datasets.multimodal_dataset.MultimodalDatasetConfig attribute) image_preprocessing_config (core.inference.config.InferenceConfig attribute) image_spec (core.inference.config.MultimodalPromptConfig attribute) IMAGE_TAGS (in module core.tokenizers.vision.libraries.multimodal_tokenizer) IMAGE_TOKEN (in module core.models.multimodal.llava_model) image_token_index (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer property) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision property) image_token_mask (core.inference.inference_request.DynamicVLMInferenceRequest attribute) image_w (core.datasets.multimodal_dataset.MultimodalDatasetConfig attribute) ImageProcessingConfig (class in core.inference.config) img_h (core.inference.config.ImageProcessingConfig attribute) img_w (core.inference.config.ImageProcessingConfig attribute) imgs (core.inference.engines.dynamic_engine._VisionCacheEntry attribute) (core.inference.inference_request.VLMInferenceRequest attribute) imgs_sizes (core.inference.engines.dynamic_engine._VisionCacheEntry attribute) (core.inference.inference_request.DynamicVLMInferenceRequest attribute) implicit_reasoning_end_markers (core.tokenizers.text.parsers.qwen3_coder_tool_parser.Qwen3CoderToolParser attribute) import_module() (in module core.transformer.spec_utils) import_package() (core.msc_utils._FeatureFlag method) in_activation_recompute_phase (in module core.tensor_parallel.generalized_tensor_parallelism) in_proj (core.ssm.gated_delta_net.common.GatedDeltaNetSubmodules attribute) (core.ssm.gated_delta_product.GatedDeltaProductMixerSubmodules attribute) (core.ssm.mamba_mixer.MambaMixerSubmodules attribute) in_proj_dim (core.ssm.gated_delta_net.common._GDNBase attribute) in_proj_extra_dim (core.ssm.gated_delta_net.common._GDNBase attribute) in_proj_qkvg_dim (core.ssm.gated_delta_net.common._GDNBase attribute) increment_batch_size_offset() (core.inference.contexts.base_context.BaseInferenceContext method) increment_sequence_len_offset() (core.inference.contexts.base_context.BaseInferenceContext method) index (core.tensor_parallel.gtp_cuda_graphs.GraphWgradRingSlot attribute) index_metadata_rosters() (in module core.resharding.planner) IndexedDataset (class in core.datasets.indexed_dataset) IndexedDatasetBuilder (class in core.datasets.indexed_dataset) IndexedOrder (class in core.distributed.fsdp.src.megatron_fsdp.experimental.indexed_order) IndicesToMultihot (class in core.fusions.fused_indices_converter) INFERENCE (core.telemetry.span_groups.MegatronSpanGroup attribute) inference_all_gather_from_tensor_model_parallel_region() (in module core.tensor_parallel.inference_layers) inference_chunk_size (core.ssm.ssm_inference.SSMChunking attribute) inference_cuda_graph_scope (core.transformer.transformer_config.TransformerConfig attribute) inference_disable_triton_nvls_kernels (core.transformer.transformer_config.TransformerConfig attribute) inference_flashinfer_mxfp8_token_capacity (core.transformer.transformer_config.TransformerConfig attribute) inference_fuse_tp_communication (core.transformer.transformer_config.TransformerConfig attribute) inference_grouped_gemm_backend (core.transformer.transformer_config.TransformerConfig attribute) inference_moe_disable_fused_quant_kernels (core.transformer.transformer_config.TransformerConfig attribute) inference_moe_token_dispatcher_type (core.transformer.transformer_config.TransformerConfig attribute) inference_parameters (core.inference.inference_request.InferenceRequest attribute) inference_pp_size (core.export.export_config.ExportConfig attribute) inference_reduce_scatter_to_sequence_parallel_region() (in module core.tensor_parallel.inference_layers) inference_rng_tracker (core.transformer.transformer_config.TransformerConfig attribute) inference_sampling_seed (core.transformer.transformer_config.TransformerConfig attribute) inference_tp_size (core.export.export_config.ExportConfig attribute) InferenceAllGatherDispatcherBase (class in core.transformer.moe.token_dispatcher_inference) InferenceBatchDimensions (class in core.inference.batch_dimensions_utils) InferenceClient (class in core.inference.inference_client) InferenceColumnParallelLinear (class in core.tensor_parallel.inference_layers) InferenceConfig (class in core.inference.config) InferenceCudaGraphScope (class in core.transformer.enums) InferenceGroupedGemmBackend (class in core.inference.moe) InferenceGroupedMLP (class in core.transformer.moe.experts) InferenceLayerNormColumnParallelLinear (class in core.tensor_parallel.inference_layers) InferenceLinear (class in core.tensor_parallel.inference_layers) InferenceMode (class in core.inference.utils) InferenceRequest (class in core.inference.inference_request) InferenceRowParallelLinear (class in core.tensor_parallel.inference_layers) InferenceShard (class in core.inference.shards) InferenceShardSpec (class in core.inference.shards_spec) InferenceSpecProvider (class in core.models.backends) InferenceStateHandoffMixin (class in core.inference.disaggregation.inference_state_handoff) InferenceTopKRouter (class in core.transformer.moe.router) info() (core.resharding.nvshmem_copy_service.logger.PELogger class method) inherit_model_init_context (core.extensions.transformer_engine.TEQuantizationRecipe attribute) init() (core.resharding.nvshmem_copy_service.core.gpu_resource_manager.GPUResourceManager method) (core.resharding.nvshmem_copy_service.logger.PELogger class method) (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) (in module core.allocator.vmm_symm_allocator) (in module core.nccl_allocator) init_backward_dw_wrapper() (core.transformer.module.GraphableMegatronModule method) init_chunk_handler() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) init_cuda_graph_cache() (in module core.transformer.utils) init_data() (core.dist_checkpointing.mapping.ShardedTensor method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) init_gigatoken_from_hf() (in module core.tokenizers.utils.utils) init_hybrid_ep_buffer() (in module core.transformer.moe.fused_a2a) init_method (core.transformer.transformer_config.TransformerConfig attribute) init_method_normal() (in module core.utils) init_method_std (core.transformer.transformer_config.TransformerConfig attribute) init_model_chunk_offload_handler() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) init_model_with_meta_device (core.transformer.transformer_config.TransformerConfig attribute) init_moe_router_tracer() (in module core.transformer.moe.router_trace) init_num_microbatches_calculator() (in module core.num_microbatches_calculator) init_permutation_map() (in module core.inference.moe.permute) init_state_fn (core.optimizer.emerging_optimizers.EmergingOptimizerEntry attribute) init_tensors() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict method) initial_loss_scale (core.optimizer.optimizer_config.OptimizerConfig attribute) INITIAL_RUN (core.rerun_state_machine.RerunState attribute) (core.rerun_state_machine.RerunValidationStatus attribute) initial_state (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) initial_value (core.distributed.fsdp.src.megatron_fsdp.experimental.countdown.Countdown property) initialize() (core.datasets.indexed_dataset.IndexedDataset method) initialize_all_tensors() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) initialize_attention_state() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) initialize_graph_wgrad_rings() (in module core.tensor_parallel.generalized_tensor_parallelism) initialize_model_parallel() (in module core.parallel_state) initialize_rerun_state_machine() (in module core.rerun_state_machine) initialize_rng_tracker() (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.tensor_parallel.random) initialized (core.resharding.nvshmem_copy_service.service.RemoteCopyService property) input_example() (core.models.audio.nemo_audio_preprocessing.AudioToMelSpectrogramPreprocessor method) input_expand() (core.transformer.hyper_connection.HyperConnectionModule static method) input_feature_dim (core.models.audio.audio_processor.NemoAudioProcessor property) input_ids (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) input_layernorm (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) input_layernorm_bias (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) input_layernorm_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) input_marker (core.inference.config.MediaPromptSpec attribute) input_segment_counts (core.context_parallel.layout._LayoutRedistributionPlan attribute) input_use_count (core.transformer.cuda_graphs.CudagraphBufferMetadata attribute) inputs (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) (core.ssm.context_parallel.gdp.GDPLocalContext attribute) insert_tensors() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict method) install_optimized_model_weights() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) int16 (core.datasets.indexed_dataset.DType attribute) int32 (core.datasets.indexed_dataset.DType attribute) int64 (core.datasets.indexed_dataset.DType attribute) int8 (core.datasets.indexed_dataset.DType attribute) INTEGRITY_FNAME (in module core.dist_checkpointing.validation) inter_dist_opt (core.process_groups_config.ProcessGroupCollection attribute) inter_document_masking (core.datasets.gpt_dataset.GPTDatasetConfig attribute) internal_api() (in module core.utils) intersect() (in module core.inference.disaggregation.utils) intra_dist_opt (core.process_groups_config.ProcessGroupCollection attribute) intra_dp_cp (core.process_groups_config.ProcessGroupCollection attribute) intra_expt_dp (core.process_groups_config.ProcessGroupCollection attribute) inv_scale (core.optimizer.grad_scaler.MegatronGradScaler property) inv_vocab (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer property) invalidate_block() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) invalidate_chunk_boundary() (core.inference.contexts.mtp_metadata.MTPMetadata method) invalidate_ep_bootstrap() (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) invalidate_refit_tensor_cache() (in module core.resharding.utils) is_active (core.models.mimo.optimizer.ModuleOptimizerInfo attribute) is_active() (core.inference.utils.InferenceMode class method) is_applicable_for_batch_dim() (core.inference.batch_dimensions_utils.InferenceBatchDimensions method) is_aux_loss_enabled() (core.transformer.moe.router.TopKRouter method) is_batch_invariant_mode_enabled() (in module core.transformer.custom_layers.batch_invariant_kernels) is_blockwise_float8tensor() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) is_boundary() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout method) is_causal_conv1d_min_version() (in module core.utils) IS_CHECKPOINTING (in module core.tensor_parallel.random) is_checkpointing() (in module core.tensor_parallel.random) is_chunked_prefill_enabled() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) is_column_parallel_linear() (in module core.fp8_utils) is_conv (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer property) is_cudagraph_input (core.transformer.cuda_graphs.CudagraphBufferMetadata attribute) is_cudagraph_output (core.transformer.cuda_graphs.CudagraphBufferMetadata attribute) is_current_rank_in_grid() (core.hyper_comm_grid.HyperCommGrid method) (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) is_cutile_available() (in module core.fusions.fused_mhc_kernels) is_decode_only() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) (core.inference.contexts.static_context.StaticInferenceContext method) is_distributed_weight (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam attribute) is_dynamic_batching() (core.inference.contexts.base_context.BaseInferenceContext method) is_emerging_optimizers_min_version() (in module core.utils) is_empty() (core.transformer.moe.moe_utils.MoECudaGraphTensorStore method) is_empty_chunk() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) is_enabled() (core.msc_utils._FeatureFlag method) is_enabled_for() (core.resharding.nvshmem_copy_service.logger.PELogger class method) is_ep (core.resharding.utils.ParameterMetadata attribute) is_experimental_enabled() (in module core.config) is_expert_parallel (core.optimizer.param_layout.BufferKey attribute) is_expert_param (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) is_fa_min_version() (in module core.utils) is_fan_in() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) is_fan_out() (core.models.mimo.comm.colocated_communicator.ColocatedBridgeCommunicator method) is_first_last_bf16_layer() (in module core.fp8_utils) is_first_microbatch_tracked() (in module core.transformer.module) is_first_stage (core.models.mimo.config.role.ModuleStageInfo attribute) is_first_stage() (core.models.mimo.config.role.RankRole method) is_flashinfer_min_version() (in module core.utils) is_float8tensor() (in module core.dist_checkpointing.exchange_utils) (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) (in module core.fp8_utils) is_gated_activation() (in module core.export.trtllm.trtllm_weights_converter.utils) is_gated_delta_net_variant() (in module core.models.gpt.experimental_attention_variant_module_specs) is_graph_capturing() (in module core.transformer.cuda_graphs) is_graph_safe_cuda_rng_tracker() (in module core.tensor_parallel.random) is_graph_warmup() (in module core.transformer.cuda_graphs) is_grouped_mxfp8tensor() (in module core.fp8_utils) is_grouped_nvfp4tensor() (in module core.fp4_utils) is_grouped_tensor() (in module core.fp8_utils) is_grouped_tensor_with_quantized_storage() (in module core.fp8_utils) is_gtp (core.resharding.utils.ParameterMetadata attribute) is_gtp_param() (in module core.tensor_parallel.generalized_tensor_parallelism) is_gtp_remat_active() (core.process_groups_config.ProcessGroupCollection static method) is_gtp_symm_pool_registered() (in module core.tensor_parallel.gtp_symmetric_memory) is_hollow (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict property) is_hybrid_model (core.transformer.transformer_config.TransformerConfig attribute) is_inference_column_parallel_linear() (in module core.tensor_parallel.inference_layers) is_initialized() (core.extensions.transformer_engine.TECudaRNGStatesTracker method) (core.inference.symmetric_memory.SymmetricMemoryManager class method) (core.tensor_parallel.random.CudaRNGStatesTracker method) (in module core.parallel_state) is_int_pow_2() (in module core.ssm.ops.mamba2.ssd_combined) is_kernel_available() (core.fusions.fused_softmax.FusedScaleMaskSoftmax method) is_last_microbatch (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext attribute) is_last_stage (core.models.mimo.config.role.ModuleStageInfo attribute) is_last_stage() (core.models.mimo.config.role.RankRole method) is_layer_window_attention() (in module core.transformer.utils) is_linear_attention_variant() (in module core.models.gpt.experimental_attention_variant_module_specs) is_main_replica() (in module core.dist_checkpointing.mapping) is_mamba_min_version() (in module core.utils) is_managed_by_layer_wise_optimizer (core.optimizer.param_layout.BufferKey attribute) is_managed_by_layer_wise_optimizer() (in module core.optimizer.layer_wise_optimizer) is_mcore_tensor_model_parallel() (in module core.distributed.fsdp.src.megatron_fsdp.utils) is_mcore_tensor_parallel_duplicated() (in module core.distributed.fsdp.src.megatron_fsdp.utils) is_memory_available() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) is_module_pp_first_stage() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) is_mxfp8_output_proj_active() (in module core.fp8_utils) is_mxfp8tensor() (in module core.fp8_utils) is_nccl_ep_bootstrapped() (in module core.transformer.moe.fused_a2a) is_no_op_top_k() (in module core.inference.sampling_params) is_no_op_top_p() (in module core.inference.sampling_params) is_nvfp4tensor() (in module core.fp4_utils) IS_NVIDIA (in module core.ssm.ops.gdp.common) IS_NVIDIA_BLACKWELL (in module core.ssm.ops.gdp.common) IS_NVIDIA_HOPPER (in module core.ssm.ops.gdp.common) is_nvrx_min_version() (in module core.dist_checkpointing.strategies.nvrx) is_object_storage_path() (in module core.datasets.object_storage_utils) is_observing_tensor() (in module core.tensor_observation) is_pipeline_first_stage() (in module core.inference.communication_utils) (in module core.parallel_state) is_pipeline_last_stage() (in module core.inference.communication_utils) (in module core.parallel_state) is_pp_first_stage (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator property) (core.pipeline_parallel.p2p_communication.P2PCommunicator property) is_pp_first_stage() (in module core.pipeline_parallel.utils) is_pp_last_stage (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator property) (core.pipeline_parallel.p2p_communication.P2PCommunicator property) is_pp_last_stage() (in module core.pipeline_parallel.utils) is_primary_rank (core.inference.apis._llm_base._MegatronLLMBase property) is_push (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend attribute) (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend attribute) is_rank_in_embedding_group() (in module core.parallel_state) is_rank_in_position_embedding_group() (in module core.parallel_state) is_root() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) is_row_parallel_linear() (in module core.fp8_utils) is_saved_for_backward (core.transformer.cuda_graphs.CudagraphBufferMetadata attribute) is_send (core.resharding.utils.TransferOp attribute) is_single_shape() (in module core.pipeline_parallel.p2p_communication) is_slurm_job() (in module core._slurm_utils) is_source_stage (core.pipeline_parallel.multimodule_communicator.RankModuleInfo attribute) is_static_batching() (core.inference.contexts.base_context.BaseInferenceContext method) (core.inference.contexts.dynamic_context.DynamicInferenceContext method) (core.inference.contexts.static_context.StaticInferenceContext method) is_submodule() (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.utils) is_symmetric_memory (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer property) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer property) is_te_min_version() (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.utils) is_terminal_stage (core.pipeline_parallel.multimodule_communicator.RankModuleInfo attribute) IS_TMA_SUPPORTED (in module core.ssm.ops.gdp.common) is_torch_min_version() (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.utils) is_tp (core.resharding.utils.ParameterMetadata attribute) is_triton_available() (in module core.fusions.fused_mhc_kernels) is_unexpectedly_large() (core.rerun_state_machine.RerunStateMachine method) is_using_quantization_scales() (in module core.utils) is_valid (core.inference.text_generation_controllers.text_generation_controller.AsyncScheduleLogitsState attribute) is_valid() (core.inference.batch_dimensions_utils.InferenceBatchDimensions method) is_valid_symbol() (in module core.models.hybrid.layers.utils) is_varlen_forward (core.inference.contexts.mtp_metadata.MTPMetadata property) is_vp_first_stage() (in module core.pipeline_parallel.utils) is_vp_last_stage() (in module core.pipeline_parallel.utils) items() (core.optimizer.optimizer.ProxyDict method) (core.process_groups_config.MultiModuleProcessGroupCollection method) iteration (core.resharding.nvshmem_copy_service.nvshmem_types.ScheduledBatch attribute) (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) J jit_fuser (in module core.jit) json_safe_logprob() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) JSON_SAFE_LOGPROB_FLOOR (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) json_safe_logprobs() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) json_safe_top_n_logprobs() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) JSONEncoderWithMcoreTypes (class in core.config_logger) K k (core.ssm.context_parallel.gdp.GDPSavedInputs attribute) (core.ssm.context_parallel.gdp_common.GDPInputs attribute) k_layernorm (core.transformer.attention.SelfAttentionSubmodules attribute) keep_fp8_transpose_cache (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) keep_mtp_in_bf16 (core.transformer.transformer_config.TransformerConfig attribute) KEEP_VARS_HINT (in module core.dist_checkpointing.optimizer) KernelLauncher (class in core.resharding.nvshmem_copy_service.core.kernel_launcher) key (core.dist_checkpointing.mapping.ShardedBase attribute) (core.dist_checkpointing.mapping.ShardedObject attribute) (core.dist_checkpointing.mapping.ShardedTensor attribute) (core.dist_checkpointing.mapping.ShardedTensorFactory attribute) (core.tensor_parallel.generalized_tensor_parallelism._TicketSlot attribute) (core.tensor_parallel.gtp_cuda_graphs.GraphWgradRingSlot attribute) key_value_cache() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) keys() (core.process_groups_config.MultiModuleProcessGroupCollection method) Kimi2DRotaryEmbedding (class in core.models.vision.vit_model) KimiLearned2DPosEmbed (class in core.models.vision.vit_model) KimiPatchMerger (class in core.models.vision.vit_model) KimiViTModel (class in core.models.vision.vit_model) kind (core.resharding.execution._Writeback attribute) kitchen_attention_backend (core.transformer.transformer_config.TransformerConfig attribute) kitchen_quantization_recipe_config() (in module core.quantization.utils) KitchenColumnParallelGroupedLinear (in module core.extensions.kitchen) KitchenColumnParallelLinear (in module core.extensions.kitchen) KitchenDotProductAttention (in module core.extensions.kitchen) KitchenFlashAttention (in module core.extensions.kitchen) KitchenLayerNormColumnParallelLinear (in module core.extensions.kitchen) KitchenRowParallelGroupedLinear (in module core.extensions.kitchen) KitchenRowParallelLinear (in module core.extensions.kitchen) KitchenSpecProvider (in module core.extensions.kitchen) kv_cache_epoch (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.FinishedRequestRecord attribute) kv_cache_management_mode (core.inference.config.InferenceConfig attribute) kv_channels (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) kv_format (core.models.mimo.config.base_configs.MimoModelConfig attribute) KV_HANDOFF_COMPLETE (core.inference.headers.Transport attribute) kv_layernorm (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) kv_lengths (core.inference.contexts.mtp_metadata.MTPMetadata attribute) kv_lora_rank (core.transformer.transformer_config.MLATransformerConfig attribute) kv_meta (core.inference.disaggregation.inference_state_handoff._PreparedHandoffMetadata attribute) (core.inference.disaggregation.pending_handoff_imports.DeferredKvHandoff attribute) kv_shard_key() (core.inference.disaggregation.kv_reshard.KVShardLayout method) KVBlockAllocator (class in core.inference.contexts.kv_block_allocator) KVCacheManagementMode (class in core.inference.config) KVEventListener (in module core.inference.contexts.dynamic_context) KVReshardTransfer (class in core.inference.disaggregation.kv_reshard) KVShardLayout (class in core.inference.disaggregation.kv_reshard) KVTransportBackend (in module core.inference.disaggregation.transfer_backends.base) L L2Norm (class in core.transformer.torch_norm) l2norm_fwd() (in module core.ssm.ops.gdp.common) l2norm_fwd_kernel() (in module core.ssm.ops.gdp.common) l2norm_fwd_kernel1() (in module core.ssm.ops.gdp.common) labels (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) language_model_input_projections (core.models.mimo.model.base.MimoModel property) language_model_input_projections_spec (core.models.mimo.config.base_configs.MimoModelConfig attribute) language_model_module_name (core.process_groups_config.MultiModuleProcessGroupCollection attribute) language_model_spec (core.models.mimo.config.base_configs.MimoModelConfig attribute) LanguageModelEmbedding (class in core.models.common.embeddings.language_model_embedding) LanguageModule (class in core.models.common.language_module.language_module) lap() (core.energy_monitor.EnergyMonitor method) last_token_logits() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) latency (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.DynamicInferenceRequestRecord attribute) launch_pack() (core.resharding.nvshmem_copy_service.core.kernel_launcher.KernelLauncher method) launch_unpack() (core.resharding.nvshmem_copy_service.core.kernel_launcher.KernelLauncher method) launched (core.inference.text_generation_controllers.text_generation_controller.DecodeOnly attribute) LAYER (core.telemetry.span_groups.MegatronSpanGroup attribute) layer (core.transformer.enums.InferenceCudaGraphScope attribute) LAYER_CONFIG_MAP (core.models.hybrid.layers.utils.Symbols attribute) layer_layouts (core.context_parallel.layout.ContextParallelLayoutManager attribute) layer_norm (core.transformer.multi_token_prediction.MultiTokenPredictionLayerSubmodules attribute) (core.transformer.transformer_block.TransformerBlockSubmodules attribute) layer_norm() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) layer_number (core.quantization.quant_config.MatchContext attribute) layer_range() (core.inference.disaggregation.kv_reshard.KVShardLayout method) (core.inference.disaggregation.ssm_reshard.SSMShardLayout method) LAYER_SCHEDULE_PLAN_CLASS (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan attribute) layer_specs (core.transformer.multi_token_prediction.MultiTokenPredictionBlockSubmodules attribute) (core.transformer.transformer_block.TransformerBlockSubmodules attribute) layer_start (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) (core.inference.disaggregation.ssm_reshard.SSMShardLayout attribute) layer_type_list (core.inference.config.MambaInferenceStateConfig attribute) (core.models.hybrid.hybrid_block.HybridStack property) LayerNorm (class in core.models.audio.nemo_transformer_encoder) layernorm_epsilon (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) layernorm_zero_centered_gamma (core.transformer.transformer_config.TransformerConfig attribute) LayerNormBuilder (class in core.transformer.torch_norm) LayerNormInterface (class in core.transformer.torch_norm) LayerState (class in core.models.common.utils) LayerType (class in core.transformer.enums) LayerWiseDistributedOptimizer (class in core.optimizer.layer_wise_optimizer) layout (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer attribute) (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) layouts (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.GroupOwnerLayout attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerGatherPlan attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerScatterPlan attribute) (core.optimizer.param_layout.FullParamLayout attribute) learned_output_contract() (in module core.transformer.hyper_connection) left_context (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) LEGACY (core.inference.config.AsyncScheduleMode attribute) length (core.resharding.shard_planner._Segment attribute) lengths (core.models.audio.packed_audio.PackedAudioEmbeddings attribute) Lifecycle (class in core.inference.headers) Linear (class in core.post_training.modelopt.layers) LINEAR (core.inference.config.CudaGraphSizingDistribution attribute) linear() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) linear_attention_freq (core.transformer.transformer_config.TransformerConfig attribute) linear_conv_kernel_dim (core.transformer.transformer_config.TransformerConfig attribute) linear_cp_layout (core.transformer.transformer_config.TransformerConfig attribute) linear_cp_mode (core.transformer.transformer_config.TransformerConfig attribute) linear_fc1 (core.transformer.mlp.MLPSubmodules attribute) (core.transformer.moe.experts.GroupedMLPSubmodules attribute) linear_fc1_forward_and_act() (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) (core.transformer.moe.shared_experts.SharedExpertMLP method) linear_fc2 (core.transformer.mlp.MLPSubmodules attribute) (core.transformer.moe.experts.GroupedMLPSubmodules attribute) linear_fc2_forward() (core.transformer.moe.shared_experts.FusedSharedExpertMLP method) (core.transformer.moe.shared_experts.SharedExpertMLP method) linear_key_head_dim (core.transformer.transformer_config.TransformerConfig attribute) linear_kv (core.transformer.attention.CrossAttentionSubmodules attribute) linear_kv_down_proj (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) linear_kv_up_proj (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) linear_num_key_heads (core.transformer.transformer_config.TransformerConfig attribute) linear_num_value_heads (core.transformer.transformer_config.TransformerConfig attribute) linear_proj (core.transformer.attention.CrossAttentionSubmodules attribute) (core.transformer.attention.SelfAttentionSubmodules attribute) (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) linear_q (core.transformer.attention.CrossAttentionSubmodules attribute) linear_q_down_proj (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) linear_q_proj (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) linear_q_up_proj (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) linear_qkv (core.transformer.attention.SelfAttentionSubmodules attribute) linear_qkv_down_proj (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) linear_value_head_dim (core.transformer.transformer_config.TransformerConfig attribute) linear_with_frozen_weight() (in module core.tensor_parallel.layers) linear_with_grad_accumulation_and_async_allreduce() (in module core.tensor_parallel.layers) LinearAttentionCPBackend (class in core.ssm.context_parallel.chunkwise) LinearFc1Builder (class in core.transformer.mlp) LinearFc1Interface (class in core.transformer.mlp) LinearFc2Builder (class in core.transformer.mlp) LinearFc2Interface (class in core.transformer.mlp) LinearInterface (class in core.transformer.attention) LinearLayerBuilder (class in core.transformer.attention) LinearProjBuilder (class in core.transformer.attention) LinearProjInterface (class in core.transformer.attention) LinearQkvBuilder (class in core.transformer.attention) LinearQkvInterface (class in core.transformer.attention) LinearWithFrozenWeight (class in core.tensor_parallel.layers) LinearWithGradAccumulationAndAsyncCommunication (class in core.tensor_parallel.layers) lion_beta1 (core.optimizer.optimizer_config.OptimizerConfig attribute) lion_beta2 (core.optimizer.optimizer_config.OptimizerConfig attribute) live_slot (core.inference.disaggregation.pending_handoff_imports.PendingSSMImport attribute) llama3p1_chat_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) llama_nemotron_super_1p5_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) llama_nemotron_super_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) llama_nemotron_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) LLaVAModel (class in core.models.multimodal.llava_model) lm_head (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) load() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelLoadStrategyWrapper method) (core.dist_checkpointing.strategies.torch.TorchDistLoadShardedStrategy method) (in module core.dist_checkpointing.serialization) load_and_upcycle_model() (in module core.transformer.moe.upcycling_utils) LOAD_BALANCED (core.inference.config.MediaCacheCoordinatorPolicy attribute) (core.inference.config.PrefixCachingCoordinatorPolicy attribute) load_checkpoint() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.checkpoint) load_common() (in module core.dist_checkpointing.strategies.common) load_common_state_dict() (in module core.dist_checkpointing.serialization) load_content_metadata() (in module core.dist_checkpointing.serialization) load_hidden_states_for_record() (in module core.transformer.moe.router_trace) load_kernels() (core.resharding.nvshmem_copy_service.core.kernel_launcher.KernelLauncher method) load_logits_for_record() (in module core.transformer.moe.router_trace) load_nemo_transformer_audio_weights() (in module core.models.audio.nemo_audio_checkpoint) load_parameter_state() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) load_parameter_state_from_dp_reshardable() (core.optimizer.distrib_optimizer.DistributedOptimizer method) load_parameter_state_from_dp_zero() (core.optimizer.distrib_optimizer.DistributedOptimizer method) load_parameter_state_from_dp_zero_legacy() (core.optimizer.distrib_optimizer.DistributedOptimizer method) load_parameter_state_from_fs_model_space() (core.optimizer.distrib_optimizer.DistributedOptimizer method) load_parameter_state_from_fully_reshardable() (core.optimizer.distrib_optimizer.DistributedOptimizer method) load_plain_tensors() (in module core.dist_checkpointing.serialization) load_preprocess() (in module core.dist_checkpointing.state_dict_utils) load_quantization_recipe() (in module core.quantization.utils) load_sharded_metadata() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelLoadStrategyWrapper method) (core.dist_checkpointing.strategies.torch.TorchDistLoadShardedStrategy method) (in module core.dist_checkpointing.serialization) load_state_dict() (core.distributed.data_parallel_base._BaseDataParallel method) (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV1 method) (core.distributed.torch_fully_sharded_data_parallel.TorchFullyShardedDataParallel method) (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.grad_scaler.ConstantGradScaler method) (core.optimizer.grad_scaler.DynamicGradScaler method) (core.optimizer.grad_scaler.MegatronGradScaler method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.optimizer_param_scheduler.OptimizerParamScheduler method) (core.rerun_state_machine.RerunDataIterator method) (core.rerun_state_machine.RerunErrorInjector method) (core.rerun_state_machine.RerunStateMachine method) (core.transformer.module.Float16Module method) load_state_dict_from_file() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) load_tensors_metadata() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelLoadStrategyWrapper method) (core.dist_checkpointing.strategies.torch.TorchDistLoadShardedStrategy method) (in module core.dist_checkpointing.serialization) local (core.transformer.enums.AttnBackend attribute) local_blocks (core.inference.disaggregation.inference_state_handoff._PreparedHandoffMetadata attribute) (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) local_buffer (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer attribute) local_chunk_offset_in_global() (core.dist_checkpointing.mapping.ShardedTensor method) local_cp_size (core.packed_seq_params.PackedSeqParams attribute) local_cu_seqlens (core.ssm.context_parallel.chunkwise.PackedSequenceCPMetadata attribute) local_error (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) local_multi_tensor_applier() (in module core.utils) local_multi_tensor_l2_norm() (in module core.utils) local_multi_tensor_scale() (in module core.utils) local_num_heads() (core.inference.disaggregation.kv_reshard.KVShardLayout method) local_num_layers() (core.inference.disaggregation.kv_reshard.KVShardLayout method) local_seq_idx (core.ssm.context_parallel.chunkwise.PackedSequenceCPMetadata attribute) local_shape (core.dist_checkpointing.mapping.ShardedTensor attribute) local_ssm_slot (core.inference.disaggregation.inference_state_handoff._PreparedHandoffMetadata attribute) local_start (core.resharding.shard_planner._Segment attribute) local_state_grad (core.ssm.context_parallel.chunkwise.CPBackwardUnpackedSummary attribute) local_transfers (core.resharding.copy_services.nccl_m2n_copy_service._PendingParameter attribute) LocalContextT (in module core.ssm.context_parallel.chunkwise) LocalNonpersistentObject (class in core.dist_checkpointing.mapping) LocalShardsContainer (class in core.dist_checkpointing.strategies.checkpointable) LocalSpecProvider (class in core.models.backends) locate_item_in_global_item() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) locate_item_shard_in_global_item() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) LOCK (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common) log (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) log() (core.timers.Timers method) LOG2E (in module core.fusions.fused_mhc_kernels) LOG_ALL (core.dist_checkpointing.validation.StrictHandling attribute) log_config_to_disk() (in module core.config_logger) log_fused_mhc_backend_once() (in module core.fusions.fused_mhc_kernels) log_max_attention_logit (core.transformer.transformer_config.TransformerConfig attribute) log_num_zeros_in_grad (core.optimizer.optimizer_config.OptimizerConfig attribute) log_on_each_pipeline_stage() (in module core.utils) log_probs_kernel() (core.inference.sampling.base.Sampling method) (core.inference.sampling.flashinfer_sampling.FlashInferSampling method) (core.inference.sampling.torch_sampling.TorchSampling method) log_single_rank() (in module core._rank_utils) (in module core.distributed.fsdp.src.megatron_fsdp.utils) log_softmax() (in module core.transformer.custom_layers.batch_invariant_kernels) LOG_UNEXPECTED (core.dist_checkpointing.validation.StrictHandling attribute) log_validation_summary() (in module core.resharding.nvshmem_copy_service.validation) log_zero_guard_type (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) log_zero_guard_value (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) log_zero_guard_value_fn() (core.models.audio.nemo_audio_preprocessing.AudioToMelSpectrogramPreprocessor method) logger (in module core.allocator.vmm_symm_allocator) (in module core.datasets.blended_dataset) (in module core.datasets.blended_megatron_dataset_builder) (in module core.datasets.blended_megatron_dataset_config) (in module core.datasets.gpt_dataset) (in module core.datasets.indexed_dataset) (in module core.datasets.masked_dataset) (in module core.datasets.utils) (in module core.dist_checkpointing.exchange_utils) (in module core.dist_checkpointing.mapping) (in module core.dist_checkpointing.optimizer) (in module core.dist_checkpointing.serialization) (in module core.dist_checkpointing.strategies.common) (in module core.dist_checkpointing.strategies.fully_parallel) (in module core.dist_checkpointing.strategies.torch) (in module core.dist_checkpointing.tensor_aware_state_dict) (in module core.dist_checkpointing.validation) (in module core.distributed.distributed_data_parallel) (in module core.distributed.fsdp.mcore_fsdp_adapter) (in module core.distributed.fsdp.src.megatron_fsdp.fully_shard) (in module core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp) (in module core.distributed.fsdp.src.megatron_fsdp.mixed_precision) (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) (in module core.distributed.fsdp.src.megatron_fsdp.utils) (in module core.distributed.param_and_grad_buffer) (in module core.fault_injector) (in module core.full_cuda_graph) (in module core.fusions.fused_mhc_kernels) (in module core.inference.disaggregation.transfer_backends.nccl) (in module core.inference.disaggregation.transfer_backends.nixl) (in module core.inference.engines.dynamic_engine) (in module core.inference.moe.flashinfer_mxfp8) (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions) (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common) (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.completions) (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.health) (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.profile) (in module core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer) (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) (in module core.models.audio.nemo_transformer_encoder) (in module core.models.common.embeddings.relative_pos_embedding) (in module core.models.common.embeddings.rope_utils) (in module core.models.common.embeddings.rotary_pos_embedding) (in module core.models.common.embeddings.yarn_rotary_pos_embedding) (in module core.models.gpt.gpt_model) (in module core.models.hybrid.hybrid_layer_allocation) (in module core.models.hybrid.hybrid_model) (in module core.models.mamba.mamba_model) (in module core.models.mimo.config.role) (in module core.models.mimo.model.base) (in module core.models.multimodal.context_parallel) (in module core.msc_utils) (in module core.nccl_allocator) (in module core.num_microbatches_calculator) (in module core.optimizer) (in module core.optimizer.distrib_optimizer) (in module core.optimizer.emerging_optimizers) (in module core.optimizer.layer_wise_optimizer) (in module core.optimizer.optimizer) (in module core.optimizer.optimizer_cuda_graph) (in module core.optimizer_param_scheduler) (in module core.parallel_state) (in module core.pipeline_parallel.bridge_communicator) (in module core.pipeline_parallel.fine_grained_activation_offload) (in module core.pipeline_parallel.utils) (in module core.post_training.modelopt.checkpointing) (in module core.post_training.modelopt.gpt.state_dict_hooks) (in module core.post_training.modelopt.layers) (in module core.quantization.quant_config) (in module core.rerun_state_machine) (in module core.resharding.copy_services.gloo_copy_service) (in module core.resharding.copy_services.nccl_copy_service) (in module core.resharding.copy_services.nccl_m2n_copy_service) (in module core.resharding.copy_services.nixl_copy_service) (in module core.resharding.copy_services.nvshmem_copy_service) (in module core.resharding.execution) (in module core.resharding.nvshmem_copy_service.core.gpu_resource_manager) (in module core.resharding.nvshmem_copy_service.planning.task_segmenter) (in module core.resharding.planner) (in module core.ssm.gated_delta_net.common) (in module core.ssm.gated_delta_net.gdn2) (in module core.ssm.gated_delta_product) (in module core.ssm.mamba_mixer) (in module core.tensor_parallel.generalized_tensor_parallelism) (in module core.tensor_parallel.gtp_cuda_graphs) (in module core.tensor_parallel.gtp_symmetric_memory) (in module core.timers) (in module core.tokenizers.megatron_tokenizer) (in module core.tokenizers.text.libraries.huggingface_tokenizer) (in module core.tokenizers.text.libraries.megatron_hf_tokenizer) (in module core.tokenizers.text.libraries.tiktoken_tokenizer) (in module core.tokenizers.text.parsers.qwen3_coder_tool_parser) (in module core.tokenizers.utils.build_tokenizer) (in module core.tokenizers.utils.utils) (in module core.transformer.cuda_graphs) (in module core.transformer.fsdp_dtensor_checkpoint) (in module core.transformer.moe.experts) (in module core.transformer.moe.paged_stash) (in module core.transformer.moe.token_dispatcher) (in module core.transformer.pipeline_parallel_layer_layout) (in module core.transformer.transformer_block) (in module core.transformer.transformer_config) (in module core.transformer.transformer_layer) (in module core.transformer.utils) (in module core.utils) logger_stack() (in module core.dist_checkpointing.utils) logging_step_interval (core.inference.config.InferenceConfig attribute) logical_cols (core.inference.moe.flashinfer_mxfp8.FlashInferRoutedMXFP8Weight attribute) logical_rows (core.inference.moe.flashinfer_mxfp8.FlashInferRoutedMXFP8Weight attribute) logprobs_mode (core.inference.config.InferenceConfig attribute) LONGEST_PREFIX (core.inference.config.PrefixCachingCoordinatorPolicy attribute) loop (core.inference.apis._llm_base._EventLoopManager property) loss (core.transformer.enums.LayerType attribute) loss_mask (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) loss_scale (core.optimizer.optimizer_config.OptimizerConfig attribute) loss_scale_window (core.optimizer.optimizer_config.OptimizerConfig attribute) lowfreq (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) LowLevelDataset (in module core.datasets.megatron_dataset) lr (core.optimizer.optimizer_config.OptimizerConfig attribute) LRU (core.inference.config.PrefixCachingEvictionPolicy attribute) M mag_power (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) main_grad (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) main_grad_buffer (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) main_grads_dtype (core.distributed.fsdp.src.megatron_fsdp.mixed_precision.MixedPrecisionPolicy attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) main_loss_backward_scale (core.transformer.moe.moe_utils.MoEAuxLossAutoScaler attribute) (core.transformer.multi_token_prediction.MTPLossAutoScaler attribute) main_params_dtype (core.distributed.fsdp.src.megatron_fsdp.mixed_precision.MixedPrecisionPolicy attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) main_pattern (core.models.hybrid.hybrid_layer_allocation.ParsedHybridPattern attribute) main_rank_for_shard (core.dist_checkpointing.exchange_utils.ShardDistribution attribute) main_weight (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BufferDistribution attribute) main_weight_buffer (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) MAJOR (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) make_buckets_equal() (core.pipeline_parallel.hybrid_cp_schedule.BalancedCPScheduler method) make_fsdp_dtensor() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) make_hook() (core.transformer.moe.router_trace.RouterTracer method) make_nvrx_async_request() (in module core.dist_checkpointing.strategies.nvrx) make_sharded_object_for_checkpoint() (in module core.transformer.utils) make_sharded_optimizer_tensor() (in module core.dist_checkpointing.optimizer) make_sharded_tensor_for_checkpoint() (in module core.utils) make_sharded_tensors_for_checkpoint() (in module core.transformer.utils) make_sharded_tensors_for_checkpoint_with_gtp_remat() (in module core.tensor_parallel.generalized_tensor_parallelism) make_tp_sharded_tensor_for_checkpoint() (in module core.utils) make_viewless() (in module core.pipeline_parallel.utils) make_viewless_tensor() (in module core.utils) make_weakref() (in module core.transformer.cuda_graphs) MakeViewlessTensor (class in core.utils) MAMBA (core.models.hybrid.layers.utils.Symbols attribute) mamba (core.transformer.enums.CudaGraphModule attribute) (core.transformer.enums.CudaGraphScope attribute) mamba_bda (core.ssm.mamba_layer.MambaLayerSubmodules attribute) mamba_chunk_scan_combined_varlen() (in module core.ssm.ops.mamba2.ssd_combined) mamba_chunk_size (core.inference.config.MambaInferenceStateConfig attribute) MAMBA_HAS_STATE_DTYPE (in module core.ssm.mamba_mixer) mamba_head_dim (core.transformer.transformer_config.TransformerConfig attribute) mamba_inference_stack_spec (in module core.models.hybrid.hybrid_layer_specs) mamba_inference_state_config (core.inference.config.InferenceConfig attribute) mamba_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) mamba_memory_ratio (core.inference.config.InferenceConfig attribute) mamba_num_groups (core.transformer.transformer_config.TransformerConfig attribute) mamba_num_heads (core.transformer.transformer_config.TransformerConfig attribute) mamba_stack_spec (in module core.models.hybrid.hybrid_layer_specs) mamba_state_dim (core.transformer.transformer_config.TransformerConfig attribute) mamba_state_selective_copy() (in module core.inference.text_generation_controllers.mtp_utils_pytorch) (in module core.inference.text_generation_controllers.mtp_utils_triton) mamba_state_shapes_per_request() (core.models.hybrid.hybrid_block.HybridStack method) (core.models.hybrid.layers.hybrid_hyper_connection.HyperConnectionHybridLayer method) (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_layer.MambaLayer method) (core.ssm.mamba_mixer.MambaMixer method) mamba_states_cache() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) mamba_training_ssm_states_dtype (core.transformer.transformer_config.TransformerConfig attribute) MambaBatchInvariantDecode (class in core.ssm.ops.mamba2.batch_invariant_decode) MambaContextParallel (class in core.ssm.mamba_context_parallel) MambaInferenceStateConfig (class in core.inference.config) MambaLayer (class in core.ssm.mamba_layer) MambaLayerConfig (class in core.ssm.mamba_layer_config) MambaLayerSubmodules (class in core.ssm.mamba_layer) MambaMixer (class in core.ssm.mamba_mixer) MambaMixerSubmodules (class in core.ssm.mamba_mixer) MambaModel (class in core.models.mamba.mamba_model) MambaSlotAllocator (class in core.inference.contexts.mamba_slot_allocator) MambaSlotCapacityError MambaStack (in module core.models.hybrid.hybrid_block) MambaStackSubmodules (in module core.models.hybrid.hybrid_block) manager (core.context_parallel.layout.ContextParallelLayoutState attribute) manual_buffer_registration() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) map_reduce() (in module core.dist_checkpointing.dict_utils) mark_keep_in_fp32() (in module core.transformer.module) mark_not_offload() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) mask (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer property) mask_id (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract property) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) mask_routing_padding() (in module core.transformer.moe.inference_routing_mask_kernel) masked_softmax_fusion (core.transformer.transformer_config.TransformerConfig attribute) MaskedWordPieceDataset (class in core.datasets.masked_dataset) MaskedWordPieceDatasetConfig (class in core.datasets.masked_dataset) masking_do_full_word (core.datasets.masked_dataset.MaskedWordPieceDatasetConfig attribute) masking_do_permutation (core.datasets.masked_dataset.MaskedWordPieceDatasetConfig attribute) masking_max_ngram (core.datasets.masked_dataset.MaskedWordPieceDatasetConfig attribute) masking_probability (core.datasets.masked_dataset.MaskedWordPieceDatasetConfig attribute) masking_use_geometric_distribution (core.datasets.masked_dataset.MaskedWordPieceDatasetConfig attribute) masking_use_longer_ngrams (core.datasets.masked_dataset.MaskedWordPieceDatasetConfig attribute) match() (core.quantization.quant_config.GlobMatcher method) (core.quantization.quant_config.Matcher method) (core.quantization.quant_config.RecipeConfig method) match_graph_config() (core.inference.batch_dimensions_utils.CUDAGraphBatchDimensionBuilder static method) match_local_ops_by_task_id() (in module core.resharding.copy_services.base) match_mla_fused_down_proj_key() (in module core.transformer.fsdp_dtensor_checkpoint) match_to_config_key() (core.quantization.quant_config.RecipeConfig method) MatchContext (class in core.quantization.quant_config) matched_block_ids (core.inference.contexts.dynamic_context.PrefixMatch attribute) Matcher (class in core.quantization.quant_config) matches() (core.optimizer.optimizer_config.ParamKey method) materialize() (core.models.audio.audio_processor.NemoAudioProcessor method) materialize_group_for_backward() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) materialize_group_for_forward() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) materialize_only_last_token_logits (core.inference.config.InferenceConfig attribute) matmul_kernel_persistent() (in module core.transformer.custom_layers.batch_invariant_kernels) matmul_persistent() (in module core.transformer.custom_layers.batch_invariant_kernels) max_btime (core.utils._StragglerData attribute) max_clock (core.utils._StragglerData attribute) max_elapsed (core.utils._StragglerData attribute) max_gdp_chunk_counts() (in module core.ssm.ops.gdp.metadata) MAX_INTERMEDIATE_OFFSETS_PER_REQUEST (in module core.inference.contexts.mamba_slot_allocator) max_kv_block_count (core.inference.contexts.mtp_metadata.MTPMetadata attribute) max_lr (core.optimizer_param_scheduler.ParamGroupOverride attribute) max_num_tiles (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) max_power (core.utils._StragglerData attribute) max_requests (core.inference.config.InferenceConfig attribute) (core.inference.contexts.mtp_metadata.MTPMetadata attribute) MAX_REQUESTS (in module core.resharding.nvshmem_copy_service.planning.task_segmenter) MAX_SEGMENT_SIZE (in module core.resharding.nvshmem_copy_service.nvshmem_types) MAX_SEGMENTS_PER_REQUEST (in module core.resharding.nvshmem_copy_service.planning.task_segmenter) max_seqlen_kv (core.packed_seq_params.PackedSeqParams attribute) max_seqlen_per_dp_cp_rank (core.model_parallel_config.ModelParallelConfig attribute) max_seqlen_q (core.packed_seq_params.PackedSeqParams attribute) max_sequence_length (core.datasets.gpt_dataset.MockGPTLowLevelDataset attribute) (core.inference.config.InferenceConfig attribute) MAX_TASKS_PER_BATCH (in module core.resharding.nvshmem_copy_service.nvshmem_types) max_temp (core.utils._StragglerData attribute) max_tokens (core.inference.config.InferenceConfig attribute) max_util (core.utils._StragglerData attribute) MaxPoolAllocator (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) MaxSequenceLengthOverflowError maybe_get_tensor() (core.inference.symmetric_memory.SymmetricMemoryBuffer method) maybe_get_tensors() (core.inference.symmetric_memory.SymmetricMemoryBuffer method) maybe_inject() (core.rerun_state_machine.RerunErrorInjector method) maybe_load_config() (in module core.dist_checkpointing.core) maybe_miscompare() (core.rerun_state_machine.RerunErrorInjector method) maybe_move_tensor_to_cpu() (in module core.transformer.moe.moe_utils) maybe_msc (in module core.msc_utils) maybe_report_missing_and_unexpected_keys() (in module core.dist_checkpointing.validation) maybe_skip_or_early_return_by_cudagraph() (in module core.transformer.moe.moe_utils) MaybeMultiStorageClient (class in core.msc_utils) mcore_fused_moe() (in module core.inference.moe.fused_moe) mcore_gpt_load_te_state_dict_pre_hook() (in module core.post_training.modelopt.gpt.state_dict_hooks) mcore_to_pyt_state_dict() (in module core.dist_checkpointing.strategies.torch) MCoreLoadPlanner (class in core.dist_checkpointing.strategies.torch) MCoreMetadata (class in core.dist_checkpointing.strategies.torch) MCoreSavePlan (class in core.dist_checkpointing.strategies.torch) MCoreSavePlanner (class in core.dist_checkpointing.strategies.torch) MCoreTensorAwareStateDict (class in core.dist_checkpointing.tensor_aware_state_dict) mean_batch_invariant() (in module core.transformer.custom_layers.batch_invariant_kernels) mean_dim() (in module core.transformer.custom_layers.batch_invariant_kernels) mean_kernel() (in module core.transformer.custom_layers.batch_invariant_kernels) MEAN_SCORE (core.transformer.moe.router_diagnostics.RouterDiagnosticChannel attribute) media_cache_coordinator_policy (core.inference.config.InferenceConfig attribute) media_cache_key (core.inference.inference_request.DynamicVLMInferenceRequest attribute) media_cache_routing_weight (core.inference.config.InferenceConfig attribute) media_tokens_preexpanded (core.inference.inference_request.DynamicVLMInferenceRequest attribute) MediaCacheCoordinatorPolicy (class in core.inference.config) MediaPromptSpec (class in core.inference.config) MEGATRON_CACHE (in module core.tokenizers.text.libraries.megatron_hf_tokenizer) MEGATRON_CONFIG_MAP (in module core.tokenizers.text.libraries.megatron_hf_tokenizer) megatron_fsdp_cuda_graph_mode (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) megatron_fsdp_enable_fine_grained_param_gather (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) megatron_fsdp_grad_comm_dtype (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) megatron_fsdp_main_grads_dtype (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) megatron_fsdp_main_params_dtype (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) megatron_fsdp_max_pool_double_buffer (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) megatron_fsdp_use_decoupled_grad (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) megatron_fsdp_version (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) MEGATRON_TOKENIZERS (in module core.tokenizers.utils.build_tokenizer) MEGATRON_TRAINING_GRAD_NORM (in module core.telemetry.training_metrics) MEGATRON_TRAINING_LEARNING_RATE (in module core.telemetry.training_metrics) MEGATRON_TRAINING_LOSS (in module core.telemetry.training_metrics) MEGATRON_TRAINING_MEMORY_ALLOCATED_GB (in module core.telemetry.training_metrics) MEGATRON_TRAINING_SKIPPED_ITERS (in module core.telemetry.training_metrics) MEGATRON_TRAINING_STEP_DURATION_MS (in module core.telemetry.training_metrics) MEGATRON_TRAINING_THROUGHPUT_TFLOPS (in module core.telemetry.training_metrics) MEGATRON_TRAINING_TOKENS_PER_SEC (in module core.telemetry.training_metrics) MegatronAsyncLLM (class in core.inference.apis.async_llm) MegatronDataset (class in core.datasets.megatron_dataset) MegatronFSDP (class in core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp) MegatronGenerate (class in core.inference.text_generation_server.text_generation_server) MegatronGradScaler (class in core.optimizer.grad_scaler) MegatronHFTokenizer (class in core.tokenizers.text.libraries.megatron_hf_tokenizer) MegatronLLM (class in core.inference.apis.llm) MegatronModule (class in core.transformer.module) MegatronMultimodalTokenizer (class in core.tokenizers.vision.libraries.multimodal_tokenizer) MegatronNullMultimodalTokenizer (class in core.tokenizers.vision.libraries.null_multimodal_tokenizer) MegatronOptimizer (class in core.optimizer.optimizer) MegatronServer (class in core.inference.text_generation_server.text_generation_server) MegatronSpanGroup (class in core.telemetry.span_groups) MegatronTokenizer (class in core.tokenizers.megatron_tokenizer) MegatronTokenizerBase (class in core.tokenizers.base_tokenizer) MegatronTokenizerChatTemplate (class in core.tokenizers.text.libraries.chat_template) MegatronTokenizerText (class in core.tokenizers.text.text_tokenizer) MegatronTokenizerTextAbstract (class in core.tokenizers.text.libraries.abstract_tokenizer) MegatronTokenizerVision (class in core.tokenizers.vision.vision_tokenizer) mel_norm (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) MEMBER (core.pipeline_parallel.bridge_communicator.CommRole attribute) memory_efficient_layer_norm (core.transformer.transformer_config.TransformerConfig attribute) MemPoolAllocatorWithoutRegistration (class in core.nccl_allocator) merge() (core.inference.inference_request.DynamicInferenceRequestRecord method) (in module core.dist_checkpointing.dict_utils) merge_16x16_to_64x64_inverse_kernel() (in module core.ssm.ops.gdp.solve_tril) merge_fn (core.dist_checkpointing.mapping.ShardedTensorFactory attribute) merge_multimodal_data() (in module core.inference.inference_request) merges_file (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) mesh (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.GroupOwnerLayout property) (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer property) MeshAxis (in module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) message (core.rerun_state_machine.Caller attribute) message_handler() (in module core.inference.data_parallel_inference_coordinator.handlers) metadata (core.ssm.context_parallel.chunkwise.CPSavedContext attribute) metainfo (core.transformer.spec_utils.ModuleSpec attribute) MetricEntry (class in core.transformer.moe.moe_logging) metrics (core.transformer.moe.moe_logging.MoEMetricsTracker property) metrics_writer (core.inference.config.InferenceConfig attribute) MHC_BACKEND_DETERMINISM (in module core.fusions.fused_mhc_kernels) mhc_fused_backend (core.transformer.transformer_config.TransformerConfig attribute) mhc_init_gating_factor (core.transformer.transformer_config.TransformerConfig attribute) mhc_multistream (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) mhc_num_residual_streams (core.transformer.transformer_config.TransformerConfig attribute) mhc_recompute_layer_num (core.transformer.transformer_config.TransformerConfig attribute) mhc_sinkhorn_iterations (core.transformer.transformer_config.TransformerConfig attribute) MHCBackend (in module core.fusions.fused_mhc_kernels) MICROBATCH (core.telemetry.span_groups.MegatronSpanGroup attribute) microbatch() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) microbatch_group_size_per_vp_stage (core.model_parallel_config.ModelParallelConfig attribute) mid_level_dataset_surplus (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) MidLevelDataset (in module core.datasets.blended_megatron_dataset_builder) MIMO_LANGUAGE_MODULE_KEY (in module core.models.mimo.config.role) MimoModel (class in core.models.mimo.model.base) MimoModelConfig (class in core.models.mimo.config.base_configs) MimoOptimizer (class in core.models.mimo.optimizer) min_btime (core.utils._StragglerData attribute) min_clock (core.utils._StragglerData attribute) min_elapsed (core.utils._StragglerData attribute) min_loss_scale (core.optimizer.optimizer_config.OptimizerConfig attribute) min_lr (core.optimizer.optimizer_config.OptimizerConfig attribute) (core.optimizer_param_scheduler.ParamGroupOverride attribute) min_offloaded_tensor_size (core.transformer.transformer_config.TransformerConfig attribute) min_power (core.utils._StragglerData attribute) MIN_SAMPLING_TEMPERATURE (in module core.inference.sampling_params) min_temp (core.utils._StragglerData attribute) min_util (core.utils._StragglerData attribute) MINOR (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) mismatches (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) mistral_custom_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) mixed_precision_context() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) MixedPrecisionOptimizer (class in core.optimizer.optimizer) MixedPrecisionPolicy (class in core.distributed.fsdp.src.megatron_fsdp.mixed_precision) mixer (core.ssm.mamba_layer.MambaLayerSubmodules attribute) MLA (core.models.hybrid.layers.utils.Symbols attribute) MLA_ATTENTION (core.models.hybrid.layers.utils.Symbols attribute) mla_down_proj_fusion (core.transformer.transformer_config.MLATransformerConfig attribute) MLA_FUSED_DOWN_PROJ (in module core.transformer.fsdp_dtensor_checkpoint) mla_fused_down_proj_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) mla_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) MLA_UNFUSED_DOWN_PROJS (in module core.transformer.fsdp_dtensor_checkpoint) MLALayerConfig (class in core.transformer.mla_layer_config) MLASelfAttention (class in core.transformer.multi_latent_attention) MLASelfAttentionSubmodules (class in core.transformer.multi_latent_attention) MLATransformerConfig (class in core.transformer.transformer_config) MLP (class in core.transformer.mlp) mlp (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan attribute) MLP (core.models.hybrid.layers.utils.Symbols attribute) mlp (core.transformer.enums.CudaGraphModule attribute) (core.transformer.enums.CudaGraphScope attribute) (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) mlp_bda (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) mlp_chunks_for_prefill (core.transformer.transformer_config.TransformerConfig attribute) mlp_chunks_for_training (core.transformer.transformer_config.TransformerConfig attribute) mlp_fc_bias (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) mlp_fc_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) mlp_fc_weight_mixture_of_experts (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) mlp_hyper_connection (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) mlp_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) mlp_module() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.LocalSpecProvider method) mlp_projection_bias (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) mlp_projection_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) mlp_projection_weight_mixture_of_experts (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) mlp_router_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) mlp_to_gpt (core.dist_checkpointing.gpt_checkpoint_interop.GPTCompatLayerMaps attribute) MlpBuilder (class in core.transformer.transformer_layer) MlpInterface (class in core.transformer.transformer_layer) MLPLayer (class in core.ssm.mlp_layer) MLPLayerConfig (class in core.ssm.mlp_layer_config) MLPSubmodules (class in core.transformer.mlp) mm_batch_invariant() (in module core.transformer.custom_layers.batch_invariant_kernels) mm_mxfp8() (in module core.inference.quantization.utils) mmap_bin_files (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) mock (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) MockGPTDataset (class in core.datasets.gpt_dataset) MockGPTLowLevelDataset (class in core.datasets.gpt_dataset) MockMultimodalDataset (class in core.datasets.multimodal_dataset) modality (core.inference.engines.dynamic_engine._VisionCacheEntry attribute) modality_module_names (core.models.mimo.config.role.RankRole property) modality_submodules_spec (core.models.mimo.config.base_configs.MimoModelConfig attribute) mode (core.models.mimo.config.role.RankRole attribute) MODEL_CONFIG_NAME (in module core.models.audio.nemo_audio_checkpoint) model_parallel_cuda_manual_seed() (in module core.tensor_parallel.random) model_parallel_is_initialized() (in module core.parallel_state) model_token (core.inference.config.MediaPromptSpec attribute) model_type (core.models.vision.encoder_registry.EncoderSpec attribute) model_weight (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BufferDistribution attribute) model_weight_buffer (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) MODEL_WEIGHTS_NAME (in module core.models.audio.nemo_audio_checkpoint) ModelChunkState (class in core.models.common.model_chunk_schedule_plan) ModelParallelConfig (class in core.model_parallel_config) ModelType (class in core.enums) (class in core.transformer.enums) (in module core.export.model_type) modify_grouped_nvfp4_rowwise_storage() (in module core.fp4_utils) modify_grouped_tensor_rowwise_storage() (in module core.fp8_utils) modify_nvfp4_rowwise_storage() (in module core.fp4_utils) modify_real_token_count_for_mtp() (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher class method) modify_underlying_storage() (in module core.fp8_utils) module core core._rank_utils core._slurm_utils core.activations core.allocator core.allocator.vmm_symm_allocator core.config core.config_logger core.context_parallel core.context_parallel.layout core.context_parallel.utils core.datasets core.datasets.bert_dataset core.datasets.blended_dataset core.datasets.blended_megatron_dataset_builder core.datasets.blended_megatron_dataset_config core.datasets.data_schedule core.datasets.data_schedule_utils core.datasets.gpt_dataset core.datasets.helpers core.datasets.indexed_dataset core.datasets.masked_dataset core.datasets.megatron_dataset core.datasets.multimodal_dataset core.datasets.object_storage_utils core.datasets.t5_dataset core.datasets.utils core.datasets.utils_s3 core.dist_checkpointing core.dist_checkpointing.core core.dist_checkpointing.dict_utils core.dist_checkpointing.exchange_utils core.dist_checkpointing.gpt_checkpoint_interop core.dist_checkpointing.mapping core.dist_checkpointing.optimizer core.dist_checkpointing.serialization core.dist_checkpointing.state_dict_utils core.dist_checkpointing.strategies core.dist_checkpointing.strategies.checkpointable core.dist_checkpointing.strategies.common core.dist_checkpointing.strategies.fully_parallel core.dist_checkpointing.strategies.nvrx core.dist_checkpointing.strategies.torch core.dist_checkpointing.tensor_aware_state_dict core.dist_checkpointing.utils core.dist_checkpointing.validation core.distributed core.distributed.data_parallel_base core.distributed.distributed_data_parallel core.distributed.distributed_data_parallel_config core.distributed.finalize_model_grads core.distributed.fsdp core.distributed.fsdp.mcore_fsdp_adapter core.distributed.fsdp.src core.distributed.fsdp.src.megatron_fsdp core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config core.distributed.fsdp.src.megatron_fsdp.experimental core.distributed.fsdp.src.megatron_fsdp.experimental.checkpoint core.distributed.fsdp.src.megatron_fsdp.experimental.countdown core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard core.distributed.fsdp.src.megatron_fsdp.experimental.indexed_order core.distributed.fsdp.src.megatron_fsdp.experimental.layout core.distributed.fsdp.src.megatron_fsdp.experimental.module core.distributed.fsdp.src.megatron_fsdp.experimental.module_utils core.distributed.fsdp.src.megatron_fsdp.experimental.optimizer core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group core.distributed.fsdp.src.megatron_fsdp.experimental.placement core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer core.distributed.fsdp.src.megatron_fsdp.experimental.schedule core.distributed.fsdp.src.megatron_fsdp.experimental.uneven_dtensor core.distributed.fsdp.src.megatron_fsdp.fully_shard core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp core.distributed.fsdp.src.megatron_fsdp.mixed_precision core.distributed.fsdp.src.megatron_fsdp.package_info core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor core.distributed.fsdp.src.megatron_fsdp.utils core.distributed.param_and_grad_buffer core.distributed.reduce_scatter_with_fp32_accumulation core.distributed.torch_fully_sharded_data_parallel core.distributed.torch_fully_sharded_data_parallel_config core.energy_monitor core.enums core.export core.export.data_type core.export.export_config core.export.model_type core.export.trtllm core.export.trtllm.engine_builder core.export.trtllm.engine_builder.trtllm_engine_builder core.export.trtllm.model_to_trllm_mapping core.export.trtllm.model_to_trllm_mapping.default_conversion_dict core.export.trtllm.trt_model_config core.export.trtllm.trt_model_type core.export.trtllm.trtllm_helper core.export.trtllm.trtllm_layers core.export.trtllm.trtllm_weights_converter core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter core.export.trtllm.trtllm_weights_converter.utils core.extensions core.extensions.kitchen core.extensions.transformer_engine core.extensions.transformer_engine_spec_provider core.fault_injector core.fp4_utils core.fp8_utils core.full_cuda_graph core.fusions core.fusions.fused_bias_dropout core.fusions.fused_bias_geglu core.fusions.fused_bias_gelu core.fusions.fused_bias_swiglu core.fusions.fused_cross_entropy core.fusions.fused_indices_converter core.fusions.fused_layer_norm core.fusions.fused_mhc_kernels core.fusions.fused_mla_yarn_rope_apply core.fusions.fused_pad_routing_map core.fusions.fused_softmax core.fusions.fused_weighted_squared_relu core.hyper_comm_grid core.inference core.inference.apis core.inference.apis._llm_base core.inference.apis.async_llm core.inference.apis.llm core.inference.apis.serve_config core.inference.async_stream core.inference.batch_dimensions_utils core.inference.common_inference_params core.inference.communication_utils core.inference.config core.inference.contexts core.inference.contexts.base_context core.inference.contexts.dynamic_context core.inference.contexts.fused_kv_append_kernel core.inference.contexts.gpu_view core.inference.contexts.kv_block_allocator core.inference.contexts.mamba_slot_allocator core.inference.contexts.mtp_context_mixin core.inference.contexts.mtp_metadata core.inference.contexts.routing_metadata core.inference.contexts.static_context core.inference.data_parallel_inference_coordinator core.inference.data_parallel_inference_coordinator.coordinator core.inference.data_parallel_inference_coordinator.handlers core.inference.data_parallel_inference_coordinator.state core.inference.disaggregation core.inference.disaggregation.decode_admission core.inference.disaggregation.engine core.inference.disaggregation.handoff_completion_tracker core.inference.disaggregation.inference_state_handoff core.inference.disaggregation.kv_reshard core.inference.disaggregation.pending_handoff_imports core.inference.disaggregation.ssm_reshard core.inference.disaggregation.transfer_backends core.inference.disaggregation.transfer_backends.base core.inference.disaggregation.transfer_backends.nccl core.inference.disaggregation.transfer_backends.nixl core.inference.disaggregation.utils core.inference.engines core.inference.engines.abstract_engine core.inference.engines.async_zmq_communicator core.inference.engines.dynamic_engine core.inference.engines.mcore_engine core.inference.engines.static_engine core.inference.headers core.inference.inference_client core.inference.inference_request core.inference.model_inference_wrappers core.inference.model_inference_wrappers.abstract_model_inference_wrapper core.inference.model_inference_wrappers.gpt core.inference.model_inference_wrappers.gpt.gpt_inference_wrapper core.inference.model_inference_wrappers.t5 core.inference.model_inference_wrappers.t5.t5_inference_wrapper core.inference.moe core.inference.moe.activations core.inference.moe.batch_invariant core.inference.moe.flashinfer_mxfp8 core.inference.moe.fused_moe core.inference.moe.metadata core.inference.moe.permute core.inference.moe.vllm_fused_moe core.inference.quantization core.inference.quantization.mxfp8_quantize core.inference.quantization.mxfp8_tensor core.inference.quantization.utils core.inference.sampling core.inference.sampling.base core.inference.sampling.flashinfer_sampling core.inference.sampling.torch_sampling core.inference.sampling_params core.inference.scheduler core.inference.shards core.inference.shards_spec core.inference.symmetric_memory core.inference.text_generation_controllers core.inference.text_generation_controllers.encoder_decoder_text_generation_controller core.inference.text_generation_controllers.mtp_controller_mixin core.inference.text_generation_controllers.mtp_utils_pytorch core.inference.text_generation_controllers.mtp_utils_triton core.inference.text_generation_controllers.text_generation_controller core.inference.text_generation_controllers.vlm_text_generation_controller core.inference.text_generation_server core.inference.text_generation_server.dynamic_text_gen_server core.inference.text_generation_server.dynamic_text_gen_server.endpoints core.inference.text_generation_server.dynamic_text_gen_server.endpoints.chat_completions core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common core.inference.text_generation_server.dynamic_text_gen_server.endpoints.completions core.inference.text_generation_server.dynamic_text_gen_server.endpoints.health core.inference.text_generation_server.dynamic_text_gen_server.endpoints.profile core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server core.inference.text_generation_server.dynamic_text_gen_server.tokenization core.inference.text_generation_server.dynamic_text_gen_server.vlm_dynamic_inference core.inference.text_generation_server.run_mcore_engine core.inference.text_generation_server.text_generation_server core.inference.text_generation_server.tokenization core.inference.unified_memory core.inference.utils core.inference_params core.jit core.model_parallel_config core.models core.models.audio core.models.audio.audio_feature_config core.models.audio.audio_processor core.models.audio.audio_projector core.models.audio.nemo_audio_checkpoint core.models.audio.nemo_audio_preprocessing core.models.audio.nemo_transformer_audio_model core.models.audio.nemo_transformer_encoder core.models.audio.packed_audio core.models.backends core.models.bert core.models.bert.bert_layer_specs core.models.bert.bert_lm_head core.models.bert.bert_model core.models.bert.pooler core.models.common core.models.common.combined_1f1b_mfsdp_scheduler core.models.common.embeddings core.models.common.embeddings.language_model_embedding core.models.common.embeddings.relative_pos_embedding core.models.common.embeddings.rope_utils core.models.common.embeddings.rotary_pos_embedding core.models.common.embeddings.yarn_rotary_pos_embedding core.models.common.fine_grained_callables core.models.common.language_module core.models.common.language_module.language_module core.models.common.model_chunk_schedule_plan core.models.common.utils core.models.common.vision_module core.models.common.vision_module.vision_module core.models.gpt core.models.gpt.experimental_attention_variant_module_specs core.models.gpt.fine_grained_callables core.models.gpt.gpt_layer_specs core.models.gpt.gpt_model core.models.gpt.moe_module_specs core.models.huggingface core.models.huggingface.clip_model core.models.huggingface.fastconformer_model core.models.huggingface.module core.models.huggingface.qwen_model core.models.hybrid core.models.hybrid.hybrid_block core.models.hybrid.hybrid_layer_allocation core.models.hybrid.hybrid_layer_specs core.models.hybrid.hybrid_model core.models.hybrid.layers core.models.hybrid.layers.hybrid_hyper_connection core.models.hybrid.layers.utils core.models.hybrid.shortcut_block core.models.mamba core.models.mamba.mamba_layer_specs core.models.mamba.mamba_model core.models.mimo core.models.mimo.comm core.models.mimo.comm.colocated_communicator core.models.mimo.config core.models.mimo.config.base_configs core.models.mimo.config.role core.models.mimo.model core.models.mimo.model.base core.models.mimo.optimizer core.models.multimodal core.models.multimodal.context_parallel core.models.multimodal.llava_model core.models.multimodal.llava_spec core.models.multimodal.utils core.models.T5 core.models.T5.t5_model core.models.T5.t5_spec core.models.vision core.models.vision.clip_vit_model core.models.vision.encoder_registry core.models.vision.multimodal_projector core.models.vision.radio core.models.vision.vit_layer_specs core.models.vision.vit_model core.msc_utils core.nccl_allocator core.num_microbatches_calculator core.optimizer core.optimizer.clip_grads core.optimizer.cpu_offloading core.optimizer.cpu_offloading.hybrid_optimizer core.optimizer.distrib_optimizer core.optimizer.emerging_optimizers core.optimizer.fully_sharded_optimizer core.optimizer.grad_scaler core.optimizer.layer_wise_optimizer core.optimizer.muon core.optimizer.optimizer core.optimizer.optimizer_config core.optimizer.optimizer_cuda_graph core.optimizer.param_layout core.optimizer.qk_clip core.optimizer_param_scheduler core.package_info core.packed_seq_params core.parallel_state core.parameter_names core.pipeline_parallel core.pipeline_parallel.bridge_communicator core.pipeline_parallel.combined_1f1b core.pipeline_parallel.fine_grained_activation_offload core.pipeline_parallel.hybrid_cp_schedule core.pipeline_parallel.multimodule_communicator core.pipeline_parallel.p2p_communication core.pipeline_parallel.schedules core.pipeline_parallel.utils core.post_training core.post_training.modelopt core.post_training.modelopt.checkpointing core.post_training.modelopt.gpt core.post_training.modelopt.gpt.model_specs core.post_training.modelopt.gpt.state_dict_hooks core.post_training.modelopt.hybrid core.post_training.modelopt.hybrid.model_specs core.post_training.modelopt.layers core.post_training.modelopt.mamba core.post_training.modelopt.mamba.model_specs core.process_groups_config core.quantization core.quantization.quant_config core.quantization.utils core.recompute core.rerun_state_machine core.resharding core.resharding.copy_services core.resharding.copy_services.base core.resharding.copy_services.gloo_copy_service core.resharding.copy_services.nccl_copy_service core.resharding.copy_services.nccl_m2n_copy_service core.resharding.copy_services.nixl_copy_service core.resharding.copy_services.nvshmem_copy_service core.resharding.execution core.resharding.nvshmem_copy_service core.resharding.nvshmem_copy_service.compat core.resharding.nvshmem_copy_service.core core.resharding.nvshmem_copy_service.core.gpu_resource_manager core.resharding.nvshmem_copy_service.core.kernel_launcher core.resharding.nvshmem_copy_service.core.pipeline_executor core.resharding.nvshmem_copy_service.logger core.resharding.nvshmem_copy_service.memory core.resharding.nvshmem_copy_service.memory.double_buffer_manager core.resharding.nvshmem_copy_service.memory.tensor_pointer_utils core.resharding.nvshmem_copy_service.nvshmem_types core.resharding.nvshmem_copy_service.planning core.resharding.nvshmem_copy_service.planning.communication_scheduler core.resharding.nvshmem_copy_service.planning.gpu_execution_planner core.resharding.nvshmem_copy_service.planning.task_segmenter core.resharding.nvshmem_copy_service.planning.workload_packer core.resharding.nvshmem_copy_service.service core.resharding.nvshmem_copy_service.validation core.resharding.planner core.resharding.refit core.resharding.shard_planner core.resharding.transforms core.resharding.utils core.safe_globals core.ssm core.ssm.causal_conv1d core.ssm.context_parallel core.ssm.context_parallel.chunkwise core.ssm.context_parallel.gdp core.ssm.context_parallel.gdp_common core.ssm.context_parallel.gdp_cutedsl core.ssm.gated_delta_net core.ssm.gated_delta_net.common core.ssm.gated_delta_net.gdn core.ssm.gated_delta_net.gdn2 core.ssm.gated_delta_product core.ssm.gdn_layer_config core.ssm.gdp_context_parallel core.ssm.mamba_block core.ssm.mamba_context_parallel core.ssm.mamba_hybrid_layer_allocation core.ssm.mamba_layer core.ssm.mamba_layer_config core.ssm.mamba_mixer core.ssm.mlp_layer core.ssm.mlp_layer_config core.ssm.ops core.ssm.ops.common core.ssm.ops.common.causal_conv1d_triton core.ssm.ops.common.causal_conv1d_varlen core.ssm.ops.common.determinism core.ssm.ops.common.intermediate_extraction core.ssm.ops.gdp core.ssm.ops.gdp.chunk core.ssm.ops.gdp.chunk_h core.ssm.ops.gdp.chunk_o core.ssm.ops.gdp.common core.ssm.ops.gdp.cumsum core.ssm.ops.gdp.decode_prepare core.ssm.ops.gdp.fused_recurrent core.ssm.ops.gdp.metadata core.ssm.ops.gdp.scaled_dot_kkt core.ssm.ops.gdp.solve_tril core.ssm.ops.gdp.wy_fast core.ssm.ops.mamba2 core.ssm.ops.mamba2.batch_invariant_decode core.ssm.ops.mamba2.mamba_ssm core.ssm.ops.mamba2.ssd_bmm core.ssm.ops.mamba2.ssd_chunk_scan core.ssm.ops.mamba2.ssd_chunk_state core.ssm.ops.mamba2.ssd_combined core.ssm.ops.mamba2.ssd_state_passing core.ssm.packed_seq_helpers core.ssm.ssm_inference core.ssm.triton_cache_manager core.ssm.utils core.telemetry core.telemetry.fallbacks core.telemetry.span_groups core.telemetry.training_metrics core.tensor_observation core.tensor_parallel core.tensor_parallel.cross_entropy core.tensor_parallel.data core.tensor_parallel.generalized_tensor_parallelism core.tensor_parallel.gtp_api core.tensor_parallel.gtp_cuda_graphs core.tensor_parallel.gtp_symmetric_memory core.tensor_parallel.inference_layers core.tensor_parallel.layers core.tensor_parallel.mappings core.tensor_parallel.random core.tensor_parallel.utils core.timers core.tokenizers core.tokenizers.base_tokenizer core.tokenizers.megatron_tokenizer core.tokenizers.text core.tokenizers.text.libraries core.tokenizers.text.libraries.abstract_tokenizer core.tokenizers.text.libraries.bytelevel_tokenizer core.tokenizers.text.libraries.chat_template core.tokenizers.text.libraries.huggingface_tokenizer core.tokenizers.text.libraries.megatron_hf_tokenizer core.tokenizers.text.libraries.null_tokenizer core.tokenizers.text.libraries.sentencepiece_tokenizer core.tokenizers.text.libraries.sft_tokenizer core.tokenizers.text.libraries.tiktoken_tokenizer core.tokenizers.text.parsers core.tokenizers.text.parsers.base_parser core.tokenizers.text.parsers.deepseek_r1_reasoning_parser core.tokenizers.text.parsers.nemotron_v3_reasoning_parser core.tokenizers.text.parsers.qwen3_coder_tool_parser core.tokenizers.text.text_tokenizer core.tokenizers.utils core.tokenizers.utils.build_tokenizer core.tokenizers.utils.utils core.tokenizers.vision core.tokenizers.vision.libraries core.tokenizers.vision.libraries.multimodal_tokenizer core.tokenizers.vision.libraries.null_multimodal_tokenizer core.tokenizers.vision.vision_tokenizer core.transformer core.transformer.attention core.transformer.attention_layer_config core.transformer.cuda_graph_config core.transformer.cuda_graphs core.transformer.custom_layers core.transformer.custom_layers.batch_invariant_kernels core.transformer.dot_product_attention core.transformer.enums core.transformer.fsdp_dtensor_checkpoint core.transformer.hyper_connection core.transformer.identity_op core.transformer.mla_layer_config core.transformer.mla_qk_norm_config core.transformer.mlp core.transformer.module core.transformer.moe core.transformer.moe.batch_invariant core.transformer.moe.experts core.transformer.moe.fused_a2a core.transformer.moe.inference_routing_mask_kernel core.transformer.moe.moe_layer core.transformer.moe.moe_layer_config core.transformer.moe.moe_logging core.transformer.moe.moe_utils core.transformer.moe.ops core.transformer.moe.ops.paged_stash core.transformer.moe.paged_stash core.transformer.moe.router core.transformer.moe.router_diagnostics core.transformer.moe.router_replay core.transformer.moe.router_trace core.transformer.moe.shared_experts core.transformer.moe.token_dispatcher core.transformer.moe.token_dispatcher_inference core.transformer.moe.upcycling_utils core.transformer.multi_latent_attention core.transformer.multi_token_prediction core.transformer.pipeline_parallel_layer_layout core.transformer.spec_utils core.transformer.torch_layer_norm core.transformer.torch_norm core.transformer.transformer_block core.transformer.transformer_config core.transformer.transformer_layer core.transformer.utils core.typed_torch core.utils module (core.transformer.spec_utils.ModuleSpec attribute) module_path (core.quantization.quant_config.MatchContext attribute) module_pgs (core.process_groups_config.MultiModuleProcessGroupCollection attribute) module_to_grid_map (core.models.mimo.config.base_configs.MimoModelConfig attribute) ModuleLayout (class in core.models.mimo.config.role) ModuleOptimizerInfo (class in core.models.mimo.optimizer) modules (core.models.mimo.config.role.RankRole attribute) ModuleSpec (class in core.transformer.spec_utils) ModuleStageInfo (class in core.models.mimo.config.role) MOE (core.models.hybrid.layers.utils.Symbols attribute) moe (core.transformer.enums.CudaGraphModule attribute) (core.transformer.enums.CudaGraphScope attribute) (in module core.models.hybrid.hybrid_layer_specs) moe_apply_probs_on_input (core.transformer.transformer_config.TransformerConfig attribute) moe_aux_loss_coeff (core.transformer.transformer_config.TransformerConfig attribute) moe_combine (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan attribute) moe_combine_bwd_dtype (core.transformer.transformer_config.TransformerConfig attribute) moe_deepep_num_sms (core.transformer.transformer_config.TransformerConfig attribute) moe_dispatch (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan attribute) moe_dispatch_fwd_dtype (core.transformer.transformer_config.TransformerConfig attribute) moe_enable_deepep (core.transformer.transformer_config.TransformerConfig attribute) moe_enable_routing_replay (core.transformer.transformer_config.TransformerConfig attribute) moe_expert_capacity_factor (core.transformer.transformer_config.TransformerConfig attribute) moe_expert_rank_capacity_factor (core.transformer.transformer_config.TransformerConfig attribute) moe_ffn_hidden_size (core.transformer.transformer_config.TransformerConfig attribute) moe_flex_dispatcher_backend (core.transformer.transformer_config.TransformerConfig attribute) moe_flex_dispatcher_num_sms (core.transformer.transformer_config.TransformerConfig attribute) moe_grad_scale_func (core.model_parallel_config.ModelParallelConfig attribute) moe_grouped_gemm (core.transformer.transformer_config.TransformerConfig attribute) moe_hybridep_num_blocks_permute (core.transformer.transformer_config.TransformerConfig attribute) moe_hybridep_num_blocks_unpermute (core.transformer.transformer_config.TransformerConfig attribute) moe_hybridep_num_sms (core.transformer.transformer_config.TransformerConfig attribute) moe_hybridep_num_sms_preprocessing (core.transformer.transformer_config.TransformerConfig attribute) moe_hybridep_pad_uneven_dispatch_inputs (core.transformer.transformer_config.TransformerConfig attribute) moe_inference (in module core.models.hybrid.hybrid_layer_specs) moe_input_jitter_eps (core.transformer.transformer_config.TransformerConfig attribute) moe_latent_size (core.transformer.transformer_config.TransformerConfig attribute) moe_layer (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) moe_layer_cache (in module core.inference.utils) moe_layer_freq (core.transformer.transformer_config.TransformerConfig attribute) moe_layer_recompute (core.transformer.transformer_config.TransformerConfig attribute) moe_mlp_glu_interleave_size (core.transformer.transformer_config.TransformerConfig attribute) moe_ncclep_zero_copy (core.transformer.transformer_config.TransformerConfig attribute) moe_pad_expert_input_to_capacity (core.transformer.transformer_config.TransformerConfig attribute) moe_pad_experts_for_cuda_graph_inference (core.transformer.transformer_config.TransformerConfig attribute) moe_paged_stash (core.transformer.transformer_config.TransformerConfig attribute) moe_paged_stash_buffer_size_factor_cpu (core.transformer.transformer_config.TransformerConfig attribute) moe_paged_stash_buffer_size_factor_cuda (core.transformer.transformer_config.TransformerConfig attribute) moe_paged_stash_page_size (core.transformer.transformer_config.TransformerConfig attribute) moe_per_layer_logging (core.transformer.transformer_config.TransformerConfig attribute) moe_permute_fusion (core.transformer.transformer_config.TransformerConfig attribute) moe_permute_fusion_into_hybridep (core.transformer.transformer_config.TransformerConfig attribute) moe_preprocess (core.transformer.enums.CudaGraphModule attribute) (core.transformer.enums.CudaGraphScope attribute) moe_router (core.transformer.enums.CudaGraphModule attribute) (core.transformer.enums.CudaGraphScope attribute) moe_router() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) moe_router_aux_loss_fusion (core.transformer.transformer_config.TransformerConfig attribute) moe_router_bias_update_rate (core.transformer.transformer_config.TransformerConfig attribute) moe_router_dtype (core.transformer.transformer_config.TransformerConfig attribute) moe_router_enable_expert_bias (core.transformer.transformer_config.TransformerConfig attribute) moe_router_force_biased (core.transformer.transformer_config.TransformerConfig attribute) moe_router_force_load_balancing (core.transformer.transformer_config.TransformerConfig attribute) moe_router_fusion (core.transformer.transformer_config.TransformerConfig attribute) moe_router_group_topk (core.transformer.transformer_config.TransformerConfig attribute) moe_router_load_balancing_type (core.transformer.transformer_config.TransformerConfig attribute) moe_router_num_groups (core.transformer.transformer_config.TransformerConfig attribute) moe_router_padding_for_fp8 (core.transformer.transformer_config.TransformerConfig attribute) moe_router_padding_for_quantization (core.transformer.transformer_config.TransformerConfig attribute) moe_router_pre_softmax (core.transformer.transformer_config.TransformerConfig attribute) moe_router_quantile_balancing_ema (core.transformer.transformer_config.TransformerConfig attribute) moe_router_score_function (core.transformer.transformer_config.TransformerConfig attribute) moe_router_skip_muon (core.transformer.transformer_config.TransformerConfig attribute) moe_router_topk (core.transformer.transformer_config.TransformerConfig attribute) moe_router_topk_limited_devices (core.transformer.transformer_config.TransformerConfig attribute) moe_router_topk_scaling_factor (core.transformer.transformer_config.TransformerConfig attribute) moe_shared_expert_gate (core.transformer.transformer_config.TransformerConfig attribute) moe_shared_expert_glu_interleave_size (core.transformer.transformer_config.TransformerConfig attribute) moe_shared_expert_intermediate_size (core.transformer.transformer_config.TransformerConfig attribute) moe_shared_expert_overlap (core.transformer.transformer_config.TransformerConfig attribute) moe_shortcut_connection (core.transformer.transformer_config.TransformerConfig attribute) moe_shortcut_parallel (core.transformer.transformer_config.TransformerConfig attribute) moe_shortcut_post_norm (core.transformer.transformer_config.TransformerConfig attribute) moe_single_grouped_bias (core.transformer.transformer_config.TransformerConfig attribute) moe_single_grouped_weight (core.transformer.transformer_config.TransformerConfig attribute) moe_token_dispatcher_type (core.transformer.transformer_config.TransformerConfig attribute) moe_token_drop_policy (core.transformer.transformer_config.TransformerConfig attribute) moe_token_dropping (core.transformer.transformer_config.TransformerConfig attribute) moe_use_grouped_tensor (core.transformer.transformer_config.TransformerConfig attribute) moe_use_norm_before_up_proj (core.transformer.transformer_config.TransformerConfig attribute) moe_z_loss_coeff (core.transformer.transformer_config.TransformerConfig attribute) MoEAllGatherTokenDispatcher (class in core.transformer.moe.token_dispatcher) MoEAlltoAllTokenDispatcher (class in core.transformer.moe.token_dispatcher) MoEAuxLossAutoScaler (class in core.transformer.moe.moe_utils) MoECudaGraphPartialCaptureSignal MoECudaGraphTensorStore (class in core.transformer.moe.moe_utils) MoEFlexTokenDispatcher (class in core.transformer.moe.token_dispatcher) MoELayer (class in core.transformer.moe.moe_layer) MoELayerConfig (class in core.transformer.moe.moe_layer_config) MoEMetricsTracker (class in core.transformer.moe.moe_logging) MoESubmodules (class in core.transformer.moe.moe_layer) MoETokenDispatcher (class in core.transformer.moe.token_dispatcher) MoETransformerLayer (class in core.transformer.transformer_layer) move_request_rows() (core.inference.contexts.mtp_metadata.MTPMetadata method) mp (core.process_groups_config.ProcessGroupCollection attribute) mpu (in module core) mrope_section (core.transformer.transformer_config.TransformerConfig attribute) MSC_PREFIX (in module core.datasets.object_storage_utils) (in module core.dist_checkpointing.strategies.torch) mscale (core.transformer.transformer_config.MLATransformerConfig attribute) mscale_all_dim (core.transformer.transformer_config.MLATransformerConfig attribute) mtp (core.transformer.enums.LayerType attribute) mtp_block_spec (core.models.hybrid.hybrid_block.HybridStackSubmodules attribute) mtp_detach_heads (core.transformer.transformer_config.TransformerConfig attribute) MTP_GRAD_NORM_GROUP (in module core.optimizer.optimizer) mtp_grad_scale_func (core.model_parallel_config.ModelParallelConfig attribute) mtp_hsm (core.transformer.transformer_config.TransformerConfig attribute) mtp_hybrid_override_pattern (core.transformer.transformer_config.TransformerConfig attribute) MTP_INNER_LAYER (in module core.transformer.fsdp_dtensor_checkpoint) MTP_INNER_LAYER_CHECKPOINT_NAME (in module core.transformer.fsdp_dtensor_checkpoint) mtp_input_mask (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) mtp_layer_type_list (core.inference.config.InferenceConfig attribute) mtp_layer_types_from_model() (in module core.inference.config) mtp_loss_scaling_factor (core.transformer.transformer_config.TransformerConfig attribute) mtp_model_layer (core.transformer.multi_token_prediction.MultiTokenPredictionLayerSubmodules attribute) mtp_num_depths (core.models.hybrid.hybrid_layer_allocation.ParsedHybridPattern attribute) mtp_num_layers (core.transformer.transformer_config.TransformerConfig attribute) mtp_on_this_rank() (in module core.transformer.multi_token_prediction) mtp_pattern (core.models.hybrid.hybrid_layer_allocation.ParsedHybridPattern attribute) mtp_post_process (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan attribute) mtp_private_suffix_start (core.inference.inference_request.DynamicInferenceRequest attribute) MTP_SEPARATOR (core.models.hybrid.layers.utils.Symbols attribute) mtp_standalone (core.model_parallel_config.ModelParallelConfig attribute) mtp_use_repeated_layer (core.transformer.transformer_config.TransformerConfig attribute) MTPContextMixin (class in core.inference.contexts.mtp_context_mixin) MTPControllerMixin (class in core.inference.text_generation_controllers.mtp_controller_mixin) MTPForwardMode (class in core.inference.contexts.mtp_metadata) MTPLossAutoScaler (class in core.transformer.multi_token_prediction) MTPLossLoggingHelper (class in core.transformer.multi_token_prediction) MTPMetadata (class in core.inference.contexts.mtp_metadata) multi_latent_attention (core.transformer.transformer_config.MLATransformerConfig attribute) (core.transformer.transformer_config.TransformerConfig attribute) MultiGroupMemPoolAllocator (class in core.nccl_allocator) MultiGroupUBRAllocator (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) MultiHeadAttention (class in core.models.audio.nemo_transformer_encoder) MultiHeadAttentionWithFA (class in core.models.audio.nemo_transformer_encoder) MultiHeadAttentionWithSDPA (class in core.models.audio.nemo_transformer_encoder) MultiHeadAttentionWithTE (class in core.models.audio.nemo_transformer_encoder) MultiLatentAttention (class in core.transformer.multi_latent_attention) multimodal_prompt_config (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper attribute) MultimodalDatasetConfig (class in core.datasets.multimodal_dataset) MultimodalProjector (class in core.models.vision.multimodal_projector) MultimodalPromptConfig (class in core.inference.config) MultimodalRotaryEmbedding (class in core.models.common.embeddings.rotary_pos_embedding) MultiModulePipelineCommunicator (class in core.pipeline_parallel.multimodule_communicator) MultiModuleProcessGroupCollection (class in core.process_groups_config) multiple_validation_sets (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) MultiStorageClientFeature (in module core.msc_utils) MultiTokenPredictionBlock (class in core.transformer.multi_token_prediction) MultiTokenPredictionBlockSubmodules (class in core.transformer.multi_token_prediction) MultiTokenPredictionInputs (class in core.transformer.multi_token_prediction) MultiTokenPredictionLayer (class in core.transformer.multi_token_prediction) MultiTokenPredictionLayerSubmodules (class in core.transformer.multi_token_prediction) muon_coefficient_type (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_extra_scale_factor (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_fp32_matmul_prec (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_momentum (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_nesterov (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_num_ns_steps (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_scalar_optimizer (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_scale_mode (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_split_qkv (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_tp_mode (core.optimizer.optimizer_config.OptimizerConfig attribute) muon_use_syrk (core.optimizer.optimizer_config.OptimizerConfig attribute) mup_attn_scale_power (core.transformer.transformer_config.TransformerConfig attribute) mup_base_head_dim (core.transformer.transformer_config.TransformerConfig attribute) mup_base_hidden_size (core.transformer.transformer_config.TransformerConfig attribute) mup_embedding_mult (core.transformer.transformer_config.TransformerConfig attribute) mup_output_mult (core.transformer.transformer_config.TransformerConfig attribute) mup_scaled_init_method_normal() (in module core.utils) mup_width_mult (core.transformer.transformer_config.TransformerConfig attribute) mxfp8 (core.enums.Fp8Recipe attribute) MXFP8_BLOCK_SIZE (in module core.inference.quantization.mxfp8_quantize) mxfp8_quantize() (in module core.inference.quantization.mxfp8_quantize) mxfp8_quantize_into() (in module core.inference.quantization.mxfp8_quantize) MXFP8_SCALE_COL_BLOCK (in module core.inference.quantization.mxfp8_quantize) MXFP8_SCALE_ROW_BLOCK (in module core.inference.quantization.mxfp8_quantize) MXFP8Backend (in module core.inference.quantization.mxfp8_tensor) MXFP8ReshardTransform (class in core.resharding.transforms) MXFP8Tensor (class in core.inference.quantization.mxfp8_tensor) my_pe (core.resharding.nvshmem_copy_service.service.RemoteCopyService property) my_rank (core.utils.StragglerDetector property) my_slice (core.resharding.utils.TransferOp attribute) N n_fft (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) n_heads (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.GPTConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) n_layers (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.GPTConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) n_mels (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) n_pes (core.resharding.nvshmem_copy_service.service.RemoteCopyService property) n_window_size (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) n_window_stride (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) name (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule property) (core.hyper_comm_grid._RankViewSpec attribute) (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend attribute) (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) (core.optimizer.optimizer_config.ParamKey attribute) (core.optimizer.optimizer_config.ParamPredicate attribute) (core.optimizer.optimizer_config.ParamWithNamePredicate attribute) (core.resharding.utils.ParameterMetadata attribute) (core.resharding.utils.ShardingDescriptor attribute) name_sorted_valid_layer_symbols() (core.models.hybrid.layers.utils.Symbols class method) named_persistent_buffers() (in module core.resharding.utils) named_refit_tensors() (in module core.resharding.utils) nan_debug (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) narrow() (core.dist_checkpointing.mapping.ShardedTensor method) native_fused_add_3() (in module core.transformer.hyper_connection) native_h_aggregate() (in module core.transformer.hyper_connection) native_h_post_bda() (in module core.transformer.hyper_connection) native_proj_rms() (in module core.transformer.hyper_connection) native_sinkhorn() (in module core.transformer.hyper_connection) nb_augmentation_prob (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) nb_max_freq (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) nccl_all_reduce_for_prefill (core.transformer.transformer_config.TransformerConfig attribute) NCCL_ALLOCATOR (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) nccl_ep_finalize() (in module core.transformer.moe.fused_a2a) nccl_ep_release_context() (in module core.transformer.moe.token_dispatcher) nccl_mem (class in core.nccl_allocator) NCCL_MEMORY_POOL (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) nccl_ub (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) NCCLAllGatherDispatcher (class in core.transformer.moe.token_dispatcher_inference) NCCLCopyService (class in core.resharding.copy_services.nccl_copy_service) NCCLM2NCopyService (class in core.resharding.copy_services.nccl_m2n_copy_service) NcclTransferBackend (class in core.inference.disaggregation.transfer_backends.nccl) NcclTransferHandle (class in core.inference.disaggregation.transfer_backends.nccl) needs_dp_avg (core.transformer.moe.moe_logging.MetricEntry attribute) nemo_audio_config_paths_from_checkpoint_dir() (in module core.models.audio.nemo_audio_checkpoint) nemo_audio_configs_from_archive() (in module core.models.audio.nemo_audio_checkpoint) nemo_audio_configs_from_checkpoint_dir() (in module core.models.audio.nemo_audio_checkpoint) nemo_audio_configs_from_json_paths() (in module core.models.audio.nemo_audio_checkpoint) nemo_audio_configs_from_path() (in module core.models.audio.nemo_audio_checkpoint) NemoAudioFeatureConfig (class in core.models.audio.audio_feature_config) NemoAudioProcessor (class in core.models.audio.audio_processor) NemoTransformerAudioConfig (class in core.models.audio.nemo_transformer_audio_model) NemoTransformerAudioModel (class in core.models.audio.nemo_transformer_audio_model) NemoTransformerAudioTokenEstimator (class in core.models.audio.audio_feature_config) nemotron_aligned_custom_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) nemotron_custom_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) nemotron_h_aligned_custom_template (in module core.tokenizers.text.libraries.sft_tokenizer) nemotron_h_reasoning_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) nemotron_nano_v2_custom_template (in module core.tokenizers.text.libraries.sft_tokenizer) NEMOTRON_NAS_CONVERSION_DICT (in module core.export.trtllm.model_to_trllm_mapping.default_conversion_dict) NemotronV3ReasoningParser (class in core.tokenizers.text.parsers.nemotron_v3_reasoning_parser) nested_values() (in module core.dist_checkpointing.dict_utils) new_registered_buffer() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferBackend method) (core.inference.disaggregation.transfer_backends.nixl.NixlTransferBackend method) new_state (core.inference.data_parallel_inference_coordinator.state.ControlTransition attribute) newly_paused_request_ids (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) next_hdp_group() (core.pipeline_parallel.hybrid_cp_schedule.BalancedCPScheduler method) next_item() (core.distributed.fsdp.src.megatron_fsdp.experimental.indexed_order.IndexedOrder method) next_iter() (core.full_cuda_graph.FullCudaGraphWrapper method) (core.optimizer.optimizer_cuda_graph.OptimizerCudaGraphWrapper method) NGPTStackingSubsampling (class in core.models.audio.nemo_transformer_encoder) ngroups (core.inference.disaggregation.ssm_reshard.SSMStateDims attribute) ngroups_local (core.inference.disaggregation.ssm_reshard.SSMShardLayout property) nheads (core.inference.disaggregation.ssm_reshard.SSMStateDims attribute) nheads_local (core.inference.disaggregation.ssm_reshard.SSMShardLayout property) NixlCopyService (class in core.resharding.copy_services.nixl_copy_service) NixlPullHandle (class in core.inference.disaggregation.transfer_backends.nixl) NixlTransferBackend (class in core.inference.disaggregation.transfer_backends.nixl) no_mask (core.transformer.enums.AttnMaskType attribute) no_rope_freq (core.transformer.transformer_config.TransformerConfig attribute) NO_SHARD (core.distributed.fsdp.src.megatron_fsdp.fully_shard.ShardingStrategy attribute) no_sync() (core.distributed.data_parallel_base._BaseDataParallel method) (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV2 method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) (core.models.mimo.model.base.MimoModel method) no_sync_func (core.model_parallel_config.ModelParallelConfig attribute) NON_COLOCATED (core.models.mimo.config.role.ModuleLayout attribute) non_leading_numel() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.layout) NON_TRANSFORMER_LAYERS_NAMES (in module core.export.trtllm.trtllm_layers) NONE (core.inference.contexts.mtp_metadata.MTPForwardMode attribute) (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightState attribute) none (core.transformer.enums.InferenceCudaGraphScope attribute) noop_decorator() (in module core.jit) NoopScheduleNode (class in core.pipeline_parallel.utils) Norm (class in core.post_training.modelopt.layers) norm (core.ssm.mamba_layer.MambaLayerSubmodules attribute) normalization (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.MLATransformerConfig attribute) (core.transformer.transformer_config.TransformerConfig attribute) normalize (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) normalize() (core.optimizer.distrib_optimizer.Range method) (in module core.datasets.utils) normalize_batch() (in module core.models.audio.nemo_audio_preprocessing) normalize_cuda_graph_modules() (in module core.transformer.cuda_graph_config) normalize_experimental_attention_variant() (in module core.models.gpt.experimental_attention_variant_module_specs) normalize_inference_cuda_graph_scope() (in module core.transformer.cuda_graph_config) normalize_shard_specs() (in module core.inference.shards_spec) not_none() (in module core.typed_torch) NOT_RUNNING_YET (core.rerun_state_machine.RerunState attribute) notify_kv_cache_cleared() (core.inference.contexts.dynamic_context.DynamoHelper method) ns_cost_fn() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning) null_decorator() (in module core.utils) null_method() (core.utils.StragglerDetector method) NullTokenizer (class in core.tokenizers.text.libraries.null_tokenizer) num_attention_heads (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) num_batches (core.resharding.utils.ReshardPlan attribute) num_blocks (core.inference.disaggregation.pending_handoff_imports.DeferredKvHandoff attribute) (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) num_blocks_from_pool (core.inference.contexts.dynamic_context.PrefixMatch attribute) num_buckets (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline property) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.GradReducePipeline property) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer property) num_buffered (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) num_cached_tokens (core.inference.inference_request.DynamicInferenceRequest attribute) num_cuda_graphs (core.inference.config.InferenceConfig attribute) num_dataset_builder_threads (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) num_decode_requests (core.inference.contexts.dynamic_context.DynamicInferenceContext property) (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsGPUResult attribute) (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) num_distributed_optimizer_instances (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) num_embeddings_from_num_samples() (core.models.audio.audio_processor.NemoAudioProcessor method) num_evictions (core.inference.inference_request.FinishedRequestRecord attribute) num_experts (core.resharding.refit._PlanCacheKey attribute) (core.resharding.utils.ParameterMetadata attribute) num_frames (core.inference.config.VideoProcessingConfig attribute) (core.inference.engines.dynamic_engine._VisionCacheEntry attribute) (core.inference.inference_request.DynamicVLMInferenceRequest attribute) num_frames_from_num_samples() (core.models.audio.audio_processor.NemoAudioProcessor method) num_gpt_layers (core.dist_checkpointing.gpt_checkpoint_interop.GPTCompatLayerMaps attribute) num_heads (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) num_householder (core.ssm.context_parallel.gdp.GDPSavedInputs attribute) (core.ssm.context_parallel.gdp.GDPSavedMetadata attribute) (core.ssm.context_parallel.gdp_common.GDPInputs attribute) (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGDPSavedMetadata attribute) (core.ssm.ssm_inference.SSMChunking attribute) num_img_embeddings_per_tile (core.inference.config.ImageProcessingConfig attribute) (core.inference.engines.dynamic_engine._VisionCacheEntry attribute) (core.inference.inference_request.VLMInferenceRequest attribute) num_last_token_logits (core.inference.contexts.dynamic_context.DynamicInferenceContext property) num_layers (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) (core.inference.disaggregation.ssm_reshard.SSMShardLayout attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) num_layers() (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan method) num_layers_at_end_in_bf16 (core.transformer.transformer_config.TransformerConfig attribute) num_layers_at_start_in_bf16 (core.transformer.transformer_config.TransformerConfig attribute) num_layers_in_first_pipeline_stage (core.transformer.transformer_config.TransformerConfig attribute) num_layers_in_last_pipeline_stage (core.transformer.transformer_config.TransformerConfig attribute) num_local_layers (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) num_matched_prefix_blocks (core.inference.inference_request.DynamicInferenceRequest attribute) num_microbatches_with_partial_activation_checkpoints (core.model_parallel_config.ModelParallelConfig attribute) num_moe_experts (core.transformer.transformer_config.TransformerConfig attribute) num_optimizer_shards (core.optimizer.param_layout.PerBufferParamLayout attribute) num_outer (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) num_parameter_elements (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule property) num_patches_per_image (core.models.vision.vit_model.ViTModel property) num_query_groups (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) num_requests_pending() (core.inference.scheduler.Scheduler method) num_speculative_tokens (core.inference.config.InferenceConfig attribute) num_tasks (core.resharding.nvshmem_copy_service.nvshmem_types.TransferMetadata attribute) num_tiles (core.inference.engines.dynamic_engine._VisionCacheEntry attribute) (core.inference.inference_request.VLMInferenceRequest attribute) num_tokens_to_generate (core.inference.sampling_params.SamplingParams attribute) num_tokens_total (core.inference.sampling_params.SamplingParams attribute) NUM_WARPS (in module core.ssm.ops.gdp.chunk_o) numel (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer._OwnedRange attribute) numel_low_level_dataset() (core.datasets.gpt_dataset.GPTDataset static method) (core.datasets.gpt_dataset.MockGPTDataset static method) (core.datasets.masked_dataset.MaskedWordPieceDataset static method) (core.datasets.megatron_dataset.MegatronDataset static method) NumMicroBatchesCalculator (class in core.num_microbatches_calculator) nvfp4 (core.enums.Fp4Recipe attribute) nvlm_yi_34b_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) NVLSAllGatherVDispatcher (class in core.transformer.moe.token_dispatcher_inference) NVRX_MIN_VERSION (in module core.dist_checkpointing.strategies.nvrx) NVSHMEMCopyService (class in core.resharding.copy_services.nvshmem_copy_service) nvtx_decorator() (in module core.utils) nvtx_range_pop() (in module core.utils) nvtx_range_push() (in module core.utils) O OBJECT_STORAGE_BIN_READERS (in module core.datasets.indexed_dataset) object_storage_cache_path (core.datasets.gpt_dataset.GPTDatasetConfig attribute) ObjectStorageConfig (class in core.datasets.object_storage_utils) observe_layer_residuals() (in module core.tensor_observation) observe_tensor() (in module core.tensor_observation) OFFLOAD (core.inference.config.KVCacheManagementMode attribute) offload() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) offload_grad_buffers() (core.distributed.distributed_data_parallel.DistributedDataParallel method) OFFLOAD_MGR (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager attribute) offload_modules (core.transformer.transformer_config.TransformerConfig attribute) offload_params (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.RequestPromptPreparationResult attribute) offload_summary_bytes (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager property) offload_summary_total_bytes (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager property) offload_to_cpu() (core.distributed.param_and_grad_buffer._ParamAndGradBuffer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) offload_to_stash() (core.transformer.moe.paged_stash.PagedTensor method) OffloadedRequestPayload (class in core.inference.inference_request) OffloadTensorGroup (class in core.pipeline_parallel.fine_grained_activation_offload) OffloadTensorPool (class in core.pipeline_parallel.fine_grained_activation_offload) offset (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer attribute) offset_sampling_seed_by_dp_rank (core.inference.config.InferenceConfig attribute) offsets (core.inference.contexts.mtp_metadata.MTPMetadata attribute) offsets() (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) on_get_saved_tensor() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) (core.transformer.moe.paged_stash.PagedStashManager method) on_group_commit_backward() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) on_group_commit_forward() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) on_group_start_backward() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) on_group_start_forward() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) on_kv_blocks_deregistered() (core.inference.contexts.dynamic_context.DynamoHelper method) (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) on_save_for_backward() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) (core.transformer.moe.paged_stash.PagedStashManager method) openai_gelu() (in module core.transformer.utils) openai_stream() (in module core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) OPTIM (core.distributed.fsdp.src.megatron_fsdp.fully_shard.ShardingStrategy attribute) OPTIM_GRADS (core.distributed.fsdp.src.megatron_fsdp.fully_shard.ShardingStrategy attribute) OPTIM_GRADS_PARAMS (core.distributed.fsdp.src.megatron_fsdp.fully_shard.ShardingStrategy attribute) optim_state_to_sharding_state() (in module core.dist_checkpointing.optimizer) optimal_dtype() (core.datasets.indexed_dataset.DType static method) optimizer (core.distributed.fsdp.mcore_fsdp_adapter._AxisPlacements attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard.Placements attribute) (core.models.mimo.optimizer.ModuleOptimizerInfo attribute) (core.optimizer.optimizer.ChainedOptimizer property) (core.optimizer.optimizer_config.OptimizerConfig attribute) (core.optimizer_param_scheduler.ParamGroupOverride attribute) optimizer_cls (core.optimizer.emerging_optimizers.EmergingOptimizerEntry attribute) optimizer_cpu_offload (core.optimizer.optimizer_config.OptimizerConfig attribute) optimizer_cuda_graph (core.optimizer.optimizer_config.OptimizerConfig attribute) optimizer_offload_fraction (core.optimizer.optimizer_config.OptimizerConfig attribute) optimizer_state_keys (core.optimizer.distrib_optimizer.DistributedOptimizer property) OptimizerConfig (class in core.optimizer.optimizer_config) OptimizerCudaGraphWrapper (class in core.optimizer.optimizer_cuda_graph) OptimizerParamScheduler (class in core.optimizer_param_scheduler) ordered_reduce_scatter_v() (in module core.inference.moe.batch_invariant) original_max_position_embeddings (core.transformer.transformer_config.MLATransformerConfig attribute) orthogonalize() (core.optimizer.emerging_optimizers.TensorParallelMuon method) out (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) out_norm (core.ssm.gated_delta_net.common.GatedDeltaNetSubmodules attribute) out_proj (core.ssm.gated_delta_net.common.GatedDeltaNetSubmodules attribute) (core.ssm.gated_delta_product.GatedDeltaProductMixerSubmodules attribute) (core.ssm.mamba_mixer.MambaMixerSubmodules attribute) outer_async_handle (core.tensor_parallel.generalized_tensor_parallelism.BatchedNVFP4AllGatherAsyncHandle attribute) outer_dp_sharding_strategy (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) outer_stride_bytes (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) output (core.inference.text_generation_controllers.text_generation_controller.DynamicBatchControllerStepResult attribute) (core.ssm.context_parallel.chunkwise.CPForwardResult attribute) output_contract() (core.transformer.hyper_connection.HyperConnectionModule static method) output_embedding_dim (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig property) output_grad_interleaved (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) output_handles (core.tensor_parallel.generalized_tensor_parallelism.BatchedNVFP4AllGatherAsyncHandle attribute) output_layer_init_method (core.transformer.transformer_config.TransformerConfig attribute) output_projection_groups (core.transformer.transformer_config.MLATransformerConfig attribute) output_projection_lora_rank (core.transformer.transformer_config.MLATransformerConfig attribute) output_segment_counts (core.context_parallel.layout._LayoutRedistributionPlan attribute) overall_required_blocks (core.inference.contexts.dynamic_context.PrefixMatch attribute) overlap_cpu_optimizer_d2h_h2d (core.optimizer.optimizer_config.OptimizerConfig attribute) overlap_dispatch_backward_with_experts_wgrad (core.model_parallel_config.ModelParallelConfig attribute) overlap_grad_reduce (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) overlap_moe_expert_parallel_comm (core.model_parallel_config.ModelParallelConfig attribute) overlap_p2p_comm (core.model_parallel_config.ModelParallelConfig attribute) overlap_p2p_comm_warmup_flush (core.model_parallel_config.ModelParallelConfig attribute) overlap_param_gather (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) overlap_param_gather_with_optimizer_step (core.optimizer.optimizer_config.OptimizerConfig attribute) overlap_state_check() (in module core.transformer.moe.shared_experts) override_nonquantized_autocast (core.extensions.transformer_engine.TEQuantizationRecipe attribute) override_quantized_autocast (core.extensions.transformer_engine.TEQuantizationRecipe attribute) override_sharded_param_methods_with_safety_checks() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) overwrite_nccl_comm_cfgs() (in module core.parallel_state) own_shards (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerGatherPlan attribute) owner_candidates() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout method) owner_rank (core.resharding.utils.ParameterMetadata attribute) OwnerGatherPlan (class in core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning) owners (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.GroupOwnerLayout attribute) OwnerScatterPlan (class in core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning) P P (in module core.typed_torch) p2p_communicator (core.pipeline_parallel.multimodule_communicator.RankModuleInfo attribute) P2PCommunicator (class in core.pipeline_parallel.p2p_communication) P_dst (in module core.typed_torch) P_src (in module core.typed_torch) pack() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerGatherPlan class method) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerScatterPlan class method) pack_routed_mxfp8_routing() (in module core.inference.moe.flashinfer_mxfp8) pack_stream (core.transformer.moe.paged_stash.PagedStashManager property) pack_workloads() (core.resharding.nvshmem_copy_service.planning.workload_packer.WorkloadPacker method) packed (core.ssm.context_parallel.chunkwise.CPBackwardPackedSummary attribute) (core.ssm.context_parallel.chunkwise.CPForwardPackedSummary attribute) packed_seq_params (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) packed_seq_params_by_layout (core.context_parallel.utils.ContextParallelBatch attribute) PackedAudioEmbeddings (class in core.models.audio.packed_audio) PackedSeqParams (class in core.packed_seq_params) PackedSequenceCPMetadata (class in core.ssm.context_parallel.chunkwise) PackingSchedulerEnum (class in core.datasets.data_schedule) pad (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer property) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision property) pad_active_slices() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) pad_between_seqs (core.context_parallel.layout._THDZigzagMetadata attribute) (core.packed_seq_params.PackedSeqParams attribute) pad_bucket_end() (in module core.optimizer.param_layout) pad_buckets_for_high_nccl_busbw (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) pad_encoder_prompts_tokens() (core.inference.model_inference_wrappers.t5.t5_inference_wrapper.T5InferenceWrapper method) pad_for_alignment (core.tensor_parallel.generalized_tensor_parallelism.GTPRematConfig attribute) pad_id (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract property) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer property) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) pad_input_prompt_tokens() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) pad_param_start() (in module core.optimizer.param_layout) pad_routing_map() (in module core.transformer.moe.moe_utils) pad_to (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) pad_to_divisor() (in module core.optimizer.param_layout) pad_to_lengths() (core.models.audio.packed_audio.PackedAudioEmbeddings method) pad_token_id (core.tokenizers.text.libraries.sft_tokenizer.PromptConfig attribute) pad_value (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) pad_vocab_size() (in module core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter) padded_cols (core.inference.moe.flashinfer_mxfp8.FlashInferRoutedMXFP8Weight attribute) padded_count (core.inference.contexts.mtp_metadata.MTPMetadata attribute) padded_rows (core.inference.moe.flashinfer_mxfp8.FlashInferRoutedMXFP8Weight attribute) padded_squared_relu() (in module core.inference.moe.activations) padded_swiglu() (in module core.inference.moe.activations) padding (core.transformer.enums.AttnMaskType attribute) padding_causal (core.transformer.enums.AttnMaskType attribute) paged_stash_copy_kernel() (in module core.transformer.moe.ops.paged_stash) paged_stash_group_commit() (in module core.transformer.moe.paged_stash) paged_stash_group_start() (in module core.transformer.moe.paged_stash) paged_stash_init_chunk_handler() (in module core.transformer.moe.paged_stash) paged_stash_pop_kernel() (in module core.transformer.moe.ops.paged_stash) paged_stash_reset() (in module core.transformer.moe.paged_stash) PagedStashBuffer (class in core.transformer.moe.paged_stash) PagedStashContext (class in core.transformer.moe.paged_stash) PagedStashManager (class in core.transformer.moe.paged_stash) PagedStashRunner (class in core.transformer.moe.paged_stash) PagedTensor (class in core.transformer.moe.paged_stash) ParakeetHuggingFaceModel (class in core.models.huggingface.fastconformer_model) ParallelFileCacheManager (class in core.ssm.triton_cache_manager) PARAM (core.distributed.param_and_grad_buffer.BufferType attribute) param (core.tensor_parallel.generalized_tensor_parallelism._TicketSlot attribute) param_dtype (core.optimizer.param_layout.BufferKey attribute) param_group_identifier_keys (in module core.optimizer.optimizer) param_group_override_to_tuple() (in module core.optimizer_param_scheduler) param_groups (core.models.mimo.optimizer.MimoOptimizer property) (core.optimizer.optimizer.ChainedOptimizer property) (core.optimizer.optimizer.MegatronOptimizer attribute) param_index_map (core.optimizer.param_layout.PerBufferParamLayout attribute) param_indices (core.optimizer.param_layout.PerBufferParamLayout attribute) param_is_not_gtp_duplicate() (in module core.tensor_parallel.layers) param_is_not_shared() (in module core.transformer.module) param_is_not_tensor_parallel_duplicate() (in module core.tensor_parallel.layers) param_name (core.resharding.execution._Writeback attribute) (core.resharding.utils.TransferOp attribute) param_name_patterns_for_fp32_local_accumulation (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) PARAM_READY_CALLBACK_ATTR (in module core.utils) param_sync_func (core.model_parallel_config.ModelParallelConfig attribute) param_sync_via_bucket_group (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig property) ParamAndGradBuffer (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) parameter (core.distributed.fsdp.mcore_fsdp_adapter._AxisPlacements attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard.Placements attribute) parameter_groups (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule property) ParameterGroup (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) ParameterLayout (class in core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning) ParameterMetadata (class in core.resharding.utils) parameters() (core.models.common.utils._BackwardDWWrapper method) ParamGroupOverride (class in core.optimizer_param_scheduler) ParamKey (class in core.optimizer.optimizer_config) ParamPredicate (class in core.optimizer.optimizer_config) params (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) (core.transformer.spec_utils.ModuleSpec attribute) params_dtype (core.model_parallel_config.ModelParallelConfig attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) params_to_ensure_ready (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) ParamWithNamePredicate (class in core.optimizer.optimizer_config) parse() (core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming.StreamingChatParser method) (core.tokenizers.text.parsers.base_parser.BaseParser static method) (core.tokenizers.text.parsers.deepseek_r1_reasoning_parser.DeepSeekR1ReasoningParser static method) (core.tokenizers.text.parsers.nemotron_v3_reasoning_parser.NemotronV3ReasoningParser static method) (core.tokenizers.text.parsers.qwen3_coder_tool_parser.Qwen3CoderToolParser static method) parse_and_normalize_split() (in module core.datasets.blended_megatron_dataset_config) parse_from_config() (core.extensions.transformer_engine.TEQuantizationParams static method) (core.extensions.transformer_engine.TEQuantizationRecipe class method) parse_hybrid_pattern() (in module core.models.hybrid.hybrid_layer_allocation) parse_inference_shards_spec() (in module core.inference.shards_spec) parse_s3_path() (in module core.datasets.object_storage_utils) parse_str_to_list() (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout static method) parse_strict_flag() (in module core.dist_checkpointing.validation) ParsedHybridPattern (class in core.models.hybrid.hybrid_layer_allocation) PARSER_MAPPING (in module core.tokenizers.text.parsers) parsers (core.inference.apis.serve_config.ServeConfig attribute) part_count (core.resharding.utils.TensorReshardSpec attribute) part_index (core.resharding.utils.TensorReshardSpec attribute) partition_buckets() (in module core.distributed.param_and_grad_buffer) partition_dim (core.resharding.utils.ParameterMetadata attribute) partition_sizes (core.resharding.utils.ParameterMetadata attribute) partition_stride (core.resharding.utils.ParameterMetadata attribute) passed (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) passed_tasks (core.resharding.nvshmem_copy_service.validation.ValidationSummary attribute) PATCH (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) patch_dim (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) PatchEmbedding (class in core.models.vision.vit_model) patchify_image() (in module core.models.multimodal.utils) path_isdir() (core.msc_utils.MaybeMultiStorageClient method) path_to_cache (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) path_to_idx_cache (core.datasets.object_storage_utils.ObjectStorageConfig attribute) pattern_from_ratios() (in module core.models.hybrid.hybrid_layer_allocation) PAUSE (core.inference.headers.Control attribute) (core.inference.inference_request.DynamicInferenceEventType attribute) pause() (core.energy_monitor.EnergyMonitor method) (core.inference.apis.async_llm.MegatronAsyncLLM method) (core.inference.apis.llm.MegatronLLM method) pause_engines() (core.inference.inference_client.InferenceClient method) PAUSED (core.inference.data_parallel_inference_coordinator.state.CoordinatorState attribute) (core.inference.engines.dynamic_engine.EngineState attribute) paused_buffer_size_gb (core.inference.config.InferenceConfig attribute) PAUSING (core.inference.engines.dynamic_engine.EngineState attribute) payload (core.inference.inference_request.DynamicInferenceEvent attribute) payload_offloaded (core.inference.inference_request.DynamicInferenceRequest attribute) payload_stage_metadata (core.inference.inference_request.DynamicInferenceRequest attribute) payload_stager (core.inference.engines.dynamic_engine.DynamicInferenceEngine attribute) peer_rank (core.resharding.utils.TransferOp attribute) peer_slice (core.resharding.utils.TransferOp attribute) PELogger (class in core.resharding.nvshmem_copy_service.logger) pending_kv_import_count (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin property) (core.inference.engines.dynamic_engine.DynamicInferenceEngine property) pending_kv_push_count (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin property) (core.inference.engines.dynamic_engine.DynamicInferenceEngine property) PendingKvImport (class in core.inference.disaggregation.pending_handoff_imports) PendingSSMImport (class in core.inference.disaggregation.pending_handoff_imports) per_bucket_numel_unpadded (core.optimizer.param_layout.PerBufferParamLayout attribute) PerBufferParamLayout (class in core.optimizer.param_layout) perform_initialization (core.model_parallel_config.ModelParallelConfig attribute) permute() (in module core.transformer.moe.moe_utils) permute_and_quantize_mxfp8() (in module core.inference.moe.permute) permute_tokens() (in module core.inference.moe.permute) PERSIST (core.inference.config.KVCacheManagementMode attribute) persist_layer_norm (core.transformer.transformer_config.TransformerConfig attribute) PERSISTENT_ERROR (core.rerun_state_machine.RerunDiagnostic attribute) pg_collection (core.inference.config.InferenceConfig attribute) (core.inference.shards.InferenceShard attribute) (core.models.mimo.optimizer.ModuleOptimizerInfo attribute) PG_DIST_CACHE_FILE_PREFIX (in module core.dist_checkpointing.exchange_utils) phase (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule property) pin_cpu_grads (core.optimizer.optimizer_config.OptimizerConfig attribute) pin_cpu_params (core.optimizer.optimizer_config.OptimizerConfig attribute) PIPE (core.models.hybrid.layers.utils.Symbols attribute) pipeline_dtype (core.model_parallel_config.ModelParallelConfig attribute) pipeline_model_parallel_comm_backend (core.model_parallel_config.ModelParallelConfig attribute) pipeline_model_parallel_layout (core.transformer.transformer_config.TransformerConfig attribute) pipeline_model_parallel_size (core.model_parallel_config.ModelParallelConfig attribute) pipeline_parallel_group_ranks (core.resharding.utils.ParameterMetadata attribute) PipelineExecutor (class in core.resharding.nvshmem_copy_service.core.pipeline_executor) PipelineOffloadManager (class in core.pipeline_parallel.fine_grained_activation_offload) PipelineParallelLayerLayout (class in core.transformer.pipeline_parallel_layer_layout) PipelinePostScheduleFunction (class in core.transformer.moe.paged_stash) PipelinePreScheduleFunction (class in core.transformer.moe.paged_stash) pixel_mean (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) pixel_shuffle (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) pixel_shuffle() (in module core.models.multimodal.llava_model) pixel_shuffle_dynamic_res() (in module core.models.multimodal.llava_model) pixel_std (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) Pixtral2DRotaryEmbedding (class in core.models.vision.vit_model) PixtralLargePatchMerger (class in core.models.vision.vit_model) Placements (class in core.distributed.fsdp.src.megatron_fsdp.experimental.fully_shard) placements (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer property) plan_kv_reshard() (in module core.inference.disaggregation.kv_reshard) plan_sharded_transfer() (in module core.resharding.shard_planner) plan_ssm_reshard() (in module core.inference.disaggregation.ssm_reshard) planes (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer property) policy_epoch (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.FinishedRequestRecord attribute) poll() (core.inference.disaggregation.transfer_backends.nccl.NcclTransferHandle method) (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle method) pool_index (core.resharding.refit._PlanCacheKey attribute) Pooler (class in core.models.bert.pooler) pop_backward_chunk() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) pop_forward_chunk() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) pop_layer() (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan method) pop_tensor() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorGroup method) pop_tensors() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict method) port (core.inference.apis.serve_config.ServeConfig attribute) pos_embd (core.process_groups_config.ProcessGroupCollection attribute) position_embedding (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) position_ids (core.transformer.multi_token_prediction.MultiTokenPredictionInputs attribute) post_all_gather_processing() (in module core.fp8_utils) POST_BACKWARD (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.TrainingState attribute) post_backward() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext method) (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) post_conv_ssm() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) post_forward() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) post_forward_comm() (core.transformer.moe.shared_experts.SharedExpertMLP method) POST_FORWARD_COMM_DONE (core.transformer.moe.shared_experts.SharedExpertState attribute) post_layernorm_bias (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) post_layernorm_weight (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) post_optimizer_model_weight (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) POST_PROCESS_NODE_CLASS (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan attribute) post_process_requests() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) post_warmup_callback() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) postprocess() (core.transformer.moe.moe_layer.MoELayer method) PostProcessNode (class in core.models.common.utils) pp (core.inference.shards_spec.InferenceShardSpec attribute) (core.process_groups_config.ProcessGroupCollection attribute) pp_rank (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) (core.pipeline_parallel.multimodule_communicator.RankModuleInfo attribute) pp_size (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) (core.pipeline_parallel.multimodule_communicator.RankModuleInfo attribute) (core.resharding.refit._ParallelConfig attribute) PRE_BACKWARD (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.TrainingState attribute) pre_backward() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) pre_conv_ssm() (core.ssm.gdp_context_parallel.GDPContextParallel method) (core.ssm.mamba_context_parallel.MambaContextParallel method) pre_cross_attn_layernorm (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) pre_dispatch_computation (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan attribute) pre_encode (core.models.audio.audio_feature_config.NemoTransformerAudioTokenEstimator attribute) (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) pre_forward() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) pre_forward_comm() (core.transformer.moe.shared_experts.SharedExpertMLP method) PRE_FORWARD_COMM_DONE (core.transformer.moe.shared_experts.SharedExpertState attribute) pre_mlp_layernorm (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) pre_optimizer_main_grad (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) PRE_PROCESS_NODE_CLASS (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan attribute) PRE_RELEASE (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) pre_reload_last_layer() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) preceding_rank_start (core.ssm.context_parallel.chunkwise.PackedSequenceCPMetadata attribute) precomputed_block_hashes (core.inference.inference_request.DynamicInferenceRequest attribute) predicate (core.optimizer.optimizer_config.ParamKey attribute) preemph (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) prefetch_managed_module_parameters() (in module core.inference.unified_memory) prefetch_managed_tensor() (in module core.inference.unified_memory) PrefetchOrder (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) prefill_req_count (core.inference.batch_dimensions_utils.InferenceBatchDimensions attribute) prefix (core.inference.config.MediaPromptSpec attribute) prefix_cache_ttl_seconds (core.inference.config.InferenceConfig attribute) prefix_caching_coordinator_policy (core.inference.config.InferenceConfig attribute) prefix_caching_eviction_policy (core.inference.config.InferenceConfig attribute) prefix_caching_mamba_gb (core.inference.config.InferenceConfig attribute) prefix_caching_routing_alpha (core.inference.config.InferenceConfig attribute) PREFIX_EOS_TOKEN_ID_FIELD (in module core.inference.inference_request) prefix_skip_tokens (core.inference.contexts.dynamic_context.PrefixMatch attribute) PREFIX_TEMPLATE_TOKEN_IDS_FIELD (in module core.inference.inference_request) PrefixCachingCoordinatorPolicy (class in core.inference.config) PrefixCachingEvictionPolicy (class in core.inference.config) PrefixMatch (class in core.inference.contexts.dynamic_context) prep_inference_input() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) (core.inference.model_inference_wrappers.gpt.gpt_inference_wrapper.GPTInferenceWrapper method) (core.inference.model_inference_wrappers.t5.t5_inference_wrapper.T5InferenceWrapper method) (core.inference.text_generation_controllers.encoder_decoder_text_generation_controller.EncoderDecoderTextGenerationController method) (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) (core.inference.text_generation_controllers.vlm_text_generation_controller.VLMTextGenerationController method) prep_model_for_inference() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) prepare_bridge_recv_shapes() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) prepare_chunk_indices() (in module core.ssm.ops.gdp.common) prepare_chunk_offsets() (in module core.ssm.ops.gdp.common) prepare_cp_layout() (core.transformer.multi_token_prediction.MultiTokenPredictionBlock method) prepare_for_absorption() (core.transformer.multi_latent_attention.MLASelfAttention method) prepare_for_rerun() (core.transformer.moe.paged_stash.PagedStashRunner method) prepare_gradient_calculation_operands() (core.tensor_parallel.cross_entropy.VocabParallelCrossEntropy static method) prepare_grads() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.optimizer.optimizer.MixedPrecisionOptimizer method) prepare_input_tensors_for_wgrad_compute() (in module core.utils) prepare_layer() (core.context_parallel.layout.ContextParallelLayoutState method) prepare_layer_input() (core.context_parallel.layout.ContextParallelLayoutManager method) prepare_model_params_for_param_sync() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) prepare_multimodal_data() (in module core.inference.inference_request) prepare_next_forward_pass() (in module core.inference.text_generation_controllers.mtp_utils_pytorch) (in module core.inference.text_generation_controllers.mtp_utils_triton) prepare_prompt() (core.inference.inference_request.RequestPromptPreparer method) prepare_recv() (core.resharding.transforms.MXFP8ReshardTransform method) (core.resharding.transforms.ReshardTransform method) prepare_requests() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) prepare_routed_mxfp8_weights() (in module core.inference.moe.flashinfer_mxfp8) prepare_send() (core.resharding.transforms.MXFP8ReshardTransform method) (core.resharding.transforms.ReshardTransform method) prepare_swap_model_weights() (in module core.resharding.refit) prepend_axis_num (core.dist_checkpointing.mapping.ShardedTensor attribute) preprocess() (core.transformer.moe.moe_layer.MoELayer method) (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) preprocess_for_fine_grained_offloading() (core.models.gpt.gpt_model.GPTModel method) (core.models.hybrid.hybrid_model.HybridModel method) preprocess_for_paged_stash() (core.models.gpt.gpt_model.GPTModel method) (core.models.hybrid.hybrid_model.HybridModel method) preprocess_func (core.datasets.multimodal_dataset.MultimodalDatasetConfig attribute) preprocess_image() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) preprocess_image_bytes() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) preprocess_image_bytes_list() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) preprocess_state_dict_for_uneven_dtensor() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) preprocess_video_bytes_list() (in module core.inference.text_generation_server.dynamic_text_gen_server.image_preprocessing) PreProcessNode (class in core.models.common.utils) preserve_gtp_prefetch_state() (in module core.tensor_parallel.gtp_cuda_graphs) PRESERVED (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BucketStatus attribute) pretty_repr() (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout method) primer_only (core.inference.text_generation_controllers.text_generation_controller.DynamicBatchControllerStepResult attribute) print_diff_in_state_dicts() (in module core.transformer.fsdp_dtensor_checkpoint) print_offload_summary_table() (in module core.pipeline_parallel.fine_grained_activation_offload) print_stats() (core.rerun_state_machine.QuickStats method) probs (core.transformer.moe.moe_utils.MoECudaGraphTensorStore attribute) process_mtp_loss() (in module core.transformer.multi_token_prediction) process_self_moves() (core.resharding.nvshmem_copy_service.core.pipeline_executor.PipelineExecutor method) ProcessGroupCollection (class in core.process_groups_config) ProcessGroupHelperMeta (class in core.process_groups_config) prompt (core.inference.disaggregation.pending_handoff_imports.DeferredKvHandoff attribute) (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.InferenceRequest attribute) (core.inference.inference_request.RequestPromptPreparationResult attribute) prompt_length (core.inference.inference_request.InferenceRequest attribute) prompt_log_probs (core.inference.inference_request.InferenceRequest attribute) (core.inference.inference_request.OffloadedRequestPayload attribute) prompt_preparer (core.inference.engines.dynamic_engine.DynamicInferenceEngine attribute) prompt_token_ids (core.inference.inference_request.OffloadedRequestPayload attribute) prompt_tokens (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.InferenceRequest attribute) prompt_top_n_logprobs (core.inference.inference_request.InferenceRequest attribute) PromptConfig (class in core.tokenizers.text.libraries.sft_tokenizer) PromptPreparationError ProxyDict (class in core.optimizer.optimizer) ptrs (core.resharding.nvshmem_copy_service.nvshmem_types.TransferMetadata attribute) publish_pending_kv_stored_events() (core.inference.contexts.dynamic_context.DynamoHelper method) push() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) push_handoff_kv() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) push_offload_groups() (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) push_tensor() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorGroup method) put() (core.inference.async_stream.AsyncStream method) (core.inference.text_generation_server.text_generation_server.MegatronGenerate method) (core.ssm.triton_cache_manager.ParallelFileCacheManager method) Q q (core.ssm.context_parallel.gdp.GDPSavedInputs attribute) (core.ssm.context_parallel.gdp_common.GDPInputs attribute) q_interleaved (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) q_layernorm (core.transformer.attention.SelfAttentionSubmodules attribute) (core.transformer.multi_latent_attention.MLASelfAttentionSubmodules attribute) q_lora_rank (core.transformer.transformer_config.MLATransformerConfig attribute) QAttentionParamsConfigSchema (in module core.extensions.kitchen) qb_dual_update() (in module core.transformer.moe.moe_utils) QFlashAttentionParamsConfigSchema (in module core.extensions.kitchen) qk_clip (core.transformer.transformer_config.TransformerConfig attribute) qk_clip_alpha (core.transformer.transformer_config.TransformerConfig attribute) qk_clip_threshold (core.transformer.transformer_config.TransformerConfig attribute) qk_head_dim (core.transformer.transformer_config.MLATransformerConfig attribute) qk_l2_norm (core.transformer.transformer_config.TransformerConfig attribute) qk_layernorm (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) qk_norm (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) qk_pos_emb_head_dim (core.transformer.transformer_config.MLATransformerConfig attribute) QKNormConfigResolver (class in core.transformer.mla_qk_norm_config) qkv_bias (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.GPTConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) qkv_format (core.packed_seq_params.PackedSeqParams attribute) QLinearParams (in module core.extensions.kitchen) QLinearParamsConfigSchema (in module core.extensions.kitchen) quant_recipe (core.transformer.transformer_config.TransformerConfig attribute) quantile_balancing() (core.transformer.moe.router.TopKRouter method) QuantizationConfig (class in core.quantization.quant_config) quantize_() (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer method) (core.inference.quantization.mxfp8_tensor.MXFP8Tensor method) quantize_and_sync_model_params_from_main_params() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) quantize_model_to_mxfp8() (in module core.inference.quantization.utils) quantize_nvfp4_param_shard() (in module core.fp4_utils) quantize_param_shard() (in module core.fp8_utils) quantize_params_to_mxfp8() (in module core.inference.quantization.utils) quantize_routed_mxfp8_input() (in module core.inference.moe.flashinfer_mxfp8) QuantizedDBuffer (class in core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer) QuantizeRecipe (in module core.extensions.kitchen) QuantizeRecipeAttnBMM (in module core.extensions.kitchen) query_lengths (core.inference.contexts.mtp_metadata.MTPMetadata attribute) queue_kv_stored_event() (core.inference.contexts.dynamic_context.DynamoHelper method) quick_geglu() (in module core.fusions.fused_bias_geglu) quick_geglu_back() (in module core.fusions.fused_bias_geglu) quick_gelu() (in module core.activations) (in module core.fusions.fused_bias_geglu) QuickStats (class in core.rerun_state_machine) qwen2p0_custom_template (in module core.tokenizers.vision.libraries.multimodal_tokenizer) Qwen3CoderToolParser (class in core.tokenizers.text.parsers.qwen3_coder_tool_parser) QwenHuggingFaceModel (class in core.models.huggingface.qwen_model) QwenLearnedPosEmbed (class in core.models.vision.vit_model) QwenPatchEmbedding (class in core.models.vision.vit_model) QwenPatchMerger (class in core.models.vision.vit_model) QwenVL2DRotaryEmbedding (class in core.models.vision.vit_model) QwenVLViTModel (class in core.models.vision.vit_model) R R_co (in module core.typed_torch) R_dst (in module core.typed_torch) R_src (in module core.typed_torch) radio_force_eval_mode (core.models.vision.encoder_registry.EncoderSpec attribute) radio_hf_resolution (core.models.vision.encoder_registry.EncoderSpec attribute) RADIOViTModel (class in core.models.vision.radio) RAISE_ALL (core.dist_checkpointing.validation.StrictHandling attribute) RAISE_UNEXPECTED (core.dist_checkpointing.validation.StrictHandling attribute) random() (core.fault_injector._FaultInjectorRNG method) random_seed (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) RandomSTE (class in core.transformer.moe.moe_utils) RandomSTEShared (class in core.transformer.moe.moe_utils) Range (class in core.optimizer.distrib_optimizer) rank (core.rerun_state_machine.Caller attribute) (core.resharding.refit._PlanCacheKey attribute) rank_numel() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout method) rank_offset (core.inference.shards.InferenceShard attribute) rank_offset() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.ParameterLayout method) rank_order_indices (core.context_parallel.layout._THDZigzagMetadata attribute) RankCommInfo (class in core.pipeline_parallel.bridge_communicator) RankedPubSub (class in core.inference.engines.async_zmq_communicator) RankGenerator (class in core.parallel_state) RankModuleInfo (class in core.pipeline_parallel.multimodule_communicator) RankRole (class in core.models.mimo.config.role) RCP_LN2 (in module core.ssm.ops.gdp.common) read() (core.datasets.indexed_dataset._BinReader method) (core.datasets.indexed_dataset._FileBinReader method) (core.datasets.indexed_dataset._MMapBinReader method) (core.datasets.indexed_dataset._MultiStorageClientBinReader method) (core.datasets.indexed_dataset._S3BinReader method) read_nemo_config() (in module core.models.audio.nemo_audio_checkpoint) ready_event (core.tensor_parallel.gtp_cuda_graphs.GraphWgradRingSlot attribute) READY_TO_USE (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BucketStatus attribute) real_quant_cfg (core.post_training.modelopt.layers.BlockwiseFP8WeightTransformerLayer attribute) (core.post_training.modelopt.layers.FP8WeightTransformerLayer attribute) (core.post_training.modelopt.layers.RealQuantTransformerLayer attribute) reallocate_storage() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer method) RealQuantTransformerLayer (class in core.post_training.modelopt.layers) receive_permutation (core.context_parallel.layout._LayoutRedistributionPlan attribute) RECEIVER (core.pipeline_parallel.bridge_communicator.CommRole attribute) ReceiveRequest (class in core.resharding.nvshmem_copy_service.nvshmem_types) RecipeConfig (class in core.quantization.quant_config) RECOMPUTE (core.inference.config.KVCacheManagementMode attribute) recompute_chunk_num (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGDPSavedMetadata attribute) recompute_granularity (core.transformer.transformer_config.TransformerConfig attribute) recompute_layers (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) recompute_method (core.transformer.transformer_config.TransformerConfig attribute) recompute_modules (core.transformer.transformer_config.TransformerConfig attribute) recompute_num_layers (core.transformer.transformer_config.TransformerConfig attribute) recompute_w_u_fwd() (in module core.ssm.ops.gdp.wy_fast) recompute_w_u_fwd_kernel() (in module core.ssm.ops.gdp.wy_fast) reconfigure_num_microbatches_calculator() (in module core.num_microbatches_calculator) reconstruct_full() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerGatherPlan method) reconstruct_routing_from_blocks() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) record (core.inference.engines.dynamic_engine.RequestEntry attribute) RECORD (core.transformer.moe.router_replay.RouterReplayAction attribute) record() (core.rerun_state_machine.QuickStats method) (core.transformer.moe.moe_logging.MoEMetricsTracker method) record_bwd_graph() (core.transformer.cuda_graphs._CudagraphGlobalRecord class method) record_current_stream() (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan method) record_fwd_graph() (core.transformer.cuda_graphs._CudagraphGlobalRecord class method) record_graph_capture() (core.transformer.cuda_graphs._CudaGraphRunner method) record_indices() (core.transformer.moe.router_replay.RouterReplay method) (core.transformer.moe.router_trace.RouterTracer method) record_offload_event() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorGroup method) record_reload_event() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorGroup method) record_training_metrics() (in module core.telemetry.training_metrics) recv_backward() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) (core.pipeline_parallel.p2p_communication.P2PCommunicator method) recv_buffer (core.resharding.execution._Writeback attribute) recv_bufs (core.resharding.execution._Writeback attribute) recv_forward() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) (core.pipeline_parallel.p2p_communication.P2PCommunicator method) recv_from_prev_pipeline_rank_() (in module core.inference.communication_utils) recv_from_ranks (core.pipeline_parallel.bridge_communicator.RankCommInfo attribute) recv_offsets (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerGatherPlan attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerScatterPlan attribute) recv_ops (core.resharding.utils.ReshardPlan attribute) recv_sizes (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerGatherPlan attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerScatterPlan attribute) RecvOp (class in core.resharding.copy_services.base) recycle_unused_buckets() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) redistribute() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer method) redistribute_uneven_dtensor_to_replicated() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) reduce_aux_losses_tracker_across_ranks() (in module core.transformer.moe.moe_utils) reduce_from_tensor_model_parallel_region() (in module core.tensor_parallel.mappings) reduce_gradients() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.GradReducePipeline method) reduce_group (core.transformer.moe.moe_logging.MetricEntry attribute) reduce_metrics_in_tracker() (core.transformer.multi_token_prediction.MTPLossLoggingHelper static method) reduce_partial_gradients() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) reduce_scatter (core.tensor_parallel.generalized_tensor_parallelism._TicketSlot attribute) reduce_scatter() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) reduce_scatter_gradients() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) reduce_scatter_last_dim_to_tensor_parallel_region() (in module core.tensor_parallel.mappings) reduce_scatter_stream (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext attribute) reduce_scatter_to_sequence_parallel_region() (in module core.tensor_parallel.mappings) reduce_scatter_with_fp32_accumulation (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.tensor_parallel.generalized_tensor_parallelism.GTPRematConfig attribute) reduce_scatter_with_fp32_accumulation() (in module core.distributed.reduce_scatter_with_fp32_accumulation) REF_ZERO (core.inference.config.PrefixCachingEvictionPolicy attribute) RefitBackendName (in module core.resharding.refit) refresh_cache() (core.ssm.mamba_mixer.MambaMixer method) (core.transformer.module.MegatronModule method) refresh_flashinfer_mxfp8_weights() (core.transformer.moe.experts.InferenceGroupedMLP method) refresh_module_caches() (in module core.resharding.execution) register_block_hashes_batch() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) register_capture_comm() (in module core.tensor_parallel.gtp_cuda_graphs) register_capture_params_to_ensure_ready() (in module core.tensor_parallel.gtp_cuda_graphs) register_capture_wgrad_finalize() (in module core.tensor_parallel.gtp_cuda_graphs) register_capture_wgrad_ring_slot() (in module core.tensor_parallel.gtp_cuda_graphs) register_combined_1f1b_hooks() (in module core.models.common.combined_1f1b_mfsdp_scheduler) register_comm() (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState method) register_grad_accum_hook() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) register_grad_ready() (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) register_gtp_symm_pool() (in module core.tensor_parallel.gtp_symmetric_memory) register_hooks() (core.transformer.moe.router_trace.RouterTracer method) register_kv_block_hashes() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) register_mem_pool() (in module core.allocator.vmm_symm_allocator) (in module core.nccl_allocator) register_module() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext method) register_params_to_ensure_ready() (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState method) register_post_backward_hook() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext method) (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) register_receive() (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) register_safe_globals() (in module core.safe_globals) register_send() (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) register_view() (core.hyper_comm_grid.HyperCommGrid method) register_wgrad_finalize() (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState method) register_wgrad_ring_slot() (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState method) RegisteredLIFOPool (class in core.tensor_parallel.gtp_symmetric_memory) RegisterFSDPBackwardFunction (class in core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp) REGISTRY (in module core.models.vision.encoder_registry) reinitialize_inference_state_buffers() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) RelativePositionEmbedding (class in core.models.common.embeddings.relative_pos_embedding) release() (core.inference.disaggregation.transfer_backends.nixl._NixlAgentContext method) (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightCache method) release_bucket() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) release_handoff() (core.inference.inference_client.InferenceClient method) release_handoff_blocks() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) RELEASE_KV (core.inference.headers.Request attribute) release_memory_blocks() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) release_memory_blocks_from_request_indexes() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) release_stash_buffers() (core.transformer.moe.paged_stash.PagedStashManager method) release_state() (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan method) (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan method) release_storage() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer method) release_unsharded_storage() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) reload() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) reload_from_cpu() (core.distributed.param_and_grad_buffer._ParamAndGradBuffer method) reload_from_stash() (core.transformer.moe.paged_stash.PagedTensor method) reload_mergeable_ranks() (in module core.tokenizers.text.libraries.tiktoken_tokenizer) reload_model_params() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.optimizer.optimizer.MixedPrecisionOptimizer method) reload_paged_tensors() (core.transformer.moe.paged_stash.PagedStashManager method) remaining_prompt_length (core.inference.inference_request.DynamicInferenceRequest property) remaining_prompt_tokens (core.inference.inference_request.DynamicInferenceRequest attribute) RemoteCopyService (class in core.resharding.nvshmem_copy_service.service) remove_forward_pre_hook_handles (core.models.mimo.model.base.MimoModel property) remove_hooks() (core.transformer.moe.router_trace.RouterTracer method) remove_paged_tensor_from_stash() (core.transformer.moe.paged_stash.PagedStashManager method) remove_per_module_state() (in module core.post_training.modelopt.checkpointing) remove_sharded_tensors() (core.dist_checkpointing.strategies.torch.TorchDistLoadShardedStrategy method) (in module core.dist_checkpointing.serialization) remove_vlm_request_data() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) rename_input_layer_names_to_trtllm_layer_names() (core.export.trtllm.trtllm_layers.TRTLLMLayers static method) rename_mtp_inner_layer_keys() (in module core.transformer.fsdp_dtensor_checkpoint) rendezvous() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) replace_prefix_for_sharding() (in module core.dist_checkpointing.utils) REPLAY_BACKWARD (core.transformer.moe.router_replay.RouterReplayAction attribute) REPLAY_FORWARD (core.transformer.moe.router_replay.RouterReplayAction attribute) replay_graph_capture() (core.transformer.cuda_graphs._CudaGraphRunner method) replica_id (core.dist_checkpointing.mapping.ShardedBase attribute) (core.dist_checkpointing.mapping.ShardedObject attribute) (core.dist_checkpointing.mapping.ShardedTensor attribute) (core.dist_checkpointing.mapping.ShardedTensorFactory attribute) ReplicaId (in module core.dist_checkpointing.mapping) report() (core.inference.disaggregation.handoff_completion_tracker.HandoffCompletionTracker method) (core.transformer.moe.moe_logging.MoEMetricsTracker method) (core.utils.StragglerDetector method) REPORT_DETERMINISM_STATS (core.rerun_state_machine.RerunMode attribute) REPORTING_INTERVAL_ITERATIONS (core.rerun_state_machine.RerunStateMachine attribute) req_count (core.inference.batch_dimensions_utils.InferenceBatchDimensions property) Request (class in core.inference.headers) request_id (core.inference.async_stream.AsyncStream property) (core.inference.disaggregation.pending_handoff_imports.DeferredKvHandoff attribute) (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.DynamicInferenceRequestRecord property) (core.inference.inference_request.InferenceRequest attribute) REQUEST_ID_BASE (in module core.resharding.nvshmem_copy_service.planning.task_segmenter) request_matched_prefix_blocks (core.inference.contexts.mtp_metadata.MTPMetadata attribute) request_metadata_types (core.inference.config.InferenceConfig attribute) REQUEST_ROUNDER (core.inference.contexts.dynamic_context.DynamicInferenceContext attribute) RequestEntry (class in core.inference.engines.dynamic_engine) RequestOverflowError RequestPayloadStager (class in core.inference.inference_request) RequestPayloadStageResult (class in core.inference.inference_request) RequestPromptPreparationResult (class in core.inference.inference_request) RequestPromptPreparer (class in core.inference.inference_request) requests (core.inference.inference_request.DynamicInferenceRequestRecord attribute) require() (in module core.models.backends) require_flashinfer_routed_mxfp8() (in module core.inference.moe.flashinfer_mxfp8) REQUIRES (core.extensions.transformer_engine_spec_provider.TESpecProvider attribute) (core.models.backends.InferenceSpecProvider attribute) (core.models.backends.LocalSpecProvider attribute) requires_conversion (core.context_parallel.layout.ContextParallelLayoutManager attribute) requires_explicit_ckpt_mismatch_check() (core.dist_checkpointing.validation.StrictHandling static method) requires_global_app_metadata() (core.dist_checkpointing.validation.StrictHandling static method) requires_grad (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup attribute) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) requires_process_group_barrier (core.resharding.copy_services.base.CopyService attribute) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService attribute) (core.resharding.copy_services.nixl_copy_service.NixlCopyService attribute) requires_returning_mismatch_keys() (core.dist_checkpointing.validation.StrictHandling static method) reroute_samples_to_dcp_ranks() (in module core.datasets.data_schedule_utils) reroute_samples_to_hdp_ranks() (core.datasets.data_schedule.HybridCPDataLoaderWrapper method) RERUN_DISABLED (core.rerun_state_machine.RerunValidationStatus attribute) RerunDataIterator (class in core.rerun_state_machine) RerunDiagnostic (class in core.rerun_state_machine) RerunErrorInjector (class in core.rerun_state_machine) RerunMode (class in core.rerun_state_machine) RERUNNING_AGAIN_FROM_CHECKPOINT (core.rerun_state_machine.RerunState attribute) RERUNNING_FROM_CHECKPOINT (core.rerun_state_machine.RerunState attribute) RERUNNING_IN_PLACE (core.rerun_state_machine.RerunState attribute) RerunState (class in core.rerun_state_machine) RerunStateMachine (class in core.rerun_state_machine) RerunValidationStatus (class in core.rerun_state_machine) reserve() (core.tensor_parallel.generalized_tensor_parallelism.GTPWeightCache method) reset() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.GradReducePipeline method) (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) (core.distributed.param_and_grad_buffer._ParamAndGradBuffer method) (core.extensions.transformer_engine.TECudaRNGStatesTracker method) (core.inference.contexts.dynamic_context.DynamicInferenceContext method) (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) (core.inference.contexts.static_context.StaticInferenceContext method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) (core.inference.utils.Counter method) (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorPool method) (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager method) (core.rerun_state_machine.QuickStats method) (core.tensor_parallel.random.CudaRNGStatesTracker method) (core.timers.DummyTimer method) (core.timers.Timer method) (core.timers.TimerBase method) (core.transformer.moe.paged_stash.PagedStashBuffer method) (core.utils.StragglerDetector method) reset_attention_mask (core.datasets.gpt_dataset.GPTDatasetConfig attribute) reset_attention_state() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) reset_batch_size_offset() (core.inference.contexts.base_context.BaseInferenceContext method) reset_cache() (core.models.audio.nemo_transformer_encoder.MultiHeadAttention method) (core.models.audio.nemo_transformer_encoder.TransformerBlock method) (core.models.audio.nemo_transformer_encoder.TransformerEncoder method) reset_cuda_graph() (core.full_cuda_graph.FullCudaGraphWrapper method) reset_global_aux_loss_tracker() (core.transformer.moe.router.TopKRouter method) reset_gtp_state() (in module core.tensor_parallel.generalized_tensor_parallelism) reset_hybrid_ep_buffer() (in module core.transformer.moe.fused_a2a) reset_instance() (core.pipeline_parallel.fine_grained_activation_offload.FineGrainedActivationOffloadingInterface static method) (core.pipeline_parallel.fine_grained_activation_offload.PipelineOffloadManager class method) reset_mamba_state() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) reset_metadata() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) reset_mixed_precision_policy() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) reset_model_temporary_tensors() (in module core.distributed.finalize_model_grads) reset_over_budget() (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) reset_param_main_grad() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) reset_param_sync_dispatch_state() (core.distributed.distributed_data_parallel.DistributedDataParallel method) reset_parameters() (core.fusions.fused_layer_norm.FusedLayerNorm method) (core.ssm.gated_delta_net.common._GDNBase method) (core.transformer.moe.router.Router method) reset_position_ids (core.datasets.gpt_dataset.GPTDatasetConfig attribute) reset_request_rows() (core.inference.contexts.mtp_metadata.MTPMetadata method) reset_tensors() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) ResetParametersContext (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) reshard() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) reshard_after_forward (core.distributed.torch_fully_sharded_data_parallel_config.TorchFullyShardedDataParallelConfig attribute) reshard_fsdp_module() (in module core.models.common.combined_1f1b_mfsdp_scheduler) reshard_model_weights() (in module core.resharding.refit) reshard_parameters() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) ReshardPlan (class in core.resharding.utils) ReshardTransform (class in core.resharding.transforms) resolve() (core.transformer.mla_qk_norm_config.QKNormConfigResolver method) resolve_gtp_pad_for_alignment() (in module core.utils) resolve_gtp_remat_group() (in module core.process_groups_config) resolve_media_token_id() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) resolve_multimodal_data_for_engine() (in module core.inference.inference_request) resolve_mxfp8_backend() (in module core.inference.quantization.utils) resolve_nemo_audio_configs_from_args() (in module core.models.audio.nemo_audio_checkpoint) resolve_requests() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) resolve_slurm_local_rank() (in module core._slurm_utils) resolve_slurm_rank() (in module core._slurm_utils) resolve_slurm_world_size() (in module core._slurm_utils) resolve_tensor() (core.dist_checkpointing.strategies.torch.MCoreLoadPlanner method) resolve_tensor_parallel_weight_shards() (in module core.model_parallel_config) resolved_name (core.resharding.utils.ParameterMetadata attribute) (core.resharding.utils.TensorReshardSpec attribute) response_metadata (core.inference.inference_request.RequestPayloadStageResult attribute) RESTING (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule.Phase attribute) restore_from_cpu() (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.MegatronOptimizer method) restore_grad_buffers() (core.distributed.distributed_data_parallel.DistributedDataParallel method) restore_sharded_modelopt_state() (in module core.post_training.modelopt.checkpointing) restore_tensor_device() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict method) restore_to_live() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) result (core.full_cuda_graph.FullCudaGraphWrapper attribute) (core.optimizer.optimizer_cuda_graph.OptimizerCudaGraphWrapper attribute) results (core.resharding.nvshmem_copy_service.validation.ValidationSummary attribute) RESUME (core.inference.headers.Control attribute) resume() (core.energy_monitor.EnergyMonitor method) (core.inference.apis.async_llm.MegatronAsyncLLM method) (core.inference.apis.llm.MegatronLLM method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) resume_engines() (core.inference.inference_client.InferenceClient method) resume_paused_requests() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) resume_tokens (core.inference.disaggregation.inference_state_handoff._PreparedHandoffMetadata attribute) (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) RESUMED (core.inference.engines.dynamic_engine.EngineState attribute) RESUMING (core.inference.engines.dynamic_engine.EngineState attribute) retain_memory_blocks() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) retarget_fsdp_state_dict_to_gpt_checkpoint() (in module core.dist_checkpointing.gpt_checkpoint_interop) retarget_sharded_state_dict_to_gpt_checkpoint() (in module core.dist_checkpointing.gpt_checkpoint_interop) RETURN_ALL (core.dist_checkpointing.validation.StrictHandling attribute) return_layer_name_and_number() (core.export.trtllm.trtllm_layers.TRTLLMLayers static method) return_log_probs (core.inference.sampling_params.SamplingParams attribute) return_prompt_tokens (core.inference.sampling_params.SamplingParams attribute) return_prompt_top_n_logprobs (core.inference.sampling_params.SamplingParams attribute) return_segments (core.inference.sampling_params.SamplingParams attribute) RETURN_UNEXPECTED (core.dist_checkpointing.validation.StrictHandling attribute) returns_residual (core.transformer.torch_norm.LayerNormInterface attribute) reuse_grad_buf_for_mxfp8_param_ag (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) reverse_receive_indices (core.context_parallel.layout.THDCPLayoutPlan attribute) reverse_send_indices (core.context_parallel.layout.THDCPLayoutPlan attribute) rewind() (core.rerun_state_machine.RerunDataIterator method) rewind_kv_cache() (in module core.inference.text_generation_controllers.mtp_utils_pytorch) (in module core.inference.text_generation_controllers.mtp_utils_triton) rmsnorm_batch_invariant() (in module core.transformer.custom_layers.batch_invariant_kernels) rng (in module core.fault_injector) role (core.inference.shards_spec.InferenceShardSpec attribute) (core.pipeline_parallel.bridge_communicator.RankCommInfo attribute) roll_tensor() (in module core.transformer.multi_token_prediction) roll_tensor_precomputed_embeddings() (in module core.transformer.multi_token_prediction) rope_type (core.transformer.transformer_config.MLATransformerConfig attribute) rotary_base (core.transformer.transformer_config.MLATransformerConfig attribute) rotary_interleaved (core.models.vision.encoder_registry.EncoderSpec attribute) (core.transformer.transformer_config.TransformerConfig attribute) rotary_percent (core.transformer.transformer_config.MLATransformerConfig attribute) rotary_scaling_factor (core.transformer.transformer_config.MLATransformerConfig attribute) RotaryBucketAllocator (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) RotaryEmbedding (class in core.models.common.embeddings.rotary_pos_embedding) round_up_requests() (core.inference.contexts.dynamic_context.DynamicInferenceContext class method) round_up_to_nearest_multiple() (in module core.utils) round_up_tokens() (core.inference.contexts.dynamic_context.DynamicInferenceContext class method) route() (core.transformer.moe.moe_layer.MoELayer method) routed_experts_compute() (core.transformer.moe.moe_layer.MoELayer method) Router (class in core.transformer.moe.router) router (core.transformer.moe.moe_layer.MoESubmodules attribute) router_and_preprocess() (core.transformer.moe.moe_layer.MoELayer method) ROUTER_DIAGNOSTIC_CHANNEL_COUNT (in module core.transformer.moe.router_diagnostics) router_gating_linear() (in module core.transformer.moe.moe_utils) RouterBuilder (class in core.transformer.moe.moe_layer) RouterDiagnosticChannel (class in core.transformer.moe.router_diagnostics) RouterGatingLinearFunction (class in core.transformer.moe.moe_utils) RouterInterface (class in core.transformer.moe.moe_layer) RouterReplay (class in core.transformer.moe.router_replay) RouterReplayAction (class in core.transformer.moe.router_replay) RouterTracer (class in core.transformer.moe.router_trace) routes_on_prefix() (in module core.inference.config) routing() (core.transformer.moe.router.Router method) (core.transformer.moe.router.TopKRouter method) routing_indices (core.inference.inference_request.DynamicInferenceRequest attribute) (core.inference.inference_request.OffloadedRequestPayload attribute) routing_map (core.transformer.moe.moe_utils.MoECudaGraphTensorStore attribute) RoutingMetadata (class in core.inference.contexts.routing_metadata) row_counts (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsGPUResult attribute) (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) row_ids (core.inference.contexts.mtp_metadata.MTPMetadata attribute) row_parallel_linear() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.InferenceSpecProvider method) (core.models.backends.LocalSpecProvider method) RowParallelLinear (class in core.tensor_parallel.layers) rowwise_data (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer attribute) rowwise_scale (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer attribute) rs_streams (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) run() (core.datasets.data_schedule.BasePackingScheduler method) (core.datasets.data_schedule.DpBalancedScheduler method) (core.inference.text_generation_server.text_generation_server.MegatronServer method) (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan static method) (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan static method) (core.pipeline_parallel.utils.AbstractSchedulePlan static method) (core.resharding.copy_services.base.CopyService method) (core.resharding.copy_services.gloo_copy_service.GlooCopyService method) (core.resharding.copy_services.nccl_copy_service.NCCLCopyService method) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) (core.resharding.copy_services.nvshmem_copy_service.NVSHMEMCopyService method) (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) run_async() (core.inference.apis._llm_base._EventLoopManager method) run_engine() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) (core.inference.engines.static_engine.StaticInferenceEngine method) run_engine_async() (core.inference.engines.static_engine.StaticInferenceEngine method) run_engine_with_coordinator() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) run_mcore_engine() (in module core.inference.text_generation_server.run_mcore_engine) run_one_forward_step() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) run_realtime_tests() (core.transformer.attention.SelfAttention method) run_sync() (core.inference.apis._llm_base._EventLoopManager method) (core.inference.apis._llm_base._MegatronLLMBase method) RUNNING (core.inference.data_parallel_inference_coordinator.state.CoordinatorState attribute) (core.inference.engines.dynamic_engine.EngineState attribute) S S3_PREFIX (in module core.datasets.object_storage_utils) S3Client (class in core.datasets.object_storage_utils) S3Config (in module core.datasets.object_storage_utils) safe_get_rank() (in module core._rank_utils) (in module core.distributed.fsdp.src.megatron_fsdp.utils) safe_get_world_size() (in module core._rank_utils) SAFE_GLOBALS (in module core.safe_globals) safe_load_from_bytes() (in module core.safe_globals) safe_numpy_load() (in module core.safe_globals) safely_set_viewless_tensor_data() (in module core.utils) SafeUnpickler (class in core.safe_globals) sample() (core.fault_injector._FaultInjectorRNG method) sample_cpu_ready_event (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) sample_from_logits() (core.inference.sampling.torch_sampling.TorchSampling static method) (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) sample_kernel() (core.inference.sampling.base.Sampling method) (core.inference.sampling.flashinfer_sampling.FlashInferSampling method) (core.inference.sampling.torch_sampling.TorchSampling method) sample_rate (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) (core.models.audio.audio_processor.NemoAudioProcessor property) sample_speculative() (core.inference.sampling.base.Sampling method) sampled_mtp_tokens_cpu_view (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) sampled_mtp_tokens_gpu (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) sampled_tokens_cpu (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) sampled_tokens_cpu_view (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) sampled_tokens_gpu (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleSampleResult attribute) Sampling (class in core.inference.sampling.base) sampling_backend (core.inference.config.InferenceConfig attribute) sampling_params (core.inference.disaggregation.pending_handoff_imports.DeferredKvHandoff attribute) (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) (core.inference.inference_request.InferenceRequest attribute) SamplingParams (class in core.inference.sampling_params) save() (core.dist_checkpointing.strategies.fully_parallel.FullyParallelSaveStrategyWrapper method) (core.dist_checkpointing.strategies.torch.TorchDistSaveShardedStrategy method) (in module core.dist_checkpointing.serialization) save_checkpoint() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.checkpoint) save_common() (in module core.dist_checkpointing.strategies.common) save_config() (in module core.dist_checkpointing.core) save_integrity_manifest() (in module core.dist_checkpointing.validation) save_metrics_to_tracker() (core.transformer.multi_token_prediction.MTPLossLoggingHelper static method) save_modelopt_state() (in module core.post_training.modelopt.checkpointing) save_parameter_state() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) save_preprocess() (in module core.dist_checkpointing.state_dict_utils) save_pretrained() (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) save_sharded_modelopt_state() (in module core.post_training.modelopt.checkpointing) save_state_dict_to_file() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) save_to_aux_losses_tracker() (in module core.transformer.moe.moe_utils) save_vocabulary() (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) saved_context (core.ssm.context_parallel.chunkwise.CPForwardResult attribute) scale (core.inference.moe.flashinfer_mxfp8.FlashInferRoutedMXFP8Weight attribute) (core.inference.quantization.mxfp8_tensor.MXFP8Tensor attribute) (core.optimizer.grad_scaler.MegatronGradScaler property) (core.ssm.context_parallel.gdp.GDPSavedInputs attribute) (core.ssm.context_parallel.gdp.GDPSavedMetadata attribute) (core.ssm.context_parallel.gdp_common.GDPInputs attribute) (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGDPSavedMetadata attribute) scale_2d() (core.inference.quantization.mxfp8_tensor.MXFP8Tensor method) scale_gradients() (core.distributed.data_parallel_base._BaseDataParallel method) (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) (core.distributed.param_and_grad_buffer._ParamAndGradBuffer method) SCALE_INV_BLOCK_SIZE (in module core.transformer.moe.paged_stash) scale_loss() (core.optimizer.optimizer.MegatronOptimizer method) scaled_init_method_normal() (in module core.utils) scaled_orthogonalize_fn_with_gtp_remat() (core.optimizer.emerging_optimizers.TensorParallelMuon method) ScaledMaskedSoftmax (class in core.fusions.fused_softmax) ScaledSoftmax (class in core.fusions.fused_softmax) ScaledUpperTriangMaskedSoftmax (class in core.fusions.fused_softmax) scatter_intermediate_conv() (in module core.ssm.ops.common.intermediate_extraction) scatter_intermediate_ssm() (in module core.ssm.ops.common.intermediate_extraction) scatter_to_sequence_parallel_region() (in module core.tensor_parallel.mappings) scatter_to_tensor_model_parallel_region() (in module core.tensor_parallel.mappings) schedule() (core.resharding.nvshmem_copy_service.service.RemoteCopyService method) schedule_chunked_prefill() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) schedule_layer (core.transformer.moe.paged_stash.PagedTensor property) schedule_non_chunked_prefill() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) schedule_requests() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) schedule_waiting_requests() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) ScheduledBatch (class in core.resharding.nvshmem_copy_service.nvshmem_types) ScheduleNode (class in core.pipeline_parallel.utils) SchedulePolicy (class in core.distributed.fsdp.src.megatron_fsdp.experimental.schedule) Scheduler (class in core.inference.scheduler) scheduler_map (in module core.datasets.data_schedule) SECOND_RERUN_NOT_REPRODUCIBLE (core.rerun_state_machine.RerunValidationStatus attribute) SECOND_RERUN_REPRODUCIBLE (core.rerun_state_machine.RerunValidationStatus attribute) seed (core.datasets.gpt_dataset.MockGPTLowLevelDataset attribute) seed() (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers method) (core.ssm.ops.mamba2.batch_invariant_decode.MambaBatchInvariantDecode method) SEGMENT_ID_MULTIPLIER (in module core.resharding.nvshmem_copy_service.planning.task_segmenter) segment_receive_request() (core.resharding.nvshmem_copy_service.planning.task_segmenter.TaskSegmenter method) segment_send_request() (core.resharding.nvshmem_copy_service.planning.task_segmenter.TaskSegmenter method) segments (core.inference.inference_request.InferenceRequest attribute) select_cross_entropy() (in module core.models.backends) select_ge_2d_params() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning) select_pipeline_segment() (in module core.models.hybrid.hybrid_layer_allocation) select_routed_mxfp8_active_rows() (in module core.inference.moe.flashinfer_mxfp8) select_src_metadata_balanced() (in module core.resharding.utils) selected_log_probs (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsGPUResult attribute) selected_log_probs_cpu_view (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) selective_state_update() (in module core.ssm.ops.mamba2.mamba_ssm) self_attention (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) self_attention_hyper_connection (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) self_attn (core.transformer.enums.AttnType attribute) self_attn_bda (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) SelfAttention (class in core.transformer.attention) SelfAttentionSubmodules (class in core.transformer.attention) send_backward() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) (core.pipeline_parallel.p2p_communication.P2PCommunicator method) send_backward_recv_backward() (core.pipeline_parallel.p2p_communication.P2PCommunicator method) send_backward_recv_forward() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) (core.pipeline_parallel.p2p_communication.P2PCommunicator method) send_buffers (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerGatherPlan attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerScatterPlan attribute) send_do_generate() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common) send_forward() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) (core.pipeline_parallel.p2p_communication.P2PCommunicator method) send_forward_backward_recv_forward_backward() (core.pipeline_parallel.p2p_communication.P2PCommunicator method) send_forward_recv_backward() (core.pipeline_parallel.bridge_communicator.BridgeCommunicator method) (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) (core.pipeline_parallel.p2p_communication.P2PCommunicator method) send_forward_recv_forward() (core.pipeline_parallel.p2p_communication.P2PCommunicator method) SEND_KV (core.inference.headers.Request attribute) send_ops (core.resharding.utils.ReshardPlan attribute) send_slots (core.context_parallel.layout._LayoutRedistributionPlan attribute) send_to_next_pipeline_rank() (in module core.inference.communication_utils) send_to_ranks (core.pipeline_parallel.bridge_communicator.RankCommInfo attribute) SENDER (core.pipeline_parallel.bridge_communicator.CommRole attribute) SendOp (class in core.resharding.copy_services.base) SendRequest (class in core.resharding.nvshmem_copy_service.nvshmem_types) SentencePieceTokenizer (class in core.tokenizers.text.libraries.sentencepiece_tokenizer) sep (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer property) sep_id (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract property) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) SEPARATE_GRAD_NORM_GROUPS (in module core.optimizer.optimizer) seq_idx (core.packed_seq_params.PackedSeqParams attribute) sequence (core.rerun_state_machine.Call attribute) sequence_length (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) sequence_length_decoder (core.datasets.t5_dataset.T5MaskedWordPieceDatasetConfig attribute) sequence_length_encoder (core.datasets.t5_dataset.T5MaskedWordPieceDatasetConfig attribute) sequence_lengths (core.datasets.indexed_dataset.IndexedDataset property) sequence_modes (core.datasets.indexed_dataset.IndexedDataset property) sequence_packing_scheduler (core.model_parallel_config.ModelParallelConfig attribute) sequence_parallel (core.context_parallel.layout.ContextParallelLayoutManager attribute) (core.model_parallel_config.ModelParallelConfig attribute) sequence_parallel_size (core.datasets.gpt_dataset.GPTDatasetConfig attribute) sequences_per_dataset (core.datasets.gpt_dataset.GPTDatasetConfig attribute) SequentialMLP (class in core.transformer.moe.experts) SerializableStateType (in module core.rerun_state_machine) serialize() (core.inference.contexts.dynamic_context.ContextErrorFactory class method) (core.inference.inference_request.DynamicInferenceEvent method) (core.inference.inference_request.DynamicInferenceRequest method) (core.inference.inference_request.InferenceRequest method) (core.inference.sampling_params.SamplingParams method) serialize_multimodal_data() (in module core.inference.inference_request) serialize_ndarray() (in module core.inference.inference_request) serialize_tensor() (in module core.inference.inference_request) serialized (core.inference.inference_request._PreparedMultimodalData attribute) serve() (core.inference.apis.async_llm.MegatronAsyncLLM method) (core.inference.apis.llm.MegatronLLM method) ServeConfig (class in core.inference.apis.serve_config) set() (core.transformer.moe.moe_utils.MoECudaGraphTensorStore method) set_active() (core.inference.utils.InferenceMode class method) set_attention_backend() (in module core.transformer.utils) set_barrier_before_all_gather() (core.tensor_parallel.inference_layers.InferenceColumnParallelLinear method) (core.tensor_parallel.inference_layers.InferenceLayerNormColumnParallelLinear method) set_barrier_group() (core.timers.Timer method) set_batch_invariant_mode() (in module core.transformer.custom_layers.batch_invariant_kernels) set_bounded_mxfp8_rows() (core.inference.utils.InferenceMode class method) set_bucket_layerwise_params_list() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) set_cuda_graph_mempool() (in module core.tensor_parallel.gtp_cuda_graphs) set_cuda_graph_modules() (in module core.tensor_parallel.generalized_tensor_parallelism) set_current_layer_name() (core.transformer.moe.paged_stash.PagedStashManager method) set_current_microbatch() (in module core.transformer.cuda_graphs) set_data_parallel_rank() (in module core.parallel_state) set_decode_expert_padding() (in module core.inference.utils) set_default_log_ranks() (in module core._rank_utils) set_defaults_if_not_set_tensor_model_parallel_attributes() (in module core.tensor_parallel.layers) set_deterministic_mode() (in module core.ssm.ops.common.determinism) set_document_indices() (core.datasets.indexed_dataset.IndexedDataset method) set_duplicate_storage_info() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorGroup method) set_elapsed() (core.timers.Timer method) set_ep_zmq_communicator() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) set_events() (core.resharding.nvshmem_copy_service.core.pipeline_executor.PipelineExecutor method) set_experimental_flag() (in module core.config) set_expert_model_parallel_rank() (in module core.parallel_state) set_expert_model_parallel_world_size() (in module core.parallel_state) set_expert_tensor_parallel_rank() (in module core.parallel_state) set_expert_tensor_parallel_world_size() (in module core.parallel_state) set_extra_state() (core.extensions.transformer_engine.TELMHeadColumnParallelLinear method) (core.tensor_parallel.layers.ColumnParallelLinear method) (core.tensor_parallel.layers.RowParallelLinear method) set_for_recompute_input_layernorm() (core.transformer.attention.Attention method) (core.transformer.attention.SelfAttention method) (core.transformer.multi_latent_attention.FusedMLASelfAttention method) (core.transformer.multi_latent_attention.MLASelfAttention method) set_for_recompute_pre_mlp_layernorm() (core.transformer.moe.moe_layer.MoELayer method) set_forward_only() (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator method) set_fsdp_reshard_hooks() (core.models.common.model_chunk_schedule_plan.TransformerLayerSchedulePlan method) SET_GENERATION_EPOCH (core.inference.headers.Control attribute) set_generation_epoch() (core.inference.inference_client.InferenceClient method) set_global_router_replay_action() (core.transformer.moe.router_replay.RouterReplay static method) set_global_static_buffers() (core.transformer.moe.router_replay.RouterReplay static method) set_graphed_backward_dw_callable() (core.models.common.utils._BackwardDWWrapper method) set_ideal_affinity_for_current_gpu() (in module core.pipeline_parallel.utils) set_input_tensor() (core.models.bert.bert_model.BertModel method) (core.models.gpt.gpt_model.GPTModel method) (core.models.huggingface.module.HuggingFaceModule method) (core.models.hybrid.hybrid_block.HybridStack method) (core.models.hybrid.hybrid_model.HybridModel method) (core.models.mimo.model.base.MimoModel method) (core.models.multimodal.llava_model.LLaVAModel method) (core.models.T5.t5_model.T5Model method) (core.models.vision.clip_vit_model.CLIPViTModel method) (core.models.vision.radio.RADIOViTModel method) (core.models.vision.vit_model.KimiViTModel method) (core.models.vision.vit_model.QwenVLViTModel method) (core.models.vision.vit_model.ViTModel method) (core.transformer.module.Float16Module method) (core.transformer.transformer_block.TransformerBlock method) set_is_first_microbatch() (core.transformer.module.MegatronModule method) set_item() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.DataParallelBuffer method) set_layer_number() (core.transformer.moe.moe_layer.BaseMoELayer method) (core.transformer.moe.moe_layer.RouterInterface method) (core.transformer.moe.router.Router method) set_layerwise_params_list() (core.distributed.param_and_grad_buffer._ParamAndGradBucket method) set_level() (core.resharding.nvshmem_copy_service.logger.PELogger class method) set_loss_scale() (core.transformer.moe.moe_utils.MoEAuxLossAutoScaler static method) (core.transformer.multi_token_prediction.MTPLossAutoScaler static method) set_mode() (core.rerun_state_machine.RerunStateMachine method) set_model_auto_sync() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) set_model_config_attribute() (in module core.transformer.utils) set_model_roles() (core.resharding.copy_services.base.CopyService method) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) set_model_to_sequence_parallel() (in module core.transformer.utils) set_moe_metadata_sync() (in module core.inference.utils) set_moe_metrics_tracker() (in module core.transformer.moe.moe_logging) set_pending() (core.inference.text_generation_controllers.text_generation_controller.AsyncScheduleLogitsState method) set_pipeline_model_parallel_rank() (in module core.parallel_state) set_pipeline_model_parallel_world_size() (in module core.parallel_state) set_plan() (core.resharding.copy_services.base.CopyService method) (core.resharding.copy_services.nccl_copy_service.NCCLCopyService method) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) set_post_backward_hook() (core.models.common.utils.TransformerLayerNode method) set_post_forward_hook() (core.models.common.utils.TransformerLayerNode method) set_real_token_count_tensor() (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher class method) set_replay_data() (core.transformer.moe.router_replay.RouterReplay static method) set_router_replay_action() (core.transformer.moe.router_replay.RouterReplay method) set_save_original_input() (in module core.extensions.transformer_engine) set_shared_experts() (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoETokenDispatcher method) set_states() (core.extensions.transformer_engine.TECudaRNGStatesTracker method) (core.tensor_parallel.random.CudaRNGStatesTracker method) set_static_buffer() (core.transformer.moe.router_replay.RouterReplay method) set_stop_word_finished_ids_callback() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) set_streams() (core.resharding.nvshmem_copy_service.core.kernel_launcher.KernelLauncher method) (core.resharding.nvshmem_copy_service.core.pipeline_executor.PipelineExecutor method) (in module core.pipeline_parallel.utils) set_symmetric_ar() (core.transformer.module.MegatronModule method) set_target_indices() (core.transformer.moe.router_replay.RouterReplay method) set_te_cuda_graph_backward_dw_wrapper() (core.transformer.module.GraphableMegatronModule method) set_tensor_grad_fn_sequence_sr() (in module core.transformer.moe.shared_experts) set_tensor_model_parallel_attributes() (in module core.tensor_parallel.layers) set_tensor_model_parallel_rank() (in module core.parallel_state) set_tensor_model_parallel_world_size() (in module core.parallel_state) set_virtual_pipeline_model_parallel_rank() (in module core.parallel_state) set_virtual_pipeline_model_parallel_world_size() (in module core.parallel_state) setup() (core.energy_monitor.EnergyMonitor method) (core.inference.apis._llm_base._CoordinatorRuntime method) setup_delayed_wgrad_acc_hook() (in module core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp) setup_delayed_wgrad_for_dispatch_backward_overlap() (core.transformer.moe.moe_layer.MoELayer method) setup_embeddings_and_output_layer() (core.models.common.language_module.language_module.LanguageModule method) setup_fault_injection() (in module core.fault_injector) setup_kv_transfer() (core.inference.disaggregation.inference_state_handoff.InferenceStateHandoffMixin method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) setup_manual_hooks() (core.transformer.module.GraphableMegatronModule method) setup_metadata() (core.transformer.moe.token_dispatcher._DeepepManager method) (core.transformer.moe.token_dispatcher._DispatchManager method) (core.transformer.moe.token_dispatcher._HybridEPManager method) (core.transformer.moe.token_dispatcher._NCCLEPManager method) setup_process_groups_for_ddp() (core.process_groups_config.ProcessGroupCollection static method) setup_process_groups_for_optimizer() (core.process_groups_config.ProcessGroupCollection static method) sft_mock_dataset_config_json (core.datasets.gpt_dataset.GPTDatasetConfig attribute) SFTTokenizer (class in core.tokenizers.text.libraries.sft_tokenizer) sgd_momentum (core.optimizer.optimizer_config.OptimizerConfig attribute) SGDOptimizerConfig (in module core.optimizer.optimizer_config) shape (core.hyper_comm_grid._RankViewSpec attribute) (core.inference.quantization.mxfp8_tensor.MXFP8Tensor property) (core.resharding.utils.ParameterMetadata attribute) Shape (in module core.distributed.fsdp.src.megatron_fsdp.experimental.layout) (in module core.pipeline_parallel.combined_1f1b) (in module core.pipeline_parallel.multimodule_communicator) (in module core.pipeline_parallel.p2p_communication) (in module core.pipeline_parallel.schedules) shard_buffer() (in module core.distributed.param_and_grad_buffer) shard_key() (core.inference.disaggregation.ssm_reshard.SSMShardLayout method) shard_params() (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) shard_to_metadata (core.dist_checkpointing.exchange_utils.ShardDistribution attribute) ShardBucketIndex (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) ShardDistribution (class in core.dist_checkpointing.exchange_utils) sharded (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameter attribute) sharded_backend (core.dist_checkpointing.core.CheckpointingConfig attribute) sharded_backend_version (core.dist_checkpointing.core.CheckpointingConfig attribute) sharded_param_state_dp_reshardable() (core.optimizer.distrib_optimizer.DistributedOptimizer method) sharded_param_state_dp_zero() (core.optimizer.distrib_optimizer.DistributedOptimizer method) sharded_param_state_fs_model_space() (core.optimizer.distrib_optimizer.DistributedOptimizer method) sharded_param_state_fsdp_dtensor() (core.optimizer.distrib_optimizer.DistributedOptimizer method) sharded_param_state_fully_reshardable() (core.optimizer.distrib_optimizer.DistributedOptimizer method) sharded_state_dict (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict attribute) sharded_state_dict() (core.extensions.transformer_engine.TEColumnParallelLinear method) (core.extensions.transformer_engine.TEDotProductAttention method) (core.extensions.transformer_engine.TELayerNormColumnParallelLinear method) (core.extensions.transformer_engine.TELinear method) (core.extensions.transformer_engine.TERowParallelLinear method) (core.models.common.language_module.language_module.LanguageModule method) (core.models.gpt.gpt_model.GPTModel method) (core.models.hybrid.hybrid_block.HybridStack method) (core.models.mimo.model.base.MimoModel method) (core.models.mimo.optimizer.MimoOptimizer method) (core.models.T5.t5_model.T5Model method) (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.post_training.modelopt.layers.Linear method) (core.ssm.gated_delta_net.common._GDNBase method) (core.ssm.gated_delta_product.ExtendedRMSNorm method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_layer.MambaLayer method) (core.ssm.mamba_mixer.ExtendedRMSNorm method) (core.ssm.mamba_mixer.MambaMixer method) (core.tensor_parallel.layers.ColumnParallelLinear method) (core.tensor_parallel.layers.RowParallelLinear method) (core.tensor_parallel.layers.VocabParallelEmbedding method) (core.transformer.dot_product_attention.DotProductAttention method) (core.transformer.mlp.MLP method) (core.transformer.module.Float16Module method) (core.transformer.module.MegatronModule method) (core.transformer.moe.experts.SequentialMLP method) (core.transformer.moe.experts.TEGroupedMLP method) (core.transformer.moe.shared_experts.SharedExpertMLP method) (core.transformer.multi_latent_attention.FusedMLASelfAttention method) (core.transformer.multi_token_prediction.MultiTokenPredictionBlock method) (core.transformer.multi_token_prediction.MultiTokenPredictionLayer method) (core.transformer.transformer_block.TransformerBlock method) (core.transformer.transformer_layer.TransformerLayer method) sharded_state_dict_default() (in module core.transformer.utils) sharded_state_dict_keys_map (core.ssm.mamba_layer.MambaLayerSubmodules attribute) (core.transformer.transformer_layer.TransformerLayerSubmodules attribute) sharded_tensor_to_torch_sharded_tensor() (in module core.dist_checkpointing.strategies.torch) ShardedBase (class in core.dist_checkpointing.mapping) ShardedObject (class in core.dist_checkpointing.mapping) ShardedStateDict (in module core.dist_checkpointing.mapping) ShardedTensor (class in core.dist_checkpointing.mapping) ShardedTensorFactory (class in core.dist_checkpointing.mapping) sharding_strategy (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) ShardingDescriptor (class in core.resharding.utils) ShardingStrategy (class in core.distributed.fsdp.src.megatron_fsdp.fully_shard) shards_in_this_group (core.dist_checkpointing.exchange_utils.ShardDistribution attribute) shared_dims (core.hyper_comm_grid._RankViewSpec attribute) shared_embedding_or_output_weight() (core.models.common.language_module.language_module.LanguageModule method) (core.models.multimodal.llava_model.LLaVAModel method) (core.models.T5.t5_model.T5Model method) shared_expert_output (core.transformer.moe.moe_utils.MoECudaGraphTensorStore attribute) shared_experts (core.transformer.moe.moe_layer.MoESubmodules attribute) shared_experts_compute() (core.transformer.moe.moe_layer.MoELayer method) SharedExpertMLP (class in core.transformer.moe.shared_experts) SharedExpertsBuilder (class in core.transformer.moe.moe_layer) SharedExpertsInterface (class in core.transformer.moe.moe_layer) SharedExpertState (class in core.transformer.moe.shared_experts) short_sequence_probability (core.datasets.masked_dataset.MaskedWordPieceDatasetConfig attribute) ShortcutMoEBlock (class in core.models.hybrid.shortcut_block) should_bulk_offload() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) should_checkpoint_and_exit() (core.rerun_state_machine.RerunStateMachine method) should_enable_mtp_kv_cache() (core.inference.contexts.mtp_context_mixin.MTPContextMixin static method) should_free_input() (in module core.models.common.utils) should_run_forward_backward() (core.rerun_state_machine.RerunStateMachine method) should_setup_fault_injection_at_iteration() (in module core.fault_injector) should_setup_fault_injection_at_start() (in module core.fault_injector) should_transform() (core.resharding.transforms.MXFP8ReshardTransform method) (core.resharding.transforms.ReshardTransform method) SHUTDOWN (core.inference.headers.Lifecycle attribute) shutdown() (core.energy_monitor.EnergyMonitor method) (core.inference.apis.async_llm.MegatronAsyncLLM method) (core.inference.apis.llm.MegatronLLM method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) (core.resharding.nvshmem_copy_service.logger.PELogger class method) shutdown_coordinator() (core.inference.inference_client.InferenceClient method) SiglipHuggingFaceModel (class in core.models.huggingface.clip_model) SingleDeviceTRTLLMModelWeightsConverter (class in core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter) sinkhorn() (in module core.transformer.moe.moe_utils) sinkhorn_load_balancing() (core.transformer.moe.router.TopKRouter method) SinkhornKnopp (class in core.transformer.hyper_connection) situ() (in module core.activations) situ_glu() (in module core.activations) (in module core.fusions.fused_bias_swiglu) situ_glu_back() (in module core.fusions.fused_bias_swiglu) size (core.datasets.gpt_dataset.MockGPTLowLevelDataset attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.layout.GlobalLayout attribute) (core.models.mimo.comm.colocated_communicator.SliceInfo attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.ReceiveRequest attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.SendRequest attribute) (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) size() (core.datasets.indexed_dataset.DType static method) (core.inference.quantization.mxfp8_tensor.MXFP8Tensor method) sizes (core.resharding.nvshmem_copy_service.nvshmem_types.TransferMetadata attribute) skip_prompt_log_probs (core.inference.sampling_params.SamplingParams attribute) (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsGPUResult attribute) (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) skip_routed_expert_padding() (in module core.transformer.moe.moe_utils) SliceInfo (class in core.models.mimo.comm.colocated_communicator) soap_shampoo_beta (core.optimizer.optimizer_config.OptimizerConfig attribute) soap_use_kl_shampoo (core.optimizer.optimizer_config.OptimizerConfig attribute) sock (core.inference.apis.serve_config.ServeConfig attribute) softmax_scale (core.transformer.transformer_config.TransformerConfig attribute) softmax_type (core.transformer.transformer_config.TransformerConfig attribute) SoftmaxOne (class in core.fusions.fused_softmax) softplus() (in module core.ssm.ops.gdp.decode_prepare) solve_tril() (in module core.ssm.ops.gdp.solve_tril) sort_chunks_by_idxs() (in module core.transformer.moe.moe_utils) SOUND_TOKEN (in module core.models.multimodal.llava_model) SP_TOKENIZERS (in module core.tokenizers.utils.build_tokenizer) space_sensitive (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) spatial_merge_size (core.inference.config.ImageProcessingConfig attribute) spec (core.inference.shards.InferenceShard attribute) spec_declares_disaggregation() (in module core.inference.shards_spec) special_token_ids (core.models.mimo.config.base_configs.MimoModelConfig attribute) SPECIAL_TOKEN_TEMPLATE (in module core.tokenizers.text.libraries.tiktoken_tokenizer) SPECIAL_TOKENS (in module core.tokenizers.text.libraries.tiktoken_tokenizer) speculative_required_logit_indices() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) speculative_reserve_blocks (core.inference.contexts.dynamic_context.PrefixMatch attribute) splice_frames() (in module core.models.audio.nemo_audio_preprocessing) Split (class in core.datasets.utils) split (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) split_dtensor() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) split_fused_fsdp_param() (in module core.transformer.fsdp_dtensor_checkpoint) split_matrix (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) split_multimodal_data() (in module core.inference.inference_request) split_state_dict_if_needed() (core.optimizer.distrib_optimizer.DistributedOptimizer method) split_te_layernorm_column_parallel_linear() (in module core.extensions.transformer_engine) split_tensor_along_last_dim() (in module core.tensor_parallel.utils) split_tensor_into_1d_equal_chunks() (in module core.tensor_parallel.utils) split_to_context_parallel_ranks() (in module core.models.multimodal.context_parallel) split_to_context_parallel_ranks_dynamic_res() (in module core.models.multimodal.context_parallel) SQUARED_RELU (core.inference.moe.fused_moe.ActivationType attribute) squared_relu() (in module core.activations) squared_relu_and_quantize_mxfp8() (in module core.inference.moe.activations) squared_relu_with_probs() (in module core.inference.moe.batch_invariant) src (core.resharding.copy_services.nccl_m2n_copy_service._LocalTransfer attribute) src_block_ids (core.inference.disaggregation.pending_handoff_imports.DeferredKvHandoff attribute) src_config (core.resharding.refit._PlanCacheKey attribute) src_dim_ranks (core.resharding.utils.ShardingDescriptor attribute) src_head_slice() (core.inference.disaggregation.kv_reshard.KVReshardTransfer method) src_hi (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) src_layer (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) src_layer_slice() (core.inference.disaggregation.kv_reshard.KVReshardTransfer method) src_lo (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) src_local_shape (core.resharding.planner._NativeParameterPart attribute) (core.resharding.utils.TensorReshardSpec attribute) src_mesh (core.resharding.copy_services.nccl_m2n_copy_service._M2NChannel attribute) src_param_name (core.resharding.utils.TensorReshardSpec attribute) src_param_shape (core.resharding.utils.TensorReshardSpec attribute) src_pe (core.resharding.nvshmem_copy_service.nvshmem_types.ReceiveRequest attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.ScheduledBatch attribute) (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) src_pos (core.resharding.nvshmem_copy_service.nvshmem_types.SendRequest attribute) src_rank (core.inference.disaggregation.kv_reshard.KVReshardTransfer attribute) (core.inference.disaggregation.ssm_reshard.SSMReshardTransfer attribute) (core.resharding.copy_services.base.RecvOp attribute) src_rank_offset (core.resharding.refit._PlanCacheKey attribute) src_ranks (core.resharding.copy_services.nccl_m2n_copy_service._M2NTopology attribute) (core.resharding.utils.TensorReshardSpec attribute) src_shard_dim (core.resharding.utils.TensorReshardSpec attribute) src_slice (core.resharding.planner._NativeParameterPart attribute) (core.resharding.utils.TensorReshardSpec attribute) src_stride (core.resharding.utils.ShardingDescriptor attribute) src_tensor (core.resharding.nvshmem_copy_service.nvshmem_types.SendRequest attribute) ssm (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) ssm_chunk_alignment (core.inference.config.MambaInferenceStateConfig attribute) ssm_chunking() (in module core.ssm.ssm_inference) ssm_decode() (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_mixer.MambaMixer method) (core.ssm.ssm_inference.SSMDynamicInferenceMixin method) ssm_dynamic_inference() (core.ssm.ssm_inference.SSMDynamicInferenceMixin method) ssm_inference_chunk_size (core.ssm.gated_delta_product.GatedDeltaProductMixer property) (core.ssm.mamba_mixer.MambaMixer property) ssm_meta (core.inference.disaggregation.inference_state_handoff._PreparedHandoffMetadata attribute) ssm_prefill() (core.ssm.gated_delta_net.gdn.GatedDeltaNet method) (core.ssm.gated_delta_product.GatedDeltaProductMixer method) (core.ssm.mamba_mixer.MambaMixer method) (core.ssm.ssm_inference.SSMDynamicInferenceMixin method) ssm_states_dtype (core.inference.config.MambaInferenceStateConfig attribute) ssm_states_shape (core.inference.config.MambaInferenceStateConfig attribute) SSMChunking (class in core.ssm.ssm_inference) SSMDynamicInferenceMixin (class in core.ssm.ssm_inference) SSMReshardTransfer (class in core.inference.disaggregation.ssm_reshard) SSMShardLayout (class in core.inference.disaggregation.ssm_reshard) SSMStateDims (class in core.inference.disaggregation.ssm_reshard) stack_factor (core.models.audio.audio_feature_config.NemoTransformerAudioTokenEstimator attribute) stage() (core.inference.inference_request.RequestPayloadStager method) stage_decode_lengths() (core.inference.contexts.mtp_metadata.MTPMetadata method) stage_prefill_lengths() (core.inference.contexts.mtp_metadata.MTPMetadata method) StageDispatchBwdGrad (class in core.pipeline_parallel.utils) start (core.models.mimo.comm.colocated_communicator.SliceInfo attribute) start() (core.inference.apis._llm_base._EventLoopManager method) (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) (core.inference.inference_client.InferenceClient method) (core.timers.DummyTimer method) (core.timers.Timer method) (core.timers.TimerBase method) START_CUDA_PROFILER (core.inference.headers.Control attribute) start_cuda_profiler() (core.inference.inference_client.InferenceClient method) start_grad_sync() (core.distributed.data_parallel_base._BaseDataParallel method) (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV2 method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) (core.models.mimo.model.base.MimoModel method) start_listening_to_data_parallel_coordinator() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) start_method() (core.utils.StragglerDetector method) start_param_sync() (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV2 method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) (core.distributed.param_and_grad_buffer._ParamAndGradBucketGroup method) (core.models.mimo.model.base.MimoModel method) start_param_sync_for_bucket_group_subset() (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) start_text_gen_server() (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) start_wd (core.optimizer_param_scheduler.ParamGroupOverride attribute) starts (core.inference.text_generation_controllers.mtp_controller_mixin._CommitSegments attribute) STASH_MGR (core.transformer.moe.paged_stash.PagedStashManager attribute) stash_paged_tensors() (core.transformer.moe.paged_stash.PagedStashManager method) state (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan property) (core.optimizer.optimizer.ChainedOptimizer property) (core.optimizer.optimizer.MegatronOptimizer attribute) state_dict() (core.distributed.data_parallel_base._BaseDataParallel method) (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.grad_scaler.ConstantGradScaler method) (core.optimizer.grad_scaler.DynamicGradScaler method) (core.optimizer.grad_scaler.MegatronGradScaler method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.optimizer_param_scheduler.OptimizerParamScheduler method) (core.rerun_state_machine.RerunDataIterator method) (core.rerun_state_machine.RerunErrorInjector method) (core.rerun_state_machine.RerunStateMachine method) (core.transformer.module.Float16Module method) state_dict_for_save_checkpoint() (core.distributed.data_parallel_base._BaseDataParallel method) (core.transformer.module.Float16Module method) (core.transformer.module.MegatronModule method) state_update (core.ssm.context_parallel.chunkwise.CPForwardUnpackedSummary attribute) StateDict (in module core.dist_checkpointing.mapping) static_buffers (core.full_cuda_graph.StaticBufferLoader attribute) static_kv_memory_pointers (core.inference.config.InferenceConfig attribute) StaticBufferLoader (class in core.full_cuda_graph) StaticInferenceContext (class in core.inference.contexts.static_context) StaticInferenceEngine (class in core.inference.engines.static_engine) Status (class in core.inference.inference_request) status (core.inference.inference_request.InferenceRequest attribute) step (core.inference.engines.dynamic_engine.DynamicInferenceEngine attribute) step() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) (core.optimizer.emerging_optimizers.TensorParallelAdaptiveMuon method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.optimizer.optimizer.MixedPrecisionOptimizer method) (core.optimizer_param_scheduler.OptimizerParamScheduler method) (core.ssm.ops.mamba2.batch_invariant_decode.MambaBatchInvariantDecode method) step_legacy() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) step_modern() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) step_time (core.inference.engines.dynamic_engine.DynamicInferenceEngineStepResult attribute) step_with_ready_grads() (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.layer_wise_optimizer.LayerWiseDistributedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) (core.optimizer.optimizer.MixedPrecisionOptimizer method) StepBatchsizeNumMicroBatchesCalculator (class in core.num_microbatches_calculator) stft() (core.models.audio.nemo_audio_preprocessing.AudioToMelSpectrogramPreprocessor method) STOP (core.inference.headers.Control attribute) stop() (core.inference.apis._llm_base._EventLoopManager method) (core.inference.data_parallel_inference_coordinator.coordinator.DataParallelInferenceCoordinator method) (core.inference.inference_client.InferenceClient method) (core.timers.DummyTimer method) (core.timers.Timer method) (core.timers.TimerBase method) stop_communication() (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV1 method) (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV2 method) STOP_CUDA_PROFILER (core.inference.headers.Control attribute) stop_cuda_profiler() (core.inference.inference_client.InferenceClient method) stop_engines() (core.inference.inference_client.InferenceClient method) STOP_ITERATION (in module core.inference.async_stream) stop_method() (core.utils.StragglerDetector method) stop_text_gen_server() (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) stop_word_ids (core.inference.inference_request.DynamicInferenceRequest attribute) stop_words (core.inference.sampling_params.SamplingParams attribute) STOPPED (core.inference.engines.dynamic_engine.EngineState attribute) STOPPING (core.inference.data_parallel_inference_coordinator.state.CoordinatorState attribute) (core.inference.engines.dynamic_engine.EngineState attribute) StorageResizeBasedBucketAllocator (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) store_block_routing() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) store_from_live_batch() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) store_from_tensors() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) store_param_remainders (core.optimizer.optimizer_config.OptimizerConfig attribute) store_routing_per_block() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) str_dtype_to_torch() (in module core.export.trtllm.trtllm_weights_converter.distributed_trtllm_model_weights_converter) (in module core.export.trtllm.trtllm_weights_converter.single_device_trtllm_model_weights_converter) StragglerDetector (class in core.utils) stream (core.resharding.copy_services.nccl_m2n_copy_service._M2NChannel attribute) (core.transformer.moe.shared_experts.SharedExpertMLP attribute) stream_acquire_context() (core.pipeline_parallel.utils.ScheduleNode method) stream_tokens() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) streaming (core.inference.sampling_params.SamplingParams attribute) streaming_interval (core.inference.sampling_params.SamplingParams attribute) streaming_markers (core.tokenizers.text.parsers.qwen3_coder_tool_parser.Qwen3CoderToolParser attribute) StreamingChatParser (class in core.inference.text_generation_server.dynamic_text_gen_server.openai_streaming) StrictHandling (class in core.dist_checkpointing.validation) sub_optimizers (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer property) submit() (core.inference.apis._llm_base._EventLoopManager method) (core.inference.apis._llm_base._MegatronLLMBase method) submit_recv() (core.resharding.copy_services.base.CopyService method) (core.resharding.copy_services.gloo_copy_service.GlooCopyService method) (core.resharding.copy_services.nccl_copy_service.NCCLCopyService method) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) (core.resharding.copy_services.nvshmem_copy_service.NVSHMEMCopyService method) SUBMIT_REQUEST (core.inference.headers.Request attribute) SUBMIT_REQUEST_WITH_KV (core.inference.headers.Request attribute) submit_send() (core.resharding.copy_services.base.CopyService method) (core.resharding.copy_services.gloo_copy_service.GlooCopyService method) (core.resharding.copy_services.nccl_copy_service.NCCLCopyService method) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService method) (core.resharding.copy_services.nixl_copy_service.NixlCopyService method) (core.resharding.copy_services.nvshmem_copy_service.NVSHMEMCopyService method) submitted_at (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle attribute) submodules (core.transformer.spec_utils.ModuleSpec attribute) subsampling_factor (core.models.audio.nemo_transformer_audio_model.NemoTransformerAudioConfig attribute) succeeded() (core.inference.inference_request.DynamicInferenceRequest method) SUCCESS (core.inference.unified_memory.CompilationState attribute) suffix (core.inference.config.MediaPromptSpec attribute) suggested_bucket_size (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.BucketingPolicy attribute) suggested_communication_unit_size (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config.DistributedDataParallelConfig attribute) summary() (core.resharding.nvshmem_copy_service.logger.PELogger class method) SUPPORTED_ATTN_MASK (in module core.transformer.multi_token_prediction) SUPPORTED_SHORTCUT_PREDECESSORS (in module core.models.hybrid.shortcut_block) SUPPORTED_TOKENIZERS (in module core.tokenizers.utils.build_tokenizer) supports_audio (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper attribute) supports_idle_ranks (core.resharding.copy_services.base.CopyService attribute) (core.resharding.copy_services.nccl_m2n_copy_service.NCCLM2NCopyService attribute) supports_image (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper attribute) supports_mhc_connections (core.transformer.transformer_layer.BaseTransformerLayer attribute) (core.transformer.transformer_layer.HyperConnectionTransformerLayer attribute) supports_multiple_runs_per_plan (core.resharding.copy_services.base.CopyService attribute) (core.resharding.copy_services.gloo_copy_service.GlooCopyService attribute) (core.resharding.copy_services.nccl_copy_service.NCCLCopyService attribute) (core.resharding.copy_services.nixl_copy_service.NixlCopyService attribute) (core.resharding.copy_services.nvshmem_copy_service.NVSHMEMCopyService attribute) supports_text (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper attribute) supports_two_stage_attention() (core.ssm.gated_delta_net.common._GDNBase method) (core.ssm.mamba_layer.MambaLayer method) (core.transformer.attention.Attention method) (core.transformer.module.TwoStageAttentionLayer method) (core.transformer.transformer_layer.TransformerLayer method) supports_video (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper attribute) survivor_idxs (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleRequestResult attribute) SUSPEND (core.inference.headers.Control attribute) suspend() (core.inference.apis.async_llm.MegatronAsyncLLM method) (core.inference.apis.llm.MegatronLLM method) (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) suspend_engines() (core.inference.inference_client.InferenceClient method) suspend_resume_ctx() (core.inference.engines.dynamic_engine.DynamicInferenceEngine static method) suspend_tensor_observations() (in module core.tensor_observation) SUSPENDED (core.inference.data_parallel_inference_coordinator.state.CoordinatorState attribute) (core.inference.engines.dynamic_engine.EngineState attribute) SUSPENDING (core.inference.engines.dynamic_engine.EngineState attribute) swap_key_value_dict() (core.inference.contexts.static_context.StaticInferenceContext method) swap_model_weights() (in module core.resharding.refit) swap_request_rows() (core.inference.contexts.mtp_metadata.MTPMetadata method) SWIGLU (core.inference.moe.fused_moe.ActivationType attribute) swiglu() (in module core.fusions.fused_bias_swiglu) swiglu_back() (in module core.fusions.fused_bias_swiglu) swiglu_with_probs() (in module core.inference.moe.batch_invariant) SwiGLUFunction (class in core.fusions.fused_bias_swiglu) switch_load_balancing_loss_func() (in module core.transformer.moe.moe_utils) symbolic() (core.models.multimodal.context_parallel.GatherFromContextParallelRanks static method) (core.tensor_parallel.mappings._AllGatherFromTensorParallelRegion static method) (core.tensor_parallel.mappings._CopyToModelParallelRegion static method) (core.tensor_parallel.mappings._GatherFromModelParallelRegion static method) (core.tensor_parallel.mappings._GatherFromSequenceParallelRegion static method) (core.tensor_parallel.mappings._ReduceFromModelParallelRegion static method) (core.tensor_parallel.mappings._ReduceScatterToSequenceParallelRegion static method) (core.tensor_parallel.mappings._ReduceScatterToTensorParallelRegion static method) (core.tensor_parallel.mappings._ScatterToModelParallelRegion static method) (core.tensor_parallel.mappings._ScatterToSequenceParallelRegion static method) Symbols (class in core.models.hybrid.layers.utils) (in module core.models.hybrid.hybrid_layer_allocation) symmetric_ar_type (core.transformer.transformer_config.TransformerConfig attribute) symmetric_wgrad_pool (in module core.tensor_parallel.gtp_symmetric_memory) SymmetricMemoryBuffer (class in core.inference.symmetric_memory) SymmetricMemoryManager (class in core.inference.symmetric_memory) sync() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) sync_all_reduce_max() (core.inference.engines.async_zmq_communicator.AsyncZMQCommunicator method) sync_model_weight_from_main_weight() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) sync_model_weights_from_main_weights() (in module core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group) sync_rng_states_across_tp_group() (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV1 method) synchronize_gradient_reduce() (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) synchronize_param_gather() (core.distributed.fsdp.mcore_fsdp_adapter.FullyShardedDataParallelV2 method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) system_default (core.tokenizers.text.libraries.sft_tokenizer.PromptConfig attribute) T T (in module core.dist_checkpointing.exchange_utils) (in module core.dist_checkpointing.strategies.fully_parallel) (in module core.distributed.fsdp.src.megatron_fsdp.experimental.indexed_order) (in module core.inference.async_stream) (in module core.transformer.identity_op) (in module core.typed_torch) t5_extended_attention_mask() (in module core.models.T5.t5_model) t5_position_ids() (in module core.models.T5.t5_model) T5InferenceWrapper (class in core.inference.model_inference_wrappers.t5.t5_inference_wrapper) T5LMHead (class in core.models.T5.t5_model) T5MaskedWordPieceDataset (class in core.datasets.t5_dataset) T5MaskedWordPieceDatasetConfig (class in core.datasets.t5_dataset) T5Model (class in core.models.T5.t5_model) tag_gtp_params_with_names() (in module core.tensor_parallel.generalized_tensor_parallelism) tag_params_for_buffer_routing() (in module core.optimizer.layer_wise_optimizer) take_chunk_boundary() (core.inference.contexts.mtp_metadata.MTPMetadata method) tanh_soft_clamp() (in module core.activations) target_rows (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) task_id (core.resharding.copy_services.base.RecvOp attribute) (core.resharding.copy_services.base.SendOp attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.ReceiveRequest attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.SendRequest attribute) (core.resharding.nvshmem_copy_service.validation.ValidationResult attribute) (core.resharding.utils.TransferOp attribute) task_ids (core.resharding.nvshmem_copy_service.nvshmem_types.WorkloadSummary attribute) task_sizes (core.resharding.nvshmem_copy_service.nvshmem_types.WorkloadSummary attribute) TASK_WINDOW (core.resharding.copy_services.nccl_copy_service.NCCLCopyService attribute) tasks (core.resharding.nvshmem_copy_service.nvshmem_types.ScheduledBatch attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.WorkloadGroup attribute) tasks_summary (core.resharding.nvshmem_copy_service.nvshmem_types.ScheduledBatch attribute) TaskSegmenter (class in core.resharding.nvshmem_copy_service.planning.task_segmenter) te_checkpoint (in module core.transformer.transformer_block) te_checkpoint() (in module core.extensions.transformer_engine) te_cross_entropy() (in module core.extensions.transformer_engine) te_supports_batch_invariant_attention() (in module core.transformer.custom_layers.batch_invariant_kernels) te_supports_batch_invariant_grouped_gemm() (in module core.transformer.custom_layers.batch_invariant_kernels) TEActivationFunctionBuilder (class in core.transformer.mlp) TEActivationFunctionInterface (class in core.transformer.mlp) teardown() (core.inference.apis._llm_base._CoordinatorRuntime method) TEColumnParallelLinear (class in core.extensions.transformer_engine) TECudaGraphHelper (class in core.transformer.cuda_graphs) TECudaRNGStatesTracker (class in core.extensions.transformer_engine) TEDelayedScaling (class in core.extensions.transformer_engine) TEDotProductAttention (class in core.extensions.transformer_engine) TEGroupedMLP (class in core.transformer.moe.experts) TELayerNormColumnParallelLinear (class in core.extensions.transformer_engine) TELinear (class in core.extensions.transformer_engine) TELMHeadColumnParallelLinear (class in core.extensions.transformer_engine) temp_log_level() (in module core.inference.text_generation_server.dynamic_text_gen_server.text_generation_server) temperature (core.inference.sampling_params.SamplingParams attribute) temporal_patch_size (core.inference.config.VideoProcessingConfig attribute) TemporaryBucketAllocator (class in core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) TENorm (class in core.extensions.transformer_engine) tensor (core.resharding.copy_services.base.RecvOp attribute) (core.resharding.copy_services.base.SendOp attribute) (core.tensor_parallel.gtp_cuda_graphs.GraphWgradRingSlot attribute) tensor_a2a_cp2hp() (in module core.ssm.gated_delta_net.common) tensor_a2a_hp2cp() (in module core.ssm.gated_delta_net.common) tensor_model_parallel_size (core.model_parallel_config.ModelParallelConfig attribute) tensor_need_offloading_checker() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) tensor_parallel_group_ranks (core.resharding.utils.ParameterMetadata attribute) tensor_parallel_num_weight_shards (core.model_parallel_config.ModelParallelConfig attribute) tensor_pop() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) tensor_push() (core.pipeline_parallel.fine_grained_activation_offload.ChunkOffloadHandler method) tensor_relative_offset (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer._OwnedRange attribute) tensor_reshard_error (core.resharding.utils.ReshardPlan attribute) tensor_reshard_specs (core.resharding.utils.ReshardPlan attribute) tensor_shapes (core.distributed.fsdp.src.megatron_fsdp.experimental.layout.GlobalLayout attribute) tensor_swap() (in module core.inference.utils) tensor_to_offset (core.distributed.fsdp.src.megatron_fsdp.experimental.layout.GlobalLayout attribute) TensorItemIndex (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) TensorObservationCallback (in module core.tensor_observation) TensorParallelAdaptiveMuon (class in core.optimizer.emerging_optimizers) TensorParallelMuon (class in core.optimizer.emerging_optimizers) TensorPointerExtractor (class in core.resharding.nvshmem_copy_service.memory.tensor_pointer_utils) TensorReshardSpec (class in core.resharding.utils) tensors (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict property) (core.ssm.context_parallel.chunkwise.CPSavedContext attribute) TensorStateDeallocatedError tensorwise (core.enums.Fp8Recipe attribute) TEQuantizationParams (class in core.extensions.transformer_engine) (core.extensions.transformer_engine.TransformerEngineConfigType attribute) TEQuantizationRecipe (class in core.extensions.transformer_engine) terminal_state_reported (core.inference.disaggregation.pending_handoff_imports.PendingKvImport attribute) termination_id (core.inference.sampling_params.SamplingParams attribute) TERowParallelLinear (class in core.extensions.transformer_engine) TESpecProvider (class in core.extensions.transformer_engine_spec_provider) test (core.datasets.utils.Split attribute) test_mode (core.transformer.transformer_config.TransformerConfig attribute) text (core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer.HuggingFaceFastIncrementalDetokenizer property) text_length (core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer.HuggingFaceFastIncrementalDetokenizer property) TEXT_LIBRARIES (in module core.tokenizers.megatron_tokenizer) text_to_ids() (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract method) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) text_to_tokens() (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract method) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) TextGenerationController (class in core.inference.text_generation_controllers.text_generation_controller) thd_plan (core.context_parallel.layout.ContextParallelLayoutState attribute) (core.context_parallel.utils.ContextParallelBatch attribute) THDCPLayoutPlan (class in core.context_parallel.layout) theta_base (core.models.audio.nemo_transformer_encoder.GPTConfig attribute) (core.models.audio.nemo_transformer_encoder.TransformerEncoderConfig attribute) this_rank (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerGatherPlan attribute) (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerScatterPlan attribute) tie_embeddings_and_output_weights_state_dict() (core.models.common.language_module.language_module.LanguageModule method) tie_output_layer_state_dict() (in module core.transformer.multi_token_prediction) tie_word_embeddings_state_dict() (in module core.transformer.multi_token_prediction) TikTokenTokenizer (class in core.tokenizers.text.libraries.tiktoken_tokenizer) timeout_s (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle attribute) Timer (class in core.timers) TimerBase (class in core.timers) Timers (class in core.timers) timers (core.model_parallel_config.ModelParallelConfig attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) timestamp (core.inference.inference_request.DynamicInferenceEvent attribute) TMS_TAG (core.inference.contexts.dynamic_context.DynamicInferenceContext attribute) to_dict() (core.inference.shards_spec.InferenceShardSpec method) to_list() (core.transformer.cuda_graphs._CudaGraphRunner method) to_local_if_dtensor() (in module core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer) (in module core.utils) to_nemo_kwargs() (core.models.audio.audio_feature_config.NemoAudioFeatureConfig method) to_state_dict() (core.dist_checkpointing.tensor_aware_state_dict.MCoreTensorAwareStateDict method) toggle_cuda_graphs() (in module core.transformer.utils) token_combine() (core.transformer.moe.token_dispatcher.MoEAllGatherTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoETokenDispatcher method) (core.transformer.moe.token_dispatcher_inference.NCCLAllGatherDispatcher method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher method) token_count (core.inference.batch_dimensions_utils.InferenceBatchDimensions attribute) token_dispatch() (core.transformer.moe.token_dispatcher.MoEAllGatherTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEAlltoAllTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoEFlexTokenDispatcher method) (core.transformer.moe.token_dispatcher.MoETokenDispatcher method) (core.transformer.moe.token_dispatcher_inference.NCCLAllGatherDispatcher method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher method) token_dtype_code (core.datasets.gpt_dataset.GPTDatasetConfig attribute) TOKEN_ROUNDER (core.inference.contexts.dynamic_context.DynamicInferenceContext attribute) (in module core.inference.batch_dimensions_utils) token_row_indices (core.inference.text_generation_controllers.text_generation_controller.AsyncScheduleLogitsState attribute) token_to_id() (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) tokenize() (core.tokenizers.base_tokenizer.MegatronTokenizerBase method) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) tokenize_conversation() (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer method) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision method) tokenize_encoder_prompt() (core.inference.model_inference_wrappers.t5.t5_inference_wrapper.T5InferenceWrapper method) tokenize_files() (core.tokenizers.text.text_tokenizer.MegatronTokenizerText method) tokenize_prompt() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController static method) tokenize_prompts() (in module core.inference.text_generation_server.dynamic_text_gen_server.tokenization) (in module core.inference.text_generation_server.tokenization) tokenizer (core.datasets.blended_megatron_dataset_config.BlendedMegatronDatasetConfig attribute) TOKENIZER_MAPPING_LIBRARIES (in module core.tokenizers.text.text_tokenizer) (in module core.tokenizers.vision.vision_tokenizer) TokenOverflowError tokens (core.inference.text_generation_controllers.mtp_controller_mixin._CommitSegments attribute) tokens_per_block (core.inference.disaggregation.transfer_backends.base.BufferGeometry attribute) tokens_per_sample (core.packed_seq_params.PackedSeqParams attribute) tokens_to_ids() (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract method) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) tokens_to_text() (core.tokenizers.text.libraries.abstract_tokenizer.MegatronTokenizerTextAbstract method) (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer method) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer method) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer method) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer method) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer method) tool_call_complete_regex (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser attribute) tool_call_end_token (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser attribute) tool_call_function_regex (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser attribute) tool_call_parameter_regex (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser attribute) tool_call_prefix (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser attribute) tool_call_regex (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser attribute) tool_call_start_token (core.tokenizers.text.parsers.qwen3_coder_tool_parser._Qwen3CoderToolParser attribute) ToolCall (in module core.tokenizers.text.parsers.qwen3_coder_tool_parser) top_k (core.inference.sampling_params.SamplingParams attribute) top_n_counts (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsGPUResult attribute) (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) top_n_log_probs (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsGPUResult attribute) top_n_log_probs_cpu_view (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) top_n_logprobs (core.inference.sampling_params.SamplingParams attribute) top_n_token_ids (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsGPUResult attribute) top_n_token_ids_cpu_view (core.inference.text_generation_controllers.text_generation_controller._AsyncScheduleLogProbsTransfer attribute) top_p (core.inference.sampling_params.SamplingParams attribute) TOPK_BOUNDARY_RELATIVE_MARGIN (core.transformer.moe.router_diagnostics.RouterDiagnosticChannel attribute) topk_routing_with_score_function() (in module core.transformer.moe.moe_utils) TopKRouter (class in core.transformer.moe.router) TopLevelDataset (in module core.datasets.blended_megatron_dataset_builder) TORCH (core.inference.moe.InferenceGroupedGemmBackend attribute) torch_chunk_gated_delta_rule() (in module core.ssm.gated_delta_net.gdn) torch_chunk_gdn2() (in module core.ssm.gated_delta_net.gdn2) torch_home (in module core.tokenizers.text.libraries.megatron_hf_tokenizer) TorchDistLoadShardedStrategy (class in core.dist_checkpointing.strategies.torch) TorchDistSaveShardedStrategy (class in core.dist_checkpointing.strategies.torch) TorchFullyShardedDataParallel (class in core.distributed.torch_fully_sharded_data_parallel) TorchFullyShardedDataParallelConfig (class in core.distributed.torch_fully_sharded_data_parallel_config) TorchSampling (class in core.inference.sampling.torch_sampling) total_bytes (core.resharding.nvshmem_copy_service.validation.ValidationSummary attribute) total_size (core.resharding.nvshmem_copy_service.nvshmem_types.ScheduledBatch attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.TransferMetadata attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.WorkloadGroup attribute) (core.resharding.nvshmem_copy_service.nvshmem_types.WorkloadSummary attribute) total_stages (core.pipeline_parallel.multimodule_communicator.MultiModulePipelineCommunicator property) (core.pipeline_parallel.p2p_communication.P2PCommunicator property) total_tasks (core.resharding.nvshmem_copy_service.validation.ValidationSummary attribute) (core.resharding.utils.ReshardPlan attribute) total_tokens (core.packed_seq_params.PackedSeqParams attribute) tp (core.inference.shards_spec.InferenceShardSpec attribute) (core.process_groups_config.ProcessGroupCollection attribute) TP_BROADCAST (core.inference.headers.Transport attribute) tp_comm_atomic_ag (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_atomic_rs (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_bootstrap_backend (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_bulk_dgrad (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_bulk_wgrad (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_overlap (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_overlap_ag (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_overlap_disable_fc1 (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_overlap_disable_qkv (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_overlap_rs (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_overlap_rs_dgrad (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_split_ag (core.model_parallel_config.ModelParallelConfig attribute) tp_comm_split_rs (core.model_parallel_config.ModelParallelConfig attribute) tp_cp (core.process_groups_config.ProcessGroupCollection attribute) tp_cp_group (core.context_parallel.layout.ContextParallelLayoutManager attribute) tp_dp_cp (core.process_groups_config.ProcessGroupCollection attribute) tp_ep (core.process_groups_config.ProcessGroupCollection attribute) tp_ep_pp (core.process_groups_config.ProcessGroupCollection attribute) tp_ep_pp_with_egtp_remat (core.process_groups_config.ProcessGroupCollection attribute) tp_group (core.context_parallel.layout.ContextParallelLayoutManager attribute) tp_local_size (core.resharding.shard_planner._GTPShardLayout attribute) tp_local_start (core.resharding.shard_planner._GTPShardLayout attribute) tp_local_stop (core.resharding.shard_planner._GTPShardLayout attribute) tp_only_amax_red (core.extensions.transformer_engine.TEQuantizationRecipe attribute) (core.transformer.transformer_config.TransformerConfig attribute) tp_rank (core.context_parallel.layout._LayoutParallelContext attribute) (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) (core.inference.disaggregation.ssm_reshard.SSMShardLayout attribute) tp_round_up_heads (core.models.vision.encoder_registry.EncoderSpec attribute) tp_size (core.context_parallel.layout._LayoutParallelContext attribute) (core.inference.disaggregation.kv_reshard.KVShardLayout attribute) (core.inference.disaggregation.ssm_reshard.SSMShardLayout attribute) (core.resharding.refit._ParallelConfig attribute) tpot (core.inference.inference_request.InferenceRequest attribute) trace() (core.resharding.nvshmem_copy_service.logger.PELogger class method) trace_async_exceptions() (in module core.utils) TRACE_REGION (core.telemetry.span_groups.MegatronSpanGroup attribute) track_generated_token_events (core.inference.config.InferenceConfig attribute) track_gtp_capture_comms() (in module core.tensor_parallel.gtp_cuda_graphs) track_moe_metrics() (in module core.transformer.moe.moe_utils) track_mtp_metrics() (core.transformer.multi_token_prediction.MTPLossLoggingHelper static method) track_paused_request_events (core.inference.config.InferenceConfig attribute) tracked_metadata (core.inference.inference_request.DynamicInferenceRequest property) tracker (core.transformer.multi_token_prediction.MTPLossLoggingHelper attribute) train (core.datasets.utils.Split attribute) train() (core.models.vision.radio.RADIOViTModel method) (core.ssm.mamba_mixer.MambaMixer method) training_recipe (core.extensions.transformer_engine.TEQuantizationParams attribute) TrainingState (class in core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp) transfer_block_count() (in module core.inference.disaggregation.utils) transfer_bookkeeping_to_gpu() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) transfer_intermediate_to_gpu() (core.inference.contexts.mamba_slot_allocator.MambaSlotAllocator method) transfer_peer_records() (in module core.inference.disaggregation.utils) TransferMetadata (class in core.resharding.nvshmem_copy_service.nvshmem_types) TransferOp (class in core.resharding.utils) transfers_for_dst() (in module core.inference.disaggregation.utils) transfers_for_src() (in module core.inference.disaggregation.utils) transform (core.resharding.utils.ReshardPlan attribute) transform_args (core.resharding.copy_services.nccl_m2n_copy_service._PendingParameter attribute) transform_object() (core.dist_checkpointing.strategies.torch.MCoreSavePlanner method) transformer_impl (core.transformer.transformer_config.TransformerConfig attribute) TransformerBlock (class in core.models.audio.nemo_transformer_encoder) (class in core.transformer.transformer_block) TransformerBlockSubmodules (class in core.transformer.transformer_block) TransformerConfig (class in core.transformer.transformer_config) TransformerEncoder (class in core.models.audio.nemo_transformer_encoder) TransformerEncoderConfig (class in core.models.audio.nemo_transformer_encoder) TransformerEngineConfigType (class in core.extensions.transformer_engine) TransformerLayer (class in core.transformer.transformer_layer) TransformerLayerNode (class in core.models.common.utils) TransformerLayerSchedulePlan (class in core.models.common.model_chunk_schedule_plan) TransformerLayerSubmodules (class in core.transformer.transformer_layer) TransformerModelChunkSchedulePlan (class in core.models.common.model_chunk_schedule_plan) TRANSIENT_ERROR (core.rerun_state_machine.RerunDiagnostic attribute) transition (core.ssm.context_parallel.chunkwise.CPBackwardUnpackedSummary attribute) (core.ssm.context_parallel.chunkwise.CPForwardUnpackedSummary attribute) transition_cudagraph_scope() (core.transformer.transformer_layer.MoETransformerLayer method) transition_moe_cudagraphs() (in module core.transformer.utils) Transport (class in core.inference.headers) transpose_weight_buffer (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParameterGroup attribute) tree_map() (in module core.transformer.cuda_graphs) TRITON_22 (in module core.ssm.ops.mamba2.ssd_chunk_scan) (in module core.ssm.ops.mamba2.ssd_combined) triton_append_key_value_cache() (in module core.inference.contexts.fused_kv_append_kernel) TRITON_HAS_CACHE_RESULTS (in module core.ssm.ops.common.determinism) TRT_MODEL_CONFIG (in module core.export.trtllm.trt_model_config) TRT_MODEL_TYPE_STRING (in module core.export.trtllm.trt_model_type) TRTLLMEngineBuilder (class in core.export.trtllm.engine_builder.trtllm_engine_builder) TRTLLMHelper (class in core.export.trtllm.trtllm_helper) TRTLLMLayers (class in core.export.trtllm.trtllm_layers) ttft (core.inference.inference_request.DynamicInferenceRequest attribute) TwoStageAttentionLayer (class in core.transformer.module) type (core.inference.inference_request.DynamicInferenceEvent attribute) U u (core.ssm.context_parallel.gdp.GDPLocalContext attribute) uid (core.inference.inference_request.DynamicInferenceRequest attribute) uint16 (core.datasets.indexed_dataset.DType attribute) uint8 (core.datasets.indexed_dataset.DType attribute) UNATTEMPTED (core.inference.unified_memory.CompilationState attribute) uncompress_kv_from_cache() (core.transformer.multi_latent_attention.MLASelfAttention method) uneven_dtensor_to_full_tensor() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) unfreeze() (core.models.audio.nemo_transformer_encoder.TransformerEncoder method) unfused (core.transformer.enums.AttnBackend attribute) unfused_cross_entropy() (in module core.tensor_parallel.cross_entropy) UNGRAPHED (core.tensor_parallel.generalized_tensor_parallelism.GTPChain attribute) unified_memory_level (core.inference.config.InferenceConfig attribute) UnifiedMemoryCompileTimeoutError UnifiedMemoryUnsupportedError unify_communication_stream (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext attribute) unique_identifiers (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) unique_key (core.dist_checkpointing.mapping.ShardedObject property) unk (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) unk_id (core.tokenizers.text.libraries.bytelevel_tokenizer.ByteLevelTokenizer property) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) UnknownHeaderError unpack() (core.distributed.fsdp.src.megatron_fsdp.experimental.owner_planning.OwnerScatterPlan method) unpack_batch() (core.datasets.data_schedule.HybridCPDataLoaderWrapper method) unpack_stream (core.transformer.moe.paged_stash.PagedStashManager property) unpad_input_prompt_tokens() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) unpatchify_image() (in module core.models.multimodal.utils) UNPAUSE (core.inference.headers.Control attribute) unpause() (core.inference.apis.async_llm.MegatronAsyncLLM method) (core.inference.apis.llm.MegatronLLM method) unpause_engines() (core.inference.inference_client.InferenceClient method) UNPAUSING (core.inference.engines.dynamic_engine.EngineState attribute) unpermute() (in module core.transformer.moe.batch_invariant) (in module core.transformer.moe.moe_utils) unpermute_tokens() (in module core.inference.moe.permute) unpermute_tokens_in_expert_order() (in module core.inference.moe.batch_invariant) unset_active() (core.inference.utils.InferenceMode class method) unset_num_microbatches_calculator() (in module core.num_microbatches_calculator) unshard() (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpModule method) unshard_parameters() (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameterGroup method) unsharded (core.distributed.fsdp.src.megatron_fsdp.experimental.parameter_group.FsdpParameter attribute) unwrap() (core.dist_checkpointing.mapping.LocalNonpersistentObject method) (core.utils.WrappedTensor method) unwrap_model() (in module core.utils) unwrap_serialized_tensors() (in module core.inference.inference_request) upcycle_state_dict() (in module core.transformer.moe.upcycling_utils) update() (core.inference.text_generation_server.dynamic_text_gen_server.incremental_detokenizer.HuggingFaceFastIncrementalDetokenizer method) (core.num_microbatches_calculator.ConstantNumMicroBatchesCalculator method) (core.num_microbatches_calculator.NumMicroBatchesCalculator method) (core.num_microbatches_calculator.StepBatchsizeNumMicroBatchesCalculator method) (core.optimizer.grad_scaler.ConstantGradScaler method) (core.optimizer.grad_scaler.DynamicGradScaler method) (core.optimizer.grad_scaler.MegatronGradScaler method) update_fp32_param_by_new_param() (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) update_generation_status() (core.inference.text_generation_controllers.text_generation_controller.TextGenerationController method) update_gtp_config() (in module core.tensor_parallel.generalized_tensor_parallelism) update_main_grads() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) update_metadata() (core.transformer.moe.token_dispatcher_inference.InferenceAllGatherDispatcherBase method) (core.transformer.moe.token_dispatcher_inference.NCCLAllGatherDispatcher method) (core.transformer.moe.token_dispatcher_inference.NVLSAllGatherVDispatcher method) update_model_chunk() (core.transformer.moe.paged_stash.PagedStashManager method) update_num_microbatches() (in module core.num_microbatches_calculator) update_offload_info() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorGroup method) update_pg_timeout() (in module core.parallel_state) update_pp_schedule() (core.transformer.moe.paged_stash.PagedStashManager method) update_requests() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) update_requests_pools() (core.inference.scheduler.Scheduler method) update_timestamps() (core.inference.contexts.kv_block_allocator.KVBlockAllocator method) update_uneven_dtensor_chunk_metadata() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) upload_file() (core.datasets.object_storage_utils.S3Client method) use_bounded_mxfp8_rows() (core.inference.utils.InferenceMode class method) use_cpu_initialization (core.model_parallel_config.ModelParallelConfig attribute) use_cuda_graphs_for_non_decode_steps (core.inference.config.InferenceConfig attribute) use_custom_fsdp (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) use_deterministic_mode() (in module core.ssm.ops.common.determinism) use_distributed_optimizer (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) (core.optimizer.optimizer_config.OptimizerConfig attribute) use_embedding_sharing (core.export.export_config.ExportConfig attribute) use_flashinfer_fused_rope (core.inference.config.InferenceConfig attribute) use_fused_mhc (core.transformer.transformer_config.TransformerConfig attribute) use_fused_mla_q_uproj (core.transformer.transformer_config.MLATransformerConfig attribute) use_fused_weighted_squared_relu (core.transformer.transformer_config.TransformerConfig attribute) use_grouped_gemm_for_dense_mlp (core.transformer.transformer_config.TransformerConfig attribute) use_grouped_gemm_for_shared_expert (core.transformer.transformer_config.TransformerConfig attribute) use_inference_optimized_layers (core.transformer.transformer_config.TransformerConfig attribute) use_kitchen (core.transformer.transformer_config.TransformerConfig attribute) use_kitchen_attention (core.transformer.transformer_config.TransformerConfig attribute) use_layer_wise_distributed_optimizer (core.optimizer.optimizer_config.OptimizerConfig attribute) use_mamba_mem_eff_path (core.transformer.transformer_config.TransformerConfig attribute) use_megatron_fsdp (core.distributed.distributed_data_parallel_config.DistributedDataParallelConfig attribute) use_mpu_process_groups() (core.process_groups_config.ProcessGroupCollection class method) use_mup (core.transformer.transformer_config.TransformerConfig attribute) use_parallel_embedding (core.export.export_config.ExportConfig attribute) use_precision_aware_optimizer (core.optimizer.optimizer_config.OptimizerConfig attribute) use_qk_l2norm_in_kernel (core.ssm.context_parallel.gdp_cutedsl.CuTeDSLGDPSavedMetadata attribute) use_ring_exchange_p2p (core.model_parallel_config.ModelParallelConfig attribute) use_symmetric_memory (core.distributed.fsdp.src.megatron_fsdp.experimental.module.FsdpContext attribute) use_synchronous_zmq_collectives (core.inference.config.InferenceConfig attribute) use_te_activation_func (core.transformer.transformer_config.TransformerConfig attribute) use_te_rng_tracker (core.model_parallel_config.ModelParallelConfig attribute) (core.transformer.transformer_config.TransformerConfig attribute) use_thumbnail (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) use_tiling (core.inference.config.ImageProcessingConfig attribute) (core.models.vision.encoder_registry.EncoderSpec attribute) use_torch_optimizer_for_cpu_offload (core.optimizer.optimizer_config.OptimizerConfig attribute) use_transformer_engine_op_fuser (core.transformer.transformer_config.TransformerConfig attribute) use_zero_copy_wgrad() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) USING_APEX_OPTIMIZER (in module core.optimizer.distrib_optimizer) using_cuda_graph_this_step() (core.inference.contexts.dynamic_context.DynamicInferenceContext method) USING_TE_OPTIMIZER (in module core.optimizer.distrib_optimizer) using_tensor_parallel() (in module core.distributed.fsdp.src.megatron_fsdp.utils) V v (core.ssm.context_parallel.gdp.GDPSavedInputs attribute) (core.ssm.context_parallel.gdp_common.GDPInputs attribute) v_head_dim (core.transformer.transformer_config.MLATransformerConfig attribute) v_new (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) valid (core.datasets.utils.Split attribute) VALID_INT_KEYS (in module core.inference.shards_spec) VALID_KEYS (in module core.inference.shards_spec) VALID_ROLES (in module core.inference.shards_spec) VALID_SHARDING_STRATEGIES (in module core.distributed.fsdp.src.megatron_fsdp.distributed_data_parallel_config) VALID_TOKEN_COUNT (core.transformer.moe.router_diagnostics.RouterDiagnosticChannel attribute) validate_coefficient_type() (in module core.optimizer.emerging_optimizers) validate_deprecated_cuda_graph_modules_migration_inputs() (in module core.transformer.cuda_graph_config) validate_fsdp_dtensor_model_load() (in module core.transformer.fsdp_dtensor_checkpoint) validate_input_modalities() (core.inference.model_inference_wrappers.abstract_model_inference_wrapper.AbstractModelInferenceWrapper method) validate_integrity_and_strict_load() (in module core.dist_checkpointing.validation) validate_layer_layout() (core.transformer.pipeline_parallel_layer_layout.PipelineParallelLayerLayout method) validate_loaded_state_dict() (in module core.transformer.fsdp_dtensor_checkpoint) validate_metadata_integrity() (core.dist_checkpointing.mapping.ShardedBase method) (core.dist_checkpointing.mapping.ShardedObject method) (core.dist_checkpointing.mapping.ShardedTensor method) (core.dist_checkpointing.mapping.ShardedTensorFactory method) validate_mxfp8_tensor() (in module core.inference.quantization.mxfp8_tensor) validate_offload_params() (in module core.inference.text_generation_server.dynamic_text_gen_server.endpoints.common) validate_received_data() (in module core.resharding.nvshmem_copy_service.validation) validate_result() (core.rerun_state_machine.RerunStateMachine method) VALIDATE_RESULTS (core.rerun_state_machine.RerunMode attribute) validate_segment_layers() (in module core.models.hybrid.hybrid_layer_allocation) validate_sharding_integrity() (in module core.dist_checkpointing.validation) validate_state_dict() (core.rerun_state_machine.RerunStateMachine method) validate_tp_comm_overlap() (in module core.models.hybrid.layers.utils) validate_uneven_dtensor() (in module core.distributed.fsdp.src.megatron_fsdp.uneven_dtensor) ValidationResult (class in core.resharding.nvshmem_copy_service.validation) ValidationSummary (class in core.resharding.nvshmem_copy_service.validation) values (core.transformer.moe.moe_logging.MetricEntry attribute) values() (core.process_groups_config.MultiModuleProcessGroupCollection method) variable_seq_lengths (core.model_parallel_config.ModelParallelConfig attribute) varlen_mock_dataset_config_json (core.datasets.gpt_dataset.GPTDatasetConfig attribute) varlen_sbhd_validation (core.datasets.gpt_dataset.GPTDatasetConfig attribute) verbose (core.inference.apis.serve_config.ServeConfig attribute) (core.inference.config.InferenceConfig attribute) (core.post_training.modelopt.layers.RealQuantTransformerLayer attribute) verify_checkpoint() (in module core.dist_checkpointing.validation) verify_integrity_manifest() (in module core.dist_checkpointing.validation) verify_speculative_tokens() (in module core.inference.text_generation_controllers.mtp_utils_pytorch) (in module core.inference.text_generation_controllers.mtp_utils_triton) VERSION (in module core.distributed.fsdp.src.megatron_fsdp.package_info) (in module core.package_info) video_maintain_aspect_ratio (core.inference.config.VideoProcessingConfig attribute) video_preprocessing_config (core.inference.config.InferenceConfig attribute) video_spec (core.inference.config.MultimodalPromptConfig attribute) VIDEO_TOKEN (in module core.models.multimodal.llava_model) VideoProcessingConfig (class in core.inference.config) view() (core.distributed.fsdp.src.megatron_fsdp.experimental.dbuffer.DBuffer method) (core.distributed.fsdp.src.megatron_fsdp.experimental.quantized_dbuffer.QuantizedDBuffer method) virtual_pipeline_model_parallel_size (core.model_parallel_config.ModelParallelConfig attribute) vision_embedding_cache_max_bytes (core.inference.config.InferenceConfig attribute) VISION_LIBRARIES (in module core.tokenizers.megatron_tokenizer) vision_model_type (core.inference.config.ImageProcessingConfig attribute) VisionModule (class in core.models.common.vision_module.vision_module) VisionTECudaGraphHelper (class in core.transformer.cuda_graphs) ViTModel (class in core.models.vision.vit_model) VLLM (core.inference.moe.InferenceGroupedGemmBackend attribute) vllm_fused_moe() (in module core.inference.moe.vllm_fused_moe) VllmFusedMoeBuffers (class in core.inference.moe.vllm_fused_moe) VLMInferenceRequest (class in core.inference.inference_request) VLMTextGenerationController (class in core.inference.text_generation_controllers.vlm_text_generation_controller) vocab (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.libraries.sentencepiece_tokenizer.SentencePieceTokenizer property) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer property) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision property) vocab() (core.tokenizers.base_tokenizer.MegatronTokenizerBase method) vocab_embedding (core.export.trtllm.trtllm_layers.TRTLLMLayers attribute) vocab_file (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) vocab_parallel_cross_entropy() (core.extensions.transformer_engine_spec_provider.TESpecProvider method) (core.models.backends.BackendSpecProvider method) (core.models.backends.LocalSpecProvider method) (in module core.tensor_parallel.cross_entropy) vocab_range_from_global_vocab_size() (core.tensor_parallel.utils.VocabUtility static method) vocab_range_from_per_partition_vocab_size() (core.tensor_parallel.utils.VocabUtility static method) vocab_size (core.models.audio.nemo_transformer_encoder.GPTConfig attribute) (core.tokenizers.text.libraries.huggingface_tokenizer.HuggingFaceTokenizer property) (core.tokenizers.text.libraries.null_tokenizer.NullTokenizer property) (core.tokenizers.text.libraries.sft_tokenizer.SFTTokenizer property) (core.tokenizers.text.libraries.tiktoken_tokenizer.TikTokenTokenizer property) (core.tokenizers.text.text_tokenizer.MegatronTokenizerText property) (core.tokenizers.vision.libraries.multimodal_tokenizer.MegatronMultimodalTokenizer property) (core.tokenizers.vision.libraries.null_multimodal_tokenizer.MegatronNullMultimodalTokenizer property) (core.tokenizers.vision.vision_tokenizer.MegatronTokenizerVision property) vocab_size() (core.tokenizers.base_tokenizer.MegatronTokenizerBase method) vocab_size_with_padding() (in module core.tokenizers.utils.build_tokenizer) VocabParallelCrossEntropy (class in core.tensor_parallel.cross_entropy) VocabParallelEmbedding (class in core.tensor_parallel.layers) VocabUtility (class in core.tensor_parallel.utils) W w (core.ssm.context_parallel.gdp.GDPBackwardContext attribute) (core.ssm.context_parallel.gdp.GDPLocalContext attribute) wait() (core.distributed.param_and_grad_buffer._LayerwiseAllGatherHandle method) (core.distributed.reduce_scatter_with_fp32_accumulation._ReduceScatterWithFP32AccumulationWorkHandle method) (core.inference.disaggregation.transfer_backends.nccl.NcclTransferHandle method) (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle method) (core.tensor_parallel.generalized_tensor_parallelism._GTPCompositeWorkHandle method) (core.tensor_parallel.generalized_tensor_parallelism.BatchedNVFP4AllGatherAsyncHandle method) (core.tensor_parallel.generalized_tensor_parallelism.GTPShardHandle method) wait_async_comms() (in module core.tensor_parallel.generalized_tensor_parallelism) wait_bucket_ready() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.AllGatherPipeline method) wait_current_stream() (core.models.common.model_chunk_schedule_plan.TransformerModelChunkSchedulePlan method) (core.transformer.moe.shared_experts.SharedExpertMLP method) wait_for_gtp_grad_reduction_on_current_stream() (in module core.tensor_parallel.generalized_tensor_parallelism) wait_for_previous_grad_reduce() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.GradReducePipeline method) wait_for_shutdown() (core.inference.apis.async_llm.MegatronAsyncLLM method) (core.inference.apis.llm.MegatronLLM method) wait_for_stash_to_complete() (core.transformer.moe.paged_stash.PagedStashManager method) wait_for_subscribers() (core.inference.engines.async_zmq_communicator.RankedPubSub method) wait_offload_event() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorGroup method) wait_reload_event() (core.pipeline_parallel.fine_grained_activation_offload.OffloadTensorGroup method) wait_until() (core.inference.engines.dynamic_engine.DynamicInferenceEngine method) WAITING_IN_QUEUE (core.inference.inference_request.Status attribute) warn() (core.resharding.nvshmem_copy_service.logger.PELogger class method) warn_single_rank() (in module core._rank_utils) warning() (core.resharding.nvshmem_copy_service.logger.PELogger class method) wd_mult (core.optimizer_param_scheduler.ParamGroupOverride attribute) weak_method() (in module core.models.common.utils) weight_decay (core.optimizer.optimizer_config.OptimizerConfig attribute) weight_prefetch (core.tensor_parallel.generalized_tensor_parallelism.GTPRematConfig attribute) weighted_bias_quick_geglu() (in module core.fusions.fused_bias_geglu) weighted_bias_quick_geglu_back() (in module core.fusions.fused_bias_geglu) weighted_bias_quick_geglu_impl() (in module core.fusions.fused_bias_geglu) weighted_bias_swiglu_impl() (in module core.fusions.fused_bias_swiglu) weighted_clamped_squared_relu() (in module core.fusions.fused_weighted_squared_relu) weighted_clamped_squared_relu_back() (in module core.fusions.fused_weighted_squared_relu) weighted_quick_geglu() (in module core.fusions.fused_bias_geglu) weighted_quick_geglu_back() (in module core.fusions.fused_bias_geglu) weighted_silu_mul_bounded() (in module core.inference.moe.batch_invariant) weighted_situ_glu() (in module core.fusions.fused_bias_swiglu) weighted_situ_glu_back() (in module core.fusions.fused_bias_swiglu) weighted_squared_relu() (in module core.fusions.fused_weighted_squared_relu) weighted_squared_relu_back() (in module core.fusions.fused_weighted_squared_relu) weighted_squared_relu_impl() (in module core.fusions.fused_weighted_squared_relu) weighted_swiglu() (in module core.fusions.fused_bias_swiglu) weighted_swiglu_back() (in module core.fusions.fused_bias_swiglu) WeightedBiasQuickGeGLUFunction (class in core.fusions.fused_bias_geglu) WeightedQuickGeGLUFunction (class in core.fusions.fused_bias_geglu) WeightedSquaredReLUFunction (class in core.fusions.fused_weighted_squared_relu) WeightedSwiGLUFunction (class in core.fusions.fused_bias_swiglu) wgrad_deferral_limit (core.model_parallel_config.ModelParallelConfig attribute) wgrad_reduce_scatter() (core.tensor_parallel.generalized_tensor_parallelism.GTPShardedParam method) wgrad_ring_slots (core.tensor_parallel.gtp_cuda_graphs.GTPCaptureCommState attribute) will_execute_quantized() (core.extensions.transformer_engine.TELayerNormColumnParallelLinear method) (core.extensions.transformer_engine.TELinear method) WILL_RERUN_FROM_CHECKPOINT (core.rerun_state_machine.RerunState attribute) window (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) WINDOW (core.models.hybrid.layers.utils.Symbols attribute) window_attn_skip_freq (core.transformer.transformer_config.TransformerConfig attribute) window_size (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) (core.transformer.transformer_config.TransformerConfig attribute) window_stride (core.models.audio.audio_feature_config.NemoAudioFeatureConfig attribute) with_name_predicate (core.optimizer.optimizer_config.ParamKey attribute) without_data() (core.dist_checkpointing.mapping.ShardedBase method) (core.dist_checkpointing.mapping.ShardedObject method) (core.dist_checkpointing.mapping.ShardedTensor method) (core.dist_checkpointing.mapping.ShardedTensorFactory method) WorkloadGroup (class in core.resharding.nvshmem_copy_service.nvshmem_types) WorkloadPacker (class in core.resharding.nvshmem_copy_service.planning.workload_packer) WorkloadSummary (class in core.resharding.nvshmem_copy_service.nvshmem_types) world_size (core.inference.shards.InferenceShard attribute) (core.inference.shards_spec.InferenceShardSpec property) (core.resharding.refit._PlanCacheKey attribute) (core.utils.StragglerDetector property) wrap_data_iterator() (in module core.datasets.data_schedule) wrap_module_params_gtp() (in module core.tensor_parallel.generalized_tensor_parallelism) WrappedTensor (class in core.utils) WrappedTorchLayerNorm (in module core.transformer.torch_layer_norm) WrappedTorchNorm (class in core.transformer.torch_norm) write() (core.datasets.indexed_dataset._IndexWriter method) (core.timers.Timers method) write_metadata() (core.tokenizers.megatron_tokenizer.MegatronTokenizer method) write_mha_metadata() (core.inference.contexts.mtp_metadata.MTPMetadata method) write_nemo_audio_configs_from_args_to_checkpoint_dir() (in module core.models.audio.nemo_audio_checkpoint) write_nemo_audio_configs_to_checkpoint_dir() (in module core.models.audio.nemo_audio_checkpoint) write_token_maps() (core.inference.contexts.mtp_metadata.MTPMetadata method) X x (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) xfers (core.inference.disaggregation.transfer_backends.nixl.NixlPullHandle attribute) Y YarnRotaryEmbedding (class in core.models.common.embeddings.yarn_rotary_pos_embedding) Z z (core.ssm.ops.mamba2.batch_invariant_decode.BatchInvariantDecodeBuffers attribute) z_loss_func() (in module core.transformer.moe.moe_utils) zero_grad() (core.distributed.fsdp.src.megatron_fsdp.param_and_grad_buffer.ParamAndGradBuffer method) (core.models.mimo.optimizer.MimoOptimizer method) (core.optimizer.cpu_offloading.hybrid_optimizer.HybridDeviceOptimizer method) (core.optimizer.distrib_optimizer.DistributedOptimizer method) (core.optimizer.fully_sharded_optimizer.FullyShardedOptimizer method) (core.optimizer.optimizer.ChainedOptimizer method) (core.optimizer.optimizer.Float16OptimizerWithFloat16Params method) (core.optimizer.optimizer.FP32Optimizer method) (core.optimizer.optimizer.MegatronOptimizer method) zero_grad_buffer() (core.distributed.data_parallel_base._BaseDataParallel method) (core.distributed.distributed_data_parallel.DistributedDataParallel method) (core.distributed.fsdp.src.megatron_fsdp.megatron_fsdp.MegatronFSDP method) (core.models.mimo.model.base.MimoModel method) zero_parameters() (core.models.common.embeddings.language_model_embedding.LanguageModelEmbedding method) zeros_like() (core.transformer.cuda_graphs.ArgMetadata method) zigzag_local_token_count (core.context_parallel.layout.THDCPLayoutPlan attribute) zigzag_packed_seq_params (core.context_parallel.layout.ContextParallelLayoutState attribute) zigzag_to_contiguous() (in module core.context_parallel.layout) zip_strict() (in module core.dist_checkpointing.utils)