bridge.recipes.nemotron_omni.h100.nemotron_omni#
Nemotron Omni SFT/PEFT recipes (CORD v2 VL, Valor32k-AVQA audio-visual, temporal video).
All recipes use nemotron_omni_step (pass --step_func nemotron_omni_step).
Module Contents#
Functions#
Create the declarative temporal-video Energon config used by Omni recipes. |
|
Return a VL SFT config for Nemotron Omni on CORD v2. |
|
|
Return an 8K CORD v2 SFT config with in-batch packing and CP2. |
Return a LoRA PEFT config for Nemotron Omni on CORD v2. |
|
Shared model/training config for all Nemotron Omni recipes. |
|
Return an Energon SFT config with temporal video embedder enabled. |
|
LoRA PEFT recipe on temporal-video Energon path (temporal_patch_dim=2). |
Data#
API#
- bridge.recipes.nemotron_omni.h100.nemotron_omni._DEFAULT_HF_PATH#
‘nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16’
- bridge.recipes.nemotron_omni.h100.nemotron_omni._make_nemotron_omni_energon_dataset(
- micro_batch_size: int,
Create the declarative temporal-video Energon config used by Omni recipes.
- bridge.recipes.nemotron_omni.h100.nemotron_omni.nemotron_omni_cord_v2_sft_4gpu_h100_bf16_config() megatron.bridge.training.config.ConfigContainer#
Return a VL SFT config for Nemotron Omni on CORD v2.
Vision-language finetuning on the CORD v2 receipt parsing dataset. Sound modules are omitted because this dataset contains only image-text samples. Default configuration: 4 GPUs (TP=4). Uses nemotron_omni_step (pass –step_func nemotron_omni_step).
- bridge.recipes.nemotron_omni.h100.nemotron_omni.nemotron_omni_cord_v2_long_context_sft_8gpu_h100_bf16_config() megatron.bridge.training.config.ConfigContainer#
Return an 8K CORD v2 SFT config with in-batch packing and CP2.
In-batch packing requires a micro batch greater than one. The TP4/CP2 topology needs at least eight GPUs and aligns every packed row to the combined CP/SP multiple. Precision-aware Adam uses FP16 main parameters with stored FP32 remainders, BF16 gradients, and BF16 moments so first-step optimizer-state initialization fits within 80 GB H100 memory.
- bridge.recipes.nemotron_omni.h100.nemotron_omni.nemotron_omni_cord_v2_peft_4gpu_h100_bf16_config() megatron.bridge.training.config.ConfigContainer#
Return a LoRA PEFT config for Nemotron Omni on CORD v2.
LoRA adapters are applied to attention, Mamba, and FC1/FC2 projections. Vision base modules remain frozen and sound modules are omitted. Default configuration: 4 GPUs (TP=4). Uses nemotron_omni_step (pass –step_func nemotron_omni_step).
- bridge.recipes.nemotron_omni.h100.nemotron_omni._nemotron_omni_base() megatron.bridge.training.config.ConfigContainer#
Shared model/training config for all Nemotron Omni recipes.
- bridge.recipes.nemotron_omni.h100.nemotron_omni.nemotron_omni_valor32k_sft_4gpu_h100_bf16_config() megatron.bridge.training.config.ConfigContainer#
Return an Energon SFT config with temporal video embedder enabled.
Uses RADIO’s
separate_video_embedderto fuse temporal frame pairs (2 consecutive frames → 1 vision embedding) instead of discarding every other frame. The shard path must be set via CLI override:dataset.path=<path>.Uses
nemotron_omni_step(pass--step_func nemotron_omni_step).
- bridge.recipes.nemotron_omni.h100.nemotron_omni.nemotron_omni_valor32k_peft_4gpu_h100_bf16_config() megatron.bridge.training.config.ConfigContainer#
LoRA PEFT recipe on temporal-video Energon path (temporal_patch_dim=2).
Adapters target attention, Mamba, and FC1/FC2 projections. Vision and sound base modules remain frozen while matching adapters are trainable.
- bridge.recipes.nemotron_omni.h100.nemotron_omni.__all__#
[‘nemotron_omni_cord_v2_long_context_sft_8gpu_h100_bf16_config’, ‘nemotron_omni_cord_v2_peft_4gpu_h1…