Model CoverageOmniNVIDIANemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16

Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16

View as Markdown

Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 is NVIDIA’s omnimodal reasoning model. It pairs a NemotronH (hybrid Mamba-2 + Attention) MoE language backbone with a RADIO v2.5-H vision encoder and a Parakeet (FastConformer) sound encoder, supporting interleaved text, image, and audio inputs.

Set up NeMo AutoModel with the latest container or follow the installation instructions.

Fine-Tune Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16

From the repository root, run:

uv run automodel examples/vlm_finetune/nemotron_omni/nemotron_omni_cord_v2.yaml --nproc-per-node 8

For a full walkthrough - dataset preparation, SFT vs. LoRA configs, and post-training inference - see the Nemotron-Omni guide.

Choose a Workflow

GoalStart Here
Full SFT - receipt parsingUse nemotron_omni_cord_v2.yaml. Dataset: CORD-v2.
Low-rank adaptation (LoRA) PEFT - receipt parsingUse nemotron_omni_cord_v2_peft.yaml. Dataset: CORD-v2.

Model Reference

Model Architecture

PropertyValue
TaskOmnimodal (Text/Image/Audio)
ArchitectureNemotronH_Nano_Omni_Reasoning_V3
Parameters30B total / 3B active
Hugging Face Organizationnvidia

Available Models

  • Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16: 30B total, 3B activated (MoE)